每日 Harness 开源 · Source
返回本期 · Back to 2026-09-14

论文 · Papers2026-09-14 · Monday, September 14, 2026

SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics

arxiv.org原文 ↗

SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics
该基准用 240 个机器可判定样本隔离测试 npm、PEP 440、Cargo 的版本约束解析,而不是把依赖理解混在整仓库任务里。六模型在 Cargo 部分比较器进位规则上都跌到约 60%,GPT-5.1 在 PEP 440 零填充/后发布 26 个真例中全错;将规则注入提示或直接调用 resolver 可把错误大幅收回,说明是应用缺口而非完全无知识。
–浏览

评论 · Comments