SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics
arxiv.org原文 ↗
该基准用 240 个机器可判定样本隔离测试 npm、PEP 440、Cargo 的版本约束解析,而不是把依赖理解混在整仓库任务里。六模型在 Cargo 部分比较器进位规则上都跌到约 60%,GPT-5.1 在 PEP 440 零填充/后发布 26 个真例中全错;将规则注入提示或直接调用 resolver 可把错误大幅收回,说明是应用缺口而非完全无知识。
–浏览
评论 · Comments