每日 Harness 开源 · Source
返回本期 · Back to 2026-09-20

论文 · Papers2026-09-20 · Sunday, September 20, 2026

LLM-as-an-Improver: Turning Verification into Better Candidates

arxiv.org原文 ↗

LLM-as-an-Improver: Turning Verification into Better Candidates
VRR 把验证器的错误信息转成新候选:除保留初胜者,还生成胜者和亚军的修复版以及一条新路线,然后按原评测标准去重、过滤和重选。跨代码与推理基准,VRR 在多种模型设置下超过只对固定候选排序的方法,甚至能从“初始池全错”中找回正确解。它把验证从终点评分器改成搜索算子,代价是每轮要额外承担三种候选的推理预算。
–浏览

评论 · Comments