Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search
arxiv.org原文 ↗
这篇论文指出 agentic search 的并行 rollout 很早就会塌缩:如果第一轮 query 相似,后续线程会围绕同一批检索证据继续推理,breadth scaling 的收益迅速递减。DivInit 不训练模型,而是在一次调用中生成 n 个候选首轮 query,从中挑出 k 个彼此差异更大的 seed 再并行展开。作者在 5 个 open-weight 模型和 8 个 benchmark 上报告 matched compute 下 multi-hop QA 平均提升 5 到 7 个点;这类小改动直接打在“测试时扩展到底扩什么”的问题上。
–浏览
评论 · Comments