每日 Harness 开源 · Source
返回本期 · Back to 2026-06-07

论文 · Papers2026-06-07 · Sunday, June 7, 2026

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

arxiv.org原文 ↗

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
OPT* 构造的是“多个可行答案里找高价值方案”的优化式推理任务族。每个任务提供 feasibility checker 和 evaluator,用复杂度参数扩展搜索空间而无需新增人工标签;训练侧研究 solver-guided online policy optimization 和无 solver 时的 search-based offline RL。它的技术兴趣在于把可验证奖励从数学/代码扩展到计划搜索质量。
浏览

评论 · Comments