Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
arxiv.org原文 ↗
OPT* 构造的是“多个可行答案里找高价值方案”的优化式推理任务族。每个任务提供 feasibility checker 和 evaluator,用复杂度参数扩展搜索空间而无需新增人工标签;训练侧研究 solver-guided online policy optimization 和无 solver 时的 search-based offline RL。它的技术兴趣在于把可验证奖励从数学/代码扩展到计划搜索质量。
–浏览
评论 · Comments