每日 Harness 开源 · Source
返回本期 · Back to 2026-09-24

论文 · Papers2026-09-24 · Thursday, September 24, 2026

When and How Should an Agent Clarify? CIGAsk: Teaching LLMs to Clarify via Counterfactual Information Gain

arxiv.org原文 ↗

When and How Should an Agent Clarify? CIGAsk: Teaching LLMs to Clarify via Counterfactual Information Gain
CIGAsk 用 counterfactual information gain 奖励真正消除歧义的回答,再用带符号的 ambiguity bonus 训练模型判断是否应该提问。7B 模型在表格、段落和开放域三个澄清基准超过更大外部基线,还能跨数据集迁移;贡献点在于把“时机”和“问题质量”作为同一条 RL 回路学习。
–浏览

评论 · Comments