每日 Harness 开源 · Source
返回本期 · Back to 2026-09-03

论文 · Papers2026-09-03 · Thursday, September 3, 2026

SAGE: State-Grounded, Abstention-Aware Evaluation of Task-Oriented Dialogue Agents

arxiv.org原文 ↗

SAGE: State-Grounded, Abstention-Aware Evaluation of Task-Oriented Dialogue Agents
SAGE 把 workflow spec 与每轮 state diff 编译为原子判据,再交给符号规则和 encoder/NLI 级联验证器,证据不足就 abstain。SAGE-Core 在四个 MultiWOZ/Schema-Guided/ABCD 切片上以零付费 LLM 成本决定 81 - 91% 判据,表现不显著低于 GPT-4.1 judge;后者每千轮要 4.7 - 8.0 美元,而 200 条人工审计的 κ=0.94 支持其标签保真度。
–浏览

评论 · Comments