SAGE: State-Grounded, Abstention-Aware Evaluation of Task-Oriented Dialogue Agents
arxiv.org原文 ↗
SAGE 把 workflow spec 与每轮 state diff 编译为原子判据,再交给符号规则和 encoder/NLI 级联验证器,证据不足就 abstain。SAGE-Core 在四个 MultiWOZ/Schema-Guided/ABCD 切片上以零付费 LLM 成本决定 81 - 91% 判据,表现不显著低于 GPT-4.1 judge;后者每千轮要 4.7 - 8.0 美元,而 200 条人工审计的 κ=0.94 支持其标签保真度。
–浏览
评论 · Comments