Operationalising Multi-Dimensional Evaluation for Conversational Agents
arxiv.org原文 ↗
论文面向零售对话 agent,讨论如何把意图对齐、事实性、语气和整体质量等维度组织成可治理的评测管线。它将 LLM-as-judge、规则检查和可审计流程组合起来,而不是只输出一个总体满意度分数。该工作适合关注企业 agent 上线评测的人阅读,因为它把评测从离线打榜推进到监控、追踪和责任归属。
–浏览
评论 · Comments