每日 Harness 开源 · Source
返回本期 · Back to 2026-07-16

论文 · Papers2026-07-16 · Thursday, July 16, 2026

Operationalising Multi-Dimensional Evaluation for Conversational Agents

arxiv.org原文 ↗

Operationalising Multi-Dimensional Evaluation for Conversational Agents
论文面向零售对话 agent,讨论如何把意图对齐、事实性、语气和整体质量等维度组织成可治理的评测管线。它将 LLM-as-judge、规则检查和可审计流程组合起来,而不是只输出一个总体满意度分数。该工作适合关注企业 agent 上线评测的人阅读,因为它把评测从离线打榜推进到监控、追踪和责任归属。
浏览

评论 · Comments