每日 Harness 开源 · Source
返回本期 · Back to 2026-09-20

论文 · Papers2026-09-20 · Sunday, September 20, 2026

A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems

arxiv.org原文 ↗

A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems
框架把输出、轨迹和跨模态证据映射到能力、鲁棒性、安全、公平、透明、治理、监督、效率八个维度,同时保留各系统的原生指标。它引入不确定性、证据追踪和“安全关键覆盖”规则,避免加权总分掩盖单点致命故障;元评测还检查评测自身的有效性与复现性。论文仍把跨部署的经验验证列为下一步,因此现阶段更像可审计的评价蓝图。
–浏览

评论 · Comments