A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems
arxiv.org原文 ↗
框架把输出、轨迹和跨模态证据映射到能力、鲁棒性、安全、公平、透明、治理、监督、效率八个维度,同时保留各系统的原生指标。它引入不确定性、证据追踪和“安全关键覆盖”规则,避免加权总分掩盖单点致命故障;元评测还检查评测自身的有效性与复现性。论文仍把跨部署的经验验证列为下一步,因此现阶段更像可审计的评价蓝图。
–浏览
评论 · Comments