Artificial Analysis Intelligence Index v4.2
artificialanalysis.ai原文 ↗
v4.2 用 AA-Briefcase 和 GDP.pdf 把评测拉向多周知识工作与长文档证据综合:后者要穿过 100 份、4,592 页 PDF,并按 1,275 个原子标准判定全通过。私有 held-out 测试占 40%,为 v4.1 的两倍,目的是减少实验室针对公开题库调参;榜单由 Claude Fable 5.1 领先、GPT-6 Astra 第二,说明“更真实”评测仍然会产生新的方法学争议。
–浏览
评论 · Comments