每日 Harness 开源 · Source
返回本期 · Back to 2026-08-06

论文 · Papers2026-08-06 · Thursday, August 6, 2026

DataSpace

arxiv.org原文 ↗

DataSpace
DataSpace 构造了 410 个跨语言分析任务,底层含 7,439 个制品、总计 15.01 GB,格式横跨 CSV、JSON、SQLite、Markdown、PDF 和视频,并用确定性表格评估器核对结果。6 个前沿多模态模型搭配 5 种 agent harness 后,最佳准确率仍只有 66.34%;同一骨干换 harness 的最大差距达到 15.36 个百分点。这个基准的启发在于,数据代理能力既是模型问题,也是执行框架和结果可验证性问题。
浏览

评论 · Comments