DataSpace 构造了 410 个跨语言分析任务,底层含 7,439 个制品、总计 15.01 GB,格式横跨 CSV、JSON、SQLite、Markdown、PDF 和视频,并用确定性表格评估器核对结果。6 个前沿多模态模型搭配 5 种 agent harness 后,最佳准确率仍只有 66.34%;同一骨干换 harness 的最大差距达到 15.36 个百分点。这个基准的启发在于,数据代理能力既是模型问题,也是执行框架和结果可验证性问题。
–浏览
评论 · Comments