ExtractBench
github.com原文 ↗
ExtractBench 要求系统面对未见过的企业文档与 JSON Schema,返回正确值、完整重复记录、明确 `null` 和逐字段来源证据,评分不用 LLM judge。数据集有 370 份文档、4,869 页、八个领域和 67 类 schema,其中 325 份为真实公共记录;长文 split 只有 20 份,却占 1,816 页,专门放大跨页表与列表截断。榜首 unified value F1 为 95.59,但最佳 word-level grounding F1 只有 46.43;“值看似对”与“能指向正确证据”的巨大差距,是这个基准比普通抽取榜更有用的地方。
–浏览
评论 · Comments