TreasuryBench
github.com原文 ↗
TreasuryBench 是一个个人财务 AI 建议 benchmark,v0.1.0 覆盖 3 个 synthetic US households、81 个任务、12 个领域,并用 judge-primary scoring 加 table-grounded factual verification。Leaderboard 显示 Treasury Product 85.5、ChatGPT full-context baseline 79.6、Origin 71.0、Monarch 52.1;错误事实会硬性封顶,material errors 最高 65 分,dangerous errors 最高 40 分。这个 benchmark 的强项是把“好建议”拆成数据读取、机会发现、事实时效和风险上限,而不是只评 prose 质量。
–浏览
评论 · Comments