每日 Harness 开源 · Source
返回本期 · Back to 2026-07-21

论文 · Papers2026-07-21 · Tuesday, July 21, 2026

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

arxiv.org原文 ↗

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data
CRAFT 把 rubric evaluation 中的 grading criterion 转成 capability probe,再聚类成层级能力树,从不同层级动态选择低分节点生成 targeted SFT 数据。对比实验固定数据生成、finetuning 和 evaluation 设置,覆盖四个开源模型、finance/legal 两个专业域和 13 个与诊断数据不重合的 held-out benchmarks。finance 域四个模型平均表现均最强,legal 域三胜一平,说明 rubric criterion 粒度比 prompt/category 粒度更能指向可训练弱项。
浏览

评论 · Comments