CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data
arxiv.org原文 ↗
CRAFT 把 rubric evaluation 中的 grading criterion 转成 capability probe,再聚类成层级能力树,从不同层级动态选择低分节点生成 targeted SFT 数据。对比实验固定数据生成、finetuning 和 evaluation 设置,覆盖四个开源模型、finance/legal 两个专业域和 13 个与诊断数据不重合的 held-out benchmarks。finance 域四个模型平均表现均最强,legal 域三胜一平,说明 rubric criterion 粒度比 prompt/category 粒度更能指向可训练弱项。
–浏览
评论 · Comments