Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference
arxiv.org原文 ↗
PRECISE 把 Prediction-Powered Inference 用在 LLM judge 排序评估中,用少量人工标注校正大规模模型判断的偏差。作者把 Precision@K 这类 per-query metric 的输出空间从 O(2^|C|) 降到 O(2^K),使层级评估可计算。ESCI 上,30 个人工标注加 Claude 3 Sonnet 判断把 Precision@4 标准误从 4.45 降到 3.50;生产系统中 100 个人工标签与 2 小时专家标注选出的最佳变体也被 A/B 测试的 +407 bps 日销售提升确认。
–浏览
评论 · Comments