每日 Harness 开源 · Source
返回本期 · Back to 2026-06-16

论文 · Papers2026-06-16 · Tuesday, June 16, 2026

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference

arxiv.org原文 ↗

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference
PRECISE 把 Prediction-Powered Inference 用在 LLM judge 排序评估中,用少量人工标注校正大规模模型判断的偏差。作者把 Precision@K 这类 per-query metric 的输出空间从 O(2^|C|) 降到 O(2^K),使层级评估可计算。ESCI 上,30 个人工标注加 Claude 3 Sonnet 判断把 Precision@4 标准误从 4.45 降到 3.50;生产系统中 100 个人工标签与 2 小时专家标注选出的最佳变体也被 A/B 测试的 +407 bps 日销售提升确认。
浏览

评论 · Comments