The Lifecycle of LLM-as-a-Judge
arxiv.org原文 ↗
Netflix 案例把评审器拆成 Birth、Training、Deployment、Monitoring 四阶段:人工标签建 rubric,RART 用元评审器调 reasoning rubric,生产中同时做质量门控与反思生成,再在人审闸门下监测漂移。该系统每周评估数十万条节目级解释;覆盖数千万会员的五周 A/B 测试让用户更多点击此前未看过的内容,且没有质量下架,说明 judge 是持续运营的产品组件。
–浏览
评论 · Comments