每日 Harness 开源 · Source
返回本期 · Back to 2026-06-12

论文 · Papers2026-06-12 · Friday, June 12, 2026

τ-Rec: A Verifiable Benchmark for Agentic Recommender Systems

arxiv.org原文 ↗

基准评测方法其他垂直
τ-Rec: A Verifiable Benchmark for Agentic Recommender Systems
τ-Rec 为多轮推荐 agent 建了一个可验证 benchmark,用 structured catalog predicates 和 reveal-tagged elicitation 取代主观 LLM-as-judge。RTE 机制控制约束在对话中何时显现,pass^k 则测量 agent 多次尝试时能否稳定满足条件。作者评测 9 个配置、5 个模型家族,最佳模型也只有约 57% pass^1 和约 38% pass^4,显示 agentic recommender 的问题不只是单轮理解,而是多轮约束保持的可靠性 cliff。它把推荐系统评测从“答案像不像”推向了“对话后是否可验地满足用户约束”。
浏览

评论 · Comments