τ-Rec 为多轮推荐 agent 建了一个可验证 benchmark,用 structured catalog predicates 和 reveal-tagged elicitation 取代主观 LLM-as-judge。RTE 机制控制约束在对话中何时显现,pass^k 则测量 agent 多次尝试时能否稳定满足条件。作者评测 9 个配置、5 个模型家族,最佳模型也只有约 57% pass^1 和约 38% pass^4,显示 agentic recommender 的问题不只是单轮理解,而是多轮约束保持的可靠性 cliff。它把推荐系统评测从“答案像不像”推向了“对话后是否可验地满足用户约束”。
–浏览
评论 · Comments