LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations
arxiv.org原文 ↗
LoSoNA 测的是模型能否从多人群聊 transcript 里推断本地隐性规范,并在最终 elicitor turn 中按规范回应。基准评估八个 frontier/open-weight 模型和四种 prompting 条件,明确提示模型“把先前对话当作规范证据”会带来不均匀收益。Gemini 3.1 Pro 在显式 norm-aware prompt 下到 84.2%,Claude Fable 5 到 81.6%,而一些模型提升很小甚至回退;这说明社交适应不是简单加一句系统提示就能普遍解决。
–浏览
评论 · Comments