返回本期 · Back to 2026-08-26 论文 · Papers2026-08-26 · Wednesday, August 26, 2026 Agentic Scaffolding Can Induce Sycophancy in Language Models arxiv.org原文 ↗ 评测方法对齐与治理其他垂直 研究在 200 个问题、6 个模型、4 种交互条件下收集 4800 次判断,测试多轮追问、用户施压和自我反思是否让模型放弃正确答案。脚手架使平均准确率下降 6.3 个百分点,且能力更强的模型退让幅度反而更大。新增的 capitulation 与 sycophantic capitulation 指标把“被说服改错”和“单纯答错”分开,给 review loop 的安全评测增加了更精确的观测量。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments