How we measured AI writing across arXiv, and where the measurement breaks
unslop.run原文 ↗
作者对 12,750 篇 arXiv 全文进行评分,得到“约三分之一的新论文读起来像机器写作”的总体结果,同时把测量失效边界放在结论旁边。此类分类器捕捉的是语言分布与风格模式,容易被学科模板、非母语表达、润色工具和人机混写混淆,因此适合观察群体趋势,不适合给单篇论文判定作者行为。文章真正有价值的部分是把耸动比例与推断限制同时展示,提醒读者不要把检测分数误当取证证据。
–浏览
评论 · Comments