主题 · Topic
7.4 对齐与治理Alignment & Governance
本主题共 13 条 · 最早 2026-05-29 · 最新 2026-07-21
2026 年 7 月4
-
Safety and alignment in an era of long-horizon models
OpenAI 总结长程运行模型的部署安全问题,重点从真实 incident 反推 adversarial evaluations,而不是只在短任务 benchmark 上验安全。文章称 eval 应贴近实际部署轨迹的分布和 horizon length,并指出在长 rollout 中模型更容易忘记指令。针对这一能力训练后,模型在更长运行中维持 alignment 的表现改善,说明 long-hor…
原文 ↗– -
ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm
ANCHOR 针对 CLI agents 做自动化 alignment auditing,把真实危害任务放进可控命令行环境中观察 agent 行动。它评估的不是聊天拒答,而是代理是否会执行不该执行的文件、网络或系统操作。这个框架的意义在于把安全审计落到可复现的工具轨迹,适合发现“文字上安全、行动上越界”的问题。
原文 ↗– -
Understand to participate
Simon Willison 记录 Geoffrey Litt 在 AIE 提出的 framing:与 coding agents 协作时,人必须理解代码才能参与。文章关注的问题是 agent 能生成越来越大、越来越复杂的改动后,维护者的理解可能逐步偏离实际系统,形成 cognitive debt。它不是反 agent,而是在强调 review、steering 和 ownership 都依赖持续…
原文 ↗– -
AgentBound: Verifiable Behavioral Governance for Autonomous AI Agents
AgentBound 做的是执行前治理,而不是模型对齐本身:每个拟执行动作同时经过 delegated authorization、owner-signed behavioral constitutions 和 site action contracts 三套权威判断,再由形式化决策模型保守组合。它还为每次决策生成 cryptographically verifiable governance r…
原文 ↗–
2026 年 6 月6
-
AgentWatch
AgentWatch 被描述为位于 LLM API 前的 runtime budget 与 policy enforcement 服务。它的工作位置像模型调用网关:agent 请求真正进入 provider 前,先检查预算、策略、可能的越权行为和运行时限制。这个方向的实际价值在于 agent 系统的风险通常发生在执行期,包括循环调用、成本飙升、敏感工具误用和策略漂移;把控制点放在 API 前,可以…
原文 ↗– -
Helping build shared standards for advanced AI
OpenAI 介绍其参与 advanced AI 共享标准建设的工作,重点包括 evaluation frameworks、safety practices 和 global cooperation。feed 摘要明确提到 Appia Foundation,说明这条不是单个模型发布,而是治理与评测标准化动作。它值得关注的地方在于 advanced AI 安全正在通过基金会、评测框架和跨机构协作寻找…
原文 ↗– -
Deontic Policies for Runtime Governance of Agentic AI Systems
这篇把 agentic AI 的运行时治理表达为 deontic policies,也就是用义务、许可和禁止来描述代理能做什么、必须做什么、不能做什么。摘要强调的风险面包括调用工具、操作数据、安装软件以及跨组织协调 peer agents,单靠 authentication 和 access control 不足以约束后续行为。这个方向把安全治理和实际 tool-calling 接口连接起来,便于…
原文 ↗– -
Leiden Declaration on Artificial Intelligence and Mathematics
London Mathematical Society 发布 Leiden Declaration,讨论 AI 在数学研究中的角色。页面说明声明源自 2025 年 Lorentz Center Leiden workshop,并咨询了国际研究者;声明列举 AI 在数学中的使用,包括 proof formalisation,同时提醒其可能改变既有研究实践。它的语气不是拒绝 AI,而是要求数学共同体明…
原文 ↗– -
Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems
PCAA 的关键是把高风险动作包装成 action certificate,而不是要求所有平台共享同一种会话日志。摘要称它是 runtime-neutral governance model,因此适合多模型、多框架并存的 agent 系统;动作能否执行取决于证明对象是否满足策略,而非模型自己解释“我为什么可以这么做”。
原文 ↗– -
Overlaying Governance: A Compositional Authorization Framework for Delegation and Scope in Agentic AI
提出 agentic AI 的组合式授权框架,认为 OAuth 式静态 consent token 不足以表达递归委托、动态 scope 和责任边界。论文定义 delegation 类型、权限与 accountability 影响,并引入 resource scope attenuation 来缩小 agent 访问 envelope。它还给出 overlay operator,把递归委托链等新语…
原文 ↗–
2026 年 5 月3
-
OpenAI: Strengthening societal resilience with Rosalind Biodefense
这条新闻的重要性在应用治理:生物安全领域需要能力释放与访问控制同时设计。它不是普通模型发布,而是把高敏场景中的授权对象、评估和使用边界推到台前。
原文 ↗– -
Governing Technical Debt in Agentic AI Systems
这是一篇偏治理框架的论文,价值在于把 agent 问题从单次 prompt 质量提升到生命周期管理。它提醒团队:记忆、工具权限、评测 harness 和监控策略都是债务来源,越晚标准化,越难解释系统为什么做出某个动作。
原文 ↗– -
OpenAI’s Frontier Governance Framework
这份框架的作用是把 Preparedness Framework 中与监管义务相关的部分公开治理化。它不是新模型能力声明,而是把 frontier 风险流程转成面向法规、审计和外部沟通的文件。
原文 ↗–