每日 Harness 开源 · Source
主题 · All topics

7.4 对齐与治理Alignment & Governance

本主题共 20 条 · 最早 2026-05-29 · 最新 2026-08-26

视图 · View

2026 年 8 月7

  • Fences, not sandboxes

    Steve Yegge 根据约 50–60 个代理、日均约 270 次提交的个人软件工厂经验,主张把凭证、权限域、拒绝规则与责任编码成组织级 fence,而不只把每个代理塞入狭窄 sandbox。其 Wheelhouse 约 60 万行代码,累计 450 个治理产物和逾 100 条 fence;投入相当于 21 个 Max 账户、每月约 12.2 万美元 API 用量。作者明说 fence 不是抵…

    Blog2026-08-26yegge.ai原文 ↗
    –
  • Strengthening democratic oversight in national security

    OpenAI 宣布未来一年投入 500 万美元,支持国家安全领域 AI 监督所需的培训、技术协助和计算额度。方案提出保存模型输入、输出与工具调用的审计记录,并认为模型无关的监督机制可行。它把讨论从原则声明推进到可留证的机构控制,但最终约束力取决于独立审查者能否持续获得完整记录与处置权限。

    News2026-08-19openai.com原文 ↗
    –
  • Pacing model development in an era of cyber-critical capabilities

    OpenAI 把 Astra 视为可能触及 cyber-critical 门槛的内部模型,并称曾暂停相关强化学习两周,较大规模版本仍在 hold 状态。配套控制包括隔离环境、逐 token 监控和 30 分钟内告警,监控额外开销约 20%,许多 Astra 工作负载因此暂停。文章给出了能力阈值触发开发节奏变化的实例,但效果仍主要依据机构自身测量与执行披露。

    News2026-08-19openai.com原文 ↗
    –
  • Claude: System Prompts

    Anthropic 建立按模型和日期排列的 Claude 产品系统提示词记录页,同一模型更新时提供差异视图。页面覆盖 claude.ai 和移动应用而非 Claude API,并说明提示中会注入当前日期、约束 Markdown 代码等产品行为;Claude 4.6 起每个 model ID 对应固定快照。公开记录让产品层指令变化可以单独审计,避免把界面行为漂移全部归因于底层模型。

    News2026-08-17platform.claude.com原文 ↗
    –
  • Hexis

    Hexis 把 skills、tools、context、permissions 与 identity 存成平台拥有的 Git 文件,配 owner、review 和逐文件权限,再通过自托管 MCP 交给 agent。agent 不直接拿底层凭据,SSO 与变更历史把安装脚本难以回答的“谁批准了哪项能力”显式化。README 给出的 Docker 启动只需 4 个必填环境值并宣称约 5 分钟部署,…

    Project2026-08-15github.com原文 ↗
    –
  • Lessons from the hacks

    Nathan Lambert 讨论前沿模型参与网络攻击后暴露出的实验室、政府与激励机制问题。

    Blog2026-08-10interconnects.ai原文 ↗
    –
  • Responding to the next frontier of critical cyber capabilities

    OpenAI 称 Astra 的初步内部评估已无法排除达到 Preparedness Framework 的 Critical 网络能力;该级别包括从高层目标出发,在多类加固关键系统上实施功能性零日等高门槛行为。

    News2026-08-08openai.com原文 ↗
    –

2026 年 7 月4

  • Safety and alignment in an era of long-horizon models

    OpenAI 总结长程运行模型的部署安全问题,重点从真实 incident 反推 adversarial evaluations,而不是只在短任务 benchmark 上验安全。文章称 eval 应贴近实际部署轨迹的分布和 horizon length,并指出在长 rollout 中模型更容易忘记指令。针对这一能力训练后,模型在更长运行中维持 alignment 的表现改善,说明 long-hor…

    News2026-07-21openai.com原文 ↗
    –
  • ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    ANCHOR 针对 CLI agents 做自动化 alignment auditing,把真实危害任务放进可控命令行环境中观察 agent 行动。它评估的不是聊天拒答,而是代理是否会执行不该执行的文件、网络或系统操作。这个框架的意义在于把安全审计落到可复现的工具轨迹,适合发现“文字上安全、行动上越界”的问题。

    Paper2026-07-15arxiv.org原文 ↗
    –
  • Understand to participate

    Simon Willison 记录 Geoffrey Litt 在 AIE 提出的 framing:与 coding agents 协作时,人必须理解代码才能参与。文章关注的问题是 agent 能生成越来越大、越来越复杂的改动后,维护者的理解可能逐步偏离实际系统,形成 cognitive debt。它不是反 agent,而是在强调 review、steering 和 ownership 都依赖持续…

    Blog2026-07-03simonwillison.net原文 ↗
    –
  • AgentBound: Verifiable Behavioral Governance for Autonomous AI Agents

    AgentBound 做的是执行前治理,而不是模型对齐本身:每个拟执行动作同时经过 delegated authorization、owner-signed behavioral constitutions 和 site action contracts 三套权威判断,再由形式化决策模型保守组合。它还为每次决策生成 cryptographically verifiable governance r…

    Paper2026-07-02arxiv.org原文 ↗
    –

2026 年 6 月6

  • AgentWatch

    AgentWatch 被描述为位于 LLM API 前的 runtime budget 与 policy enforcement 服务。它的工作位置像模型调用网关:agent 请求真正进入 provider 前,先检查预算、策略、可能的越权行为和运行时限制。这个方向的实际价值在于 agent 系统的风险通常发生在执行期,包括循环调用、成本飙升、敏感工具误用和策略漂移;把控制点放在 API 前,可以…

    Project2026-06-29agent-watch.dev原文 ↗
    –
  • Helping build shared standards for advanced AI

    OpenAI 介绍其参与 advanced AI 共享标准建设的工作,重点包括 evaluation frameworks、safety practices 和 global cooperation。feed 摘要明确提到 Appia Foundation,说明这条不是单个模型发布,而是治理与评测标准化动作。它值得关注的地方在于 advanced AI 安全正在通过基金会、评测框架和跨机构协作寻找…

    News2026-06-24openai.com原文 ↗
    –
  • Deontic Policies for Runtime Governance of Agentic AI Systems

    这篇把 agentic AI 的运行时治理表达为 deontic policies,也就是用义务、许可和禁止来描述代理能做什么、必须做什么、不能做什么。摘要强调的风险面包括调用工具、操作数据、安装软件以及跨组织协调 peer agents,单靠 authentication 和 access control 不足以约束后续行为。这个方向把安全治理和实际 tool-calling 接口连接起来,便于…

    Paper2026-06-20arxiv.org原文 ↗
    –
  • Leiden Declaration on Artificial Intelligence and Mathematics

    London Mathematical Society 发布 Leiden Declaration,讨论 AI 在数学研究中的角色。页面说明声明源自 2025 年 Lorentz Center Leiden workshop,并咨询了国际研究者;声明列举 AI 在数学中的使用,包括 proof formalisation,同时提醒其可能改变既有研究实践。它的语气不是拒绝 AI,而是要求数学共同体明…

    News2026-06-08lms.ac.uk原文 ↗
    –
  • Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems

    PCAA 的关键是把高风险动作包装成 action certificate,而不是要求所有平台共享同一种会话日志。摘要称它是 runtime-neutral governance model,因此适合多模型、多框架并存的 agent 系统;动作能否执行取决于证明对象是否满足策略,而非模型自己解释“我为什么可以这么做”。

    Paper2026-06-05arxiv.org原文 ↗
    –
  • Overlaying Governance: A Compositional Authorization Framework for Delegation and Scope in Agentic AI

    提出 agentic AI 的组合式授权框架,认为 OAuth 式静态 consent token 不足以表达递归委托、动态 scope 和责任边界。论文定义 delegation 类型、权限与 accountability 影响,并引入 resource scope attenuation 来缩小 agent 访问 envelope。它还给出 overlay operator,把递归委托链等新语…

    Paper2026-06-04arxiv.org原文 ↗
    –

2026 年 5 月3

  • OpenAI: Strengthening societal resilience with Rosalind Biodefense

    这条新闻的重要性在应用治理:生物安全领域需要能力释放与访问控制同时设计。它不是普通模型发布,而是把高敏场景中的授权对象、评估和使用边界推到台前。

    News2026-05-30openai.com原文 ↗
    –
  • Governing Technical Debt in Agentic AI Systems

    这是一篇偏治理框架的论文,价值在于把 agent 问题从单次 prompt 质量提升到生命周期管理。它提醒团队:记忆、工具权限、评测 harness 和监控策略都是债务来源,越晚标准化,越难解释系统为什么做出某个动作。

    Paper2026-05-30arxiv.org原文 ↗
    –
  • OpenAI’s Frontier Governance Framework

    这份框架的作用是把 Preparedness Framework 中与监管义务相关的部分公开治理化。它不是新模型能力声明,而是把 frontier 风险流程转成面向法规、审计和外部沟通的文件。

    News2026-05-29openai.com原文 ↗
    –