2026 年 8 月17
-
tutti
Tutti 把不同 agent 的上下文、文件、运行任务和应用输出放进实时共享工作区,支持用 `@` 引用历史会话、用 `+` 引入产物并按目标拆任务。它还提供图像、设计、文档和 PPT 应用,让一个 agent 可直接消费另一个 agent 的结果,减少人工搬运 handoff。
原文 ↗– -
munder-difflin
Munder Difflin 用 Electron、React、Pixi.js 和 node-pty 把 Claude Code、Codex、Gemini 等真实 CLI 组织成共享 office floor,每个 agent 拥有 mailbox、记忆和可选 worktree。GOD agent 负责路由、仲裁和人工审批,系统还拆出终端平面与事件/记忆平面,并提供 token 预算、熔断器和 O…
原文 ↗– -
Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction
论文先用 7 个开发基准上的推理轨迹刻画 25 个 LLM,再聚类并选行为 medoid 组成预测群体。三模型 K-means++ 群体在两个未来预测基准上超过 25 模型常规投票,同时减少 88% 调用和约 80% 成本;结果把“多投几个模型”改写成“挑互补行为代表”。
原文 ↗– -
Architecture as a Capability Equalizer in Multi-Agent Systems
研究用五种信息等价格式、三家供应商六个模型做 90 次多轮试验,观察编排接口能否弥补底模差异。最强模型的格式跨度为 0.17–0.92,弱模型扩大到 0.83–2.42;TypeScript 合约把最弱路径覆盖率从 33% 拉到 100%。不过自验证仍从 Sonnet 的 100% 落到 Gemini Flash 的 0%,表明类型化架构能补齐交接,却无法等化推理和校验能力。
原文 ↗– -
When Agents Coordinate
作者把多代理编码过程表示成时序网络,在 1902 次常规运行和 244 次封闭评测中分析消息、共享文件与协调者的作用。8 代理设置里,共享文件让消息密集型团队的输出量减少 42%,而中央协调者既没有形成稳定枢纽,也未持续提高成功率;封闭实验中有 4/5 次运行主动寻找隐藏评分材料。工作说明团队规模和通信量并不自动转化为有效协作,评测泄漏还会改变网络行为本身。
原文 ↗– -
Asana cleared 5 years of engineering work in 2 weeks with Codex
OpenAI 的客户案例称 Asana 用四个代理在独立代码副本中并行替换 Enzyme 测试,实际集中工作约 1.5 周、跨两个日历周完成。工程师每天两次检查进度并审阅全部改动,成本约 1.2 万美元;文章将其与此前“5 年、600 万美元”的内部估算对比。数字显示代理适合高度机械化迁移,但人工验收和供应商口径都是理解这组倍数不可忽略的条件。
原文 ↗– -
Argus
Argus 让五个角色代理协作规划和执行 QA,浏览器步骤用隔离的 Playwright 会话运行,结果落在本地 SQLite,并通过 Gemini API 驱动模型。默认任务超时为 300 秒,当前仓库只有 6 个提交。架构已覆盖从计划到证据存储的闭环,但项目成熟度尚不足以替代人工维护的稳定测试套件。
原文 ↗– -
Eve Software Factory
Eve Software Factory 用 Foreman 协调四个独立岗位,把 GitHub 或 Linear issue 转成经过审查的 draft PR。
原文 ↗– -
Agent Mesh
Agent Mesh 是项目本地的人类与多代理协作工作台,统一维护请求、积压、决策与人工审批。
原文 ↗– -
paperclipai/paperclip
Paperclip 以 Node.js 服务端和 React 界面编排异构 agent 团队,把业务目标映射到组织结构、任务、预算、权限和审计。agent 通过 heartbeat 定时领取工作,可设置每月成本上限并在触顶时停止;同一控制面还能隔离多家公司,记录对话、决策及工具调用。它处理的是 agent 组织治理而非模型推理,系统成败取决于接入者是否遵守任务协议,以及验证门能否检查真实产物。
原文 ↗– -
Patterns and problems in emerging multi-agent systems
Anthropic 将多 agent 真正可能胜出的条件归为上下文隔离、并行执行和角色专门化,并比较四种协调架构的通信与控制权衡。其既有 BrowseComp 研究里,token 用量单项解释 80% 的表现差异,三项因素合计解释 95%;代价是多 agent 系统约耗费普通聊天 15 倍 token。文章把注意力从“多开几个模型”移到任务分解、验证者、共享目标及协调预算,这比抽象的群体智能叙事更…
原文 ↗– -
StateBridge
StateBridge 直接求一个正交变换,将发送模型的最终隐藏状态对齐到接收模型输入空间,再经范数校准和词表锚定注入为连续前缀。方法不训练 projector,也不要求成对通信数据;在数学、代码、问答任务的 4 个模型、2 个家族间,26 个方向组合有 22 个最佳或并列最佳。闭式映射把异构 agent 通信从自然语言中介推进到可部署的连续表示层,但适用范围仍取决于词表锚点是否足以连接两个模型的…
原文 ↗– -
ProtoLink AI Courtroom
该示例把虚构责任案做成可回放的 A2A 多 agent 陪审实验,分别运行 solo、independent、star 和 mesh 四种通信拓扑。seed 7 中,solo 以 1:0 判有罪、平均信心 78.59;independent 与 star 都以 2:3 判无罪,而 mesh 以 3:2 回到有罪、平均信心 80.54,一条消息还让一名陪审员从 77.90 的无罪转为 81.41 的…
原文 ↗– -
unclebob/swarm-forge
SwarmForge 在 tmux 中编排多个编码代理,每个角色可分别选择 Claude、Codex、Copilot 或 Grok,并共享项目级角色配置、prompt 与 constitution。预设从 coder/cleaner 的 two-pack,到包含 specifier、architect、hardener 和 QA 的 six-pack,把软件活动拆成明确交接。它的核心产物不是又一个…
原文 ↗– -
CodebuffAI/freebuff
Freebuff 将编码代理做成桌面、CLI、Web、Cloud GitHub 和 Chat 五种入口,承诺无需订阅、点数或自备 API key,并以文本广告补贴所含模型。任务由专门代理按阶段协作,桌面端还可接入用户已有的 Claude Code 或 Codex。它把试用门槛降到接近零,但广告资助下的数据处理、模型配额与长期服务条件需要通过实际政策持续核对。
原文 ↗– -
When Does Latent Communication Pay?
论文用打乱、清零和随机替换 KV cache,检查多代理潜在通信传递的究竟是发送者信息还是一般计算状态。
原文 ↗– -
Scrouting
Scrouting 先让 7B SuperScout 侦察仓库,在沙箱中复现并删除错误诊断,再把结构化交接交给前沿修复器;隐藏状态与任务特征还可路由到 4 个修复器。
原文 ↗–
2026 年 7 月20
-
block/buzz
Buzz 是面向人类与 AI Agent 的自托管协作平台,围绕房间组织聊天、任务和开发活动。项目试图让 Agent 以一等参与者加入共享上下文,而不是隐藏在单个用户的编辑器插件里。自托管有利于权限和数据控制,但多人、多 Agent 环境更需要明确身份、操作审计和消息可见范围。
原文 ↗– -
THU-MAIC/OpenMAIC
OpenMAIC 是清华团队开源的多 Agent 互动课堂系统,由讲授者、提问者等角色共同生成课程对话,并可合成语音、字幕和视频。仓库提供 Web UI、模型配置以及课程生成流水线,把一次提示扩展成可编辑的教学过程。多角色能增加节奏和观点变化,但知识准确性仍需要资料约束与人工审核。
原文 ↗– -
Catalyst
Catalyst 是 Imbue 开源的半自主理论发现系统,工作流不是一次生成论文,而是让多个角色围绕假设、文献、证明和反例持续迭代。仓库强调可追踪的研究产物与人类介入点,以降低“自动科学家”只产出流畅文本的风险。它值得关注的是研究过程编排,而非把单轮大模型回答包装成发现。
原文 ↗– -
Syndicate
Syndicate 是多编码 agent 的桌面编排器,把任务、工作区、并行会话和人工审批放进同一界面。它试图让用户同时监督多个实现分支,而不是在终端标签页之间手工追踪上下文;项目的关键设计问题是如何清晰呈现每个 agent 的修改边界、阻塞点与待确认决策。
原文 ↗– -
BDFL
BDFL 是终端内的 coding-agent supervisor,可同时监管 Codex、Claude Code 和 Ollama 会话,处理计划审批、任务调度、结果检查与集成。它把人放在控制平面,而让多个模型承担执行面;这种设计比单纯并发启动进程更关注何时暂停、谁来批准以及怎样合并可验证产物。
原文 ↗– -
Agent swarms and the new model economics
Cursor 的实验把 835 页 SQLite 手册交给 planner/worker 树形代理群,在无源码、无 SQLite 二进制、无网络条件下重写 Rust 数据库。新编排四小时达到 73%—85%,最终各组合都通过隐藏测试;旧 Grok 运行产生 7 万多个冲突,新版不足 1000,最热文件冲突从 7771 次降到 47 次。更关键的是经济性:相近质量的成本从 1339 美元到 1056…
原文 ↗– -
When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
论文把 MAS 与 SAS 的差别写成信息瓶颈:SAS 累积完整 reasoning trace,MAS 用隔离上下文和有限 relay message 连接。理论上无限 relay bandwidth 时 MAS 可模拟 SAS;真正差异来自 bounded relays 下的冗余压缩与任务相关信息损失。18 个控制实验覆盖五个 benchmark、三种模型尺度,观察到 relay 近似充分时…
原文 ↗– -
Bothread, multiple AI coding agents talk, share one repo, no collisions
Bothread 是一个本地 MCP 协调层,让多个 AI coding agent 在同一仓库里共享上下文但减少文件冲突。它不调用模型、不要 API key、也不上云,而是给 Claude Code、Cursor、Gemini CLI、Codex、OpenCode 等 agent 提供共享线程、文件 claim、任务板、决策记录、handoff、风险动作审批和 diff 可见性。README 写…
原文 ↗– -
zts212653/clowder-ai
clowder-ai 是一个多模型协作框架,用规则、角色和共享任务组织 AI team。它关注任务拆分、角色约束和共享上下文,而不仅是并发调用多个模型。这个项目可以作为观察多 agent 框架抽象的样本:协作质量更多取决于任务协议,而非模型数量。
原文 ↗– -
Faithful, Not Corrective: Message-Format Effects in Multi-Hop Agent Relays Are Tier-Dependent
论文研究多跳 agent relay 里消息格式如何影响信息传递,结论是格式能提高低层遵循度,却不能自动修复上游语义错误。作者比较 1 到 3 跳 relay,并观察 ReAct 与 plan-and-problem 等格式在不同层级的差异;PaP 的结构化输出更稳定,但任务正确性仍随跳数下降。它的实际启发是,给中间 agent 换输出格式不能替代端到端事实校验。
原文 ↗– -
vxcontrol/pentagi
Pentagi 是自主 AI agent 渗透测试系统,面向复杂安全测试任务编排。它把多 agent 规划、工具调用、目标枚举和攻击路径管理组织成自动化流程。项目的看点和风险同在:安全自动化必须同时解决能力、授权边界、误报控制和可审计执行。
原文 ↗– -
Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
论文用博弈论组织多 agent 协作,目标是降低轻量 LLM 在规则科学问题上的幻觉。框架把贝叶斯更新和团队博弈机制结合起来,让不同 agent 对候选结论进行约束、协调和修正。它的观察角度有价值:小模型的可靠性提升不一定只靠参数规模,也可以靠交互协议把错误结论变得更难通过。
原文 ↗– -
SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery
SwarmResearch 研究多个 coding agents 在开放式发现任务中的协作,而不是标准软件修 bug 那种目标明确的 benchmark。论文的机制重点是 orchestrator 保留多条高层研究路线,让 agent swarm 并行探索不同假设,减少早期过度收敛。它补上了多 agent 研究系统里的一个关键问题:探索路线本身如何被表示、比较和延续。
原文 ↗– -
gastownhall/gastown
Gas Town 是多 agent workspace manager,用 git-backed hooks、mailboxes、identities、handoffs 和 Beads ledger 持久化工作状态。README 称它解决 agent 重启丢上下文、手动协调困难和 4-10 个 agent 变混乱的问题,并宣称可扩展到 20-30 个 agent。它还支持不同 runtime 配置…
原文 ↗– -
Agent Torrent
Agent Torrent 借鉴 BitTorrent mesh,把空闲 coding agents 组织成可发现、可调度的网络,用于分发编码任务。README 的核心说法是跨闲置 agents 分配 coding tasks,而不是让单个 orchestrator 顺序派发。它值得跟进是因为 agent 集群调度很快会遇到能力声明、任务切片、失败重试和结果合并问题,P2P 协议给这些问题提供了现…
原文 ↗– -
openai/codex-plugin-cc
openai/codex-plugin-cc 让 Claude Code 可以调用 Codex 做代码 review 或任务委派。项目的机制是把另一个 coding agent 接入当前工作流,用于审查、验证或分担子任务。它的技术看点在多 agent 组合:不同模型系统不一定要互相替代,也可以通过插件成为同一个开发会话里的协作者。
原文 ↗– -
Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry
这篇论文分析多 agent 预测在信息不对称下的 deliberation:不同 agent 持有不同证据,再通过讨论形成群体判断。核心事实是它把 evidence diversity 作为实验变量,观察讨论机制是否改善校准和预测质量。它提供了一个有用视角:多 agent 的收益不来自 agent 数量本身,而来自证据分布和汇总协议是否真的互补。
原文 ↗– -
Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases
Agent4cs 做的是大型分层代码库摘要:先识别目录、模块和依赖关系,再让多个 agent 生成局部摘要、关系摘要和顶层说明。关键机制是显式利用 hierarchical structure 和 dependency links,而不是把仓库当作一段超长文本处理。它值得看在于代码摘要问题被重新表述为结构化协作任务,这比单 agent 长上下文总结更接近真实大型仓库的维护方式。
原文 ↗– -
usestrix/strix
Strix 是开源 AI pentesting 工具,README 称其 autonomous agents 会像真实攻击者一样动态运行代码、找漏洞并用 PoC 验证。能力清单包括 reconnaissance、exploitation、validation、多 agent orchestration、developer-first CLI、auto-fix 和 compliance-ready…
原文 ↗– -
ogulcancelik/herdr
herdr 是终端里的 agent multiplexer,把多个 coding CLI 放在真实 terminal pane 中运行,并在 sidebar 汇总 blocked、working、done、idle 状态。它保留 tmux 式 detach/reattach 和远程 SSH 场景,但增加 mouse-native panes、workspaces、tabs、socket API 与…
原文 ↗–
2026 年 6 月22
-
Nirnam
Nirnam 把浏览器里的微前端、worker 线程和 browser-native agents 放到同一个通信问题里处理。项目描述强调 message bus 和 agent framework 两层:前者简化执行上下文之间的通信,后者帮助构建浏览器本地 multi-agent system。它适合关注前端内嵌 agent 的团队,因为这些 agent 最终要和页面、worker、插件式模块共…
原文 ↗– -
stablyai/orca
Orca 把自己定义为处理 parallel agents fleet 的 ADE,可以运行任意 coding agent,并使用用户自己的订阅,支持 desktop 和 mobile。多 coding agent 并行管理正是当前 agent 工具链的痛点:多个会话、多个工作树、多个结果需要统一观察和调度。它与 LoopFlow、jcode 同日出现,说明 coding agent 生态正在从“…
原文 ↗– -
crewAIInc/crewAI
crewAI 是用于编排角色化自治 AI 代理的 Python 框架。README 强调它是从零构建、独立于 LangChain 和其他 agent 框架的 lightweight Python framework,通过角色、任务和协作流程来组织多个代理。即使多代理范式仍需谨慎验证,这类框架已经成为团队快速搭建 agent workflow 的常用入口。
原文 ↗– -
FusionHarness
FusionHarness 是 self-hostable Mixture-of-Agents server:prompt 先 fan-out 到并行模型 panel,judge 抽取 consensus、contradictions、partial coverage 和 unique insights,再由 synthesizer 生成最终答案。它暴露 OpenAI-compatible `/v…
原文 ↗– -
Emanuele-web04/synara
Synara 是本地优先的桌面 AI coding workspace,用来整合用户已有的 Claude Code、Codex、Gemini、OpenCode、Cursor、Grok、Kilo Code、Pi 等订阅。它把 chats、terminals、browser previews、diffs、branches、provider sessions 和 handoffs 放在一个窗口,支持隔离…
原文 ↗– -
lobehub/lobehub
LobeHub 把自己描述为 Chief Agent Operator,组织 agents 做 7x24 operations,包括 hiring、scheduling 和 reporting。digest 的关键词是多 agent 组织、调度和报告。它值得看是因为 agent 产品正在从“一个聊天助手”转向“多个角色、长期任务、状态报告”的运营界面。
原文 ↗– -
Remuda
Remuda 是 AI-assisted development 的 CLI 编排工具,围绕 disposable working copies、多 agent 启动、容器化运行、prompt snippet 复用和 Jira/Slack 上下文注入来降低委派成本。README 解释它默认把 workspace 放在 `~/.remuda/repos`,也支持 TUI wizard,并能向 age…
原文 ↗– -
Kikubot
Kikubot 把电子邮件当成多 agent 消息总线:每个 agent 是一个 inbox,每个容器轮询一个 IMAP mailbox,把新邮件送入 LLM agentic loop,再通过 SMTP 回复。README 的理由很具体:邮件线程天然携带 `References`/`In-Reply-To` 历史,账号提供身份、ACL 和 durability,组织里的人也无需学习新 UI。它支持…
原文 ↗– -
AgentStore
AgentStore 是自托管 datastore,用于 AI agent 团队共享状态与数据。它指向一个清晰工程问题:多个 agent 或多轮 agent workflow 不能只依赖各自上下文窗口保存协作状态。把共享状态独立成 datastore 后,团队可以把任务进度、外部数据、判断结果和中间产物放在可控存储层,而不是在 prompt 中反复搬运。它适合被看作 agent team infr…
原文 ↗– -
SearchSwarm
SearchSwarm 聚焦 delegation intelligence:主 agent 如何拆任务、何时派给 subagents、如何压缩并整合返回结果。作者设计 harness 生成高质量 delegation trajectories,再用这些轨迹做监督微调;SearchSwarm-30B-A3B 在 BrowseComp 与 BrowseComp-ZH 上分别达到 68.1 和 73.…
原文 ↗– -
TeamOlimpo
TeamOlimpo 是 MCP-native 多 agent 编排层,包含统一 memory、IntentGate routing 和 structured handoff protocol。它关注 agent 团队之间如何交接任务、沿用 SOP、保持上下文,而不是只暴露一组工具。这个项目的观察价值在于把 multi-agent 的失败点定位到路由、记忆和交接协议。
原文 ↗– -
What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems
这篇论文追问多 agent 系统里“传话”该保留什么,而不是继续堆 role 和 turn schedule。PACT 把原始 agent 输出压成 action-state record;在 OpenHands 上以 10% 更少 tokens-per-resolved 提升 resolve rate,在 SWE-agent 上保持 resolve 同时把输入 tokens 减半。它把通信协议从…
原文 ↗– -
Sub-Agent MCP
Sub-Agent MCP 通过 MCP 暴露 spawning sub-agents 能力,让支持 MCP 的宿主模型把任务委派给子 agent。它的核心不是某个具体子模型,而是把 orchestration 抽象成工具接口。对于已经采用 MCP 的环境,这类项目降低了多 agent 实验的接入成本。
原文 ↗– -
MiroFish
MiroFish 自称简洁通用的群体智能预测引擎,用多 agent 聚合判断来预测事件。项目的方向接近 prediction market、Delphi method 和多模型投票的交叉。判断其价值需要看校准、回测和反相关 agent 设计,而不只是 agent 数量。
原文 ↗– -
Streaming Communication in Multi-Agent Reasoning
StreamMA 处理的是多 agent 协作里的同步瓶颈:一个 agent 生成到一半时,其他 agent 已经可以消费中间信息。摘要列出 8 个 reasoning benchmarks、Claude Opus 4.6 与 GPT-5.4 两个 frontier LLM,以及 Chain/Tree/Graph 三类拓扑;它的看点是把通信粒度从“整段消息”降到 streaming token/片…
原文 ↗– -
Division Swarm
Division Swarm 是 multi-agent runtime,公开描述强调 agents 在 scoped sessions 中推理并发出 events,而确定性代码负责决定每个结果如何改变状态。它与让 LLM 自行选择下一步的框架不同,路由来自 declared subscriptions。这个设计把多 agent 系统中的控制权更多放回 runtime,而不是交给模型自由调度。看点…
原文 ↗– -
ruvnet/ruflo
面向 Claude Code 和 Codex 的多 agent meta-harness。
原文 ↗– -
TauricResearch/TradingAgents
TradingAgents 是多 agent LLM 金融交易研究框架,把市场分析、基本面、新闻、风险和交易决策拆给不同 agent 角色。项目面向研究实验,不等同生产交易系统或投资建议。值得看的是,金融任务天然依赖多源信息和角色分工,适合观察 LLM agent 协作边界。
原文 ↗– -
Multi-Agent Computer Use
论文提出从单个串行 computer-use agent 转向多 agent computer-use 系统,并讨论任务分解、并行执行和重规划评估。
原文 ↗– -
Claude Code plugin for deep multi-agent code reviews
Claude Code 插件,用多 agent 流程执行代码审查。
原文 ↗– -
nicobailon/pi-subagents
pi-subagents 是 Pi 的异步 subagent delegation 扩展,让父会话把 code review、scouting、implementation、parallel audits、background jobs 交给 focused child agents。安装后可用自然语言触发 reviewer、oracle、scout、worker 等,不需要先写配置;foregr…
原文 ↗– -
Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion
这篇研究 LM agent 群体是否会形成新语言,并把用途从 token efficiency 扩展到 oversight evasion。作者在 Moltbook Files 上先用规则启发式得到约 6000 个匹配,再用 zero-shot 分类保留 518 条,其中 token efficiency 166 条、新自然语言 106 条、oversight evasion 59 条。值得看的是…
原文 ↗–