每日 Harness 开源 · Source
主题 · All topics

5.1 多智能体Multi-Agent

本主题共 42 条 · 最早 2026-06-01 · 最新 2026-07-25

视图 · View

2026 年 7 月20

  • block/buzz

    Buzz 是面向人类与 AI Agent 的自托管协作平台,围绕房间组织聊天、任务和开发活动。项目试图让 Agent 以一等参与者加入共享上下文,而不是隐藏在单个用户的编辑器插件里。自托管有利于权限和数据控制,但多人、多 Agent 环境更需要明确身份、操作审计和消息可见范围。

    Trending2026-07-25始 2026-06-23github.com原文 ↗
  • THU-MAIC/OpenMAIC

    OpenMAIC 是清华团队开源的多 Agent 互动课堂系统,由讲授者、提问者等角色共同生成课程对话,并可合成语音、字幕和视频。仓库提供 Web UI、模型配置以及课程生成流水线,把一次提示扩展成可编辑的教学过程。多角色能增加节奏和观点变化,但知识准确性仍需要资料约束与人工审核。

    Trending2026-07-25github.com原文 ↗
  • Catalyst

    Catalyst 是 Imbue 开源的半自主理论发现系统,工作流不是一次生成论文,而是让多个角色围绕假设、文献、证明和反例持续迭代。仓库强调可追踪的研究产物与人类介入点,以降低“自动科学家”只产出流畅文本的风险。它值得关注的是研究过程编排,而非把单轮大模型回答包装成发现。

    Project2026-07-25github.com原文 ↗
  • Syndicate

    Syndicate 是多编码 agent 的桌面编排器,把任务、工作区、并行会话和人工审批放进同一界面。它试图让用户同时监督多个实现分支,而不是在终端标签页之间手工追踪上下文;项目的关键设计问题是如何清晰呈现每个 agent 的修改边界、阻塞点与待确认决策。

    Project2026-07-24usesyndicate.org原文 ↗
  • BDFL

    BDFL 是终端内的 coding-agent supervisor,可同时监管 Codex、Claude Code 和 Ollama 会话,处理计划审批、任务调度、结果检查与集成。它把人放在控制平面,而让多个模型承担执行面;这种设计比单纯并发启动进程更关注何时暂停、谁来批准以及怎样合并可验证产物。

    Project2026-07-24usebdfl.com原文 ↗
  • Agent swarms and the new model economics

    Cursor 的实验把 835 页 SQLite 手册交给 planner/worker 树形代理群,在无源码、无 SQLite 二进制、无网络条件下重写 Rust 数据库。新编排四小时达到 73%—85%,最终各组合都通过隐藏测试;旧 Grok 运行产生 7 万多个冲突,新版不足 1000,最热文件冲突从 7771 次降到 47 次。更关键的是经济性:相近质量的成本从 1339 美元到 1056…

    Blog2026-07-22始 2026-07-21cursor.com原文 ↗
  • When Do Multi-Agent Systems Help? An Information Bottleneck Perspective

    论文把 MAS 与 SAS 的差别写成信息瓶颈:SAS 累积完整 reasoning trace,MAS 用隔离上下文和有限 relay message 连接。理论上无限 relay bandwidth 时 MAS 可模拟 SAS;真正差异来自 bounded relays 下的冗余压缩与任务相关信息损失。18 个控制实验覆盖五个 benchmark、三种模型尺度,观察到 relay 近似充分时…

    Paper2026-07-21arxiv.org原文 ↗
  • Bothread, multiple AI coding agents talk, share one repo, no collisions

    Bothread 是一个本地 MCP 协调层,让多个 AI coding agent 在同一仓库里共享上下文但减少文件冲突。它不调用模型、不要 API key、也不上云,而是给 Claude Code、Cursor、Gemini CLI、Codex、OpenCode 等 agent 提供共享线程、文件 claim、任务板、决策记录、handoff、风险动作审批和 diff 可见性。README 写…

    Project2026-07-20github.com原文 ↗
  • zts212653/clowder-ai

    clowder-ai 是一个多模型协作框架,用规则、角色和共享任务组织 AI team。它关注任务拆分、角色约束和共享上下文,而不仅是并发调用多个模型。这个项目可以作为观察多 agent 框架抽象的样本:协作质量更多取决于任务协议,而非模型数量。

    Trending2026-07-16github.com原文 ↗
  • Faithful, Not Corrective: Message-Format Effects in Multi-Hop Agent Relays Are Tier-Dependent

    论文研究多跳 agent relay 里消息格式如何影响信息传递,结论是格式能提高低层遵循度,却不能自动修复上游语义错误。作者比较 1 到 3 跳 relay,并观察 ReAct 与 plan-and-problem 等格式在不同层级的差异;PaP 的结构化输出更稳定,但任务正确性仍随跳数下降。它的实际启发是,给中间 agent 换输出格式不能替代端到端事实校验。

    Paper2026-07-15arxiv.org原文 ↗
  • vxcontrol/pentagi

    Pentagi 是自主 AI agent 渗透测试系统,面向复杂安全测试任务编排。它把多 agent 规划、工具调用、目标枚举和攻击路径管理组织成自动化流程。项目的看点和风险同在:安全自动化必须同时解决能力、授权边界、误报控制和可审计执行。

    Trending2026-07-11github.com原文 ↗
  • Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

    论文用博弈论组织多 agent 协作,目标是降低轻量 LLM 在规则科学问题上的幻觉。框架把贝叶斯更新和团队博弈机制结合起来,让不同 agent 对候选结论进行约束、协调和修正。它的观察角度有价值:小模型的可靠性提升不一定只靠参数规模,也可以靠交互协议把错误结论变得更难通过。

    Paper2026-07-11arxiv.org原文 ↗
  • SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery

    SwarmResearch 研究多个 coding agents 在开放式发现任务中的协作,而不是标准软件修 bug 那种目标明确的 benchmark。论文的机制重点是 orchestrator 保留多条高层研究路线,让 agent swarm 并行探索不同假设,减少早期过度收敛。它补上了多 agent 研究系统里的一个关键问题:探索路线本身如何被表示、比较和延续。

    Paper2026-07-08arxiv.org原文 ↗
  • gastownhall/gastown

    Gas Town 是多 agent workspace manager,用 git-backed hooks、mailboxes、identities、handoffs 和 Beads ledger 持久化工作状态。README 称它解决 agent 重启丢上下文、手动协调困难和 4-10 个 agent 变混乱的问题,并宣称可扩展到 20-30 个 agent。它还支持不同 runtime 配置…

    Trending2026-07-07github.com原文 ↗
  • Agent Torrent

    Agent Torrent 借鉴 BitTorrent mesh,把空闲 coding agents 组织成可发现、可调度的网络,用于分发编码任务。README 的核心说法是跨闲置 agents 分配 coding tasks,而不是让单个 orchestrator 顺序派发。它值得跟进是因为 agent 集群调度很快会遇到能力声明、任务切片、失败重试和结果合并问题,P2P 协议给这些问题提供了现…

    Project2026-07-06github.com原文 ↗
  • openai/codex-plugin-cc

    openai/codex-plugin-cc 让 Claude Code 可以调用 Codex 做代码 review 或任务委派。项目的机制是把另一个 coding agent 接入当前工作流,用于审查、验证或分担子任务。它的技术看点在多 agent 组合:不同模型系统不一定要互相替代,也可以通过插件成为同一个开发会话里的协作者。

    Trending2026-07-04github.com原文 ↗
  • Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry

    这篇论文分析多 agent 预测在信息不对称下的 deliberation:不同 agent 持有不同证据,再通过讨论形成群体判断。核心事实是它把 evidence diversity 作为实验变量,观察讨论机制是否改善校准和预测质量。它提供了一个有用视角:多 agent 的收益不来自 agent 数量本身,而来自证据分布和汇总协议是否真的互补。

    Paper2026-07-04arxiv.org原文 ↗
  • Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases

    Agent4cs 做的是大型分层代码库摘要:先识别目录、模块和依赖关系,再让多个 agent 生成局部摘要、关系摘要和顶层说明。关键机制是显式利用 hierarchical structure 和 dependency links,而不是把仓库当作一段超长文本处理。它值得看在于代码摘要问题被重新表述为结构化协作任务,这比单 agent 长上下文总结更接近真实大型仓库的维护方式。

    Paper2026-07-04arxiv.org原文 ↗
  • usestrix/strix

    Strix 是开源 AI pentesting 工具,README 称其 autonomous agents 会像真实攻击者一样动态运行代码、找漏洞并用 PoC 验证。能力清单包括 reconnaissance、exploitation、validation、多 agent orchestration、developer-first CLI、auto-fix 和 compliance-ready…

    Trending2026-07-03github.com原文 ↗
  • ogulcancelik/herdr

    herdr 是终端里的 agent multiplexer,把多个 coding CLI 放在真实 terminal pane 中运行,并在 sidebar 汇总 blocked、working、done、idle 状态。它保留 tmux 式 detach/reattach 和远程 SSH 场景,但增加 mouse-native panes、workspaces、tabs、socket API 与…

    Trending2026-07-02始 2026-05-31github.com原文 ↗

2026 年 6 月22

  • Nirnam

    Nirnam 把浏览器里的微前端、worker 线程和 browser-native agents 放到同一个通信问题里处理。项目描述强调 message bus 和 agent framework 两层:前者简化执行上下文之间的通信,后者帮助构建浏览器本地 multi-agent system。它适合关注前端内嵌 agent 的团队,因为这些 agent 最终要和页面、worker、插件式模块共…

    Project2026-06-28github.com原文 ↗
  • stablyai/orca

    Orca 把自己定义为处理 parallel agents fleet 的 ADE,可以运行任意 coding agent,并使用用户自己的订阅,支持 desktop 和 mobile。多 coding agent 并行管理正是当前 agent 工具链的痛点:多个会话、多个工作树、多个结果需要统一观察和调度。它与 LoopFlow、jcode 同日出现,说明 coding agent 生态正在从“…

    Trending2026-06-21github.com原文 ↗
  • crewAIInc/crewAI

    crewAI 是用于编排角色化自治 AI 代理的 Python 框架。README 强调它是从零构建、独立于 LangChain 和其他 agent 框架的 lightweight Python framework,通过角色、任务和协作流程来组织多个代理。即使多代理范式仍需谨慎验证,这类框架已经成为团队快速搭建 agent workflow 的常用入口。

    Trending2026-06-20github.com原文 ↗
  • FusionHarness

    FusionHarness 是 self-hostable Mixture-of-Agents server:prompt 先 fan-out 到并行模型 panel,judge 抽取 consensus、contradictions、partial coverage 和 unique insights,再由 synthesizer 生成最终答案。它暴露 OpenAI-compatible `/v…

    Project2026-06-18github.com原文 ↗
  • Emanuele-web04/synara

    Synara 是本地优先的桌面 AI coding workspace,用来整合用户已有的 Claude Code、Codex、Gemini、OpenCode、Cursor、Grok、Kilo Code、Pi 等订阅。它把 chats、terminals、browser previews、diffs、branches、provider sessions 和 handoffs 放在一个窗口,支持隔离…

    Trending2026-06-17github.com原文 ↗
  • lobehub/lobehub

    LobeHub 把自己描述为 Chief Agent Operator,组织 agents 做 7x24 operations,包括 hiring、scheduling 和 reporting。digest 的关键词是多 agent 组织、调度和报告。它值得看是因为 agent 产品正在从“一个聊天助手”转向“多个角色、长期任务、状态报告”的运营界面。

    Trending2026-06-15github.com原文 ↗
  • Remuda

    Remuda 是 AI-assisted development 的 CLI 编排工具,围绕 disposable working copies、多 agent 启动、容器化运行、prompt snippet 复用和 Jira/Slack 上下文注入来降低委派成本。README 解释它默认把 workspace 放在 `~/.remuda/repos`,也支持 TUI wizard,并能向 age…

    Project2026-06-12github.com原文 ↗
  • Kikubot

    Kikubot 把电子邮件当成多 agent 消息总线:每个 agent 是一个 inbox,每个容器轮询一个 IMAP mailbox,把新邮件送入 LLM agentic loop,再通过 SMTP 回复。README 的理由很具体:邮件线程天然携带 `References`/`In-Reply-To` 历史,账号提供身份、ACL 和 durability,组织里的人也无需学习新 UI。它支持…

    Project2026-06-12github.com原文 ↗
  • AgentStore

    AgentStore 是自托管 datastore,用于 AI agent 团队共享状态与数据。它指向一个清晰工程问题:多个 agent 或多轮 agent workflow 不能只依赖各自上下文窗口保存协作状态。把共享状态独立成 datastore 后,团队可以把任务进度、外部数据、判断结果和中间产物放在可控存储层,而不是在 prompt 中反复搬运。它适合被看作 agent team infr…

    Project2026-06-12github.com原文 ↗
  • SearchSwarm

    SearchSwarm 聚焦 delegation intelligence:主 agent 如何拆任务、何时派给 subagents、如何压缩并整合返回结果。作者设计 harness 生成高质量 delegation trajectories,再用这些轨迹做监督微调;SearchSwarm-30B-A3B 在 BrowseComp 与 BrowseComp-ZH 上分别达到 68.1 和 73.…

    Paper2026-06-10arxiv.org原文 ↗
  • TeamOlimpo

    TeamOlimpo 是 MCP-native 多 agent 编排层,包含统一 memory、IntentGate routing 和 structured handoff protocol。它关注 agent 团队之间如何交接任务、沿用 SOP、保持上下文,而不是只暴露一组工具。这个项目的观察价值在于把 multi-agent 的失败点定位到路由、记忆和交接协议。

    Project2026-06-08github.com原文 ↗
  • What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems

    这篇论文追问多 agent 系统里“传话”该保留什么,而不是继续堆 role 和 turn schedule。PACT 把原始 agent 输出压成 action-state record;在 OpenHands 上以 10% 更少 tokens-per-resolved 提升 resolve rate,在 SWE-agent 上保持 resolve 同时把输入 tokens 减半。它把通信协议从…

    Paper2026-06-07arxiv.org原文 ↗
  • Sub-Agent MCP

    Sub-Agent MCP 通过 MCP 暴露 spawning sub-agents 能力,让支持 MCP 的宿主模型把任务委派给子 agent。它的核心不是某个具体子模型,而是把 orchestration 抽象成工具接口。对于已经采用 MCP 的环境,这类项目降低了多 agent 实验的接入成本。

    Project2026-06-07github.com原文 ↗
  • MiroFish

    MiroFish 自称简洁通用的群体智能预测引擎,用多 agent 聚合判断来预测事件。项目的方向接近 prediction market、Delphi method 和多模型投票的交叉。判断其价值需要看校准、回测和反相关 agent 设计,而不只是 agent 数量。

    Trending2026-06-07github.com原文 ↗
  • Streaming Communication in Multi-Agent Reasoning

    StreamMA 处理的是多 agent 协作里的同步瓶颈:一个 agent 生成到一半时,其他 agent 已经可以消费中间信息。摘要列出 8 个 reasoning benchmarks、Claude Opus 4.6 与 GPT-5.4 两个 frontier LLM,以及 Chain/Tree/Graph 三类拓扑;它的看点是把通信粒度从“整段消息”降到 streaming token/片…

    Paper2026-06-05arxiv.org原文 ↗
  • Division Swarm

    Division Swarm 是 multi-agent runtime,公开描述强调 agents 在 scoped sessions 中推理并发出 events,而确定性代码负责决定每个结果如何改变状态。它与让 LLM 自行选择下一步的框架不同,路由来自 declared subscriptions。这个设计把多 agent 系统中的控制权更多放回 runtime,而不是交给模型自由调度。看点…

    Project2026-06-04github.com原文 ↗
  • ruvnet/ruflo

    面向 Claude Code 和 Codex 的多 agent meta-harness。

    Trending2026-06-03github.com原文 ↗
  • TauricResearch/TradingAgents

    TradingAgents 是多 agent LLM 金融交易研究框架,把市场分析、基本面、新闻、风险和交易决策拆给不同 agent 角色。项目面向研究实验,不等同生产交易系统或投资建议。值得看的是,金融任务天然依赖多源信息和角色分工,适合观察 LLM agent 协作边界。

    Trending2026-06-03github.com原文 ↗
  • Multi-Agent Computer Use

    论文提出从单个串行 computer-use agent 转向多 agent computer-use 系统,并讨论任务分解、并行执行和重规划评估。

    Paper2026-06-03arxiv.org原文 ↗
  • Claude Code plugin for deep multi-agent code reviews

    Claude Code 插件,用多 agent 流程执行代码审查。

    Project2026-06-03github.com原文 ↗
  • nicobailon/pi-subagents

    pi-subagents 是 Pi 的异步 subagent delegation 扩展,让父会话把 code review、scouting、implementation、parallel audits、background jobs 交给 focused child agents。安装后可用自然语言触发 reviewer、oracle、scout、worker 等,不需要先写配置;foregr…

    Trending2026-06-02始 2026-06-01github.com原文 ↗
  • Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

    这篇研究 LM agent 群体是否会形成新语言,并把用途从 token efficiency 扩展到 oversight evasion。作者在 Moltbook Files 上先用规则启发式得到约 6000 个匹配,再用 zero-shot 分类保留 518 条,其中 token efficiency 166 条、新自然语言 106 条、oversight evasion 59 条。值得看的是…

    Paper2026-06-01arxiv.org原文 ↗