每日 Harness 开源 · Source
主题 · All topics

5.2 工作流与控制流Workflows & Control

本主题共 88 条 · 最早 2026-05-29 · 最新 2026-07-25

视图 · View

2026 年 7 月40

  • alibaba/open-code-review

    Open Code Review 是代码审查 CLI,把确定性规则管线与 LLM Agent 结合,在 pull request 或本地 diff 上生成行级问题评论。规则先处理可稳定检测的问题,模型再分析上下文、设计与潜在缺陷,避免所有判断都依赖生成式输出。可落地性的关键在低误报、增量范围控制以及评论能否提供可验证修复建议。

    Trending2026-07-25github.com原文 ↗
  • Sigil

    Sigil 把 Markdown 编写的 `SKILL.md` 编译成可执行状态机,为每个步骤注入前后置条件、验收标准和失败处理。Agent 不能靠文字声称“已经完成”来跳过流程,运行时会依据日志和状态检查是否允许进入下一步。它针对的是提示词约束缺乏强制力的问题,把工作规范提升为可验证的控制平面。

    Project2026-07-25github.com原文 ↗
  • Why Software Factories Fail

    文章反驳“搭好 harness 就能批量生产软件”的想象,指出编码 agent 的主要瓶颈仍是规格不完整、反馈慢、环境不可复现和组织无法验收。更多并行 agent 会放大不确定性与集成成本,而不是自动消除它们;作者因此把重点放回可验证任务分解、快速测试和明确所有权。

    Blog2026-07-24github.com原文 ↗
  • CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

    CodeRescue 面向编码 agent 首次尝试失败后的决策:继续当前模型、切换恢复策略,还是升级到更强模型。路由器结合测试反馈、错误类型和剩余 token/调用预算预测各路径收益,避免对所有失败都昂贵升级;论文把恢复视为预算约束下的序贯决策,补足了只比较首轮成功率的评测盲点。

    Paper2026-07-24arxiv.org原文 ↗
  • BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

    BatchDAG 把自然语言分析请求编译成类型化 DAG:节点声明输入输出模式,执行层再对同类实体做批处理,而不是让模型逐条串行调用工具。论文在四类企业分析任务上报告,相比 ReAct/CodeAct 风格基线,最高可把运行时间降低 55.7%、token 成本降低 72.5%,同时维持或提高答案质量;价值在于把 agent 的“计划”变成可检查、可并行的执行对象。

    Paper2026-07-24arxiv.org原文 ↗
  • block/buzz

    Buzz 把团队聊天、Git 托管事件和 AI agent 协作集中到一个可自托管工作区。代理可以在对话中接收任务、访问代码并反馈执行状态,人类仍保留讨论和审查界面。它尝试把 agent 从独立 CLI 拉进团队协作流,但权限继承与自动执行边界必须设计清楚。

    Trending2026-07-23github.com原文 ↗
  • Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

    作者研究验证器和修复器都会犯错时,代理何时应继续循环、回滚或停止。论文将过程建模为带噪决策问题,并给出基于置信度与预期收益的停止规则;在合成与代码任务中,策略减少了无效修复和越修越坏。它把常见的固定轮数启发式替换为风险敏感决策,但前提是能够校准验证信号。

    Paper2026-07-23arxiv.org原文 ↗
  • ETAS: An Effect-Typed Language for Agent Systems

    ETAS 把模型调用、工具访问、记忆读写、人工审批、策略检查和轨迹记录建模为语言级 effect,并通过类型系统约束组合。这样,程序在执行前就能暴露未经授权的工具路径、遗漏审批或不可重放副作用。它尝试把 agent orchestration 从松散脚本提升为可静态分析的程序,但实际采用成本取决于现有工具生态能否映射到其 effect 模型。

    Paper2026-07-23arxiv.org原文 ↗
  • Human mathematicians are being outcounterexampled

    Kevin Buzzard 描述了一种新研究循环:模型先寻找反例,再把结论形式化到 Lean,由人检查陈述是否忠实、依赖是否可信、证明是否编译。文中 Sol 三周生成约 120 万行 Lean,而 mathlib 九年约 230 万行;一个 60 年问题的反例最终是 1076 行 Lean,本地验证不到五分钟。速度令人震动,但作者也记录了模型先写出错误非正式论证、另一模型再找出反例的情况,说明形式…

    Blog2026-07-22xenaproject.wordpress.com原文 ↗
  • Claude Is Not a Compiler

    这篇文章拆解“规格就是新源码、LLM 就是编译器”的比喻:编译器有形式语义、确定转换和可重复构建,模型则会对未说明部分自行补全,并可能在相同输入下输出不同程序。把提示词当可执行规格会掩盖验证责任,因为测试通过只证明覆盖到的行为,而非意图被完整保留。更稳妥的做法是把代理放进编译器、类型系统、测试和 review 组成的约束链,而不是让概率模型替代这些确定性环节。

    Blog2026-07-22blog.exe.dev原文 ↗
  • Buzz

    Buzz 将团队聊天、代理工作流与早期 Git 事件放进同一个工作区,现有功能覆盖频道、线程、私信、canvas、媒体、搜索、审计日志和桌面客户端。Jack Dorsey 将其描述为模型无关、去中心化、自主可控的 Slack/GitHub 替代方向,关键设计不是再加一个聊天机器人,而是让代理与人共享身份和审计轨迹。项目是否成立取决于 Git 托管深度、权限模型和生态迁移成本,而不只是消息功能是否齐…

    News2026-07-22runtimewire.com原文 ↗
  • 30 to 70 PRs a Day: How We Managed to Not Wreck Our Systems

    Honeycomb 的峰值 PR 数从约 30 增至 70,作者将全年吞吐提升概括为 2.5 倍,同时提醒日历平均只有峰值约一半。更有参考价值的是控制面:组件隔舱、review、deploy train、feature flag、最小权限和可观测性在 AI 之前就存在,代理只是被接入这些防线,而不是获得直达生产的捷径。文章说明高频合并能否持续,取决于团队是否把失败设计成局部、可回滚、可观察,而非是…

    Blog2026-07-22honeycomb.io原文 ↗
  • pi-for-each

    pi-for-each 是 Pi 扩展,提供带 `$each` 插入的顺序 prompt-loop 控制结构。它处理的是 agent prompt workflow 中很常见但容易写散的需求:把一组输入逐项带入同一 prompt,并确保执行顺序可读、可重复。对 Pi 这类可扩展 harness 来说,这类小型控制流扩展会把“让 agent 自己记得循环”转成显式机制。

    Project2026-07-21pi.dev原文 ↗
  • R3 - Review locally and send feedback back to your coding agent

    r3 把 AI 生成代码和长文档的反馈流程做成本地 review server,而不是继续塞进聊天流。agent 运行 `r3 create` 后分享 URL,用户在浏览器里把意见锚定到具体 line 或 quote,`r3 watch` 阻塞等待并把反馈打印回 stdout 供 agent 处理。它支持 live files review 与 immutable diff review;默认数据…

    Project2026-07-21github.com原文 ↗
  • musistudio/claude-code-router

    claude-code-router 是本地 AI agent 控制平面,用于跨模型路由和工具编排。digest 的核心是它让 Claude Code 类工作流可以根据配置转发到不同模型或 provider,并集中管理工具链。技术价值在于把 agent 前端、模型后端和工具调用解耦,使用户能在成本、能力、上下文窗口和可用性之间切换。它也反映出当前 agent 用户越来越少满足于单一官方后端,而是希…

    Trending2026-07-20github.com原文 ↗
  • Software and AI - Plotting vs. Pantsing

    这篇文章把软件开发中的 AI 使用方式类比成写作里的规划式 plotting 与即兴式 pantsing。关键不是二选一,而是判断任务处在光谱哪一端:架构、约束和验收标准清楚时,AI 更适合按计划填充;问题空间仍模糊时,小步探索和人工收束更自然。这个框架比“AI 会不会写代码”更实用,因为它把提示、检查、回滚和人工介入放回工程流程。它也解释了为什么同一个 agent 在脚手架任务上很稳,在架构边界…

    Blog2026-07-20pyjarrett.github.io原文 ↗
  • simstudioai/sim

    Sim 是用于构建、部署和编排 AI agents 与 workflows 的自托管工作台。它把模型、工具、触发器和多步 workflow 放到一个可管理环境中运行。自托管定位让它更适合需要控制数据路径、密钥和部署边界的团队,而不是只做云端低代码 agent demo。

    Trending2026-07-15github.com原文 ↗
  • The Agentic Loop: Three loops in a trench coat

    这篇文章把 agentic loop 拆成多个控制循环,而不是把 agent 执行看成单次“思考-行动-观察”。这种分解能区分规划循环、工具执行循环和外层监督/治理循环各自承担的责任。它适合用来审视 agent 架构图:很多系统图把所有反馈都画成一个箭头,实际调试时却需要知道是哪一层 loop 失控。

    Blog2026-07-15bobbytables.io原文 ↗
  • Skillscript

    Skillscript 用声明式语言描述 agent workflow,仓库包含 runtime、compiler 和 CLI。它把多步骤代理任务从临时 prompt、shell 脚本和手写 glue code 中抽离出来,变成可编译、可运行、可复用的工作流资产。这个项目的关键点在于把 agent orchestration 当成程序结构处理,而不是只依赖对话上下文维持状态。

    Project2026-07-13github.com原文 ↗
  • Old and new apps, via modern coding agents

    Terence Tao 记录用现代 coding agents 生成和改造应用的经验,覆盖旧应用迁移和新应用试作两类任务。文章的重点不是展示一次完美自动生成,而是观察人类如何审阅、修正和约束代理输出。它提供了高水平用户视角下的 coding-agent 工作流样本。

    Blog2026-07-13terrytao.wordpress.com原文 ↗
  • Autoresearch, Claude and Constrained Optimization

    Elliot C. Smith 记录用 Claude 做自动研究和约束优化实验的过程。文章把 LLM 放进迭代式搜索任务中,让模型提出候选、接收反馈并在约束下调整方案。它有意思的地方在于把“自动研究”收束到可评价目标上,而不是让模型无限扩写可能性。

    Blog2026-07-13elliotcsmith.com原文 ↗
  • GitLake

    GitLake 提出 agent-first lakehouse 的 Git-for-data 设计,让数据管线能在分支上运行、审查、合并和发布。关键事实是它把数据资产的变更治理改造成接近 pull request 的流程,而不是让 agent 直接改生产湖仓。这个设计值得关注,因为 agent 自动化越强,数据版本、审计和回滚边界越需要变成一等概念。

    Paper2026-07-11arxiv.org原文 ↗
  • GenUI

    GenUI 让 AI agent 生成原生 SwiftUI 交互界面,面向 iOS/macOS。它的做法不是在 App 里塞一个 WebView,而是把 agent 输出映射到平台原生组件、状态和交互结构。这个项目把“生成 UI”问题推进到运行时界面编排,风险点则在安全边界、状态一致性和可测试性。

    Project2026-07-11github.com原文 ↗
  • Agentic Neural Architecture Search

    这篇把 LLM agent 放进神经架构搜索循环:语言模型提出候选模块、连接和超参数,传统 NAS 机制负责评估、筛选和优化。摘要称它在多个计算机视觉 benchmark 上达到或超过既有 NAS baseline,并发现手写搜索空间容易漏掉的非平凡构件。技术看点在于 LLM 不是替代搜索算法,而是扩大可表达的架构假设空间。

    Paper2026-07-11arxiv.org原文 ↗
  • MadsLorentzen/ai-job-search

    ai-job-search 是一个基于 Claude Code 的求职自动化框架:fork 仓库、填写个人 profile 后,让 Claude 评估职位、定制 CV、生成 cover letters,并准备面试。README 的定位不是招聘平台,而是把求职材料生产流程做成可运行的 agent workspace。它反映了 coding-agent 工具链正在被挪用到个人生产力场景:同样的 rep…

    Trending2026-07-09github.com原文 ↗
  • Wayflow

    Wayflow 是可嵌入的 AI workflow builder,将节点编辑器和运行时连接起来。它面向产品内嵌,而不是独立低代码平台;应用可以把 workflow 画布、节点状态和 AI 调用接入自有界面。这个形态适合需要给用户开放自动化能力、但又不想从头做编排器的产品。

    Project2026-07-08wayflow.build原文 ↗
  • Open Science, open-source alternative to Claude Science

    Open Science 是本地优先、模型无关的科学研究 workbench,而不是一个聊天窗口。README 把流程定义为 plan -> approve -> execute -> artifacts -> review,并要求图表、表格和报告能追溯回代码、数据、环境和对话。技术栈是 Tauri + React + OpenCode runtime + agent skills,当前 rele…

    Project2026-07-07github.com原文 ↗
  • sqlite-utils 4.0rc2, mostly written by Claude Fable

    Simon Willison 记录用 Claude Fable 推进 sqlite-utils 4.0rc2 的开发过程,场景是成熟开源库的真实维护而不是一次性 demo。文章展示 coding agent 参与修改、测试和发布候选整理,再由维护者审查收束。它提供了一个有用样本:当项目已有测试、兼容性要求和发布纪律时,模型贡献会被工程流程塑形。

    Blog2026-07-06simonwillison.net原文 ↗
  • Agentic coding notes

    Dan Luu 记录 agentic coding 循环、工具使用和写作过程中的工程观察,重点在模型如何反复尝试、调用工具、修改代码,再由人类审查与收束。文章把 agent 工作流中的摩擦暴露出来,包括反馈延迟、错误累积、上下文管理和人工介入时机。它的可读性来自具体经验,而不是把 coding agent 简化成“能写代码”或“不能写代码”的二分判断。

    Blog2026-07-06danluu.com原文 ↗
  • langflow-ai/langflow

    Langflow 是可视化构建、部署 AI agents 和 workflows 的平台,把模型、提示、工具、向量库和流程节点组织成可编辑图。它适合快速搭建和调试 LLM 应用,因为链路结构被显性化,不必完全埋在代码里。项目的长期价值取决于可视化便利性与工程可维护性之间能否保持平衡。

    Trending2026-07-04github.com原文 ↗
  • The Short Leash AI Coding Method For Beating Fable

    这篇文章描述短反馈周期的 AI coding 方法:小步任务、频繁检查、快速测试和明确边界。它的策略是把 agent 控制在短回路里,让人类持续校准方向,而不是把一个大目标交给模型长时间自主运行。这个方法的工程含义很直接:减少漂移、缩短回滚距离,并让错误在局部暴露。

    Blog2026-07-04blog.okturtles.org原文 ↗
  • TaskPeace

    TaskPeace 把任务队列通过 MCP 暴露给 AI coding agents,让 agent 可以拉取、处理并回写工作项。它把人给 agent 的工作从一次性自然语言委托改成 queue-based dispatch,边界更像持续集成系统里的 job。这个形态适合多 agent 或多人协作场景,因为任务状态、所有权和重复执行需要被显式管理。

    Project2026-07-04taskpeace.com原文 ↗
  • Fable's judgement

    Simon Willison 记录 Claude Code 团队关于 Fable 的经验,重点是让模型自行判断何时测试、如何执行和何时停止。文章讨论的核心变量是 judgement:过度硬编码流程可能压制模型在具体上下文中的判断。它与“短反馈控制”形成有趣对照,说明 coding agent 的有效边界仍在工具约束和模型自主之间摆动。

    Blog2026-07-04simonwillison.net原文 ↗
  • The Control Plane Was the Point: Revisiting autofz in the LLM Era

    这篇重新审视 autofz,强调 fuzzing 系统中真正关键的是 control plane:如何调度 fuzzers、分配预算、收集信号、去重结果和决定下一步。把它放到 LLM 时代,重点不在让模型“写 fuzz target”,而在让 agent 参与已有测试工具生态时仍有清晰的控制、观测和反馈面。它把 fuzzing 和 agent orchestration 连接起来,适合与今日多篇…

    Blog2026-07-03yfu.tw原文 ↗
  • SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks

    SWE-Router 认为只看 task description 的 router 有不可避免的信息下界,因为同样的 issue 描述可能隐藏局部 typo,也可能隐藏跨模块重构。它采用 value-based temporal routing:先让便宜模型跑几个 exploratory turns,再读取 partial trajectory 决定继续便宜执行或升级到昂贵模型。作者给出 Baye…

    Paper2026-07-03arxiv.org原文 ↗
  • Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

    Mnemosyne 提出 Agentic Transaction Processing:LLM、solver 或 agent team 生成的 workflow action 先被视为未受信 proposal,只有通过声明的可执行约束集 C 才能被 runtime admit 和 commit。系统由 append-only transition log、effective-state proje…

    Paper2026-07-03arxiv.org原文 ↗
  • Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

    这篇把 LLM 生成网页采集器的输出从自由代码收窄到 typed JSON collector 配置,再用六类 collector taxonomy、模板/utility 约束、静态 Airflow DAG、规则质量检查和反馈修正来管住执行路径。实验覆盖 138 个任务;在 80 个独立源验证任务上,执行阶段实现了 zero execution-stage LLM tokens,并取得最低平均 w…

    Paper2026-07-03arxiv.org原文 ↗
  • HKUDS/VideoAgent

    VideoAgent 是 All-in-One agentic video framework,覆盖理解、编辑和 remaking。README 的 demo 流程包括明确用户需求、intent analysis、自主工具使用和规划,再生成 multi-modal products 与 detailed workflows。它把视频 agent 拆成需求理解、计划、工具调用和产物生成几层,而不是单…

    Trending2026-07-03github.com原文 ↗
  • Rigorix OSS

    Rigorix 把自然语言开发意图先编译成可审查 DAG,再在策略、权限、预算和质量门内执行,而不是让 LLM 在开放循环中边想边做。README 示例里,一个 TypeScript refactor 被转成 5 个节点:读文件、插入方法、写测试、type-check、跑测试;执行结果 5 passed,LLM 调用和 token 也被记录。它当前支持 Rust、TypeScript、Python…

    Project2026-07-02github.com原文 ↗
  • Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics

    这项工作把自然语言数学研究转成 Lean 4 形式化证明,重点不在刷现有 Mathlib 覆盖的题,而是处理研究论文中超出现有库的概念。系统用 orchestrator 管理多代理流水线,必要时动态扩展类型定义,并通过 Auxiliary Lemma 技术验证这些扩展后再形式化主定理。实验包括 PutnamBench 32 个随机样本和 5 篇 STOC 论文,覆盖组合、通信复杂性、机制设计和学习…

    Paper2026-07-02arxiv.org原文 ↗

2026 年 6 月44

  • hugohe3/ppt-master

    PPT Master 用 AI 从文档生成真正可编辑的 PowerPoint,而不是把幻灯片压成图片。README 明确输出 DrawingML 原生形状、文本框、图表、动画和 speaker notes,可进一步生成音频旁白,也支持套用现有 `.pptx` 模板;仓库页面显示 3.37 万星和 871 commits。作者强调它是 workflow harness,`harness + mode…

    Trending2026-06-29github.com原文 ↗
  • Quoting Jon Udell

    Simon Willison 摘录 Jon Udell 对 human-in-the-loop 与 agent-assisted software development 的表述。这条不是新工具发布,而是给 agent 时代的开发协作找更准确的语言。它的价值在于避免两个极端:既不把 agent 当成完全自主开发者,也不把它降格为普通 autocomplete;更现实的描述是人类仍负责目标、判断和验…

    Blog2026-06-29simonwillison.net原文 ↗
  • Fission-AI/OpenSpec

    OpenSpec 是面向 AI coding assistants 的 spec-driven development 框架,要把 agent 开发从“直接让模型改代码”拉回规格、验收和变更追踪。它的价值在流程约束:当需求被写成 spec,agent 的实现空间、测试条件和 review 对象都更明确。对团队协作而言,这比单次 prompt 更接近工程合同。

    Trending2026-06-29github.com原文 ↗
  • Autonomous CAD design and OpenFOAM optimization loop using local LLMs

    这个项目用 Ollama 本地模型、CadQuery、OpenFOAM 和 scikit-learn Gaussian Process 做螺旋桨的设计-仿真-优化闭环。README 的关键约束是模型只负责 propose,不负责 score:`qwen2.5-coder:7b` 的 Proposer、Mutator、Coder 生成 7 参数设计向量或 Python search operator…

    Project2026-06-29github.com原文 ↗
  • kunchenguid/no-mistakes

    kunchenguid/no-mistakes 在真实 remote 前放了一个本地 git proxy,让开发者 push 到 no-mistakes 而不是直接 push origin。README 描述的流程是创建 disposable worktree、运行 AI-driven validation pipeline,全部通过后才转发 branch 并自动打开 clean PR。这个项目把…

    Trending2026-06-28github.com原文 ↗
  • When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

    论文给多模型组合方法加了一个很硬的上限:如果系统输出必须来自某个成员模型,准确率最多是 1 减去所有模型共同答错的 beta。作者测了 21 家提供商的 67 个模型,开放数学任务观察 beta=0.052,而 Gaussian copula 估计只有 0.023,执行判分代码任务 beta=0.079。它的贡献是提醒路由、投票和 MoA 的收益来自“错在不同题”,不是模型越多越稳。

    Paper2026-06-27arxiv.org原文 ↗
  • Semantic Early-Stopping for Iterative LLM Agent Loops

    论文把 writer-critic 等循环的停止条件从固定轮数改成语义变化和质量改进信号。HotpotQA 60 题实验中,judge-free semantic stopper 相比 max_iterations 减少 38% operational tokens,质量基本持平;full quality-gated 版本反而因每轮 judge 成本过高而不划算。它把循环 agent 的成本问题拆…

    Paper2026-06-27arxiv.org原文 ↗
  • A Deterministic Control Plane for LLM Coding Agents

    论文研究 coding agent 配置文件作为未声明共享组件的传播风险。作者扫描 10,008 个公开 GitHub repo 和 6,145 个 agent config,发现 10.1% tracked paths 在独立 repo 间 SHA-256 完全重复,75.5% clone pairs 跨组织,且少于 1% 的 agent configs 声明权限边界。Rel(AI)Build…

    Paper2026-06-27arxiv.org原文 ↗
  • We got local models to triage the OpenClaw repo for FREE

    Hugging Face 记录用本地模型对 OpenClaw 仓库做 issue/PR triage 的实验。标题里的 FREE 指向成本约束:目标不是调用最强闭源模型,而是看本地模型能否承担分类、优先级和重复劳动。这个案例把 LLM 用在开源维护的边缘流程上,效果评估会比聊天演示更接近维护者的日常负担。

    Blog2026-06-24huggingface.co原文 ↗
  • Shipping huggingface_hub every week with AI, open tools, and a human in the loop

    Hugging Face 介绍 huggingface_hub 的每周发布流程,强调 AI、开放工具和 human in the loop。它不是宣称发布完全自动化,而是把 AI 放在 triage、检查、生成发布辅助材料等环节,再由维护者保留最终判断。对基础库来说,这种流程比一次性“AI 写代码”更有参考价值,因为发布质量依赖重复、保守、可追踪的步骤。

    Blog2026-06-24huggingface.co原文 ↗
  • Q00/ouroboros

    Ouroboros 自称 Agent OS,口号是 Stop prompting. Start specifying. 它提供 specification-first 的 AI coding workflow,把模糊想法转成可复放、可验证的代码库构建过程,并宣称跨 Claude Code、Codex CLI、OpenCode、Hermes、Gemini 等工具运行。这个项目把 agent 编程的控…

    Trending2026-06-24github.com原文 ↗
  • Aharness

    Aharness 用 TypeScript 有限状态机约束 Codex 等 coding agent 的工作流执行。项目判断当前主要失败模式是 process drift 和 context management:prompt 与 skill 能描述流程,但无法强制流程。它让 state 定义 agent 下一步允许做什么,并用 typed transitions 控制流转,这比单靠系统提示更接近…

    Project2026-06-24github.com原文 ↗
  • calesthio/OpenMontage

    OpenMontage 是开源 agentic video production system,GitHub 描述称包含 12 条 pipelines、52 个 tools 和 500+ agent skills。仓库内有 AGENT_GUIDE、CODEX、COPILOT、CURSOR、PROMPT_GALLERY、config 和渲染 demo,说明它面向多种 coding assistant…

    Trending2026-06-23始 2026-06-19github.com原文 ↗
  • Using LLMs to Secure Source Code

    Eugene Yan 描述用 LLM 做威胁建模、漏洞发现、验证、分诊和修补的流程。它把模型放进完整安全工程闭环:先界定威胁面,再找候选问题,然后验证可达性和影响,最后生成补丁并交给测试与 review。这个框架避免把“模型发现漏洞”误认为“系统已经更安全”。

    Blog2026-06-23eugeneyan.com原文 ↗
  • FlowiseAI/Flowise

    Flowise 是可视化构建 AI agents 和 LLM workflows 的 TypeScript 项目。README 的 quick start 是 Node >=20、全局安装 `flowise`、`npx flowise start` 后打开 localhost:3000;项目同时提供 Docker、自托管和云版本路径。它把 chain、agent 和工具编排变成节点式操作界面,降低…

    Trending2026-06-23github.com原文 ↗
  • Codex-maxxing for long-running work

    OpenAI 发布 Jason Liu 的 Codex-maxxing whitepaper,主题是把 Codex 用作能延续上下文的工作空间。页面摘要强调把大目标拆成可验证步骤、保持多个 workstream 的 continuity,并判断哪些执行交给 Codex、哪些环节需要 human oversight。它关注的是长周期工作管理,而不是单条 prompt 技巧。

    Blog2026-06-23openai.com原文 ↗
  • n8n

    n8n 是面向技术团队的 workflow automation platform,把可视化流程搭建、代码扩展和 native AI capabilities 放在同一产品里。README 给出的关键规模是 400+ integrations,并强调 fair-code license、自托管或 cloud 两种部署方式。它在 GitHub Trending 里的看点不是单个节点功能,而是 wor…

    Trending2026-06-22github.com原文 ↗
  • LLMs Are Complicated Now

    HN 这条讨论围绕 LLM 产品和 workflow 复杂化展开。它关心的不是单个模型能力,而是模型选择、tool 调用、agent 编排、memory、context 管理、权限和计费一起进入日常使用后,用户和工程团队都要面对更高的配置面。这个主题值得纳入日报,因为 LLM 复杂度正在从研究指标转移到产品操作性和组织实践。

    Blog2026-06-22始 2026-05-31news.ycombinator.com原文 ↗
  • Building reliable agentic AI systems

    这篇案例写的是 Bayer 与 Thoughtworks 的 PRINCE:一个把几十年 preclinical safety study reports 接入 Agentic RAG 和 Text-to-SQL 的云端研究平台。文章把架构拆成 context engineering 和 harness engineering 两条线:前者决定每个 specialized agent 接收什么信息…

    Blog2026-06-22martinfowler.com原文 ↗
  • LoopFlow

    LoopFlow 把“反复提示 coding agent”抽象成 YAML loop:一个步骤负责修复,另一个 gate 步骤用独立 persona 审查,直到 gate 通过、预算耗尽或达到迭代上限。README 的关键设计是 gate 必须显式给出 `VERDICT: PASS` 或 `VERDICT: FAIL`,无 verdict 视为失败;每次运行还会把 outcome、cost 和 s…

    Project2026-06-21github.com原文 ↗
  • Pagecast - Publish Markdown/HTML Reports to Cloudflare Pages

    Pagecast 是一个 CLI,用来把本地 Markdown 或 HTML 报告发布到自己的 Cloudflare Pages 账号。作者明确列出 stable URLs、renaming、republishing to the same URL 和 watch mode,用来替代临时 localhost tunnel。对于自动化日报、实验报告和代理产物发布,这类工具能把“写完”到“可访问”之间…

    Project2026-06-20github.com原文 ↗
  • Git worktrees and evidence gates for Codex and Claude Code

    glueRun-go 用 git worktree 和 evidence gates 管理 Codex、Claude Code 等编码代理的执行流程。worktree 让不同尝试可以隔离,evidence gate 则要求代理在进入下一步前留下测试、差异或验证证据。这个项目的工程味很重:它把代理输出纳入类似 CI 的检查节奏,而不是只看最终回答是否顺眼。

    Project2026-06-20github.com原文 ↗
  • FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

    FAPO 处理的是多步 LLM pipeline 中 retrieval、reasoning 和 formatting 互相影响导致的失败,因此单点 prompt 优化容易漏掉链路瓶颈。框架让 Claude Code 在标准化代码库里评估 pipeline、检查中间步骤、诊断失败,再提出 scoped prompt changes。它把 prompt optimization 拉回软件工程语境:提…

    Paper2026-06-20arxiv.org原文 ↗
  • CWC scans your Claude Code history and auto-builds agent workflows

    Claude Workflow Composer 的思路是扫描 Claude Code 历史,把反复出现的操作模式转成可复用 agent workflow。它不是从空白模板开始设计工作流,而是把真实会话中的步骤、命令和修复路径作为素材。这个项目反映出一个趋势:代理工具的下一层抽象会来自历史轨迹挖掘,而不是让用户手动编排每个节点。

    Project2026-06-20github.com原文 ↗
  • asgeirtj/system_prompts_leaks

    system_prompts_leaks 收集多个 AI 产品和模型的 system prompt。README 的最近更新列出 Claude Fable 5、Claude Opus 4.8、Claude Code tools、GPT-5.5、Perplexity Computer、Gemini 3.5 Flash、Antigravity CLI、Grok Expert 等,并提供 prompt…

    Trending2026-06-17github.com原文 ↗
  • The octopus architecture for AI agents

    这篇文章提出一种 “octopus architecture”:中心协调器连接多个专门子系统,而不是把所有职责塞进单个 agent。这个思路适合 agent 工程中的职责分离,例如搜索、执行、记忆、验证和用户交互分别由不同“触手”承担。它的讨论价值在系统组织层面:当 agent 数量增加时,失败隔离、状态同步和工具路由会比单个 prompt 写法更关键。

    Blog2026-06-17blog.goodman.dev原文 ↗
  • The Engineer

    The Engineer 是一个长驻 orchestration daemon,把 GitHub Issues 等任务入口接到 Claude Code、OpenCode、Gemini CLI 这类编码 agent,再推进到 PR。README 把流程拆成 requirements、research、planning、execution、review、delivery 六阶段,每个任务在独立 git…

    Project2026-06-15github.com原文 ↗
  • gitbutlerapp/gitbutler

    GitButler 是基于 Git 的版本控制客户端,用 Tauri、Rust 和 Svelte 构建,仓库已有 apps、crates、packages、e2e 等大型项目结构。它面向现代协作与 AI workflow,这一点与其长期主张的本地变更组织、虚拟分支和更细粒度 review 流程一致。AI coding 会让工作区同时出现多条未完成变更,传统单 working tree 和线性 br…

    Trending2026-06-12github.com原文 ↗
  • datasette-agent 0.2a0

    Simon Willison 发布 datasette-agent 0.2a0 alpha,新增了工具执行过程中向用户提问的机制。这个小改动很实用:agent 在访问数据、构造 SQL 或执行 Datasette 工具时,如果发现缺约束或需要确认,不必在工具链里硬猜,可以暂停并请求用户补充。它把 human-in-the-loop 从聊天层挪到 tool execution path 中,适合数据…

    Blog2026-06-12simonwillison.net原文 ↗
  • The Sequence Opinion: Systems of Record vs. Systems of Action

    TheSequence 讨论 agentic AI 对企业软件分工的影响:传统系统保存事实,agentic 系统开始跨系统执行动作。“记录系统”和“行动系统”的区分很关键,因为 CRM、ERP、ticketing、warehouse 这些系统过去主要提供读写接口,AI agent 则会把它们串成可执行流程。这样一来,审计、权限、回滚和责任边界会比查询体验更重要。文章的价值在于把 agent 讨论从…

    Blog2026-06-12thesequence.substack.com原文 ↗
  • Plannotator

    Plannotator 是本地浏览器式 review surface,用来标注 agent 的计划、spec、Markdown、HTML、diff 和 PR,并把批注反馈回 agent。它集成 Claude Code、Codex、Copilot CLI、Gemini CLI、OpenCode、Kiro、Amp、Pi 等,Codex 侧通过 hook/skills 接入,计划模式中可自动打开 rev…

    Project2026-06-12github.com原文 ↗
  • Command Center

    Command Center 是面向 AI coding 的开发环境,关注代码生成之后的质量控制、审查和交付。它把 review、验证、修复和 release workflow 放在 AI 编程体验中心,切入点不是“再快生成一段代码”,而是降低生成代码进入主干前的工程风险。

    Project2026-06-10cc.dev原文 ↗
  • Cate

    Cate 是面向 agentic coding workflow 的开源 canvas IDE。它把需求、上下文、agent 任务和产物放在可视化画布中组织,适合多步编码流程的拆解和回看;这类界面要解决的是聊天线性历史难以表达并行子任务的问题。

    Project2026-06-10cate.cero-ai.com原文 ↗
  • anthropics/claude-code-action

    claude-code-action 让 Claude Code 在 GitHub PR 和 issue 中回答问题或实现代码修改。README 说明它可根据 `@claude` mention、issue assignment 或显式 prompt 激活,并支持 Anthropic API、Bedrock、Vertex AI 和 Microsoft Foundry 等认证路径。它代表 agent…

    Trending2026-06-08github.com原文 ↗
  • Open-LLM-VTuber

    Open-LLM-VTuber 是本地跨平台 LLM VTuber 项目,支持语音交互、语音打断和 Live2D 表现。它把 ASR、LLM、TTS、interrupt handling 与 avatar runtime 串成一条实时链路。这个项目的复杂度主要在低延迟交互编排,而不是单次文本生成。

    Trending2026-06-07github.com原文 ↗
  • pg_durable

    pg_durable 是 PostgreSQL 内部的 durable execution 扩展,工作流用 SQL operator 组成图,再由 background worker checkpoint 每一步。README 明确说它适合 embedding pipeline、ingest pipeline、scheduled maintenance、fan-out aggregation 和外…

    Project2026-06-06github.com原文 ↗
  • BoundaryML/baml

    BAML 用 schema-first 的方式定义 AI-powered functions:开发者写类型、prompt 和输出结构,框架把 schema 注入 prompt 并帮助解析结果。它解决的是生产 AI workflow 中的结构化输出可靠性,而不是再造一个 agent;在多步骤 agent 里,稳定的 typed boundary 往往比更长提示词更关键。

    Trending2026-06-05github.com原文 ↗
  • OpenSOP

    OpenSOP 用 YAML 定义可执行 agentic processes,并通过 typed REST API 暴露给 agents 和 humans。digest 信息表明它把 SOP 从文档变成可执行流程,使 agent 可以按明确步骤调用,而人也可通过同一 API 参与。这个方向适合把企业流程、审批和多步操作做成 typed interface。它的技术重点在过程定义、类型约束和人机共用…

    Project2026-06-04opensop.ai原文 ↗
  • Chatcode

    Chatcode 是远程控制 Claude Code 和 Codex 的工具,digest 将其定位为 coding agent 远程控制层。公开相邻产品信息显示这一类工具通常把本地 agent session 通过移动端、浏览器或消息通道继续操控。它解决的问题不是模型能力,而是人在离开终端后如何继续监督、打断和追加指令。对长时间运行的 coding tasks,远程控制是 agent workf…

    Project2026-06-04chatcode.dev原文 ↗
  • Terse, TypeScript First Workflow Builder

    TypeScript-first 的开源 workflow builder,面向 IDE 和 Claude Code 工作流。

    Project2026-06-03github.com原文 ↗
  • Cloud CI and agentic workflows for embedded hardware development

    Jumpstarter 是开源测试自动化框架,用统一 API 连接真实和虚拟 embedded devices,并接入 CI/CD。README 强调 UART、CAN、SPI、GPIO、电源和 USB 等硬件抽象,Python/PyTest 生态集成,团队安全租用测试硬件,以及人、脚本、CI、AI agents 共用接口。它把嵌入式硬件测试从人工台架操作推向可编程、可共享的流水线。

    Project2026-06-02github.com原文 ↗
  • BloopAI/vibe-kanban

    vibe-kanban 面向 Claude Code、Codex 等 coding agents 提供规划与 review kanban。它把 agent 工作拆成可视化任务流,适合并行开发、审查和状态跟踪。它值得关注在于 coding agent 工具链正在从单次 prompt 执行走向项目管理界面。

    Trending2026-06-02始 2026-06-01github.com原文 ↗
  • Beyond LLMs: Why Scalable Enterprise AI Adoption Depends on Agent Logic

    Hugging Face / IBM Research 博文讨论企业 AI 采用中的 agent logic。其核心观点是企业规模化部署不能只依赖 LLM prompt,而需要可组合、可治理的 agent logic 作为系统层。它值得看在于把企业 AI 的难点从模型接入转向流程、工具、状态和控制逻辑。

    Blog2026-06-02huggingface.co原文 ↗
  • Ministry of Everything

    MoE 是一个 CLI-first agent harness,用 durable markdown canvas 和 Git journal 管理单人操作者与多个 agent 的工作流。它不做后台自动 scheduler,而是让每个阶段产物落在 `projects/<project>/runs/<slug>/documents/<stage>/content.md`,再由下游阶段读取;每轮提交带…

    Project2026-06-01github.com原文 ↗

2026 年 5 月4

  • AI-org - org-mode powered by AI

    AI-org 是基于 opencode fork 的 org-mode 风格任务管理和 agenda 工具。它把 org-mode 的层级任务、agenda 和文本化工作流引入 agent 任务管理,而不是做一个聊天式待办列表。值得看的是它沿用了成熟个人信息管理模型,试图给 AI agent 更稳定的任务组织界面。

    Project2026-05-31ai-org.net原文 ↗
  • SQLite is all you need for durable workflows

    这类设计的好处是把 durable execution 的最小闭环落在一个本地 ACID 数据库上。它适合单节点或边缘部署;一旦需要多写节点、跨区域协调或高并发队列,就要明确何时迁移到更重的系统。

    Blog2026-05-30obeli.sk原文 ↗
  • Dynamic Workflows in Claude Code

    这不是单纯 prompt 模板,而是把 Claude Code 的反复任务沉淀成可调用流程。关键问题会是 workflow 的可审计性、参数边界和失败恢复,而不是“能否生成一个脚本”。

    News2026-05-29claude.com原文 ↗
  • Data Formulator 0.7: AI-powered data analytics for enterprise data

    Data Formulator 0.7 把企业数据连接、agent 引导探索和可视化 refinement 放进同一个 workspace。关键设计不是让聊天框直接答数,而是让 agent 访问数据源、loaded tables、历史 charts 和目标,并生成可复现代码与可编辑图表。

    News2026-05-29microsoft.com原文 ↗