每日 Harness 开源 · Source
主题 · All topics

工具与技能Tools & Skills

本主题共 245 条 · 最早 2026-05-29 · 最新 2026-09-18

视图 · View

2026 年 9 月7

  • Cloudflare/Security-Audit-Skill

    这个 coding-agent 技能采用六阶段审计:先建立侦察账本,再搜寻覆盖空洞、验证候选问题、生成结构化发现,最后独立复核记录并输出中性报告。README 规定 findings.json 的 verdict、证据和置信字段,并要求 Node 与操作系统沙箱,适合把一次性代码审查变成可重放流程。

    Project2026-09-18github.com原文 ↗
    –
  • humanlayer/skills

    HumanLayer 的 skills 集合覆盖 CLAUDE.md 指令重写、React props 收窄、迭代式 agent GitHub Actions、控制环设计和图示说明。每个 skill 都以 `npx skills add ... --skill ...` 安装到项目,重点在把一次性提示转成可重复的 repo-local 工作流;其中 `design-control-loop` 明确…

    Trending2026-09-06github.com原文 ↗
    –
  • earthtojake/text-to-cad

    text-to-cad 把 CAD/CAE/CAM 和机器人描述文件拆成一组可安装 skills,分别负责 STEP 生成、标准件检索、DXF、URDF/SRDF/SDF、DfAM、G-code 和 Bambu 打印。它支持 Skills CLI 以及 Codex/Claude/Grok 原生插件,强调从本地项目文件读取、检查并交接工件;这比单次 text-to-mesh 更接近可验证的机械工程流…

    Trending2026-09-06github.com原文 ↗
    –
  • Yulin Local AWS Simulator

    Yulin 在 Node.js 进程内模拟 AWS 行为,让测试不需要容器、真实云账号或网络依赖。它覆盖 API Gateway、DynamoDB、Cognito、ECR、ECS、CloudWatch 和 WAFv2,ECR/ECS 甚至允许把本地 handler 当作镜像/任务运行;SDK 拦截与 localhost 服务两种入口兼顾单测和集成测试。对基础设施代码而言,重要变化是把“部署后才观察…

    Project2026-09-06yulinsim.dev原文 ↗
    –
  • Using Blender with coding agents on macOS

    Simon Willison 的实践是让 Codex 直接启动 `/Applications/Blender`,用 Blender Python API 生成场景,而不是让模型输出一张不可编辑的图片。几轮自然语言追加就能得到带背景、灯光和动画潜力的 `.blend`,说明桌面软件的脚本接口正在成为 agent 的通用执行面;瓶颈从“能否生成”转向场景资产、渲染时间和结果验收。

    Blog2026-09-06simonwillison.net原文 ↗
    –
  • MCPay - spend authorization and per-call billing for MCP tools

    MCPay 的请求路径是 API 创建预算 session、保存价格快照、签发 Ed25519 spend token,再由 gateway 验证 token/nonce 后转发 MCP 调用,worker 负责结算与重试。设计把授权、用量 ledger 和工具提供者收入拆成 Go 服务、PostgreSQL、持久 gateway 及 JS/Python SDK;但 beta 明确承认不保证 ex…

    Project2026-09-06github.com原文 ↗
    –
  • Fast Cut Video tool for cutting video for Agents

    fastCutVid 把“找片段并拼接”单独做成 Rust/egui 原生工具,媒体分析与导出交给 FFmpeg,核心产物是人和 agent 都能读写的 `fastcut.timeline/v1` JSON。MVP 已覆盖多视频导入、波形、非阻塞分析、split/trim/reorder 和 MP4 渲染;它刻意不做转场、调色或高级混音,当前还要求用户自行安装 FFmpeg,Windows/Lin…

    Project2026-09-06github.com原文 ↗
    –

2026 年 8 月61

  • scientific-agent-skills

    Scientific Agent Skills 将 161 个研究技能和 100+ 科学数据库封装成开放 Agent Skills,覆盖生物、化学、医学和药物发现。K-Dense BYOK 可在本机接 40+ 模型、搜索和文件处理,数据默认留在本地,也能把重计算扩展到云端,说明它把研究流程当作可组合工具链。

    Trending2026-08-28始 2026-06-20github.com原文 ↗
    –
  • garden-skills

    Garden Skills 提供网页/视频演示、前端设计、图像生成和来源转文章等生产级 skills,兼容 Claude Code、Cursor、Codex。项目同时维护 npx CLI、Claude 插件市场、固定 zip、手工复制和 submodule 安装路径,并提供中英日文档,强调复用交付规范。

    Trending2026-08-28github.com原文 ↗
    –
  • context-engineering-kit

    Context Engineering Kit 汇集面向 Claude Code、OpenCode、Cursor、Antigravity 的手工 skills,以较小 token 足迹提高结果质量和可预测性。内容来自团队长期提示实践,并吸收论文/项目插件;仓库还提供 CodeRabbit 的开源替代,重点是流程规范而非新模型。

    Trending2026-08-28github.com原文 ↗
    –
  • browser-use

    Browser Use 让 agent 执行点击、输入、表单填写和结构化网页抽取,Python 库支持自选 LLM 与 `uv` 安装。README 的公开 benchmark 覆盖 100 个真实任务,Odysseys 长时网页任务平均 87.4%;开源本地 agent 与带代理轮换、验证码处理、1000+ 集成的云端版分层提供。

    Trending2026-08-28github.com原文 ↗
    –
  • Telem

    Telem 的 Web Search Router 用单一 API 按成本、延迟、答案质量在多家搜索提供商间选路,并在供应商退化时自动 failover;Web Fetch Router 负责渲染、重试和正文抽取。它还保存搜索 trace 与质量指标,使 agent 的检索选择可回放、可比较,解决了“只知道答案、不知道为何选源”的观测缺口。

    Project2026-08-28telem.ai原文 ↗
    –
  • Godogen

    Godogen 生成的是游戏仓库而不是成品游戏:agent 根据短描述选择 Godot、Bevy 或 Babylon.js,生成资产、运行引擎并用实时画面或录制视频验证。发布仓库只保留运行时清单、引擎指南和资产 skill,其余脚手架由 agent 按指南重建,体现跨引擎的提示驱动工作流。

    Trending2026-08-28github.com原文 ↗
    –
  • Concord

    Concord MCP 以 SQLite 保存仓库级共享状态,提供 `start_work`、`inspect_work`、`update_work`、`transfer_work`、`finish_work` 五类工具,支持编辑前声明文件、检测重叠和带证据交接。版本号使并发状态转移只有一个成功,README 还明确它不是自治 agent、编排器或云端同步服务,这个边界有助于评估部署责任。

    Project2026-08-28github.com原文 ↗
    –
  • BrowserSkill

    BrowserSkill 通过 CLI/扩展让 agent 操作用户已登录的真实浏览器,要求显式借用某个标签页并在任务后归还。该约束保留验证码、企业会话和人工浏览上下文,同时避免 agent 获得整个浏览器的无界控制。

    Trending2026-08-28github.com原文 ↗
    –
  • pgBot

    pgBot 是 PostgreSQL 的只读诊断代理,可直连数据库或驻留 Docker、Kubernetes、VPC 内,检查锁、WAL、vacuum、慢查询和索引。MCP 的 `inspect`、`unused_indexes` 等工具先生成确定性 JSON,再由模型解释;`pgbot://baselines` 可保存历史对照。模型没有写权限,把建议与实际变更分开,适合在生产库上建立低风险的第一…

    Project2026-08-26pgbot.dev原文 ↗
    –
  • only-cli

    only-cli 把网页压成带编号的紧凑终端视图,默认预算 500 token,并使用 Chrome 指纹完成抓取,无需常驻浏览器。作者的 15 页测试中,oc 共消耗 10936 token,Jina 为 148479、Playwright 为 531335、原始 HTML 为 1552491,同时覆盖目标内容。当前只适合阅读和导航:fill、submit、back 尚未实现,JavaScrip…

    Project2026-08-26github.com原文 ↗
    –
  • SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG

    SchemaRouter 把工具、端点、参数、返回字段、领域概念、单位、来源和许可编码为 schema graph,小模型抽取查询意图后,由确定性图投影选择调用及字段。110 道材料科学查询上准确率 0.71,与全量抓取的置信区间重叠,但检索上下文从 2066 token 降到 227,端到端延迟比 prompt-all 低 2.7 倍,工具精确率达 0.93。把字段数压到最少反而使准确率跌至 0…

    Paper2026-08-26arxiv.org原文 ↗
    –
  • Ratify Agent Relay Harness

    Ratify 离线重放委派、handoff、联邦、收据和撤销流程,用 ProofBundle、签名收据与检查点验证每个协议声明,失败即返回非零退出码。Go、TypeScript、Python、Rust、C 五套 SDK 都能复核同一批合成证据。项目还把必须依赖真实 OS 隔离的路径穿越测试标作 SKIP,诚实地区分了跨语言协议一致性和线上部署安全。

    Project2026-08-26github.com原文 ↗
    –
  • WecomTeam/wecom-cli

    wecom-cli 将企业微信的消息、邮件、文档、表格、待办、日程、会议、微盘和通讯录暴露为终端命令,也给 AI Agent 提供对应 Skill。

    Trending2026-08-22github.com原文 ↗
    –
  • Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees

    作者把有限上下文里的 Skill 装载写成硬 token 预算下“单调次模收益减上下文惩罚”的集合优化,并提出多项式时间的 Best Prefix Selection。

    Paper2026-08-22arxiv.org原文 ↗
    –
  • LLMs are proof that Unix won

    作者把编码 Agent 对 shell、文本流、文件和小工具组合的依赖,解释为 Unix 接口哲学在 LLM 时代的延续。

    Blog2026-08-22bastian.rieck.me原文 ↗
    –
  • Claudette

    NoBuzz 为 Claude Code 提供 `/debuzz` Skill,将上一条回复交给 Gemini CLI 按纯英文风格改写,再原样输出,避免 Claude 的二次润色重新引入套话。

    Project2026-08-22github.com原文 ↗
    –
  • Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

    论文受控比较整任务与子任务 Skill,以及文本与代码表示,发现整任务经验多数拖累无记忆基线,拆成子任务后才平均产生正迁移,文本 Skill 又优于代码。

    Paper2026-08-22arxiv.org原文 ↗
    –
  • A shot-scraper-style JSON API on Bun 1.4's new Bun.WebView

    Simon 用 Claude Code 搭建 TypeScript 原型,把 `Bun.WebView` 包成可加载网页、执行 JavaScript 的 JSON API,功能方向接近 shot-scraper。

    Blog2026-08-22simonwillison.net原文 ↗
    –
  • anthropics/skills

    该仓库用包含 `SKILL.md`、脚本和资源的目录封装可复用代理技能,并提供规范、模板与多类示例。多数内容采用 Apache 2.0,但文档、PDF、演示稿和表格类技能使用单独的 source-available 条款。README 还明确要求审查第三方技能中的工具调用,说明“可安装提示包”已经具有接近代码依赖的供应链风险。

    Trending2026-08-19始 2026-05-30github.com原文 ↗
    –
  • agent-codemode

    agent-codemode 不让模型逐次选择 MCP 工具,而是生成 TypeScript 脚本,由脚本直接调用已配置服务并在执行侧聚合结果。仓库以 39 个 Linear ticket 为例,传统工具轨迹为 40 次调用、262159 字符,脚本路径为 1 次调用、903 字符,声称字符量减少 99.66%。这种代码模式显著压缩交互面,但脚本权限仍继承底层 MCP 配置,并不会自动获得额外的鉴…

    Project2026-08-19github.com原文 ↗
    –
  • SkillCommit

    SkillCommit 先生成实例级补丁,再经检索、跨实例重放和 LLM 机制检查,只有行为上可泛化的策略才被提交为共享技能。作者在 RuleArena、OpenExempt 和 KOR 三类环境中测试这条流程,核心判据是新技能是否在不同实例上真实改善行为,而非文本语义是否相似。这个设计针对的是技能库逐步膨胀后的错误合并与能力回退,但摘要没有给出各阶段的独立消融幅度。

    Paper2026-08-19arxiv.org原文 ↗
    –
  • Skill Blocks: How Should an Agent Load Its Skill?

    作者在五类基准上比较全文预载、按需加载、仅给引用和混合加载,并按缓存实际命中量核算输入成本。Skill Block 在 ScienceWorld 和 SynthProc 分别减少 62.5% 与 73.0% 的输入,但 Hybrid 在 SearchQA 和 Spreadsheet 上使成功率下降 27.4 与 39.8 个百分点。配对结果没有发现显著质量差异,却也没有建立统计等价性,结论更接近“…

    Paper2026-08-19arxiv.org原文 ↗
    –
  • NeoBrowser

    NeoBrowser 是约 4 MB 的 Rust 静态程序,通过 CDP 驱动真实 Chrome,提供 43 个 MCP 工具并可沿用现有 cookie 与登录配置。它支持 CAPTCHA 人工接管,覆盖纯无头自动化难以继续的流程;仓库自测认为其调用路径比 Playwright MCP 更快。复用日常浏览器身份也扩大了可访问数据面,部署时需要隔离 profile 并限制 MCP 客户端权限。

    Project2026-08-19github.com原文 ↗
    –
  • HarnessRouter

    HarnessRouter 用一个自托管容器把 Codex、Claude、Hermes 等多种代理 harness 暴露为统一协议。

    Project2026-08-18github.com原文 ↗
    –
  • Does a Language Server Save Tokens for Coding Agents?

    论文没有把 LSP 的工具数量当能力代理,而是用“成功所耗 token”在 Python、TypeScript 仓库及三档 Claude 模型上做五臂消融。

    Paper2026-08-18arxiv.org原文 ↗
    –
  • Demystifying Agent Skills: Why They Work - Until They Don't

    作者通过受控实验拆解 agent skills 的工作机制,累计 8,135 次试验,并从 240 条编码记录中取得 238 个有效标签。

    Paper2026-08-18arxiv.org原文 ↗
    –
  • AgenticSchema

    AgenticSchema 读取网页已有的 JSON-LD、Microdata 或 RDFa Schema.org 标记,并把每个 thing/action 注册成代理可调用工具。

    Project2026-08-18github.com原文 ↗
    –
  • titanwings/colleague-skill

    colleague-skill 已演进为 dot-skill,可从个人材料与工作描述提取 persona/work skill,供 Claude、Hermes、OpenClaw、Codex 和 DeepSeek 等 agent 复用。项目展示库称有 215 个技能、165 名贡献者和累计 10 万卡片星标,并能接入飞书、钉钉、Slack 等工作来源。把隐性经验结构化很有吸引力,但员工同意、敏感信息…

    Trending2026-08-17github.com原文 ↗
    –
  • liustack/modlens

    ModLens 给 DeepSeek、GLM 等纯文本 agent 增加视觉桥接:粘贴图片后借外部视觉引擎生成全文转录、阅读顺序、实体和关系等结构化证据。它内置 6 类 provider、可复用 4 种本地 agent CLI 登录,所有回退写入 `meta.attempts`;API 通道通常 5–10 秒,CLI 约 15–45 秒。其工程重点是显式路由、授权和可见回退,让文本模型依据证据答题…

    Trending2026-08-17github.com原文 ↗
    –
  • cathrynlavery/diagram-design

    Diagram Design 为 Claude Code、Codex 和 Pi 提供自包含 HTML/SVG 制图 skill,覆盖架构、时序、状态机等 27 类版式,每类有浅色、深色和 editorial 三种静态变体。它能从网站提取颜色及字体 token、自动检查 WCAG AA 对比度,也可重绘 draw.io/Mermaid;默认输出无脚本,动效走受限模板。最可复用的资产是明确的密度、语义…

    Trending2026-08-17github.com原文 ↗
    –
  • MathCode

    MathCode 把自然语言数学题转成 Lean 4 定理,再借助 Lean LSP、Loogle 和编译错误反馈循环修补证明,结果写入 `LeanFormalizations/`。它还提供子目标树、多规划器和 Obsidian 定理图谱,发布包覆盖 macOS arm64 与 Linux x86_64。相比只生成一段看似合理的推导,这套工作流把答案放进编译器可检查的形式证明边界内。

    Project2026-08-17math-ai-org.github.io原文 ↗
    –
  • HKUDS/CLI-Anything

    CLI-Anything 为 GUI 软件生成 agent 可调用的命令行 harness,并用结构化 JSON、SKILL 文档及 registry/`cli-hub` 管理适配。已有 FreeCAD、Blender、GIMP、Joplin 等入口;其中 FreeCAD harness 含 17 个命令组、258 个命令,Joplin 适配列出 134 个测试。把界面点击改成可脚本、可断言的命令…

    Trending2026-08-17github.com原文 ↗
    –
  • deepseek-ai/awesome-deepseek-agent

    该仓库集中维护 DeepSeek-V4-Pro、Flash 等模型接入编码 agent 的安装、配置与首次运行指南。覆盖对象包括 Claude Code、Codex、Cline 等多种工具,作用是把端点、模型名和兼容参数差异整理成可执行步骤。它是集成索引而非 agent 框架,实用性取决于文档能否跟上模型接口和客户端版本的快速变化。

    Trending2026-08-16github.com原文 ↗
    –
  • cactus-compute/needle

    Needle 面向手机、可穿戴设备和嵌入式硬件执行工具调用,模型只有 45M 参数,CQ2 二进制约 14 MB,运行内存约 28 MB。它用字节级 grammar 约束函数与参数格式,以置信度头决定是否调用工具,并先检索最相关的 5 个工具;256-token 滑动窗口把工具定义固定为 KV sinks。与通用小模型相比,它把容量集中在受约束动作生成上,代价是开放问答能力和复杂长上下文并非设计重…

    Trending2026-08-16github.com原文 ↗
    –
  • Velorn

    Velorn 是一套 Electron 桌面视频工作站,把规划、素材生成、多轨剪辑、字幕、效果和导出放在同一工作流里。常规剪辑无需 ComfyUI,生成能力则连接本地 ComfyUI,可导入自定义 workflow JSON;README 还列出 500 多个官方模板,并暴露含 100 多项工具的 MCP 接口。编辑操作采用预览后执行并支持撤销,降低 agent 直接改时间线的风险;GPL-3.0…

    Project2026-08-16github.com原文 ↗
    –
  • NVIDIA-NeMo/Switchyard

    Switchyard 是 Rust 实现的 LLM 代理与库,可在 OpenAI Chat/Responses、Anthropic Messages 之间转换,并把请求送往 vLLM、NIM、Ollama 等后端。路由既可随机,也可用模型分类、阶段编排或失败升级策略;Prometheus 指标覆盖请求、错误、延迟、token 和代理开销。统一协议与路由逻辑能减少应用侧适配,但仓库明确处于 pre-…

    Trending2026-08-16github.com原文 ↗
    –
  • Agent Desktop

    Agent Desktop 是 Rust 编写的原生桌面自动化 CLI,通过辅助功能树定位控件并返回稳定引用,不依赖截图或像素匹配。README 列出 58 个命令名,其中 54 个已经可运行;渐进式 skeleton 输出据称能减少 78%–96% 的上下文消耗,Chromium 应用还可转用 CDP。它把 Playwright 式“检查后操作”延伸到系统界面,不过当前平台要求是 macOS 1…

    Project2026-08-16github.com原文 ↗
    –
  • kepano/obsidian-skills

    这个仓库按 Agent Skills 标准提供 5 个 Obsidian 技能:Markdown、Bases、JSON Canvas、CLI 和 Defuddle 网页提取。Claude、Codex、OpenCode 等兼容客户端可直接读取规则,输出仍落在普通 Markdown、JSON 与可检查命令中。它没有另造知识库 API,而是把 Obsidian 文件格式中的细节显式教给 agent,因而…

    Trending2026-08-15github.com原文 ↗
    –
  • apify/apify-mcp-server

    Apify MCP Server 让 agent 把网页抓取、社交平台、搜索、地图和电商 Actor 当作 MCP 工具,README 称可接入 8,000 多个 Actors。托管端支持 OAuth、Streamable HTTP 与结构化结果 schema 推断,本地则可用 `npx @apify/actors-mcp-server` 经 stdio 启动;旧 SSE 入口已删除。它把大规模抓…

    Trending2026-08-15github.com原文 ↗
    –
  • MCP-stama

    MCP-stama 是无第三方依赖的 Rust stdio JSON-RPC server,提供 fast_grep、基于 gix 的 git_snapshot 和 docker_watcher。README 的 100 次自测中,docker 工具 p50 为 327 微秒、p99 为 1.66 毫秒,Git 为 462 微秒和 1.36 毫秒,grep 为 5.05 与 8.72 毫秒;二进制…

    Project2026-08-15github.com原文 ↗
    –
  • brightdata/cli

    Bright Data 官方 CLI 把 Web Unlocker 抓取、三种搜索引擎、意图 discovery、40 多个平台数据管线、远程浏览器和 AI scraper 生成/修复整合成同一命令面。它能给 Claude Code、Cursor、Codex 安装 skill 或写 MCP 配置;自愈 scraper 会停在 approval gate,AI 生成碰并发上限则指数退避,默认重试四次…

    Trending2026-08-12github.com原文 ↗
    –
  • Your Prompt Is Not the Only Prompt

    论文把结构化输出中的 schema description 当作第二条指令通道,在两个厂商的十种配置上,用 nonce label 分类隔离标签先验。GPT-4.1 与无 reasoning 的 GPT-5.4 中,schema 放定义比 system prompt 低 11–13 点;当两者冲突时,错误 schema 可令准确率跌 5–45 点,Claude Haiku 4.5 更从 52.5%…

    Paper2026-08-12arxiv.org原文 ↗
    –
  • What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files

    作者依据官方规范和最佳实践建立两层缺陷分类,检查来自 20,556 个仓库的 138,133 份 `SKILL.md`,不是只抽样几个热门 skill。91.8% 至少命中一项缺陷,宽松到严格阈值下仍为 88.8%–94.6%,主因是弱路由元数据、臃肿或不可执行的正文和资源组织失序,而非罕见安全攻击。20,000 项 skill 的确定性路由压力测试进一步表明,规范元数据确实提高启动描述中的召回;…

    Paper2026-08-12arxiv.org原文 ↗
    –
  • Mcptoon

    Mcptoon 用一个零依赖 CLI 统一 stdio/HTTP MCP server,把工具列表和结果输出成紧凑 TOON,同时能导出 OpenAI function、OpenAPI 3.0 与原生 MCP manifest,任何会跑 shell 的 agent 都能接。README 自报 manifest token 省 97%、结果省 40%–60%,并提供五分钟 schema cache、…

    Project2026-08-12github.com原文 ↗
    –
  • Go is an ideal language for AI-assisted software engineering

    Google 认为 Go 的小语法面、强约定和统一 `fmt`、build、test、vet/module 工具链,能减少 coding agent 的无效选择,并让改动快速进入机械验证。这个论点把“适合 AI”落在反馈闭环与可验证性,而不是宣称模型天生更会写 Go。它仍是一篇语言工程立场文,不是控制任务难度后的跨语言 benchmark;可取之处是把 agent 效率归因到工具表面设计。

    News2026-08-12developers.googleblog.com原文 ↗
    –
  • Mistral patent for “code implemented tool calls”

    USPTO 公报中的 Mistral 专利描述模型生成代码、再由代码实施外部工具调用的流程。相较固定 schema,这种做法把循环、条件和参数处理交给运行时代码,随之扩大了沙箱、审计和资源限制的必要性。该条只说明专利文件所述方法,不对权利要求有效性或产业影响作法律判断。

    News2026-08-11patentsgazette.uspto.gov原文 ↗
    –
  • google/skills

    这是 Google 产品与 Google Cloud 的官方 Agent Skills 集合,可用 `npx skills add google/skills` 整包安装,也能只选目标 skill。目录覆盖 GKE、AI、数据库等云服务,并给出将 skills 与 MCP 一起分发到 Claude、Codex、Antigravity 的 plugin 路径。仓库仍在持续开发,实际接入时需要逐项审阅…

    Trending2026-08-10始 2026-06-10github.com原文 ↗
    –
  • Sufleur

    Sufleur 把提示词包管理设计成 npm 式流程:`sufleur.yaml` 声明依赖,锁文件固定版本,生成器输出单个 TypeScript 或 Python 文件。生成代码带类型化输入和基于 Zod/Pydantic 的 `parseOutput`,部署时既不需要厂商 SDK,也不需要运行时远程拉取;公共提示词无需账号或 API key 即可安装。它把提示词版本、文件、eval 和应用侧类…

    Project2026-08-10github.com原文 ↗
    –
  • Agent Hop

    Agent Hop 读取 Claude Code、Codex、OpenCode、Pi 与 Grok Build 的原生会话,统一成 `{role,text}` 后再由适配器写回目标工具格式,既支持搜索也能真正恢复。检索先在每次按键时跑 BM25,再用本地 WASM 版 `all-MiniLM-L6-v2` 做语义细化,并维护增量向量索引;README 称五个适配器均经过真实续接验证。它把会话可移植…

    Project2026-08-10github.com原文 ↗
    –
  • usekaneo/kaneo

    Kaneo 是可自托管的轻量项目管理系统,标准部署使用 Docker Compose 与 PostgreSQL 16,也提供 Helm 路径。它内置 HTTP MCP 端点 `/api/mcp`,另有 npm 发布的 stdio MCP,使代理可以通过正式接口操作任务而非模拟点击。功能范围保持在项目与事项协作,部署透明度和代理接口是它区别于托管看板的两条主线。

    Trending2026-08-09github.com原文 ↗
    –
  • Agent Feedback

    Agent Feedback 在 Vite 或 Next.js App Router 的开发页面上叠加标注层:点击元素并写指令后,会把 selector、组件、页面与说明追加到 `.agent-feedback/feedback.jsonl`,同时在终端输出。嵌套节点会归一到可交互祖先,生产构建则排除这套界面;数据只留本地,不依赖账号或外部服务。它把含糊的截图反馈转成代理可定位的 DOM 上下文,…

    Project2026-08-09github.com原文 ↗
    –
  • Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

    OSWorld-MCP 在 309 个任务上控制工具集合,发现同一工具让推理模型提高 4.0 个百分点,却让非推理模型下降 5.9 个点,每个条件重复 5 次且差异超过 2 个标准误。

    Paper2026-08-08arxiv.org原文 ↗
    –
  • mcp-use v2

    mcp-use v2 按新版 MCP 改成无状态请求:每次携带协议与客户端信息,以 `server/discover` 和 requestState 支持发现与多轮处理,底层切换到官方 SDK v2。

    Project2026-08-07manufact.com原文 ↗
    –
  • Sift

    Sift 将多个 MCP server 收拢到 `search_tools` 与 `call_tool` 两个接口,代理先检索候选工具,选中后才加载完整 schema。

    Project2026-08-07github.com原文 ↗
    –
  • Channels SDK

    Channels SDK 把兼容 AG-UI 的代理连接到 Slack、Teams 和 Discord,在聊天入口保留流式回复、工具调用、文件处理与人工审批。

    Project2026-08-07github.com原文 ↗
    –
  • czlonkowski/n8n-mcp

    n8n-mcp 向 MCP 客户端结构化开放 n8n 的节点文档、属性、操作、模板与工作流校验。README 统计 2,412 个节点,其中 829 个核心、1,583 个社区节点;属性 schema 覆盖率 99%,模板库有 2,352 项。搜索、分级取数和多阶段验证让它超出静态文档索引,但维护者明确警告不要让 AI 直接修改生产工作流。

    Trending2026-08-06github.com原文 ↗
    –
  • blader/humanizer

    Humanizer 以一份可移植 Markdown 技能审查并改写常见机器生成文风,要求保留原有事实、观点和语气。README 将问题划分为 33 种模式,并规定完成改写后再审计一次,其中“不得捏造事实”是硬约束。它没有复杂运行时,优势恰是规则可读、可移植,也方便编辑者逐条检查代理为何改动文本。

    Trending2026-08-06github.com原文 ↗
    –
  • Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

    论文针对超时、延迟可见和部分写入这类“调用可能已生效、响应却不确定”的故障,在工具层加入后置条件、重试前验证和幂等语义。受控故障注入表明,该协议在保持相近任务成功率的同时显著减少重复副作用。它把可靠性责任从代理的猜测式重试下沉为可检查的调用契约,适合支付、消息发送和资源创建等不可随意重放的动作。

    Paper2026-08-06arxiv.org原文 ↗
    –
  • OpenEdit

    OpenEdit 不提供传统时间线 GUI,而让编码代理直接生成和修改视频工程,字幕样式由 HTML/CSS 描述。当前 Apple Silicon、macOS 26 路径使用 VEED 的闭源但免费渲染器,仓库给出的内部初步数据最高比 Chrome 快 2.2 倍,尚没有外部可复现基准;v1 重点也仍是字幕。它值得观察的是“视频编辑即代码”的接口设计,而非现阶段的跨平台成熟度。

    Project2026-08-06github.com原文 ↗
    –
  • Labgrid MCP

    Labgrid MCP 将实验室的预约、电源、串口、mux、刷写和 SSH 暴露为 47 个工具与 5 个资源,并给操作加只读或破坏性注解。刷写和删除默认关闭,演示环境可直接通过 `uvx` 启动。相比通用 shell MCP,它把硬件实验室的资源占用和危险动作显式建模,更便于客户端做权限与确认策略。

    Project2026-08-06github.com原文 ↗
    –
  • HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

    HyperAgent 将工具调用建模为有向超图:工具是从输入 schema 指向输出 schema 的超边,再从相关上下文图生成 schema-aware 任务 DAG,并按能力缺口扩展计划。AppWorld 实验显示,这种显式结构能提高任务完成度,同时减少冗余 API 调用、模型交互和 token;真正的贡献是让规划约束来自接口结构,而非只靠自然语言反思。

    Paper2026-08-06arxiv.org原文 ↗
    –

2026 年 7 月69

  • oraios/serena

    Serena 通过语言服务器与符号级代码分析,为编码 Agent 提供查找定义、引用关系、结构化编辑和重构能力,并可作为 MCP Server 接入多种客户端。它避免让模型反复读取整文件,转而围绕类、函数和符号关系操作代码。仓库同时支持多语言与项目记忆,定位更接近“Agent 的 IDE 后端”而非又一个聊天界面。

    Trending2026-07-25github.com原文 ↗
    –
  • CockroachCrawler

    CockroachCrawler 将普通 HTTP 抓取、浏览器自动化、PDF 解析、正文抽取和 MCP 接口打包到一套工具链中。调用方可以按页面复杂度在轻量请求与完整浏览器之间切换,并把结果交给 Agent 继续处理。统一接口减少了多种爬取组件的胶水代码,但部署时仍需处理站点条款、限速与不受信任页面内容。

    Project2026-07-25github.com原文 ↗
    –
  • Browser Bridge

    Browser Bridge 通过 Chrome DevTools Protocol 和 MCP,把用户已经登录的浏览器会话暴露给 Claude Code、Codex 等 Agent。工具支持页面导航、DOM/可访问性快照、点击、输入、截图、标签页和网络请求检查,并可选择仅允许本地连接。与启动隔离浏览器不同,它能复用真实 cookie 与登录状态,因此便利性很高,权限边界也必须按本机高信任工具处理…

    Project2026-07-25github.com原文 ↗
    –
  • Palmier Pro

    Palmier Pro 是面向 macOS 的开源视频编辑器,把常规时间线编辑、AI 生成能力与本地 MCP 服务放在一个应用中。MCP 让外部 agent 能以工具方式操作素材和编辑流程,而不只生成一段不可执行建议;项目展示了桌面创作软件如何把 agent 接口直接嵌入本地资产工作流。

    Project2026-07-24始 2026-06-21github.com原文 ↗
    –
  • Decode-Time Grammars

    Decode-Time Grammars 让调用方在生成过程中逐步提供语法片段,把语法约束从固定编译产物变成可组合的解码接口。模型无需针对每门 DSL 重新训练,就能在 token 级屏蔽非法续写;实验覆盖低资源语言、专用 API 和多种模型,显示严格语法能显著提升可解析率,但语义正确性仍取决于模型本身。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • Claude Code Proxy

    Claude Code Proxy 接收 Anthropic Messages API 形态的请求,再适配到 Codex、Kimi、Grok、Cursor 等后端,使 Claude Code 客户端不必随模型供应商改变工作流。代理层负责请求/响应格式、流式事件和工具调用兼容;它的工程难点不在普通转发,而在维持不同模型协议之间的行为一致性。

    Project2026-07-24始 2026-07-15github.com原文 ↗
    –
  • Browser Tools SDK

    Browser Tools SDK 为智能体提供真实浏览器会话中的导航、DOM 读取、点击、输入、截图与网络观察能力,并以 TypeScript 工具接口暴露。它强调让 agent 操作实际网页而非简化模拟环境,适合端到端测试和网页任务执行。真实浏览器提高了行为保真度,也意味着权限隔离、凭据保护和页面注入必须纳入部署设计。

    Project2026-07-23libretto.sh原文 ↗
    –
  • moonshine-ai/moonshine

    Moonshine 把 ASR、意图识别和 TTS 组合成低延迟语音接口工具包,目标是支持持续对话式代理,而非只生成一份音频转写。集成式设计有利于共同优化首字延迟、打断处理和端点检测,也方便在本地设备上避免多服务往返。项目的实际竞争力需要用端到端延迟、噪声鲁棒性、语言覆盖和长时间流式稳定性衡量,而不能只看单个识别模型分数。

    Trending2026-07-22github.com原文 ↗
    –
  • PrefectHQ/fastmcp

    FastMCP 将 MCP 的协议样板压缩为 Python 装饰器:函数签名自动变成 schema、验证和文档,客户端侧则封装传输、认证与生命周期。除 server/client 外,新体系还包含能在对话内呈现交互 UI 的 Apps,并提供企业网关 Horizon 做 SSO、工具级 RBAC、审计和回滚。README 称项目日下载约一百万次、某版本覆盖约 70% 的 MCP servers;这…

    Trending2026-07-22github.com原文 ↗
    –
  • Glass

    Glass 不是把截图能力简单包装成 MCP,而是提供应用启动、视觉捕获、输入注入、日志读取和画面变化检测的一整套闭环。由于从外部驱动 GUI,它不要求项目采用特定框架,并已覆盖 X11、Wayland、Windows、Android AVD、iOS Simulator 与 macOS。跨平台抽象很有吸引力,但黑盒视觉检查天然比 DOM 或可访问性树更脆弱,实际可靠性取决于后端能否提供稳定的结构化…

    Project2026-07-22github.com原文 ↗
    –
  • memorywire: A Vendor-Neutral Wire Format for Agent Memory Operations

    memorywire 不是新 memory algorithm,而是为 agent memory 定义 JSON-Schema 2020-12 wire format,覆盖 remember、recall、forget、merge、expire 五类操作和四类 memory。参考实现提供 sqlite-vec、mem0、Letta、Cognee、pgvector 五个 backend adapte…

    Paper2026-07-21arxiv.org原文 ↗
    –
  • Scalable LLM Agent Tool Access in the Cloud

    这篇把 MCP 云端规模化问题抽成 gateway 架构:legacy service integration、协议兼容、access control、tool recommendation、session-aware routing 都由 gateway 接管。论文给出的关键数字是 hybrid retrieval 保持 98% Top-15 recall,并把可访问工具扩展到 3,000+。t…

    Paper2026-07-21arxiv.org原文 ↗
    –
  • Reverse-engineering is cheap now

    Simon Willison 记录 coding agents 如何降低家用设备逆向工程和自动化脚本编写成本。核心变化是,抓包、读协议、试错脚本和控制自动化不再全部依赖人工长时间摸索,agent 可以快速生成候选解释与工具代码。这个变化会扩大逆向工程的参与人群,同时也会让设备厂商更难依赖“接口不公开所以没人会用”这一隐性壁垒。

    Blog2026-07-21simonwillison.net原文 ↗
    –
  • Hail.so - Open-source phone, SMS and email for agents and humans, v0.15

    Hail 把电话、SMS、email 包成 agent 可调用通信平台,当前定位是 outbound first、inbound next、自托管 AGPLv3。自托管 quickstart 需要 Twilio、LiveKit Cloud、Deepgram、Cartesia,以及 OpenAI/Gemini/Anthropic 之一;agent 可以通过 HTTP API 或 MCP endpoi…

    Project2026-07-21github.com原文 ↗
    –
  • ibelick/ui-skills

    ibelick/ui-skills 是面向 design engineer 的 UI skill 集合和 CLI。digest 给出的项目定位是把可复用的界面实现经验、组件模式和设计工程流程包装成 agent 可调用的 skills。它关注的不是某个单独组件,而是让 AI coding agent 在做 UI 时带着稳定的视觉、交互和实现约束工作。随着 coding agent 更常接手前端任务,…

    Trending2026-07-20github.com原文 ↗
    –
  • KnockOutEZ/wigolo

    wigolo 是面向 AI coding agent 的本地优先搜索、抓取、爬取和研究 MCP 工具。digest 强调它把 research 能力做成 agent 可调用的 MCP server/tool,而不是依赖远端浏览器服务。组合点包括本地搜索、网页抓取、爬取上下文,并把结果返回给 coding agent 使用。它适合补上 agent 在“查资料”环节的工具缺口,尤其是在希望浏览过程留在…

    Trending2026-07-20github.com原文 ↗
    –
  • A schema you change by talking to it, without the model writing SQL

    mutable-crm 做的是一个可通过自然语言修改 schema 和 UI 的 CRM 原型,但它把 LLM 的权限限制在 typed tools 上,而不是让模型直接生成 SQL。README 明确列出四个 schema 工具:`createTables`、`addColumn`、`renameColumn`、`changeColumnType`;没有 drop 工具,模型也只看表名、列名和类…

    Project2026-07-20github.com原文 ↗
    –
  • stripe/ai

    stripe/ai 提供把 Stripe billing 接入 LLM 和 agent 框架的 SDK 与示例。它将支付、订阅、计费和工具调用连接起来,使 AI 应用可以查询账单、执行商业流程或接入用量计费。项目看点在于 Stripe 把自己放进 agent 工具生态,而不只是提供传统 REST API 文档。

    Trending2026-07-16github.com原文 ↗
    –
  • StyleSeed

    StyleSeed 是给 AI agent 使用的设计规则引擎,用规则约束 UI 生成结果。它不是组件库,而是把品牌、布局、色彩和交互偏好编码成 agent 可执行约束。项目的核心在于减少生成式 UI 的随机漂移,让同一产品的多个界面保持一致视觉语言。

    Project2026-07-16github.com原文 ↗
    –
  • One MCP setup for 22 clients

    toolport 是本地 MCP gateway,目标是用一套配置服务 22 个 MCP client。它通过少量 meta-tools 和 lazy tool discovery 暴露能力,并复用认证配置,减少每个客户端重复维护 server 列表。这个项目击中的痛点是 MCP 生态碎片化:工具多起来后,配置和凭据比单个工具本身更难管理。

    Project2026-07-16github.com原文 ↗
    –
  • Nutlope/hallmark

    hallmark 是面向 Claude Code、Cursor 和 Codex 的设计 skill,内置主题和 UI 生成约束。它把视觉偏好包装成 agent 可加载规则,帮助编码助手生成更一致的界面。这个仓库说明“设计系统”正在变成 prompt、规则和 skill 的组合,而不仅是 Figma 文件或 React 组件。

    Trending2026-07-16github.com原文 ↗
    –
  • Nable

    Nable 是本地优先的 cloud/AI cost intelligence MCP 工具,聚合账单并暴露成本分析能力。它把成本查询接入 agent 工作流,使开发者可以在同一个对话或 IDE 环境里追问云资源、AI 用量和费用异常。这个方向反映出 FinOps 正在从仪表盘向可操作工具接口迁移。

    Project2026-07-16github.com原文 ↗
    –
  • Designing Agent-Ready Websites for AI Web Agents

    这篇论文把问题从“训练更聪明的 Web agent”转向“网页是否适合 agent 操作”,提出 agent-ready website 框架。作者用机器可读性、可执行性和决策可靠性三个维度描述站点应暴露的结构与语义。它的看点在于把 Web agent 出错的一部分原因放回网站设计,给未来的页面标注、交互状态和任务接口提出了工程化要求。

    Paper2026-07-16arxiv.org原文 ↗
    –
  • Aict

    Aict 提供一组面向 AI agent 的 Unix coreutils 风格命令,并输出 XML/JSON 结构化数据。它保留 shell 小工具可组合的优势,但把表格、错误和字段变成模型更容易解析的格式。这个思路非常工程化:与其让 agent 猜普通 CLI 输出,不如给它稳定的机器接口。

    Project2026-07-16github.com原文 ↗
    –
  • Vexa-ai/vexa

    Vexa 是面向 Google Meet、Microsoft Teams 和 Zoom 的开源会议转写 API。摘要强调实时 WebSocket transcript 与 MCP server,使会议内容可以直接进入 agent 或自动化流程。它的看点是把会议 bot、转写服务和 agent 接口放进同一个可自托管项目里。

    Trending2026-07-15github.com原文 ↗
    –
  • The MCP Census

    The MCP Census 对 MCP server 生态做报告和索引,digest 给出的规模是 15,382 个 servers。它做 health check,并把可用性、元数据和发现问题集中呈现。这个项目提供的是生态基础数据:MCP 的热度需要和实际可连接、可维护的服务数量分开看。

    Project2026-07-15mcpcensus.pages.dev原文 ↗
    –
  • OpenCut-app/OpenCut

    OpenCut 是开源视频编辑器,目标覆盖 Web、desktop 和 mobile。digest 还提到 headless 与 MCP server 模式规划,说明项目希望把剪辑能力开放给自动化和 agent,而不只是提供人工界面。它位于多端创作工具与可编排媒体引擎的交界处。

    Trending2026-07-15github.com原文 ↗
    –
  • Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

    这篇综述把 skill library 看成会持续演化的运行时资产,而不是一组静态 prompt 或脚本。文章按生命周期整理技能发现、表示、检索、执行、更新与治理机制,并比较代码技能、工具技能和程序化记忆等形态。它的价值在于给“agent 会积累能力”这件事建立词汇表,同时指出版本控制、评测和退役机制仍缺统一做法。

    Paper2026-07-15arxiv.org原文 ↗
    –
  • mcp-spec-check

    mcp-spec-check 是一个 CLI,用黑盒方式检查已部署 MCP server 是否适配 2026-07-28 spec 的核心变化。它不需要服务器源码,而是通过远程协议交互判断 readiness,这让兼容性检查可以放进发布前或升级前流程。MCP 生态正在快速扩张,协议版本差异会直接影响 agent 工具调用稳定性,这类探针的价值会随服务数量上升。

    Project2026-07-13github.com原文 ↗
    –
  • google-labs-code/stitch-skills

    stitch-skills 是面向 Google Stitch MCP server 的 Agent Skills 集合,并遵循 Agent Skills open standard。它把可复用能力打包成 skill,让 agent 在设计或应用生成流程中调用。这个仓库说明 MCP 相关生态正在从单个工具 endpoint 扩展到可分发能力包。

    Trending2026-07-13github.com原文 ↗
    –
  • Skyvern-AI/skyvern

    Skyvern 用 LLM 和 computer vision 自动化浏览器工作流,并提供 Playwright-compatible SDK。它区别于固定选择器脚本的地方,是让模型根据页面视觉和状态决定下一步动作。浏览器自动化一旦进入真实后台系统,验证、回滚和人类审批会成为与识别能力同等重要的部分。

    Trending2026-07-13github.com原文 ↗
    –
  • MCP Gateway

    MCP Gateway 把 OpenAPI 接口和数据库转换为 MCP server。它复用已有 API schema 与数据库元数据生成模型可调用的 tools/resources,减少每个内部系统都手写 MCP 适配层的成本。这个工具击中的是真实集成痛点:MCP 的价值取决于企业现有系统能多快被安全、结构化地暴露出来。

    Project2026-07-11swaggertomcp.com原文 ↗
    –
  • ChatGPT Work

    OpenAI 介绍 ChatGPT Work,面向企业工作流提供云端与桌面端能力。条目强调它服务于实际工作任务、工具连接和跨应用操作,而不是只作为网页版问答入口。值得注意的是产品叙事从“聊天”继续转向“工作代理层”,这会影响企业权限、数据边界和审计需求。

    News2026-07-11openai.com原文 ↗
    –
  • iOfficeAI/OfficeCLI

    OfficeCLI 是面向 AI agents 的 Office 文件读写与自动化 CLI,覆盖 Word、Excel 和 PowerPoint。README 强调它是 open-source、single binary、no Office installation、no dependencies,并内置 HTML rendering engine,可把 `.docx`、`.xlsx`、`.ppt…

    Trending2026-07-09始 2026-07-07github.com原文 ↗
    –
  • dotnet/skills

    dotnet/skills 是 .NET 团队维护的 agent skills 仓库,为 coding agents 提供 .NET 与 C# 开发任务知识。README 列出多个插件:`dotnet` LSP 集成、`dotnet-msbuild` 构建诊断与现代化、`dotnet-test` 测试运行与分析、`dotnet-ai` LLM/RAG/MCP/ML.NET 相关能力,以及 .NET…

    Trending2026-07-09始 2026-07-06github.com原文 ↗
    –
  • Task Decomposition-Guided Reranking for Adaptive Agent Skill Retrieval

    SkillReranker 面向大型 skill library 中“多个泛化 skill 都语义相近”的选择难题,在 inference time 用任务分解来重排候选 skill。它同时分解 task 和 skill,生成 subtask、execution-state 与 transition-state 描述,再构成一个有向无环执行图:中间 task states 是节点,candidat…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • Skill-extractor turns coding agent transcripts into reusable skills

    skill-extractor 从 Claude Code、OpenAI Codex CLI 或其他 agent transcript 里挖可复用 skill,而不是让 agent 平台用不可见 memory 自动学习。它按 confidence 和 utility 给候选打分,并用 trace outcome(successful / meh / failed)加权;候选会进入 VS Code…

    Project2026-07-09github.com原文 ↗
    –
  • SawyerHood/dev-browser

    dev-browser 是一个 Claude Skill,让 agent 可以通过 sandboxed JavaScript scripts 控制浏览器。README 提到脚本运行在 QuickJS WASM sandbox 中,没有 host access;同时支持 persistent pages,让 agent 一次导航后可以跨多个脚本持续交互,并能 auto-connect 到浏览器。它不…

    Trending2026-07-09github.com原文 ↗
    –
  • Geosql: A Claude/Codex skill for geospatial data

    GeoSQL 是给 Claude、Codex、GitHub Copilot 的 geospatial analytics skill,面向 PostGIS、BigQuery、Snowflake 和 Wherobots 上的数据分析。README 强调它可以 100% local 或 self-hosted,不需要 SaaS 账号;`pip install geosql && geosql` 后可安…

    Project2026-07-09github.com原文 ↗
    –
  • GPT‑Live

    OpenAI 发布 GPT-Live,把 ChatGPT Voice 的语音交互从 turn-based 模式推进到 full-duplex continuous interaction:模型可以同时听和说,并在每秒多次决定继续听、暂停、插话或调用工具。它还把连续对话层和深度工作层解耦,遇到搜索、推理或更 agentic 的任务时委托给 GPT-5.5,同时保持语音流不断。公告称 GPT-Live…

    News2026-07-09openai.com原文 ↗
    –
  • bradautomates/claude-video

    claude-video 是让 Claude 下载、抽帧、转录并处理视频的 skill。它把视频转换成模型可操作的文本、图像帧和时间线信息,使 Claude 能总结、分析或引用片段。这个仓库的实用点在于把多模态材料预处理包装成 agent 可调用工作流。

    Trending2026-07-08始 2026-07-07github.com原文 ↗
    –
  • The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools

    论文比较自然语言工具和结构化工具调用在多模型上的表现,核心发现是工具接口形式本身会显著影响 agent 能力。自然语言工具把能力描述成模型熟悉的文本语境,在一些任务上可接近甚至优于严格 schema。它挑战了“结构化调用一定更可靠”的默认假设,尤其适合重新审视工具 API 设计。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • JuliusBrussee/caveman

    Caveman 是面向 AI coding agent 的 skill/plugin,用更短、更直接的输出风格减少 token 消耗。它约束 agent 的沟通方式和中间叙述,把上下文预算留给代码、命令和关键状态。这个项目很小,但抓住了 coding agent 的真实成本项:语言冗余也会吃掉窗口和账单。

    Trending2026-07-08github.com原文 ↗
    –
  • Docx-CLI

    Docx-CLI 提供命令行方式读取和编辑 Word `.docx` 文档,目标用户明确包括 agent。它让模型或脚本能检查文档结构、正文和段落并执行修改,而不用依赖 Word GUI 或脆弱的手工复制。这个项目的实用点在办公自动化:很多 agent 能处理纯文本,却卡在真实文档格式上。

    Project2026-07-08github.com原文 ↗
    –
  • ComposioHQ/awesome-claude-skills

    awesome-claude-skills 是 Claude Skills、插件和 agent workflow 的资源列表。它以 curated list 的方式整理技能包、扩展和示例工作流,价值主要来自发现和分类。这个仓库反映 Claude Skills 生态正在从零散技巧转向可复用组件目录。

    Trending2026-07-08github.com原文 ↗
    –
  • Chrome DevTools MCP

    Chrome DevTools MCP 把真实 Chrome DevTools 接到 MCP,让 coding agent 能检查页面结构、网络请求、控制台、性能 trace 和浏览器运行状态。它直接使用 Chrome,而不是用简化浏览器模拟环境,因此适合前端调试、自动化回归和网页 agent 任务。对 coding agent 来说,这相当于把“看页面”升级成“用 DevTools 读页面”。

    Project2026-07-08始 2026-06-18github.com原文 ↗
    –
  • coreyhaines31/marketingskills

    marketingskills 把营销工作拆成 agent skills,覆盖 CRO、copywriting、SEO、analytics、growth、sales/GTM 和 strategy。README 的结构里 product-marketing 是基础 skill,其它 skill 先读取产品、受众和定位,再进入具体任务。这个设计比“让 agent 写营销文案”更系统,因为它把上下文依赖…

    Trending2026-07-07github.com原文 ↗
    –
  • hesreallyhim/awesome-claude-code

    这是 Claude Code 资源合集,收集 skills、agents、status lines、hooks、工作流和相关开发工具。它本身不是运行时项目,而是用 curated list 映射 Claude Code 生态的增长点。看这个仓库可以快速判断社区把精力投向哪里:提示资产、自动化脚本、状态展示、子代理编排和团队规范都在变成可复用部件。

    Trending2026-07-06github.com原文 ↗
    –
  • Open-source phone calling infra for AI agents

    AgentLine 是给 AI agents 使用的开源电话呼叫基础设施,目标是让 agent 能发起、接听和管理真实电话交互。它把电话号码接入、实时音频、转写和 agent 状态管理纳入同一条链路,而不是只做离线语音识别 demo。这个项目说明 LLM 工具调用正在进入传统通信网络,工程难点会从 prompt 转向延迟、失败恢复、通话状态和合规记录。

    Project2026-07-06github.com原文 ↗
    –
  • Local MCP

    Local MCP 是 macOS 本地 MCP 应用,把 Claude、ChatGPT、Cursor 等客户端连接到本机消息、文件和应用上下文。它把多个本地 MCP server 整合成桌面应用形态,降低用户手写 connector 和配置 JSON 的门槛。这个项目的关键不在“又一个 MCP server”,而在本地权限边界、敏感数据访问提示和多 AI 客户端复用同一套上下文。

    Project2026-07-06始 2026-06-07local-mcp.com原文 ↗
    –
  • CoplayDev/unity-mcp

    unity-mcp 是 Unity Editor 与 AI assistants 之间的 MCP bridge,可让助手管理资源、场景和脚本。它把 Unity 编辑器操作暴露成模型可调用工具,避免用户在聊天窗口和 IDE 之间手动搬运代码。这个方向的难点是权限、状态同步和可撤销编辑,因为 agent 一旦能改场景和资源,错误操作的成本会比生成一段脚本更高。

    Trending2026-07-06github.com原文 ↗
    –
  • Better Models: Worse Tools

    Armin Ronacher 描述更强模型在结构化工具调用中生成 schema 之外参数的问题。这个现象说明模型对任务理解更强时,可能更主动推断隐含字段或补充参数,反而破坏工具协议的严格契约。文章把注意力放在接口边界上:工具层需要校验、拒绝和反馈机制,而不是默认相信模型会因为能力提升就更守规矩。

    Blog2026-07-06lucumr.pocoo.org原文 ↗
    –
  • modelcontextprotocol/ext-apps

    modelcontextprotocol/ext-apps 是 MCP Apps 协议和 SDK,用于在 AI chat 客户端中嵌入交互式 UI。它把 MCP 从文本工具调用扩展到可视化应用承载层,让 agent 可以与表单、图表或小应用共同完成任务。这个仓库重要在协议方向:复杂工作流很难永远靠聊天消息和 JSON 工具结果表达。

    Trending2026-07-04github.com原文 ↗
    –
  • agentskills/agentskills

    agentskills/agentskills 定义 Agent Skills 规范和 `SKILL.md` 文档格式,用于给 agent 安装可复用能力。仓库把技能说明、资源和工作流约束打包,避免把所有领域知识塞进一个巨大系统提示。它反映了 agent 能力工程的一条路线:把提示变成可分发、可版本化、可按任务加载的模块。

    Trending2026-07-04github.com原文 ↗
    –
  • The Safari MCP server for web developers

    WebKit 团队发布 Safari MCP server,让开发工具和 agent 可以控制 Safari、检查页面并执行调试任务。它把 MCP 接到真实浏览器运行时,使 agent 能根据 Safari 的实际渲染、网络和开发者工具状态行动。随着 Chrome 和 Safari 都出现 MCP 调试入口,浏览器正在成为 coding agent 的一等工具环境。

    News2026-07-04webkit.org原文 ↗
    –
  • SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    SkillCoach 研究 agent 对可复用 skill 的选择和执行质量,用自演化 rubric 从轨迹中更新评价标准。它不是只打一个 pass/fail 分数,而是让 rubric 随任务分布提炼新的评分维度。技术意义在于 skill-based agent 需要可维护的评估体系,否则 skill 数量增长后很难判断 agent 是选错技能、参数错了,还是执行策略不合适。

    Paper2026-07-04arxiv.org原文 ↗
    –
  • Scopewalker

    Scopewalker 是本地只读 MCP server,为 agent 提供代码行数、复杂度、嵌套深度和参数数量等指标。它通过工具调用把代码库形状暴露给模型,帮助 agent 在重构或审查前判断风险区域。这个项目的亮点是克制:只读指标不会替模型做决定,却能减少模型对代码规模和复杂度的主观猜测。

    Project2026-07-04github.com原文 ↗
    –
  • vas3k/TaxHacker

    TaxHacker 是自托管 AI accounting 应用,面向 freelancer、indie hacker 和小企业的收据、发票、交易分析。README 描述上传照片、PDF 或 invoice 后,系统会抽取 product names、amounts、items、dates、merchants、taxes,并写入类似 Excel 的结构化数据库。可自定义字段和 prompt 的设计让…

    Trending2026-07-03github.com原文 ↗
    –
  • t8y2/dbx

    DBX 是 15MB 级跨平台数据库客户端,支持桌面和 Docker 自托管,并带 built-in AI assistant。README 标称支持 60+ databases,包括 MySQL、PostgreSQL、SQLite、Redis、MongoDB、DuckDB、ClickHouse、SQL Server 等。它的卖点不是单个数据库能力,而是以小体积把多数据库管理、跨平台打包和 AI…

    Trending2026-07-03github.com原文 ↗
    –
  • getmaxun/maxun

    Maxun 是开源 no-code 平台,用于 web scraping、crawling、search 和 AI data extraction,口号是把任意网站转成 structured API。README 指向 Web app、文档和教程,适合不想手写爬虫但需要结构化数据抽取的团队。页面还出现 residential proxy 赞助信息,提到 9000 万以上真实 IP 和 200 多个…

    Trending2026-07-03github.com原文 ↗
    –
  • Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

    这篇把 agent skills 看作 dependency-bearing artifacts,指出它们的 identities、versions、provenance 常常是隐式的,已经造成 duplicated dependencies 和 inconsistent installations。SkillDepAnalyzer 借鉴 SBOM 思路,从自然语言依赖证据中恢复 skill me…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • SkillSelect-Serve: Budget-Controllable and QoS-Aware Skill Service Recommendation and Composition for Small LLM Agents

    论文把 agent skill 从可检索文档重塑为 Skill Service:每个 skill 带功能描述、依赖、上下文成本、风险和 QoS 属性。Local Micro-Agent Requirement Planner 将自然语言任务转成结构化服务需求,共享 discovery backbone 从大 registry 中召回候选,再用 skill-level marginal suitab…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • QUALITY.md - open format/specification, agent skill, and CLI

    QUALITY.md 把项目质量评估写成一个开放说明格式,并配套 agent skill 与 CLI。作者在原始描述里强调它最初用于建立 holistic quality evaluation process,后来发现也适合 loop engineering。这里的方向不是再加一个 lint,而是把质量标准、评估步骤和 agent 可执行的检查周期写成项目资产,让修复从事后 review/repa…

    Project2026-07-03getquality.md原文 ↗
    –
  • Claude-real-video - any LLM can watch a video

    这个工具把视频变成任何 LLM 都能消费的本地文件夹:关键帧、transcript 和 MANIFEST.txt,而不是只把视频链接交给模型。它用 scene-change detection 加 density floor 取代固定 1fps 抽帧,再用 sliding-window dedup 去掉重复镜头;默认 `--max-frames` 是 150,并可通过 Whisper 转写音频。工…

    Project2026-07-03github.com原文 ↗
    –
  • Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

    OpenAgent 将 tool-use agent 的泛化问题形式化为 query、action、observation、domain 四个维度上的 distribution shift,而不是在固定工具集上看 leaderboard。作者构造受控 sandbox,并把扰动组织为 Perception、Interaction、Reasoning、Internalization 四层 hierar…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • ttsc graph

    `@ttsc/graph` 把 TypeScript compiler 看到的真实程序图暴露给 MCP agent:什么调用什么、什么依赖什么、每个符号在哪个文件和行。它的 MCP surface 是单工具 `inspect_typescript_graph`,返回 names、edges、signatures 和 spans,不返回源码正文,所以 graph 查询的 token cost 随仓库…

    Project2026-07-02github.com原文 ↗
    –
  • diegosouzapw/OmniRoute

    OmniRoute 是多 provider AI gateway,试图让 Claude Code、Codex、Cursor、Cline、Copilot 和 Antigravity 共用一个 endpoint 接入大量模型供应商。README 的强营销数字包括 236 providers、50+ free providers、约 1.6B free tokens/month,以及 RTK + Cav…

    Trending2026-07-02github.com原文 ↗
    –
  • cloudflare/skills

    cloudflare/skills 是 Cloudflare 给 Agent Skills 标准准备的一组 skill,覆盖 Workers、Agents SDK 和更广的 Cloudflare Developer Platform。它可通过 Claude plugin marketplace、Cursor marketplace/remote rule、`npx skills add` 或直接复…

    Trending2026-07-02github.com原文 ↗
    –
  • LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents

    LUMOS 把操作系统与浏览器已有的 accessibility metadata 转换为 machine-readable semantic blueprints,包含 stable identifiers、roles、names、values、bounds 和 action affordances。agent 通过 constrained visible-UI primitives 做 obs…

    Paper2026-07-02arxiv.org原文 ↗
    –

2026 年 6 月95

  • browser-use/video-use

    video-use 的目标是让 coding agents 编辑视频,把视频剪辑流程暴露给 agent,而不是让模型只生成脚本或建议。这个方向难点在可观察状态:agent 需要理解时间线、素材、剪切点、导出结果和视觉反馈,不能只依赖文本 diff。它出现在 Trending 里说明 agent 工具正在从代码库扩展到媒体生产工作流。

    Trending2026-06-29github.com原文 ↗
    –
  • alibaba/page-agent

    page-agent 是阿里开源的 JavaScript in-page GUI agent,用自然语言控制网页界面。它可嵌入网页内部,而不是从外部驱动浏览器。这个位置差异很重要:页面内 agent 可以直接接触 DOM、组件状态和应用上下文,也更容易和产品权限、埋点、UI 状态机集成。它适合那些希望给已有 Web 应用加自然语言操作层的团队,而不是只做测试自动化。

    Trending2026-06-29始 2026-06-27github.com原文 ↗
    –
  • Use-zerostack

    use-zerostack 是一个 agent skill,把 Claude Code、Cursor 等 coding agent 的 slash command 映射到 zerostack CLI,让主 agent 可以把实现、计划、审查和复杂编排委派出去。README 给出的命令面很小但明确:`/zs:code`、`/zs:ask`、`/zs:plan`、`/zs:review`、`/zs:p…

    Project2026-06-29github.com原文 ↗
    –
  • Tsar-MCP

    Tsar-MCP 这篇 IBM 文档讲解如何用 C/C++ 实现 MCP server aspect,“aspect”这个切入点说明它关注 MCP server 的横切能力组织,而不是只演示一个工具 handler。对 C/C++ 生态来说,MCP server 若要进入已有系统,常见难点是生命周期、资源暴露、错误处理和接口复用。把这些做成 aspect 有助于让 MCP 嵌入传统 native…

    Project2026-06-29ibm.github.io原文 ↗
    –
  • Shikhu

    Shikhu 是 CLI 加 `/shikhu-study` agent skill,目标是帮助开发者学习自己或 AI 生成的代码库。它用 Mercury API 读取源码生成摘要和概念性多选题,用本地 SQLite 的 `coverage.db` 跟踪 knowledge coverage;每个文件需要 3 个 golden questions 才算 fully covered。README 还…

    Project2026-06-29github.com原文 ↗
    –
  • Peek-CLI

    Peek-CLI 让 coding agents 能捕捉浏览器打开 tab 的截图,填补本地前端调试中“agent 看不到页面”的缺口。README 说明它通过浏览器扩展经 WebSocket 传输截图,本地 `peeked start` 启动 daemon,`peeked list` 列出 URL,`peeked at http://localhost:3000` 会保存截图文件。项目还提供 C…

    Project2026-06-29github.com原文 ↗
    –
  • Moumantai

    Moumantai 是自托管 personal app runtime:服务器保存状态和业务逻辑,再根据浏览器、手机、手表或 ESP32 面板投射不同 face。README 的核心抽象是 “Schema. Tools. Faces.”:schema 管状态,tools 做变更,faces 只读展示;agent backend 不能直接改状态,只能请求服务器验证并执行工具。quick start…

    Project2026-06-29github.com原文 ↗
    –
  • vercel-labs/skills

    vercel-labs/skills 提供一个开放 agent skills 生态的 CLI,核心入口是 `npx skills`。README 写到它支持 OpenCode、Claude Code、Codex、Cursor 和 68 个以上工具,还能安装 skill 或把某个 skill 直接生成 prompt 传给 agent。它的看点在于把“可迁移的 agent 能力包”做成跨工具分发层,而…

    Trending2026-06-28github.com原文 ↗
    –
  • aws/agent-toolkit-for-aws

    aws/agent-toolkit-for-aws 是 AWS 官方支持的 agent toolkit,包含 MCP servers、skills 和 plugins。README 明确说它面向 Claude Code、Codex、Cursor 等 coding agents,帮助这些 agent 在 AWS 上 build、deploy、manage applications。它的意义在于云厂商…

    Trending2026-06-28始 2026-06-27github.com原文 ↗
    –
  • Open Tag

    Open Tag 是 CopilotKit 做的 Claude Tag 类开源实现,目标是把特定产品里的 tag 式交互抽成可复用项目。公开描述没有展开太多实现细节,但它处在一个明确趋势里:agent 应用开始需要更细粒度地标注上下文、目标对象和可操作区域。它可作为观察 CopilotKit 如何把 agent UI 交互组件化的入口。

    Project2026-06-28github.com原文 ↗
    –
  • Ocarina

    Ocarina 把 MCP server 的 tools 和 resources 当作可脚本化接口,用 YAML 编排调用、测试和自动化流程。作者的切入点来自 Ansible 式自动化:MCP 已经把服务能力描述成 typed、LLM-readable 的协议对象,因此不必每次都通过聊天模型来触发。这个项目把 MCP 从“给 agent 用的接口”推进到“可重复执行的集成测试面”。

    Project2026-06-28github.com原文 ↗
    –
  • Mcpify

    Mcpify 读取 OpenAPI 规格并生成 MCP server,目标是消除为每个 REST endpoint 手写 MCP tool wrapper 的重复工作。作者指出,现有 API 通常已经有 OpenAPI spec,因此生成整套 server 比手工桥接更合理。它的技术看点在于把 MCP 接入从“写胶水代码”变成“从既有契约生成 agent 可调用接口”。

    Project2026-06-28github.com原文 ↗
    –
  • xbtlin/ai-berkshire

    AI Berkshire 是基于 Claude Code 的价值投资研究框架,把巴菲特、芒格、段永平、李录四种方法论做成 skills 和多 agent 流程。README 列出 16 个 skill,包含深度研究、财报分析、行业筛选、持仓管理和思维工具;它还展示 2024 全年 +69.29%、2025 年至今 +66.38% 的实盘记录。项目真正有意思的地方是把投研纪律、反偏见清单和多源数据校…

    Trending2026-06-27github.com原文 ↗
    –
  • every-app/open-seo

    OpenSEO 是开源 Semrush/Ahrefs 替代,定位为可自托管、按 API 成本付费、可被 agent 调用的 SEO 工具。README 列出 keyword research、rank tracking、competitor insights、backlinks、site audits 和 AI visibility,并提供 MCP server 与 Claude Code/Ope…

    Trending2026-06-27github.com原文 ↗
    –
  • SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills

    论文将 FSM-defined scenarios 里的成功轨迹看作未知转移图路径,把可复用 skill 表示成 parameterized finite-state-machine subgraphs。SkillDisCo 从 successful traces 蒸馏 PFSM 子图,再编译成 callable、executable、verifiable procedural skills;AL…

    Paper2026-06-27arxiv.org原文 ↗
    –
  • Computer use in Gemini 3.5 Flash

    Google 介绍 Gemini 3.5 Flash 的 computer-use 能力,说明其产品线继续向可操作界面的 agent 执行层延伸。这条的重点是能力类别:模型不只是生成文本,还承担屏幕/应用操作。它与 GUI/CLI agent 论文形成呼应,行业正在把 computer use 从研究 demo 推进到主力模型功能。

    News2026-06-27blog.google原文 ↗
    –
  • modelcontextprotocol/rust-sdk

    modelcontextprotocol/rust-sdk 是 Model Context Protocol 的官方 Rust SDK,基于 tokio async runtime。README 提到 RMCP 核心 crate、rmcp-macros procedural macro crate,以及 1.x migration guide。Rust SDK 的成熟度会影响 MCP 在高性能服务…

    Trending2026-06-24github.com原文 ↗
    –
  • corsairdev/corsair

    Corsair 是面向 agents 的 unified integration layer,用来集中连接外部服务并控制权限。README 描述的模式是 agent 连接到 Corsair 实例后获得 integrations,但不直接看到 credentials,用户仍能控制它能做什么。它把 agent 集成问题拆成两层:外部服务连接由平台管理,动作权限由用户和策略收口。

    Trending2026-06-24github.com原文 ↗
    –
  • NVIDIA/skills

    NVIDIA/skills 是 NVIDIA 发布的官方 agent skills 集合,README 将 skills 定义为 portable instruction sets。它们用于教 AI agents 更好使用 NVIDIA 软件,包括 CUDA-X libraries、AI Blueprints 等,并链接 docs、livestream 和 capability governanc…

    Trending2026-06-24github.com原文 ↗
    –
  • Caplets

    Caplets 把 agent 能力拆成更小的 capability 单元,而不是把一整面工具墙交给模型。它的设计目标是按任务分发最小可用能力,使 agent 只拿到当前动作需要的权限。这个项目和 MCP/tool registry 生态相邻,但关注点更偏 capability packaging 与细粒度授权。

    Project2026-06-24caplets.dev原文 ↗
    –
  • ByteAsk Embedded MCP

    ByteAsk Embedded MCP 是一个 MCP server,为 coding agents 提供嵌入式 datasheet 信息,并带页码引用。嵌入式开发的资料常常长、表格密、约束细,答案如果不能回到具体页码,工程可信度会很低。这个项目把资料检索和引用位置一起暴露给 agent,适合硬件接口、寄存器和器件选型类任务。

    Project2026-06-24github.com原文 ↗
    –
  • Selector Forge

    Selector Forge 是一个浏览器扩展,用 AI 生成 CSS/XPath selector,但最终正确性由 live DOM 验证。流程是用户选中页面元素,扩展发送目标、DOM 上下文和 seed candidates,后端生成和排序候选,浏览器逐个验证并回传结果;列表模式还会检查完整目标集合,拒绝 over-match 和 under-match。项目的核心设计是把 AI 限定为 pr…

    Project2026-06-23github.com原文 ↗
    –
  • Open-geo

    open-geo 是 Claude Code skill,用真实登录浏览器跑查询并记录品牌在生成式答案中的可见性。README 写明它检查目标域名是否进入 answer、sources、citations 和正文,使用 SQLite WAL 存本地时间序列,并输出 FastAPI/React dashboard 与 A4 PDF;指标采用 answer→sources→citations funn…

    Project2026-06-23github.com原文 ↗
    –
  • GLM-5.2 is the step change for open agents

    Nathan Lambert 评述 GLM-5.2 在开放 agent 能力上的表现和生态位置。文章的判断背景是开放模型能否在工具使用、长任务和 coding agent 工作流里承担真实负载,而不只是聊天和基准测试。它把 GLM-5.2 放进“开放模型是否开始具备可用 agent 栈”的讨论中。

    Blog2026-06-23interconnects.ai原文 ↗
    –
  • voicebox

    Voicebox 把 voice cloning、TTS、dictation 和 agent voice output 放进一个本地优先应用。README 的功能密度很高:7 个 TTS engines、23 种语言、从几秒参考音频 zero-shot clone、50+ preset voices、全局 push-to-talk/toggle dictation、Whisper STT、REST…

    Trending2026-06-22github.com原文 ↗
    –
  • Rocannon

    Rocannon 把 Ansible 资产直接反射成 MCP 工具:启动时读 `ansible-doc`,把安装的 module 和带 argument spec 的 role 变成带类型、默认值、choices 和安全提示的 LLM-callable tool。它不是只做自然语言 wrapper,README 还强调 session 可以录制成 `.rocannon/playbooks/` 下的…

    Project2026-06-22github.com原文 ↗
    –
  • Project Fetch: Phase Two

    Anthropic 复盘 Project Fetch 时把机器人任务拆成连接视频、连接 lidar、程序控制、路径监控、检测 beach ball 等阶段,让 Claude Opus 4.7 在 Claude Code 中跑三次,研究员只负责插线、输入初始 prompt、批准命令和任务切换。结果最醒目的数字是:四个所有团队都完成的任务里,Opus 4.7 平均 9 分 35 秒完成,而原先 Tea…

    News2026-06-22anthropic.com原文 ↗
    –
  • Nori Browser

    Nori Browser 把“人看的浏览器”和“agent 脚本化的浏览器”合成同一个 Electron 应用:侧栏运行 Claude Code 或 shell,页面本身是可通过 CDP 暴露的 Chromium。README 写明默认 CDP port 是 `19222`,agent 用 Playwright `connectOverCDP` 控制用户正在看的同一组页面,而不是走 MCP 工具或…

    Project2026-06-22github.com原文 ↗
    –
  • Quoting Sean Lynch

    Simon Willison 摘录 Sean Lynch 的 HN 评论,把 MCP 的价值从“工具协议”重新聚焦到授权隔离。评论指出,MCP 相比 skills/CLI 的关键能力是把 auth flow 放到 agent context window 之外,甚至放到 harness 之外;理想形态可能只是 API 的 auth gateway。这个判断与 Cloudflare temporar…

    Blog2026-06-21simonwillison.net原文 ↗
    –
  • Quikdown

    Quikdown 针对的不是完整 CommonMark 或 ProseMirror 替代,而是“Markdown 仍是 source of truth,但用户能编辑源文本或渲染侧”的轻量文档面。README 给出的核心 parser 大约 15-17KB、零运行时依赖,双向模块约 20KB,editor 约 98KB;rich fence 覆盖 Mermaid、MathJax、GeoJSON、ST…

    Project2026-06-21github.com原文 ↗
    –
  • Namecom-CLI

    Namecom-CLI 是把 Name.com DNS/domain 管理做成 agent-friendly CLI:`--json` 覆盖所有命令,`commands` introspection 让 agent 能发现可用 surface,`records set` 采用 create-or-update 语义避免自动化重复记录。README 还把安全细节写得比较实用:凭据优先走 macOS…

    Project2026-06-21github.com原文 ↗
    –
  • openai/skills

    openai/skills 是 Codex Agent Skills 的技能目录仓库。README 把 Agent Skills 定义为 agents 可发现并用于特定任务的 instructions、scripts 和 resources 文件夹,强调 “write once, use everywhere”。这个仓库和自动生成 SKILL.md 的论文互相呼应:一个提供技能分发形态,另一个试图…

    Trending2026-06-20github.com原文 ↗
    –
  • modelcontextprotocol/servers

    modelcontextprotocol/servers 是 MCP 的参考 server 实现和社区资源集合。它为文件系统、数据库、开发工具和外部服务等能力提供示例入口,使客户端和工具作者有共同参照。随着 MCP 成为代理工具接口的重要协议,这个仓库更像生态基础设施,而不是普通示例集。

    Trending2026-06-20github.com原文 ↗
    –
  • Zero-Touch OAuth for MCP

    MCP 官方博客介绍企业托管认证下的 zero-touch OAuth 流程,目的是让 MCP server 的授权更适合企业管理。它把用户逐个同意的交互,转向由组织身份和管理策略预先处理的认证体验。随着 MCP 工具进入公司环境,认证和权限生命周期会和协议本身一样重要。

    News2026-06-20blog.modelcontextprotocol.io原文 ↗
    –
  • Surface skill for HTML pages a coding agent watches and reacts to

    Surface 提供的是面向编码代理的 HTML 页面观察与响应技能,让代理能看见页面状态并据此采取动作。它的重点不是生成页面,而是把浏览器中的可视反馈纳入编码闭环。对于前端和可视化调试任务,这类技能可以把“截图观察、定位问题、修改代码”变成更连续的工作流。

    Project2026-06-20github.com原文 ↗
    –
  • PostgreSQL MCP Server with 135 tools for various purpose

    mcp-pg-rust 是一个用 Rust 编写的 PostgreSQL MCP server,材料中明确给出它提供 135 个工具。项目把数据库访问、检查和操作能力通过 MCP 暴露给代理,覆盖面比单一查询工具更广。它的看点在于把数据库管理拆成大量可枚举工具后,代理权限、审计和错误恢复都可以更细粒度地处理。

    Project2026-06-20github.com原文 ↗
    –
  • OpenTunnel - Run Remote Commands as Local Agent Tool Calls

    OpenTunnel 把远程命令包装成本地代理工具调用,让代理可以在本地接口下触发远端执行。这个设计适合处理本地模型或本地代理需要操作远端环境的场景,同时保留工具调用的统一形态。它的技术边界在权限和审计:远程命令一旦进入代理工具层,就需要清楚定义可执行范围。

    Project2026-06-20github.com原文 ↗
    –
  • Let agents send/receive SMS using your old Android phone

    这个项目把一台旧 Android 手机变成代理可调用的 SMS 通道,通过手机端应用和 relay server 完成读取、发送短信。作者在 HN 描述里给出的动机很具体:让代理访问 OTP codes,同时避开 Twilio 的成本和配置负担;relay server 充当 agents 的 MCP 入口。技术上看,它把物理设备能力包装成代理工具,比纯云端 API 更贴近个人自动化场景。

    Project2026-06-20simlink.snaz.cz原文 ↗
    –
  • BuilderIO/agent-native

    agent-native 面向的是让代理成为应用一等交互者,而不是在既有 UI 外面再套一个聊天框。项目的核心做法是把用户界面操作、代理动作和状态更新放进同一套状态与动作系统,使人类点击和模型执行能共享可追踪的应用语义。这个方向的技术看点在于,应用不只把代理当“文本生成器”,而是为代理暴露结构化、可回放、可约束的操作面。

    Project2026-06-20github.com原文 ↗
    –
  • Beyond Static Endpoints: Tool Programs as an Interface for Flexible Agentic Web Services

    这篇反思静态 API endpoint 对代理接口的限制,提出 ToolPro,用可执行 tool program 表示代理面向 Web 服务的多步意图。摘要点名的长程工作流结构包括 loops、conditionals、joins 和 retries,这些都很难被一组固定端点完整表达。它适合解释为什么 agentic web services 需要比 OpenAPI 风格接口更灵活的执行单位。

    Paper2026-06-20arxiv.org原文 ↗
    –
  • Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

    这篇面向 computer-using agents,目标是从 GUI 交互轨迹中自动生成 SKILL.md。摘要给出的三阶段流程是 segment GUI trajectories、cluster segments into candidate skills,再训练 skill-aware policy;动机是显式技能库更容易检查,但能否从交互数据中挖掘仍需验证。它把“人教代理做任务”的成本从手…

    Paper2026-06-20arxiv.org原文 ↗
    –
  • web-infra-dev/midscene

    Midscene 用视觉理解和自然语言描述做 UI 自动化与测试。它降低了选择器脆弱性,因为操作目标可以由画面语义决定,而不是固定 DOM path。对现代前端测试来说,这类框架把“用户看到什么”重新放回自动化主语。

    Trending2026-06-19github.com原文 ↗
    –
  • mattpocock/skills

    mattpocock/skills 收集面向工程工作流的 agent skills。它把经验、约束和操作步骤沉淀成可被 agent 调用的技能文件,而不是依赖每次对话重新说明。这个仓库体现 skills 正在成为 AI 开发环境里的新配置层。

    Trending2026-06-19github.com原文 ↗
    –
  • Vibesurfer - a token-efficient browser for AI agents

    vibesurfer 是 Rust 浏览器 daemon,底层用 WKWebView、WebKitGTK 或 WebView2,不依赖 Chromium/CDP。README 给出一个直观对比:Hacker News 首页经 Playwright 约 2000 输入 token,而 vibesurfer 约 50,因为它返回 state tokens 和 tree deltas。mutating…

    Project2026-06-19github.com原文 ↗
    –
  • Towards an Agent-First Web: Redesigning the Web for AI Agents

    论文从访问、经济和内容三层重新设计 Web,主张代理作为人类 proxy 时应继承相应访问权,并用请求元数据、rate limit 和 agent-optimized 内容协商边界。经济层提出按 intent 和 token 计量,内容层提出 ATML、四级人类监督和加密 provenance chain。它把 agent 访问网站的问题从反爬和 CAPTCHA 扩展到社会契约、付费机制和知识来源…

    Paper2026-06-19arxiv.org原文 ↗
    –
  • Throne MCP Registry

    Throne MCP Registry 记录 74 个 MCP server 在 microVM 中运行时的兼容性和故障情况。它的价值不在“又一个 MCP 列表”,而在把 MCP server 放入隔离执行环境后观察真实安装、启动和运行问题。对正在把 MCP 接入生产 agent 的团队,兼容性矩阵比 README 徽章更接近可用性证据。

    Project2026-06-19usethrone.dev原文 ↗
    –
  • Skill Studio - mine, edit, and manage Agent Skills

    Skill Studio 是跨平台 Rust 应用,用来挖掘、编辑和管理 agent skills。它把 skills 当作可维护资产,而不是散落在项目里的提示词片段。这个方向值得注意,因为多 agent 工作流越复杂,技能的发现、版本和编辑体验越接近 IDE 或包管理问题。

    Project2026-06-19github.com原文 ↗
    –
  • AutomatiQ - generate web scrapers/automations by browsing any website

    AutomatiQ 先用 Chrome CDP 记录用户浏览时的网络请求、响应体、cookie、点击、输入和导航,再让视觉模型标注动作片段,最后由 LLM 在隔离 Python/IPython 环境中生成自动化脚本。README 的使用路径很短:`automatiq run https://example.com`,浏览后按 Ctrl+C,agent 接管生成脚本。它把 web scraping…

    Project2026-06-19始 2026-06-18github.com原文 ↗
    –
  • A Technical Taxonomy of LLM Agent Communication Protocols

    作者用 5 轮迭代方法分析 9 个有采用迹象的开源 agent 通信协议,给出 counterparty、payload、interaction state、discovery mechanism 和 schema flexibility 五个维度。样本中 agent-to-agent 协议普遍保留 session state,多数支持多个预定义 schema,只有少数在运行时协商 schema。…

    Paper2026-06-19arxiv.org原文 ↗
    –
  • mcp-sql

    mcp-sql 把数据库访问包装成 MCP server,重点不是“让模型会写 SQL”,而是把查询权限和修改权限拆开。作者在原始描述中写到,SELECT 可以让 LLM 自由使用以建立上下文,但涉及写入、更新、删除时,尤其在敏感环境中,需要人类保留控制和理解。这个权限模型适合企业内部 Agent:读路径帮助分析,写路径必须显式审批或被更严格地 gated。

    Project2026-06-18github.com原文 ↗
    –
  • PreAct: Computer-Using Agents that Get Faster on Repeated Tasks

    PreAct 把 computer-use Agent 的一次成功执行编译成小型 state-machine program:状态负责检查屏幕是否符合预期,transition 负责执行点击或输入,后续同类任务直接 replay 而不是逐步调用模型。论文报告 replay 比重新让 Agent 观察和推理快 8.5 到 13 倍,且每一步不再消耗语言模型调用;一旦屏幕状态不匹配,控制权会交回 Ag…

    Paper2026-06-18arxiv.org原文 ↗
    –
  • AuthPlane

    AuthPlane 的定位是 MCP 场景下的 OAuth 2.1 与 PKCE authorization server。它直接落在远程 MCP 部署最薄弱的一层:Agent 需要访问用户关联服务时,授权边界不能靠长期静态 token 或临时共享密钥撑住。把 OAuth 2.1/PKCE 放进 MCP 工具链,意味着可以用标准 delegated authorization、client flo…

    Project2026-06-18github.com原文 ↗
    –
  • Aihu

    Aihu 的定位是 Web Components framework for AI agents,目标是让 Agent 更稳定地驱动前端组件。它通过 custom elements、属性和组件级语义约定,为 Agent 提供比像素点击或临时 CSS selector 更稳的操作面。它反映了前端工具链的新分叉:UI 不只要对人可用,也要对自动化和 Agent 可解释。

    Project2026-06-18github.com原文 ↗
    –
  • A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry

    OpenAI 与 Molecule.one 把 GPT-5.4 接到 Maria AI/Lab,让系统从开放目标出发改进 medicinal chemistry 里的 Chan-Lam coupling。最有结果的 proposal OAI-M1-03 选择 primary sulfonamides 这一低产率但高价值 substrate class,并提出 TEMPO 等 mild oxidan…

    News2026-06-18openai.com原文 ↗
    –
  • datasette-agent 0.3a0

    datasette-agent 0.3a0 新增带用户审批的写 SQL 工具。这个变化把 agent 从只读分析推进到可提出数据库 mutation,但把最终执行权留在人类确认步骤。它是数据库 agent 产品化中的一个小而重要的边界设计:模型可以生成操作计划和 SQL,系统必须在副作用发生前暴露清楚并等待批准。

    Blog2026-06-17simonwillison.net原文 ↗
    –
  • PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

    PrologMCP 把 Prolog 作为 stateful MCP server 暴露给 LLM agent,让模型负责翻译问题,符号求解器负责演绎推理。接口包含结构化错误报告和 per-session isolation,适配 translate-run-inspect-repair 循环。PARARULE-Plus 两个子集上,formalizer agent 在一般样本达到或追平 1.00…

    Paper2026-06-17arxiv.org原文 ↗
    –
  • FastContext: Training Efficient Repository Explorer for Coding Agents

    FastContext 将 repository exploration 从 coding solver 中拆出,训练 4B-30B 的专门探索子 agent。它按需并行调用工具,只返回文件路径和行号范围,减少探索阶段对主 agent history 的污染。接入 Mini-SWE-Agent 后,在 SWE-bench Multilingual、SWE-bench Pro 和 SWE-QA 上端…

    Paper2026-06-17arxiv.org原文 ↗
    –
  • Claireon

    Claireon 是运行在 Unreal Editor 内的 MCP server 插件。它把外部 MCP 表面收缩成 `tool_search` 和 `python_execute`,再在编辑器内部用 SQLite FTS5 与 embedding model 检索数百个 automation tools。功能覆盖 Blueprint、Animation、State Tree、Behavior…

    Project2026-06-17github.com原文 ↗
    –
  • addyosmani/agent-skills

    agent-skills 是面向 AI coding agents 的 production-grade engineering skills 集合。digest 的重点是把工程流程、代码审查、测试、文档和交付习惯封装成可复用指令包。它值得看是因为 agent 能力越来越取决于可执行流程模板,而不仅是模型本身的代码生成能力。

    Trending2026-06-15github.com原文 ↗
    –
  • RAIF

    RAIF 观察到 LLM 不是确定性 JSON writer,常见失败包括少括号、markdown fence、半截流和分隔符滑移,因此把“可修复”写进格式本身。README 的数字是相对 JSON 少约 14.4% cl100k token、15.9% o200k token,截断输出在同等预算下恢复 46% leaf,而 JSON + jsonrepair 为 41%。它还用 5,000-se…

    Project2026-06-15github.com原文 ↗
    –
  • datasette 1.0a33

    Datasette 1.0a33 扩展 JSON API 的 `_extra=` 模式,使其覆盖 queries 和 rows。这个变化面向自动化调用者:API client 可以直接请求附加结构化信息,而不必围绕查询结果再发额外请求或解析页面。它与 datasette-agent 放在同一天看更清楚,Datasette 正在把自己变成更适合 agent 和脚本消费的数据界面。对于小型数据工具,J…

    Blog2026-06-12simonwillison.net原文 ↗
    –
  • BerriAI/litellm

    LiteLLM 是 OpenAI-compatible LLM gateway/SDK,覆盖 100+ 模型 API,并支持 cost tracking、guardrails、load balancing、logging。仓库描述列出的后端包括 Bedrock、Azure、OpenAI、VertexAI、Cohere、Anthropic、SageMaker、HuggingFace、vLLM、NVI…

    Trending2026-06-12github.com原文 ↗
    –
  • Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

    SKIM 关注的是自然语言 skill,而不是普通文档压缩:skill 里有步骤依赖、工具协议和可执行 workflow,简单摘要会破坏可用性。它按 skill 复杂度自适应生成不同数量的 soft tokens,形成多分辨率过程知识压缩,并且强调离线、轻量,适合频繁更新的社区 skill。实验里 skill 被压到原 token 长度的 30%-60%,同时任务表现比既有压缩方法保留得更好。对于…

    Paper2026-06-12arxiv.org原文 ↗
    –
  • thesysdev/openui

    OpenUI 是面向 generative UI 的开放标准与 React runtime。README 说明 OpenUI Lang 支持 token streaming、受控组件渲染和 Zod 类型契约,并在七个 UI 场景中相对 JSON streaming 格式总 token 少约 52.8%;仓库还包含 chat state adapters、prebuilt chat UI、CLI、N…

    Trending2026-06-10github.com原文 ↗
    –
  • LatentSkill

    LatentSkill 把 agent 的 textual skills 转成 plug-and-play LoRA adapters,让技能知识存到权重空间而不是每步塞进 prompt。它用预训练 hypernetwork 生成 skill LoRA,并支持 scaling 与 parameter-space composition;在 ALFWorld seen/unseen split 成功…

    Paper2026-06-10arxiv.org原文 ↗
    –
  • How engineers at Nextdoor use Codex to build without limits

    OpenAI 案例文章介绍 Nextdoor 平台团队如何用 Codex 调查问题和推进跨平台产品工作。Nextdoor 服务 11 个国家超过 1.1 亿用户;文章举的 Opportunity Alerts 地图功能过去可能需要 mobile、frontend、backend 三队协作,现在由一名工程师借助 Codex 端到端完成。案例的核心不是“生成更多代码”,而是工程师职责从系统局部移动到产…

    News2026-06-10openai.com原文 ↗
    –
  • Apple Core AI Framework

    Apple Core AI Framework 文档面向开发者在 Apple 平台集成系统 AI 能力。结合 Apple Intelligence 页面看,开发者入口的关键不是单一模型 API,而是把 Foundation Models framework、App Intents、Siri、Writing Tools、Image Playground 等能力放进系统框架。它决定第三方 app 能多…

    News2026-06-10developer.apple.com原文 ↗
    –
  • Anything2Skill

    Anything2Skill 把外部知识库中的手册、示例、日志和轨迹编译成可复用 agent skills。框架先切 evidence windows,再按 skill-tree prior plan-and-expand,最后生成包含 invocation conditions、contraindications、action moves、workflow steps、constraints、o…

    Paper2026-06-10arxiv.org原文 ↗
    –
  • openai/plugins

    这是 OpenAI 的 Codex plugin 示例集合,覆盖 manifest、skills、commands、hooks 和 MCP 配置等结构。GitHub 页面显示约 2k stars,语言以 JavaScript 和 Python 为主。它适合当作 plugin scaffolding 的参考,而不是完整产品仓库。

    Trending2026-06-08github.com原文 ↗
    –
  • IBM/mcp-context-forge

    IBM mcp-context-forge 是 MCP、A2A、REST/gRPC API 前的 gateway、registry 和 proxy。仓库描述强调统一 endpoint、集中发现、guardrails、管理、observability 和 plugin 支持。随着 MCP server 数量增加,这类 registry/proxy 会成为 agent 平台治理的基础设施,而不是可选周…

    Trending2026-06-08github.com原文 ↗
    –
  • Aquifer

    Aquifer 是自托管 MCP Gateway Runtime,面向突发 agent 工具调用流量。仓库描述称其为 API Aqueduct,最新 release v0.2.0 在 2026-06-06 发布。它切中的问题是 MCP server 一旦被多个 agent 并发调用,需要网关层处理流量整形、运行时调度和稳定性。

    Project2026-06-08github.com原文 ↗
    –
  • Apple Contacts MCP

    Apple Contacts MCP 把 macOS Contacts 暴露为本地优先 MCP server,支持安全搜索和编辑联系人。联系人属于高度敏感的个人数据,因此 local-first 约束比功能数量更重要。它代表一类桌面私有数据 MCP:有用,但必须把权限边界设计清楚。

    Project2026-06-07github.com原文 ↗
    –
  • Agent-Reach

    Agent-Reach 给 AI agent 提供 Twitter、Reddit、YouTube、GitHub、Bilibili、小红书等平台的读取和搜索能力,并强调 zero API fees。它把跨平台信息采集做成 CLI,适合研究、舆情或内容整理 agent 调用。风险点同样明显:平台 ToS、反爬限制和账号安全会决定可持续性。

    Trending2026-06-07github.com原文 ↗
    –
  • openai-ads-mcp

    openai-ads-mcp 把 ChatGPT Ads API 包成 MCP server,当前定位是只读查询账户、广告系列和投放数据。它属于“业务 API agent 化”的典型小工具:价值不在复杂推理,而在让 ChatGPT/Claude/Codex 类客户端以工具调用方式访问广告后台。

    Project2026-06-05github.com原文 ↗
    –
  • SheetMog - OSS Excel alternative and headless SDK

    SheetMog 做的是 Rust/WASM spreadsheet engine,目标是开源 Excel 替代和 headless SDK 的结合体。它把表格能力拆成可嵌入前端与程序化 API,对 agent 场景尤其有用,因为模型可以操作表格计算结构,而不必依赖屏幕坐标和 Excel 自动化。

    Project2026-06-05github.com原文 ↗
    –
  • NeuroAnswer

    NeuroAnswer 是给 Claude 使用的大规模脑图数据 MCP server,作用是把神经科学图谱查询封装成模型可调用工具。它的技术点在接口层:让 agent 通过 MCP 导航专业数据,而不是把整套脑图材料塞进普通上下文。

    Project2026-06-05github.com原文 ↗
    –
  • Designing the hf CLI as an agent-optimized way to work with the Hub

    Hugging Face 把 hf CLI 明确设计成 agent 可用接口,而不是只服务人类终端用户。文档提到 Claude Code、OpenAI Codex、Open Code 可通过 `hf` 操作 Hub,并提供 `agent`、`json`、`quiet` 等输出模式;这类 CLI 细节会直接影响 agent 调用工具时的可解析性和失败恢复。

    Blog2026-06-05huggingface.co原文 ↗
    –
  • AIP: A Graph Representation for Learning and Governing Agent Skills

    AIP 把 agent skill 从一段说明文档改成有类型边的有向执行图,节点可以绑定脚本,也可以保留自然语言步骤。摘要提到 schema-validated YAML 和 typed input/output,这让 skill 可以被校验、组合和治理,减少“技能库越长越像提示词垃圾堆”的风险。

    Paper2026-06-05arxiv.org原文 ↗
    –
  • modelscope/FunASR

    FunASR 是工业级语音识别工具包,README 摘要列出 ASR、VAD、标点恢复、语言模型、说话人验证、说话人分离、多说话人 ASR、情绪识别、streaming 和 OpenAI-compatible API。项目标题称支持 50+ languages、170x realtime。它的价值在于把语音前处理、识别和服务接口集中在一个开源工具包里。对实时语音 agent,streaming 与…

    Trending2026-06-04github.com原文 ↗
    –
  • googleworkspace/cli

    Google Workspace CLI 用一个 `gws` 命令覆盖 Drive、Gmail、Calendar、Sheets、Docs、Chat、Admin 等 API,并由 Google Discovery Service 动态构建。README 摘要称它包含 100+ Agent Skills,一个支持 API 对应一个 SKILL.md,另有 50 个 Gmail、Drive、Docs、C…

    Trending2026-06-04github.com原文 ↗
    –
  • agentgateway/agentgateway

    agentgateway 是开源 HTTP/gRPC gateway,把传统应用流量和 AI-native protocols 放在同一 data plane。项目站点说明它可 route、secure、observe、govern services、LLM provider traffic、MCP tools 和 agent-to-agent communication,并支持 OpenAI、C…

    Trending2026-06-04github.com原文 ↗
    –
  • ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

    研究 VLM agent 在 OCR、检测、分割等感知工具真正执行前,是否应该跳过该调用。作者发现 baseline 的局部选择性很差,helpful 和 harmful calls 比例接近 11.8% vs 9.9%,多数调用也不会改变 forced-answer prediction。ToolGate 用轨迹文本和结构特征做轻量 execute/skip 控制,在两个 Qwen3-VL ba…

    Paper2026-06-04arxiv.org原文 ↗
    –
  • The Sequence AI of the Week #871: Inside the Loop with Claude Opus 4.8

    TheSequence 讨论 Claude Opus 4.8 在 agent 和 coding 场景中的行为变化。digest 没给出细节,因此正文只按文章主题处理:它关注模型在 loop 内执行、工具调用和代码任务中的表现,而不是静态 benchmark。此类评论的价值在于观察 agent 行为的质感变化,例如坚持性、错误恢复和上下文处理。

    Blog2026-06-04thesequence.substack.com原文 ↗
    –
  • SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

    把大型 skill library 的选择问题建模成 typed directed graph,而不是单纯 embedding 相似度检索。图边表达依赖、冲突、特化和重复关系;每次检索返回 vector matches、typed-edge neighbors 和 conflict signals,agent 还能通过 propose-then-commit 把执行证据写回图。论文在 ALFWor…

    Paper2026-06-04arxiv.org原文 ↗
    –
  • Now AI agents need what RSS does

    Julien Reszka 讨论 RSS 作为 agent 可读信息接口的作用。文章核心是:AI agents 需要稳定、可订阅、结构化的信息源,而 RSS 已经提供了类似能力。它把 RSS 从人类阅读器时代的遗产,重新解释为 agent 获取更新、追踪站点和减少网页抓取噪音的基础协议。

    Blog2026-06-04julienreszka.com原文 ↗
    –
  • Introducing new capabilities to GPT-Rosalind

    OpenAI 更新 GPT-Rosalind 的生命科学能力,覆盖生物推理、药物化学、基因组分析和实验工作流。此前 GPT-Rosalind 作为 research preview 面向合格客户在 ChatGPT、Codex 和 API 中提供,并配套 Codex 的 Life Sciences research plugin,连接 50 多个科学工具和数据源。它的关键点是把 domain mod…

    News2026-06-04openai.com原文 ↗
    –
  • Inducing Reasoning Primitives from Agent Traces

    提出 Reasoning Primitive Induction,从成功 ReAct traces 中单遍挖掘、聚类重复推理动作,并转成 typed pseudo-tools。每个 pseudo-tool 由自然语言 docstring 说明,测试时由普通 ReAct loop 组合调用。作者报告 induced libraries 反超生成它们的原 agent:RuleArena NBA 从 3…

    Paper2026-06-04arxiv.org原文 ↗
    –
  • pbakaus/impeccable

    impeccable 是面向 AI coding harness 的前端设计技能与命令集合,帮助 agent 在 UI 任务中遵守更具体的设计规范。项目把布局、组件、视觉检查和交互细节沉淀成可复用命令。值得看的是,它把“AI 写前端不好看”拆成技能、约束和审查流程问题。

    Trending2026-06-03github.com原文 ↗
    –
  • Agent Skills Should Go Beyond Text: The Case for Visual Skills

    论文指出文本技能文件对视觉任务存在表达瓶颈,提出把可复用 agent skill 扩展到视觉形式。

    Paper2026-06-03arxiv.org原文 ↗
    –
  • ASys

    给 AI agent 操作服务器用的 typed binary protocol,目标是替代 SSH 式交互。

    Project2026-06-03github.com原文 ↗
    –
  • AERF, signed receipts for AI agent actions

    为 agent 动作生成签名收据的规范项目。

    Project2026-06-03github.com原文 ↗
    –
  • Skill Availability and Presentation Granularity in Large-Language-Model Agents

    SkillsBench 控制实验研究 skill 是否可用以及呈现粒度是否影响 agent 成功率。实验用 30 个领域均衡任务、两个 reasoning 模型、六种 skill 条件,每个 task-condition-model cell 五次试验,共 1,800 行数据。skill availability 提升最强:GPT-5.5 相比无 skill 提升 26.7-36.0 个百分点,D…

    Paper2026-06-02arxiv.org原文 ↗
    –
  • D4Vinci/Scrapling

    Scrapling 是 adaptive web scraping framework,从单次请求到 full-scale crawl 都覆盖。README 强调 parser 可学习页面变化并自动重新定位元素,fetchers 可处理 Cloudflare Turnstile 等 anti-bot,spider framework 支持并发、多 session、pause/resume 和 pr…

    Trending2026-06-02github.com原文 ↗
    –
  • May 2026 newsletter

    Simon Willison 的月度通讯回顾 2026 年 5 月模型发布、工具使用和 Datasette 进展。它的价值在于把一整月的模型、工具和个人项目实践放进同一时间线,而不是只列发布链接。对跟踪 AI tooling 的读者来说,Simon 的月报通常更接近“实际用过后的技术日志”。

    Blog2026-06-01simonwillison.net原文 ↗
    –
  • MAVEN: Improving Generalization in Agentic Tool Calling

    MAVEN 是一个 lightweight symbolic reasoning scaffold,用结构化分解、自适应工具编排和 intermediate verification 改善工具调用泛化。论文评测 BFCL v3、TauBench、Tau2Bench、AceBench,并引入 MAVEN-Bench 测多步数学/物理推理与对抗组合;在 MAVEN-Bench 上,它把 GPT-OSS…

    Paper2026-06-01arxiv.org原文 ↗
    –

2026 年 5 月13

  • cursor/plugins

    cursor/plugins 是 Cursor 官方插件规范和插件集合,每个插件目录带 `.cursor-plugin/plugin.json` manifest。README 列出 continual-learning、cursor-team-kit、thermos、create-plugin、agent-compatibility、cli-for-agent、pr-review-canvas、…

    Trending2026-05-31github.com原文 ↗
    –
  • Ego lite - why our browser agent writes JavaScript not CLI commands

    ego-lite 是面向人和 agent 并行工作的浏览器,agent 在独立 Space 中通过 `ego-browser` 操作页面。README 的核心设计是暴露 snapshot、fill、click、wait、navigate、capture 等 in-page JavaScript 工具,让 agent 组合 JS 任务,而不是多轮 CLI 调用;项目称复杂任务最多快 2.5 倍。值得…

    Project2026-05-31github.com原文 ↗
    –
  • A Claude Code skill that scopes problems like Peter Naur

    Cartographer skill 把 coding request 前置成 problem-theory 产物,而不是直接进入方案设计。它要求 agent 先写 World、Actors、Program correspondence、Known、Assumed、Thin spots 等字段,并把每个需求追溯到现实世界中的对应关系。值得看的是它把“需求澄清”变成可检查 artifact,适合领域…

    Project2026-05-31github.com原文 ↗
    –
  • theta-spec

    它试图解决 agent 配置被各家 CLI/harness 锁死的问题。统一规格的价值在团队可迁移和可审计;真正难点会在语义差异,例如不同工具权限、hook 生命周期和 skill 调度并不总能无损映射。

    Project2026-05-30github.com原文 ↗
    –
  • SkillsInjector: Dynamic Skill Context Construction for LLM Agents

    这篇工作抓住了 skills 机制的核心矛盾:技能库越丰富,静态塞进上下文越容易把模型带偏。动态规划器把 skill 选择变成执行相关的检索和改写问题,但效果会依赖 skill 描述质量以及训练时的任务分布。

    Paper2026-05-30arxiv.org原文 ↗
    –
  • P2P proof of concept for ACP decentralized agent communication

    这类项目的技术问题不在“能发消息”,而在身份、路由、权限和失败恢复。作为 POC,它适合验证 agent 通信协议形态;距离生产系统还需要认证、审计和流控设计。

    Project2026-05-30github.com原文 ↗
    –
  • obra/superpowers

    面向 coding agent 的软件开发方法论和可组合 skills 框架。

    Trending2026-05-29github.com原文 ↗
    –
  • hardikpandya/stop-slop

    Stop Slop 是一个写作 skill,结构包含核心 SKILL.md 和 phrases、structures、examples 三类参考文件,用于识别并移除 AI prose 中的套路短语、结构 cliché、节奏问题和 meta-commentary。它更像可移植编辑准则,而不是自动检测器。

    Trending2026-05-29github.com原文 ↗
    –
  • anthropics/knowledge-work-plugins

    这说明 Anthropic 正把 Cowork/Claude Code 的能力生态做成插件市场,而不是只提供通用 agent。插件化降低入门成本,但也把权限、数据访问和组织流程固化进可执行包。

    Trending2026-05-29github.com原文 ↗
    –
  • Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution

    Tool Forge 的价值不在“又做一个工具注册表”,而在把工具生成、验证、生命周期和路由合成一个可审计工件链。它的局限也在摘要里说得很清楚:当前数字是初始系统 benchmark,尚未证明面对对抗路由、真实 API grounding 和跨系统评估时仍成立。

    Paper2026-05-29arxiv.org原文 ↗
    –
  • Open Agent Tools Coder

    本地编码 agent,实验将工具调用委派给较小模型。

    Project2026-05-29github.com原文 ↗
    –
  • LiteParse

    LiteParse 的定位很清晰:把“够快、够本地、够结构化”的解析能力给 agent,而不是用云端 LLM 做重型文档理解。复杂表格、手写和扫描 PDF 仍被明确让位给 LlamaParse。

    Project2026-05-29github.com原文 ↗
    –
  • Leonxlnx/taste-skill

    taste-skill 是前端设计类 agent skills 集合,默认 `design-taste-frontend` v2 会读 brief、推断设计语言,并通过 VARIANCE、MOTION、DENSITY 三个 dial 约束布局、动效和信息密度;还包含 image-to-code、redesign、minimalist、brutalist、brandkit 等分支技能。

    Trending2026-05-29github.com原文 ↗
    –