每日 Harness 开源 · Source
主题 · All topics

工具与技能Tools & Skills

本主题共 180 条 · 最早 2026-05-29 · 最新 2026-07-25

视图 · View

2026 年 7 月69

  • oraios/serena

    Serena 通过语言服务器与符号级代码分析,为编码 Agent 提供查找定义、引用关系、结构化编辑和重构能力,并可作为 MCP Server 接入多种客户端。它避免让模型反复读取整文件,转而围绕类、函数和符号关系操作代码。仓库同时支持多语言与项目记忆,定位更接近“Agent 的 IDE 后端”而非又一个聊天界面。

    Trending2026-07-25github.com原文 ↗
  • CockroachCrawler

    CockroachCrawler 将普通 HTTP 抓取、浏览器自动化、PDF 解析、正文抽取和 MCP 接口打包到一套工具链中。调用方可以按页面复杂度在轻量请求与完整浏览器之间切换,并把结果交给 Agent 继续处理。统一接口减少了多种爬取组件的胶水代码,但部署时仍需处理站点条款、限速与不受信任页面内容。

    Project2026-07-25github.com原文 ↗
  • Browser Bridge

    Browser Bridge 通过 Chrome DevTools Protocol 和 MCP,把用户已经登录的浏览器会话暴露给 Claude Code、Codex 等 Agent。工具支持页面导航、DOM/可访问性快照、点击、输入、截图、标签页和网络请求检查,并可选择仅允许本地连接。与启动隔离浏览器不同,它能复用真实 cookie 与登录状态,因此便利性很高,权限边界也必须按本机高信任工具处理…

    Project2026-07-25github.com原文 ↗
  • Palmier Pro

    Palmier Pro 是面向 macOS 的开源视频编辑器,把常规时间线编辑、AI 生成能力与本地 MCP 服务放在一个应用中。MCP 让外部 agent 能以工具方式操作素材和编辑流程,而不只生成一段不可执行建议;项目展示了桌面创作软件如何把 agent 接口直接嵌入本地资产工作流。

    Project2026-07-24始 2026-06-21github.com原文 ↗
  • Decode-Time Grammars

    Decode-Time Grammars 让调用方在生成过程中逐步提供语法片段,把语法约束从固定编译产物变成可组合的解码接口。模型无需针对每门 DSL 重新训练,就能在 token 级屏蔽非法续写;实验覆盖低资源语言、专用 API 和多种模型,显示严格语法能显著提升可解析率,但语义正确性仍取决于模型本身。

    Paper2026-07-24arxiv.org原文 ↗
  • Claude Code Proxy

    Claude Code Proxy 接收 Anthropic Messages API 形态的请求,再适配到 Codex、Kimi、Grok、Cursor 等后端,使 Claude Code 客户端不必随模型供应商改变工作流。代理层负责请求/响应格式、流式事件和工具调用兼容;它的工程难点不在普通转发,而在维持不同模型协议之间的行为一致性。

    Project2026-07-24始 2026-07-15github.com原文 ↗
  • Browser Tools SDK

    Browser Tools SDK 为智能体提供真实浏览器会话中的导航、DOM 读取、点击、输入、截图与网络观察能力,并以 TypeScript 工具接口暴露。它强调让 agent 操作实际网页而非简化模拟环境,适合端到端测试和网页任务执行。真实浏览器提高了行为保真度,也意味着权限隔离、凭据保护和页面注入必须纳入部署设计。

    Project2026-07-23libretto.sh原文 ↗
  • moonshine-ai/moonshine

    Moonshine 把 ASR、意图识别和 TTS 组合成低延迟语音接口工具包,目标是支持持续对话式代理,而非只生成一份音频转写。集成式设计有利于共同优化首字延迟、打断处理和端点检测,也方便在本地设备上避免多服务往返。项目的实际竞争力需要用端到端延迟、噪声鲁棒性、语言覆盖和长时间流式稳定性衡量,而不能只看单个识别模型分数。

    Trending2026-07-22github.com原文 ↗
  • PrefectHQ/fastmcp

    FastMCP 将 MCP 的协议样板压缩为 Python 装饰器:函数签名自动变成 schema、验证和文档,客户端侧则封装传输、认证与生命周期。除 server/client 外,新体系还包含能在对话内呈现交互 UI 的 Apps,并提供企业网关 Horizon 做 SSO、工具级 RBAC、审计和回滚。README 称项目日下载约一百万次、某版本覆盖约 70% 的 MCP servers;这…

    Trending2026-07-22github.com原文 ↗
  • Glass

    Glass 不是把截图能力简单包装成 MCP,而是提供应用启动、视觉捕获、输入注入、日志读取和画面变化检测的一整套闭环。由于从外部驱动 GUI,它不要求项目采用特定框架,并已覆盖 X11、Wayland、Windows、Android AVD、iOS Simulator 与 macOS。跨平台抽象很有吸引力,但黑盒视觉检查天然比 DOM 或可访问性树更脆弱,实际可靠性取决于后端能否提供稳定的结构化…

    Project2026-07-22github.com原文 ↗
  • memorywire: A Vendor-Neutral Wire Format for Agent Memory Operations

    memorywire 不是新 memory algorithm,而是为 agent memory 定义 JSON-Schema 2020-12 wire format,覆盖 remember、recall、forget、merge、expire 五类操作和四类 memory。参考实现提供 sqlite-vec、mem0、Letta、Cognee、pgvector 五个 backend adapte…

    Paper2026-07-21arxiv.org原文 ↗
  • Scalable LLM Agent Tool Access in the Cloud

    这篇把 MCP 云端规模化问题抽成 gateway 架构:legacy service integration、协议兼容、access control、tool recommendation、session-aware routing 都由 gateway 接管。论文给出的关键数字是 hybrid retrieval 保持 98% Top-15 recall,并把可访问工具扩展到 3,000+。t…

    Paper2026-07-21arxiv.org原文 ↗
  • Reverse-engineering is cheap now

    Simon Willison 记录 coding agents 如何降低家用设备逆向工程和自动化脚本编写成本。核心变化是,抓包、读协议、试错脚本和控制自动化不再全部依赖人工长时间摸索,agent 可以快速生成候选解释与工具代码。这个变化会扩大逆向工程的参与人群,同时也会让设备厂商更难依赖“接口不公开所以没人会用”这一隐性壁垒。

    Blog2026-07-21simonwillison.net原文 ↗
  • Hail.so - Open-source phone, SMS and email for agents and humans, v0.15

    Hail 把电话、SMS、email 包成 agent 可调用通信平台,当前定位是 outbound first、inbound next、自托管 AGPLv3。自托管 quickstart 需要 Twilio、LiveKit Cloud、Deepgram、Cartesia,以及 OpenAI/Gemini/Anthropic 之一;agent 可以通过 HTTP API 或 MCP endpoi…

    Project2026-07-21github.com原文 ↗
  • ibelick/ui-skills

    ibelick/ui-skills 是面向 design engineer 的 UI skill 集合和 CLI。digest 给出的项目定位是把可复用的界面实现经验、组件模式和设计工程流程包装成 agent 可调用的 skills。它关注的不是某个单独组件,而是让 AI coding agent 在做 UI 时带着稳定的视觉、交互和实现约束工作。随着 coding agent 更常接手前端任务,…

    Trending2026-07-20github.com原文 ↗
  • KnockOutEZ/wigolo

    wigolo 是面向 AI coding agent 的本地优先搜索、抓取、爬取和研究 MCP 工具。digest 强调它把 research 能力做成 agent 可调用的 MCP server/tool,而不是依赖远端浏览器服务。组合点包括本地搜索、网页抓取、爬取上下文,并把结果返回给 coding agent 使用。它适合补上 agent 在“查资料”环节的工具缺口,尤其是在希望浏览过程留在…

    Trending2026-07-20github.com原文 ↗
  • A schema you change by talking to it, without the model writing SQL

    mutable-crm 做的是一个可通过自然语言修改 schema 和 UI 的 CRM 原型,但它把 LLM 的权限限制在 typed tools 上,而不是让模型直接生成 SQL。README 明确列出四个 schema 工具:`createTables`、`addColumn`、`renameColumn`、`changeColumnType`;没有 drop 工具,模型也只看表名、列名和类…

    Project2026-07-20github.com原文 ↗
  • stripe/ai

    stripe/ai 提供把 Stripe billing 接入 LLM 和 agent 框架的 SDK 与示例。它将支付、订阅、计费和工具调用连接起来,使 AI 应用可以查询账单、执行商业流程或接入用量计费。项目看点在于 Stripe 把自己放进 agent 工具生态,而不只是提供传统 REST API 文档。

    Trending2026-07-16github.com原文 ↗
  • StyleSeed

    StyleSeed 是给 AI agent 使用的设计规则引擎,用规则约束 UI 生成结果。它不是组件库,而是把品牌、布局、色彩和交互偏好编码成 agent 可执行约束。项目的核心在于减少生成式 UI 的随机漂移,让同一产品的多个界面保持一致视觉语言。

    Project2026-07-16github.com原文 ↗
  • One MCP setup for 22 clients

    toolport 是本地 MCP gateway,目标是用一套配置服务 22 个 MCP client。它通过少量 meta-tools 和 lazy tool discovery 暴露能力,并复用认证配置,减少每个客户端重复维护 server 列表。这个项目击中的痛点是 MCP 生态碎片化:工具多起来后,配置和凭据比单个工具本身更难管理。

    Project2026-07-16github.com原文 ↗
  • Nutlope/hallmark

    hallmark 是面向 Claude Code、Cursor 和 Codex 的设计 skill,内置主题和 UI 生成约束。它把视觉偏好包装成 agent 可加载规则,帮助编码助手生成更一致的界面。这个仓库说明“设计系统”正在变成 prompt、规则和 skill 的组合,而不仅是 Figma 文件或 React 组件。

    Trending2026-07-16github.com原文 ↗
  • Nable

    Nable 是本地优先的 cloud/AI cost intelligence MCP 工具,聚合账单并暴露成本分析能力。它把成本查询接入 agent 工作流,使开发者可以在同一个对话或 IDE 环境里追问云资源、AI 用量和费用异常。这个方向反映出 FinOps 正在从仪表盘向可操作工具接口迁移。

    Project2026-07-16github.com原文 ↗
  • Designing Agent-Ready Websites for AI Web Agents

    这篇论文把问题从“训练更聪明的 Web agent”转向“网页是否适合 agent 操作”,提出 agent-ready website 框架。作者用机器可读性、可执行性和决策可靠性三个维度描述站点应暴露的结构与语义。它的看点在于把 Web agent 出错的一部分原因放回网站设计,给未来的页面标注、交互状态和任务接口提出了工程化要求。

    Paper2026-07-16arxiv.org原文 ↗
  • Aict

    Aict 提供一组面向 AI agent 的 Unix coreutils 风格命令,并输出 XML/JSON 结构化数据。它保留 shell 小工具可组合的优势,但把表格、错误和字段变成模型更容易解析的格式。这个思路非常工程化:与其让 agent 猜普通 CLI 输出,不如给它稳定的机器接口。

    Project2026-07-16github.com原文 ↗
  • Vexa-ai/vexa

    Vexa 是面向 Google Meet、Microsoft Teams 和 Zoom 的开源会议转写 API。摘要强调实时 WebSocket transcript 与 MCP server,使会议内容可以直接进入 agent 或自动化流程。它的看点是把会议 bot、转写服务和 agent 接口放进同一个可自托管项目里。

    Trending2026-07-15github.com原文 ↗
  • The MCP Census

    The MCP Census 对 MCP server 生态做报告和索引,digest 给出的规模是 15,382 个 servers。它做 health check,并把可用性、元数据和发现问题集中呈现。这个项目提供的是生态基础数据:MCP 的热度需要和实际可连接、可维护的服务数量分开看。

    Project2026-07-15mcpcensus.pages.dev原文 ↗
  • OpenCut-app/OpenCut

    OpenCut 是开源视频编辑器,目标覆盖 Web、desktop 和 mobile。digest 还提到 headless 与 MCP server 模式规划,说明项目希望把剪辑能力开放给自动化和 agent,而不只是提供人工界面。它位于多端创作工具与可编排媒体引擎的交界处。

    Trending2026-07-15github.com原文 ↗
  • Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

    这篇综述把 skill library 看成会持续演化的运行时资产,而不是一组静态 prompt 或脚本。文章按生命周期整理技能发现、表示、检索、执行、更新与治理机制,并比较代码技能、工具技能和程序化记忆等形态。它的价值在于给“agent 会积累能力”这件事建立词汇表,同时指出版本控制、评测和退役机制仍缺统一做法。

    Paper2026-07-15arxiv.org原文 ↗
  • mcp-spec-check

    mcp-spec-check 是一个 CLI,用黑盒方式检查已部署 MCP server 是否适配 2026-07-28 spec 的核心变化。它不需要服务器源码,而是通过远程协议交互判断 readiness,这让兼容性检查可以放进发布前或升级前流程。MCP 生态正在快速扩张,协议版本差异会直接影响 agent 工具调用稳定性,这类探针的价值会随服务数量上升。

    Project2026-07-13github.com原文 ↗
  • google-labs-code/stitch-skills

    stitch-skills 是面向 Google Stitch MCP server 的 Agent Skills 集合,并遵循 Agent Skills open standard。它把可复用能力打包成 skill,让 agent 在设计或应用生成流程中调用。这个仓库说明 MCP 相关生态正在从单个工具 endpoint 扩展到可分发能力包。

    Trending2026-07-13github.com原文 ↗
  • Skyvern-AI/skyvern

    Skyvern 用 LLM 和 computer vision 自动化浏览器工作流,并提供 Playwright-compatible SDK。它区别于固定选择器脚本的地方,是让模型根据页面视觉和状态决定下一步动作。浏览器自动化一旦进入真实后台系统,验证、回滚和人类审批会成为与识别能力同等重要的部分。

    Trending2026-07-13github.com原文 ↗
  • MCP Gateway

    MCP Gateway 把 OpenAPI 接口和数据库转换为 MCP server。它复用已有 API schema 与数据库元数据生成模型可调用的 tools/resources,减少每个内部系统都手写 MCP 适配层的成本。这个工具击中的是真实集成痛点:MCP 的价值取决于企业现有系统能多快被安全、结构化地暴露出来。

    Project2026-07-11swaggertomcp.com原文 ↗
  • ChatGPT Work

    OpenAI 介绍 ChatGPT Work,面向企业工作流提供云端与桌面端能力。条目强调它服务于实际工作任务、工具连接和跨应用操作,而不是只作为网页版问答入口。值得注意的是产品叙事从“聊天”继续转向“工作代理层”,这会影响企业权限、数据边界和审计需求。

    News2026-07-11openai.com原文 ↗
  • iOfficeAI/OfficeCLI

    OfficeCLI 是面向 AI agents 的 Office 文件读写与自动化 CLI,覆盖 Word、Excel 和 PowerPoint。README 强调它是 open-source、single binary、no Office installation、no dependencies,并内置 HTML rendering engine,可把 `.docx`、`.xlsx`、`.ppt…

    Trending2026-07-09始 2026-07-07github.com原文 ↗
  • dotnet/skills

    dotnet/skills 是 .NET 团队维护的 agent skills 仓库,为 coding agents 提供 .NET 与 C# 开发任务知识。README 列出多个插件:`dotnet` LSP 集成、`dotnet-msbuild` 构建诊断与现代化、`dotnet-test` 测试运行与分析、`dotnet-ai` LLM/RAG/MCP/ML.NET 相关能力,以及 .NET…

    Trending2026-07-09始 2026-07-06github.com原文 ↗
  • Task Decomposition-Guided Reranking for Adaptive Agent Skill Retrieval

    SkillReranker 面向大型 skill library 中“多个泛化 skill 都语义相近”的选择难题,在 inference time 用任务分解来重排候选 skill。它同时分解 task 和 skill,生成 subtask、execution-state 与 transition-state 描述,再构成一个有向无环执行图:中间 task states 是节点,candidat…

    Paper2026-07-09arxiv.org原文 ↗
  • Skill-extractor turns coding agent transcripts into reusable skills

    skill-extractor 从 Claude Code、OpenAI Codex CLI 或其他 agent transcript 里挖可复用 skill,而不是让 agent 平台用不可见 memory 自动学习。它按 confidence 和 utility 给候选打分,并用 trace outcome(successful / meh / failed)加权;候选会进入 VS Code…

    Project2026-07-09github.com原文 ↗
  • SawyerHood/dev-browser

    dev-browser 是一个 Claude Skill,让 agent 可以通过 sandboxed JavaScript scripts 控制浏览器。README 提到脚本运行在 QuickJS WASM sandbox 中,没有 host access;同时支持 persistent pages,让 agent 一次导航后可以跨多个脚本持续交互,并能 auto-connect 到浏览器。它不…

    Trending2026-07-09github.com原文 ↗
  • Geosql: A Claude/Codex skill for geospatial data

    GeoSQL 是给 Claude、Codex、GitHub Copilot 的 geospatial analytics skill,面向 PostGIS、BigQuery、Snowflake 和 Wherobots 上的数据分析。README 强调它可以 100% local 或 self-hosted,不需要 SaaS 账号;`pip install geosql && geosql` 后可安…

    Project2026-07-09github.com原文 ↗
  • GPT‑Live

    OpenAI 发布 GPT-Live,把 ChatGPT Voice 的语音交互从 turn-based 模式推进到 full-duplex continuous interaction:模型可以同时听和说,并在每秒多次决定继续听、暂停、插话或调用工具。它还把连续对话层和深度工作层解耦,遇到搜索、推理或更 agentic 的任务时委托给 GPT-5.5,同时保持语音流不断。公告称 GPT-Live…

    News2026-07-09openai.com原文 ↗
  • bradautomates/claude-video

    claude-video 是让 Claude 下载、抽帧、转录并处理视频的 skill。它把视频转换成模型可操作的文本、图像帧和时间线信息,使 Claude 能总结、分析或引用片段。这个仓库的实用点在于把多模态材料预处理包装成 agent 可调用工作流。

    Trending2026-07-08始 2026-07-07github.com原文 ↗
  • The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools

    论文比较自然语言工具和结构化工具调用在多模型上的表现,核心发现是工具接口形式本身会显著影响 agent 能力。自然语言工具把能力描述成模型熟悉的文本语境,在一些任务上可接近甚至优于严格 schema。它挑战了“结构化调用一定更可靠”的默认假设,尤其适合重新审视工具 API 设计。

    Paper2026-07-08arxiv.org原文 ↗
  • JuliusBrussee/caveman

    Caveman 是面向 AI coding agent 的 skill/plugin,用更短、更直接的输出风格减少 token 消耗。它约束 agent 的沟通方式和中间叙述,把上下文预算留给代码、命令和关键状态。这个项目很小,但抓住了 coding agent 的真实成本项:语言冗余也会吃掉窗口和账单。

    Trending2026-07-08github.com原文 ↗
  • Docx-CLI

    Docx-CLI 提供命令行方式读取和编辑 Word `.docx` 文档,目标用户明确包括 agent。它让模型或脚本能检查文档结构、正文和段落并执行修改,而不用依赖 Word GUI 或脆弱的手工复制。这个项目的实用点在办公自动化:很多 agent 能处理纯文本,却卡在真实文档格式上。

    Project2026-07-08github.com原文 ↗
  • ComposioHQ/awesome-claude-skills

    awesome-claude-skills 是 Claude Skills、插件和 agent workflow 的资源列表。它以 curated list 的方式整理技能包、扩展和示例工作流,价值主要来自发现和分类。这个仓库反映 Claude Skills 生态正在从零散技巧转向可复用组件目录。

    Trending2026-07-08github.com原文 ↗
  • Chrome DevTools MCP

    Chrome DevTools MCP 把真实 Chrome DevTools 接到 MCP,让 coding agent 能检查页面结构、网络请求、控制台、性能 trace 和浏览器运行状态。它直接使用 Chrome,而不是用简化浏览器模拟环境,因此适合前端调试、自动化回归和网页 agent 任务。对 coding agent 来说,这相当于把“看页面”升级成“用 DevTools 读页面”。

    Project2026-07-08始 2026-06-18github.com原文 ↗
  • coreyhaines31/marketingskills

    marketingskills 把营销工作拆成 agent skills,覆盖 CRO、copywriting、SEO、analytics、growth、sales/GTM 和 strategy。README 的结构里 product-marketing 是基础 skill,其它 skill 先读取产品、受众和定位,再进入具体任务。这个设计比“让 agent 写营销文案”更系统,因为它把上下文依赖…

    Trending2026-07-07github.com原文 ↗
  • hesreallyhim/awesome-claude-code

    这是 Claude Code 资源合集,收集 skills、agents、status lines、hooks、工作流和相关开发工具。它本身不是运行时项目,而是用 curated list 映射 Claude Code 生态的增长点。看这个仓库可以快速判断社区把精力投向哪里:提示资产、自动化脚本、状态展示、子代理编排和团队规范都在变成可复用部件。

    Trending2026-07-06github.com原文 ↗
  • Open-source phone calling infra for AI agents

    AgentLine 是给 AI agents 使用的开源电话呼叫基础设施,目标是让 agent 能发起、接听和管理真实电话交互。它把电话号码接入、实时音频、转写和 agent 状态管理纳入同一条链路,而不是只做离线语音识别 demo。这个项目说明 LLM 工具调用正在进入传统通信网络,工程难点会从 prompt 转向延迟、失败恢复、通话状态和合规记录。

    Project2026-07-06github.com原文 ↗
  • Local MCP

    Local MCP 是 macOS 本地 MCP 应用,把 Claude、ChatGPT、Cursor 等客户端连接到本机消息、文件和应用上下文。它把多个本地 MCP server 整合成桌面应用形态,降低用户手写 connector 和配置 JSON 的门槛。这个项目的关键不在“又一个 MCP server”,而在本地权限边界、敏感数据访问提示和多 AI 客户端复用同一套上下文。

    Project2026-07-06始 2026-06-07local-mcp.com原文 ↗
  • CoplayDev/unity-mcp

    unity-mcp 是 Unity Editor 与 AI assistants 之间的 MCP bridge,可让助手管理资源、场景和脚本。它把 Unity 编辑器操作暴露成模型可调用工具,避免用户在聊天窗口和 IDE 之间手动搬运代码。这个方向的难点是权限、状态同步和可撤销编辑,因为 agent 一旦能改场景和资源,错误操作的成本会比生成一段脚本更高。

    Trending2026-07-06github.com原文 ↗
  • Better Models: Worse Tools

    Armin Ronacher 描述更强模型在结构化工具调用中生成 schema 之外参数的问题。这个现象说明模型对任务理解更强时,可能更主动推断隐含字段或补充参数,反而破坏工具协议的严格契约。文章把注意力放在接口边界上:工具层需要校验、拒绝和反馈机制,而不是默认相信模型会因为能力提升就更守规矩。

    Blog2026-07-06lucumr.pocoo.org原文 ↗
  • modelcontextprotocol/ext-apps

    modelcontextprotocol/ext-apps 是 MCP Apps 协议和 SDK,用于在 AI chat 客户端中嵌入交互式 UI。它把 MCP 从文本工具调用扩展到可视化应用承载层,让 agent 可以与表单、图表或小应用共同完成任务。这个仓库重要在协议方向:复杂工作流很难永远靠聊天消息和 JSON 工具结果表达。

    Trending2026-07-04github.com原文 ↗
  • agentskills/agentskills

    agentskills/agentskills 定义 Agent Skills 规范和 `SKILL.md` 文档格式,用于给 agent 安装可复用能力。仓库把技能说明、资源和工作流约束打包,避免把所有领域知识塞进一个巨大系统提示。它反映了 agent 能力工程的一条路线:把提示变成可分发、可版本化、可按任务加载的模块。

    Trending2026-07-04github.com原文 ↗
  • The Safari MCP server for web developers

    WebKit 团队发布 Safari MCP server,让开发工具和 agent 可以控制 Safari、检查页面并执行调试任务。它把 MCP 接到真实浏览器运行时,使 agent 能根据 Safari 的实际渲染、网络和开发者工具状态行动。随着 Chrome 和 Safari 都出现 MCP 调试入口,浏览器正在成为 coding agent 的一等工具环境。

    News2026-07-04webkit.org原文 ↗
  • SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

    SkillCoach 研究 agent 对可复用 skill 的选择和执行质量,用自演化 rubric 从轨迹中更新评价标准。它不是只打一个 pass/fail 分数,而是让 rubric 随任务分布提炼新的评分维度。技术意义在于 skill-based agent 需要可维护的评估体系,否则 skill 数量增长后很难判断 agent 是选错技能、参数错了,还是执行策略不合适。

    Paper2026-07-04arxiv.org原文 ↗
  • Scopewalker

    Scopewalker 是本地只读 MCP server,为 agent 提供代码行数、复杂度、嵌套深度和参数数量等指标。它通过工具调用把代码库形状暴露给模型,帮助 agent 在重构或审查前判断风险区域。这个项目的亮点是克制:只读指标不会替模型做决定,却能减少模型对代码规模和复杂度的主观猜测。

    Project2026-07-04github.com原文 ↗
  • vas3k/TaxHacker

    TaxHacker 是自托管 AI accounting 应用,面向 freelancer、indie hacker 和小企业的收据、发票、交易分析。README 描述上传照片、PDF 或 invoice 后,系统会抽取 product names、amounts、items、dates、merchants、taxes,并写入类似 Excel 的结构化数据库。可自定义字段和 prompt 的设计让…

    Trending2026-07-03github.com原文 ↗
  • t8y2/dbx

    DBX 是 15MB 级跨平台数据库客户端,支持桌面和 Docker 自托管,并带 built-in AI assistant。README 标称支持 60+ databases,包括 MySQL、PostgreSQL、SQLite、Redis、MongoDB、DuckDB、ClickHouse、SQL Server 等。它的卖点不是单个数据库能力,而是以小体积把多数据库管理、跨平台打包和 AI…

    Trending2026-07-03github.com原文 ↗
  • getmaxun/maxun

    Maxun 是开源 no-code 平台,用于 web scraping、crawling、search 和 AI data extraction,口号是把任意网站转成 structured API。README 指向 Web app、文档和教程,适合不想手写爬虫但需要结构化数据抽取的团队。页面还出现 residential proxy 赞助信息,提到 9000 万以上真实 IP 和 200 多个…

    Trending2026-07-03github.com原文 ↗
  • Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

    这篇把 agent skills 看作 dependency-bearing artifacts,指出它们的 identities、versions、provenance 常常是隐式的,已经造成 duplicated dependencies 和 inconsistent installations。SkillDepAnalyzer 借鉴 SBOM 思路,从自然语言依赖证据中恢复 skill me…

    Paper2026-07-03arxiv.org原文 ↗
  • SkillSelect-Serve: Budget-Controllable and QoS-Aware Skill Service Recommendation and Composition for Small LLM Agents

    论文把 agent skill 从可检索文档重塑为 Skill Service:每个 skill 带功能描述、依赖、上下文成本、风险和 QoS 属性。Local Micro-Agent Requirement Planner 将自然语言任务转成结构化服务需求,共享 discovery backbone 从大 registry 中召回候选,再用 skill-level marginal suitab…

    Paper2026-07-03arxiv.org原文 ↗
  • QUALITY.md - open format/specification, agent skill, and CLI

    QUALITY.md 把项目质量评估写成一个开放说明格式,并配套 agent skill 与 CLI。作者在原始描述里强调它最初用于建立 holistic quality evaluation process,后来发现也适合 loop engineering。这里的方向不是再加一个 lint,而是把质量标准、评估步骤和 agent 可执行的检查周期写成项目资产,让修复从事后 review/repa…

    Project2026-07-03getquality.md原文 ↗
  • Claude-real-video - any LLM can watch a video

    这个工具把视频变成任何 LLM 都能消费的本地文件夹:关键帧、transcript 和 MANIFEST.txt,而不是只把视频链接交给模型。它用 scene-change detection 加 density floor 取代固定 1fps 抽帧,再用 sliding-window dedup 去掉重复镜头;默认 `--max-frames` 是 150,并可通过 Whisper 转写音频。工…

    Project2026-07-03github.com原文 ↗
  • Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

    OpenAgent 将 tool-use agent 的泛化问题形式化为 query、action、observation、domain 四个维度上的 distribution shift,而不是在固定工具集上看 leaderboard。作者构造受控 sandbox,并把扰动组织为 Perception、Interaction、Reasoning、Internalization 四层 hierar…

    Paper2026-07-03arxiv.org原文 ↗
  • ttsc graph

    `@ttsc/graph` 把 TypeScript compiler 看到的真实程序图暴露给 MCP agent:什么调用什么、什么依赖什么、每个符号在哪个文件和行。它的 MCP surface 是单工具 `inspect_typescript_graph`,返回 names、edges、signatures 和 spans,不返回源码正文,所以 graph 查询的 token cost 随仓库…

    Project2026-07-02github.com原文 ↗
  • diegosouzapw/OmniRoute

    OmniRoute 是多 provider AI gateway,试图让 Claude Code、Codex、Cursor、Cline、Copilot 和 Antigravity 共用一个 endpoint 接入大量模型供应商。README 的强营销数字包括 236 providers、50+ free providers、约 1.6B free tokens/month,以及 RTK + Cav…

    Trending2026-07-02github.com原文 ↗
  • cloudflare/skills

    cloudflare/skills 是 Cloudflare 给 Agent Skills 标准准备的一组 skill,覆盖 Workers、Agents SDK 和更广的 Cloudflare Developer Platform。它可通过 Claude plugin marketplace、Cursor marketplace/remote rule、`npx skills add` 或直接复…

    Trending2026-07-02github.com原文 ↗
  • LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents

    LUMOS 把操作系统与浏览器已有的 accessibility metadata 转换为 machine-readable semantic blueprints,包含 stable identifiers、roles、names、values、bounds 和 action affordances。agent 通过 constrained visible-UI primitives 做 obs…

    Paper2026-07-02arxiv.org原文 ↗

2026 年 6 月97

  • browser-use/video-use

    video-use 的目标是让 coding agents 编辑视频,把视频剪辑流程暴露给 agent,而不是让模型只生成脚本或建议。这个方向难点在可观察状态:agent 需要理解时间线、素材、剪切点、导出结果和视觉反馈,不能只依赖文本 diff。它出现在 Trending 里说明 agent 工具正在从代码库扩展到媒体生产工作流。

    Trending2026-06-29github.com原文 ↗
  • alibaba/page-agent

    page-agent 是阿里开源的 JavaScript in-page GUI agent,用自然语言控制网页界面。它可嵌入网页内部,而不是从外部驱动浏览器。这个位置差异很重要:页面内 agent 可以直接接触 DOM、组件状态和应用上下文,也更容易和产品权限、埋点、UI 状态机集成。它适合那些希望给已有 Web 应用加自然语言操作层的团队,而不是只做测试自动化。

    Trending2026-06-29始 2026-06-27github.com原文 ↗
  • Use-zerostack

    use-zerostack 是一个 agent skill,把 Claude Code、Cursor 等 coding agent 的 slash command 映射到 zerostack CLI,让主 agent 可以把实现、计划、审查和复杂编排委派出去。README 给出的命令面很小但明确:`/zs:code`、`/zs:ask`、`/zs:plan`、`/zs:review`、`/zs:p…

    Project2026-06-29github.com原文 ↗
  • Tsar-MCP

    Tsar-MCP 这篇 IBM 文档讲解如何用 C/C++ 实现 MCP server aspect,“aspect”这个切入点说明它关注 MCP server 的横切能力组织,而不是只演示一个工具 handler。对 C/C++ 生态来说,MCP server 若要进入已有系统,常见难点是生命周期、资源暴露、错误处理和接口复用。把这些做成 aspect 有助于让 MCP 嵌入传统 native…

    Project2026-06-29ibm.github.io原文 ↗
  • Shikhu

    Shikhu 是 CLI 加 `/shikhu-study` agent skill,目标是帮助开发者学习自己或 AI 生成的代码库。它用 Mercury API 读取源码生成摘要和概念性多选题,用本地 SQLite 的 `coverage.db` 跟踪 knowledge coverage;每个文件需要 3 个 golden questions 才算 fully covered。README 还…

    Project2026-06-29github.com原文 ↗
  • Peek-CLI

    Peek-CLI 让 coding agents 能捕捉浏览器打开 tab 的截图,填补本地前端调试中“agent 看不到页面”的缺口。README 说明它通过浏览器扩展经 WebSocket 传输截图,本地 `peeked start` 启动 daemon,`peeked list` 列出 URL,`peeked at http://localhost:3000` 会保存截图文件。项目还提供 C…

    Project2026-06-29github.com原文 ↗
  • Moumantai

    Moumantai 是自托管 personal app runtime:服务器保存状态和业务逻辑,再根据浏览器、手机、手表或 ESP32 面板投射不同 face。README 的核心抽象是 “Schema. Tools. Faces.”:schema 管状态,tools 做变更,faces 只读展示;agent backend 不能直接改状态,只能请求服务器验证并执行工具。quick start…

    Project2026-06-29github.com原文 ↗
  • vercel-labs/skills

    vercel-labs/skills 提供一个开放 agent skills 生态的 CLI,核心入口是 `npx skills`。README 写到它支持 OpenCode、Claude Code、Codex、Cursor 和 68 个以上工具,还能安装 skill 或把某个 skill 直接生成 prompt 传给 agent。它的看点在于把“可迁移的 agent 能力包”做成跨工具分发层,而…

    Trending2026-06-28github.com原文 ↗
  • aws/agent-toolkit-for-aws

    aws/agent-toolkit-for-aws 是 AWS 官方支持的 agent toolkit,包含 MCP servers、skills 和 plugins。README 明确说它面向 Claude Code、Codex、Cursor 等 coding agents,帮助这些 agent 在 AWS 上 build、deploy、manage applications。它的意义在于云厂商…

    Trending2026-06-28始 2026-06-27github.com原文 ↗
  • Open Tag

    Open Tag 是 CopilotKit 做的 Claude Tag 类开源实现,目标是把特定产品里的 tag 式交互抽成可复用项目。公开描述没有展开太多实现细节,但它处在一个明确趋势里:agent 应用开始需要更细粒度地标注上下文、目标对象和可操作区域。它可作为观察 CopilotKit 如何把 agent UI 交互组件化的入口。

    Project2026-06-28github.com原文 ↗
  • Ocarina

    Ocarina 把 MCP server 的 tools 和 resources 当作可脚本化接口,用 YAML 编排调用、测试和自动化流程。作者的切入点来自 Ansible 式自动化:MCP 已经把服务能力描述成 typed、LLM-readable 的协议对象,因此不必每次都通过聊天模型来触发。这个项目把 MCP 从“给 agent 用的接口”推进到“可重复执行的集成测试面”。

    Project2026-06-28github.com原文 ↗
  • Mcpify

    Mcpify 读取 OpenAPI 规格并生成 MCP server,目标是消除为每个 REST endpoint 手写 MCP tool wrapper 的重复工作。作者指出,现有 API 通常已经有 OpenAPI spec,因此生成整套 server 比手工桥接更合理。它的技术看点在于把 MCP 接入从“写胶水代码”变成“从既有契约生成 agent 可调用接口”。

    Project2026-06-28github.com原文 ↗
  • xbtlin/ai-berkshire

    AI Berkshire 是基于 Claude Code 的价值投资研究框架,把巴菲特、芒格、段永平、李录四种方法论做成 skills 和多 agent 流程。README 列出 16 个 skill,包含深度研究、财报分析、行业筛选、持仓管理和思维工具;它还展示 2024 全年 +69.29%、2025 年至今 +66.38% 的实盘记录。项目真正有意思的地方是把投研纪律、反偏见清单和多源数据校…

    Trending2026-06-27github.com原文 ↗
  • every-app/open-seo

    OpenSEO 是开源 Semrush/Ahrefs 替代,定位为可自托管、按 API 成本付费、可被 agent 调用的 SEO 工具。README 列出 keyword research、rank tracking、competitor insights、backlinks、site audits 和 AI visibility,并提供 MCP server 与 Claude Code/Ope…

    Trending2026-06-27github.com原文 ↗
  • SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills

    论文将 FSM-defined scenarios 里的成功轨迹看作未知转移图路径,把可复用 skill 表示成 parameterized finite-state-machine subgraphs。SkillDisCo 从 successful traces 蒸馏 PFSM 子图,再编译成 callable、executable、verifiable procedural skills;AL…

    Paper2026-06-27arxiv.org原文 ↗
  • Computer use in Gemini 3.5 Flash

    Google 介绍 Gemini 3.5 Flash 的 computer-use 能力,说明其产品线继续向可操作界面的 agent 执行层延伸。这条的重点是能力类别:模型不只是生成文本,还承担屏幕/应用操作。它与 GUI/CLI agent 论文形成呼应,行业正在把 computer use 从研究 demo 推进到主力模型功能。

    News2026-06-27blog.google原文 ↗
  • modelcontextprotocol/rust-sdk

    modelcontextprotocol/rust-sdk 是 Model Context Protocol 的官方 Rust SDK,基于 tokio async runtime。README 提到 RMCP 核心 crate、rmcp-macros procedural macro crate,以及 1.x migration guide。Rust SDK 的成熟度会影响 MCP 在高性能服务…

    Trending2026-06-24github.com原文 ↗
  • corsairdev/corsair

    Corsair 是面向 agents 的 unified integration layer,用来集中连接外部服务并控制权限。README 描述的模式是 agent 连接到 Corsair 实例后获得 integrations,但不直接看到 credentials,用户仍能控制它能做什么。它把 agent 集成问题拆成两层:外部服务连接由平台管理,动作权限由用户和策略收口。

    Trending2026-06-24github.com原文 ↗
  • NVIDIA/skills

    NVIDIA/skills 是 NVIDIA 发布的官方 agent skills 集合,README 将 skills 定义为 portable instruction sets。它们用于教 AI agents 更好使用 NVIDIA 软件,包括 CUDA-X libraries、AI Blueprints 等,并链接 docs、livestream 和 capability governanc…

    Trending2026-06-24github.com原文 ↗
  • Caplets

    Caplets 把 agent 能力拆成更小的 capability 单元,而不是把一整面工具墙交给模型。它的设计目标是按任务分发最小可用能力,使 agent 只拿到当前动作需要的权限。这个项目和 MCP/tool registry 生态相邻,但关注点更偏 capability packaging 与细粒度授权。

    Project2026-06-24caplets.dev原文 ↗
  • ByteAsk Embedded MCP

    ByteAsk Embedded MCP 是一个 MCP server,为 coding agents 提供嵌入式 datasheet 信息,并带页码引用。嵌入式开发的资料常常长、表格密、约束细,答案如果不能回到具体页码,工程可信度会很低。这个项目把资料检索和引用位置一起暴露给 agent,适合硬件接口、寄存器和器件选型类任务。

    Project2026-06-24github.com原文 ↗
  • Selector Forge

    Selector Forge 是一个浏览器扩展,用 AI 生成 CSS/XPath selector,但最终正确性由 live DOM 验证。流程是用户选中页面元素,扩展发送目标、DOM 上下文和 seed candidates,后端生成和排序候选,浏览器逐个验证并回传结果;列表模式还会检查完整目标集合,拒绝 over-match 和 under-match。项目的核心设计是把 AI 限定为 pr…

    Project2026-06-23github.com原文 ↗
  • Open-geo

    open-geo 是 Claude Code skill,用真实登录浏览器跑查询并记录品牌在生成式答案中的可见性。README 写明它检查目标域名是否进入 answer、sources、citations 和正文,使用 SQLite WAL 存本地时间序列,并输出 FastAPI/React dashboard 与 A4 PDF;指标采用 answer→sources→citations funn…

    Project2026-06-23github.com原文 ↗
  • GLM-5.2 is the step change for open agents

    Nathan Lambert 评述 GLM-5.2 在开放 agent 能力上的表现和生态位置。文章的判断背景是开放模型能否在工具使用、长任务和 coding agent 工作流里承担真实负载,而不只是聊天和基准测试。它把 GLM-5.2 放进“开放模型是否开始具备可用 agent 栈”的讨论中。

    Blog2026-06-23interconnects.ai原文 ↗
  • voicebox

    Voicebox 把 voice cloning、TTS、dictation 和 agent voice output 放进一个本地优先应用。README 的功能密度很高:7 个 TTS engines、23 种语言、从几秒参考音频 zero-shot clone、50+ preset voices、全局 push-to-talk/toggle dictation、Whisper STT、REST…

    Trending2026-06-22github.com原文 ↗
  • Rocannon

    Rocannon 把 Ansible 资产直接反射成 MCP 工具:启动时读 `ansible-doc`,把安装的 module 和带 argument spec 的 role 变成带类型、默认值、choices 和安全提示的 LLM-callable tool。它不是只做自然语言 wrapper,README 还强调 session 可以录制成 `.rocannon/playbooks/` 下的…

    Project2026-06-22github.com原文 ↗
  • Project Fetch: Phase Two

    Anthropic 复盘 Project Fetch 时把机器人任务拆成连接视频、连接 lidar、程序控制、路径监控、检测 beach ball 等阶段,让 Claude Opus 4.7 在 Claude Code 中跑三次,研究员只负责插线、输入初始 prompt、批准命令和任务切换。结果最醒目的数字是:四个所有团队都完成的任务里,Opus 4.7 平均 9 分 35 秒完成,而原先 Tea…

    News2026-06-22anthropic.com原文 ↗
  • Nori Browser

    Nori Browser 把“人看的浏览器”和“agent 脚本化的浏览器”合成同一个 Electron 应用:侧栏运行 Claude Code 或 shell,页面本身是可通过 CDP 暴露的 Chromium。README 写明默认 CDP port 是 `19222`,agent 用 Playwright `connectOverCDP` 控制用户正在看的同一组页面,而不是走 MCP 工具或…

    Project2026-06-22github.com原文 ↗
  • Quoting Sean Lynch

    Simon Willison 摘录 Sean Lynch 的 HN 评论,把 MCP 的价值从“工具协议”重新聚焦到授权隔离。评论指出,MCP 相比 skills/CLI 的关键能力是把 auth flow 放到 agent context window 之外,甚至放到 harness 之外;理想形态可能只是 API 的 auth gateway。这个判断与 Cloudflare temporar…

    Blog2026-06-21simonwillison.net原文 ↗
  • Quikdown

    Quikdown 针对的不是完整 CommonMark 或 ProseMirror 替代,而是“Markdown 仍是 source of truth,但用户能编辑源文本或渲染侧”的轻量文档面。README 给出的核心 parser 大约 15-17KB、零运行时依赖,双向模块约 20KB,editor 约 98KB;rich fence 覆盖 Mermaid、MathJax、GeoJSON、ST…

    Project2026-06-21github.com原文 ↗
  • Namecom-CLI

    Namecom-CLI 是把 Name.com DNS/domain 管理做成 agent-friendly CLI:`--json` 覆盖所有命令,`commands` introspection 让 agent 能发现可用 surface,`records set` 采用 create-or-update 语义避免自动化重复记录。README 还把安全细节写得比较实用:凭据优先走 macOS…

    Project2026-06-21github.com原文 ↗
  • openai/skills

    openai/skills 是 Codex Agent Skills 的技能目录仓库。README 把 Agent Skills 定义为 agents 可发现并用于特定任务的 instructions、scripts 和 resources 文件夹,强调 “write once, use everywhere”。这个仓库和自动生成 SKILL.md 的论文互相呼应:一个提供技能分发形态,另一个试图…

    Trending2026-06-20github.com原文 ↗
  • modelcontextprotocol/servers

    modelcontextprotocol/servers 是 MCP 的参考 server 实现和社区资源集合。它为文件系统、数据库、开发工具和外部服务等能力提供示例入口,使客户端和工具作者有共同参照。随着 MCP 成为代理工具接口的重要协议,这个仓库更像生态基础设施,而不是普通示例集。

    Trending2026-06-20github.com原文 ↗
  • Zero-Touch OAuth for MCP

    MCP 官方博客介绍企业托管认证下的 zero-touch OAuth 流程,目的是让 MCP server 的授权更适合企业管理。它把用户逐个同意的交互,转向由组织身份和管理策略预先处理的认证体验。随着 MCP 工具进入公司环境,认证和权限生命周期会和协议本身一样重要。

    News2026-06-20blog.modelcontextprotocol.io原文 ↗
  • Surface skill for HTML pages a coding agent watches and reacts to

    Surface 提供的是面向编码代理的 HTML 页面观察与响应技能,让代理能看见页面状态并据此采取动作。它的重点不是生成页面,而是把浏览器中的可视反馈纳入编码闭环。对于前端和可视化调试任务,这类技能可以把“截图观察、定位问题、修改代码”变成更连续的工作流。

    Project2026-06-20github.com原文 ↗
  • PostgreSQL MCP Server with 135 tools for various purpose

    mcp-pg-rust 是一个用 Rust 编写的 PostgreSQL MCP server,材料中明确给出它提供 135 个工具。项目把数据库访问、检查和操作能力通过 MCP 暴露给代理,覆盖面比单一查询工具更广。它的看点在于把数据库管理拆成大量可枚举工具后,代理权限、审计和错误恢复都可以更细粒度地处理。

    Project2026-06-20github.com原文 ↗
  • OpenTunnel - Run Remote Commands as Local Agent Tool Calls

    OpenTunnel 把远程命令包装成本地代理工具调用,让代理可以在本地接口下触发远端执行。这个设计适合处理本地模型或本地代理需要操作远端环境的场景,同时保留工具调用的统一形态。它的技术边界在权限和审计:远程命令一旦进入代理工具层,就需要清楚定义可执行范围。

    Project2026-06-20github.com原文 ↗
  • Let agents send/receive SMS using your old Android phone

    这个项目把一台旧 Android 手机变成代理可调用的 SMS 通道,通过手机端应用和 relay server 完成读取、发送短信。作者在 HN 描述里给出的动机很具体:让代理访问 OTP codes,同时避开 Twilio 的成本和配置负担;relay server 充当 agents 的 MCP 入口。技术上看,它把物理设备能力包装成代理工具,比纯云端 API 更贴近个人自动化场景。

    Project2026-06-20simlink.snaz.cz原文 ↗
  • K-Dense-AI/scientific-agent-skills

    scientific-agent-skills 是面向科学研究代理的技能库,README 声称已有 160,000+ scientists 使用,提供 140 ready-to-use skills 和 100+ scientific databases,覆盖生物、化学、医学和药物发现。它把领域数据库访问和研究流程写成代理可复用的技能,降低科学任务里反复查库、转换格式和解释字段的成本。这个仓库说明…

    Trending2026-06-20github.com原文 ↗
  • BuilderIO/agent-native

    agent-native 面向的是让代理成为应用一等交互者,而不是在既有 UI 外面再套一个聊天框。项目的核心做法是把用户界面操作、代理动作和状态更新放进同一套状态与动作系统,使人类点击和模型执行能共享可追踪的应用语义。这个方向的技术看点在于,应用不只把代理当“文本生成器”,而是为代理暴露结构化、可回放、可约束的操作面。

    Project2026-06-20github.com原文 ↗
  • Beyond Static Endpoints: Tool Programs as an Interface for Flexible Agentic Web Services

    这篇反思静态 API endpoint 对代理接口的限制,提出 ToolPro,用可执行 tool program 表示代理面向 Web 服务的多步意图。摘要点名的长程工作流结构包括 loops、conditionals、joins 和 retries,这些都很难被一组固定端点完整表达。它适合解释为什么 agentic web services 需要比 OpenAPI 风格接口更灵活的执行单位。

    Paper2026-06-20arxiv.org原文 ↗
  • Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

    这篇面向 computer-using agents,目标是从 GUI 交互轨迹中自动生成 SKILL.md。摘要给出的三阶段流程是 segment GUI trajectories、cluster segments into candidate skills,再训练 skill-aware policy;动机是显式技能库更容易检查,但能否从交互数据中挖掘仍需验证。它把“人教代理做任务”的成本从手…

    Paper2026-06-20arxiv.org原文 ↗
  • web-infra-dev/midscene

    Midscene 用视觉理解和自然语言描述做 UI 自动化与测试。它降低了选择器脆弱性,因为操作目标可以由画面语义决定,而不是固定 DOM path。对现代前端测试来说,这类框架把“用户看到什么”重新放回自动化主语。

    Trending2026-06-19github.com原文 ↗
  • mattpocock/skills

    mattpocock/skills 收集面向工程工作流的 agent skills。它把经验、约束和操作步骤沉淀成可被 agent 调用的技能文件,而不是依赖每次对话重新说明。这个仓库体现 skills 正在成为 AI 开发环境里的新配置层。

    Trending2026-06-19github.com原文 ↗
  • Vibesurfer - a token-efficient browser for AI agents

    vibesurfer 是 Rust 浏览器 daemon,底层用 WKWebView、WebKitGTK 或 WebView2,不依赖 Chromium/CDP。README 给出一个直观对比:Hacker News 首页经 Playwright 约 2000 输入 token,而 vibesurfer 约 50,因为它返回 state tokens 和 tree deltas。mutating…

    Project2026-06-19github.com原文 ↗
  • Towards an Agent-First Web: Redesigning the Web for AI Agents

    论文从访问、经济和内容三层重新设计 Web,主张代理作为人类 proxy 时应继承相应访问权,并用请求元数据、rate limit 和 agent-optimized 内容协商边界。经济层提出按 intent 和 token 计量,内容层提出 ATML、四级人类监督和加密 provenance chain。它把 agent 访问网站的问题从反爬和 CAPTCHA 扩展到社会契约、付费机制和知识来源…

    Paper2026-06-19arxiv.org原文 ↗
  • Throne MCP Registry

    Throne MCP Registry 记录 74 个 MCP server 在 microVM 中运行时的兼容性和故障情况。它的价值不在“又一个 MCP 列表”,而在把 MCP server 放入隔离执行环境后观察真实安装、启动和运行问题。对正在把 MCP 接入生产 agent 的团队,兼容性矩阵比 README 徽章更接近可用性证据。

    Project2026-06-19usethrone.dev原文 ↗
  • Skill Studio - mine, edit, and manage Agent Skills

    Skill Studio 是跨平台 Rust 应用,用来挖掘、编辑和管理 agent skills。它把 skills 当作可维护资产,而不是散落在项目里的提示词片段。这个方向值得注意,因为多 agent 工作流越复杂,技能的发现、版本和编辑体验越接近 IDE 或包管理问题。

    Project2026-06-19github.com原文 ↗
  • AutomatiQ - generate web scrapers/automations by browsing any website

    AutomatiQ 先用 Chrome CDP 记录用户浏览时的网络请求、响应体、cookie、点击、输入和导航,再让视觉模型标注动作片段,最后由 LLM 在隔离 Python/IPython 环境中生成自动化脚本。README 的使用路径很短:`automatiq run https://example.com`,浏览后按 Ctrl+C,agent 接管生成脚本。它把 web scraping…

    Project2026-06-19始 2026-06-18github.com原文 ↗
  • A Technical Taxonomy of LLM Agent Communication Protocols

    作者用 5 轮迭代方法分析 9 个有采用迹象的开源 agent 通信协议,给出 counterparty、payload、interaction state、discovery mechanism 和 schema flexibility 五个维度。样本中 agent-to-agent 协议普遍保留 session state,多数支持多个预定义 schema,只有少数在运行时协商 schema。…

    Paper2026-06-19arxiv.org原文 ↗
  • mcp-sql

    mcp-sql 把数据库访问包装成 MCP server,重点不是“让模型会写 SQL”,而是把查询权限和修改权限拆开。作者在原始描述中写到,SELECT 可以让 LLM 自由使用以建立上下文,但涉及写入、更新、删除时,尤其在敏感环境中,需要人类保留控制和理解。这个权限模型适合企业内部 Agent:读路径帮助分析,写路径必须显式审批或被更严格地 gated。

    Project2026-06-18github.com原文 ↗
  • PreAct: Computer-Using Agents that Get Faster on Repeated Tasks

    PreAct 把 computer-use Agent 的一次成功执行编译成小型 state-machine program:状态负责检查屏幕是否符合预期,transition 负责执行点击或输入,后续同类任务直接 replay 而不是逐步调用模型。论文报告 replay 比重新让 Agent 观察和推理快 8.5 到 13 倍,且每一步不再消耗语言模型调用;一旦屏幕状态不匹配,控制权会交回 Ag…

    Paper2026-06-18arxiv.org原文 ↗
  • AuthPlane

    AuthPlane 的定位是 MCP 场景下的 OAuth 2.1 与 PKCE authorization server。它直接落在远程 MCP 部署最薄弱的一层:Agent 需要访问用户关联服务时,授权边界不能靠长期静态 token 或临时共享密钥撑住。把 OAuth 2.1/PKCE 放进 MCP 工具链,意味着可以用标准 delegated authorization、client flo…

    Project2026-06-18github.com原文 ↗
  • Aihu

    Aihu 的定位是 Web Components framework for AI agents,目标是让 Agent 更稳定地驱动前端组件。它通过 custom elements、属性和组件级语义约定,为 Agent 提供比像素点击或临时 CSS selector 更稳的操作面。它反映了前端工具链的新分叉:UI 不只要对人可用,也要对自动化和 Agent 可解释。

    Project2026-06-18github.com原文 ↗
  • A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry

    OpenAI 与 Molecule.one 把 GPT-5.4 接到 Maria AI/Lab,让系统从开放目标出发改进 medicinal chemistry 里的 Chan-Lam coupling。最有结果的 proposal OAI-M1-03 选择 primary sulfonamides 这一低产率但高价值 substrate class,并提出 TEMPO 等 mild oxidan…

    News2026-06-18openai.com原文 ↗
  • datasette-agent 0.3a0

    datasette-agent 0.3a0 新增带用户审批的写 SQL 工具。这个变化把 agent 从只读分析推进到可提出数据库 mutation,但把最终执行权留在人类确认步骤。它是数据库 agent 产品化中的一个小而重要的边界设计:模型可以生成操作计划和 SQL,系统必须在副作用发生前暴露清楚并等待批准。

    Blog2026-06-17simonwillison.net原文 ↗
  • PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

    PrologMCP 把 Prolog 作为 stateful MCP server 暴露给 LLM agent,让模型负责翻译问题,符号求解器负责演绎推理。接口包含结构化错误报告和 per-session isolation,适配 translate-run-inspect-repair 循环。PARARULE-Plus 两个子集上,formalizer agent 在一般样本达到或追平 1.00…

    Paper2026-06-17arxiv.org原文 ↗
  • FastContext: Training Efficient Repository Explorer for Coding Agents

    FastContext 将 repository exploration 从 coding solver 中拆出,训练 4B-30B 的专门探索子 agent。它按需并行调用工具,只返回文件路径和行号范围,减少探索阶段对主 agent history 的污染。接入 Mini-SWE-Agent 后,在 SWE-bench Multilingual、SWE-bench Pro 和 SWE-QA 上端…

    Paper2026-06-17arxiv.org原文 ↗
  • Claireon

    Claireon 是运行在 Unreal Editor 内的 MCP server 插件。它把外部 MCP 表面收缩成 `tool_search` 和 `python_execute`,再在编辑器内部用 SQLite FTS5 与 embedding model 检索数百个 automation tools。功能覆盖 Blueprint、Animation、State Tree、Behavior…

    Project2026-06-17github.com原文 ↗
  • addyosmani/agent-skills

    agent-skills 是面向 AI coding agents 的 production-grade engineering skills 集合。digest 的重点是把工程流程、代码审查、测试、文档和交付习惯封装成可复用指令包。它值得看是因为 agent 能力越来越取决于可执行流程模板,而不仅是模型本身的代码生成能力。

    Trending2026-06-15github.com原文 ↗
  • RAIF

    RAIF 观察到 LLM 不是确定性 JSON writer,常见失败包括少括号、markdown fence、半截流和分隔符滑移,因此把“可修复”写进格式本身。README 的数字是相对 JSON 少约 14.4% cl100k token、15.9% o200k token,截断输出在同等预算下恢复 46% leaf,而 JSON + jsonrepair 为 41%。它还用 5,000-se…

    Project2026-06-15github.com原文 ↗
  • datasette 1.0a33

    Datasette 1.0a33 扩展 JSON API 的 `_extra=` 模式,使其覆盖 queries 和 rows。这个变化面向自动化调用者:API client 可以直接请求附加结构化信息,而不必围绕查询结果再发额外请求或解析页面。它与 datasette-agent 放在同一天看更清楚,Datasette 正在把自己变成更适合 agent 和脚本消费的数据界面。对于小型数据工具,J…

    Blog2026-06-12simonwillison.net原文 ↗
  • BerriAI/litellm

    LiteLLM 是 OpenAI-compatible LLM gateway/SDK,覆盖 100+ 模型 API,并支持 cost tracking、guardrails、load balancing、logging。仓库描述列出的后端包括 Bedrock、Azure、OpenAI、VertexAI、Cohere、Anthropic、SageMaker、HuggingFace、vLLM、NVI…

    Trending2026-06-12github.com原文 ↗
  • Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

    SKIM 关注的是自然语言 skill,而不是普通文档压缩:skill 里有步骤依赖、工具协议和可执行 workflow,简单摘要会破坏可用性。它按 skill 复杂度自适应生成不同数量的 soft tokens,形成多分辨率过程知识压缩,并且强调离线、轻量,适合频繁更新的社区 skill。实验里 skill 被压到原 token 长度的 30%-60%,同时任务表现比既有压缩方法保留得更好。对于…

    Paper2026-06-12arxiv.org原文 ↗
  • thesysdev/openui

    OpenUI 是面向 generative UI 的开放标准与 React runtime。README 说明 OpenUI Lang 支持 token streaming、受控组件渲染和 Zod 类型契约,并在七个 UI 场景中相对 JSON streaming 格式总 token 少约 52.8%;仓库还包含 chat state adapters、prebuilt chat UI、CLI、N…

    Trending2026-06-10github.com原文 ↗
  • google/skills

    Google 的 skills 仓库收集面向 Google 产品和技术栈的 Agent Skills,可用 npx skills add google/skills 安装并选择具体技能。README 列出 Gemini API on Agent Platform、Managed Agents API、Skill Registry API、AlloyDB、BigQuery、Cloud Run、Clo…

    Trending2026-06-10github.com原文 ↗
  • LatentSkill

    LatentSkill 把 agent 的 textual skills 转成 plug-and-play LoRA adapters,让技能知识存到权重空间而不是每步塞进 prompt。它用预训练 hypernetwork 生成 skill LoRA,并支持 scaling 与 parameter-space composition;在 ALFWorld seen/unseen split 成功…

    Paper2026-06-10arxiv.org原文 ↗
  • How engineers at Nextdoor use Codex to build without limits

    OpenAI 案例文章介绍 Nextdoor 平台团队如何用 Codex 调查问题和推进跨平台产品工作。Nextdoor 服务 11 个国家超过 1.1 亿用户;文章举的 Opportunity Alerts 地图功能过去可能需要 mobile、frontend、backend 三队协作,现在由一名工程师借助 Codex 端到端完成。案例的核心不是“生成更多代码”,而是工程师职责从系统局部移动到产…

    News2026-06-10openai.com原文 ↗
  • Apple Core AI Framework

    Apple Core AI Framework 文档面向开发者在 Apple 平台集成系统 AI 能力。结合 Apple Intelligence 页面看,开发者入口的关键不是单一模型 API,而是把 Foundation Models framework、App Intents、Siri、Writing Tools、Image Playground 等能力放进系统框架。它决定第三方 app 能多…

    News2026-06-10developer.apple.com原文 ↗
  • Anything2Skill

    Anything2Skill 把外部知识库中的手册、示例、日志和轨迹编译成可复用 agent skills。框架先切 evidence windows,再按 skill-tree prior plan-and-expand,最后生成包含 invocation conditions、contraindications、action moves、workflow steps、constraints、o…

    Paper2026-06-10arxiv.org原文 ↗
  • openai/plugins

    这是 OpenAI 的 Codex plugin 示例集合,覆盖 manifest、skills、commands、hooks 和 MCP 配置等结构。GitHub 页面显示约 2k stars,语言以 JavaScript 和 Python 为主。它适合当作 plugin scaffolding 的参考,而不是完整产品仓库。

    Trending2026-06-08github.com原文 ↗
  • IBM/mcp-context-forge

    IBM mcp-context-forge 是 MCP、A2A、REST/gRPC API 前的 gateway、registry 和 proxy。仓库描述强调统一 endpoint、集中发现、guardrails、管理、observability 和 plugin 支持。随着 MCP server 数量增加,这类 registry/proxy 会成为 agent 平台治理的基础设施,而不是可选周…

    Trending2026-06-08github.com原文 ↗
  • Aquifer

    Aquifer 是自托管 MCP Gateway Runtime,面向突发 agent 工具调用流量。仓库描述称其为 API Aqueduct,最新 release v0.2.0 在 2026-06-06 发布。它切中的问题是 MCP server 一旦被多个 agent 并发调用,需要网关层处理流量整形、运行时调度和稳定性。

    Project2026-06-08github.com原文 ↗
  • Apple Contacts MCP

    Apple Contacts MCP 把 macOS Contacts 暴露为本地优先 MCP server,支持安全搜索和编辑联系人。联系人属于高度敏感的个人数据,因此 local-first 约束比功能数量更重要。它代表一类桌面私有数据 MCP:有用,但必须把权限边界设计清楚。

    Project2026-06-07github.com原文 ↗
  • Agent-Reach

    Agent-Reach 给 AI agent 提供 Twitter、Reddit、YouTube、GitHub、Bilibili、小红书等平台的读取和搜索能力,并强调 zero API fees。它把跨平台信息采集做成 CLI,适合研究、舆情或内容整理 agent 调用。风险点同样明显:平台 ToS、反爬限制和账号安全会决定可持续性。

    Trending2026-06-07github.com原文 ↗
  • openai-ads-mcp

    openai-ads-mcp 把 ChatGPT Ads API 包成 MCP server,当前定位是只读查询账户、广告系列和投放数据。它属于“业务 API agent 化”的典型小工具:价值不在复杂推理,而在让 ChatGPT/Claude/Codex 类客户端以工具调用方式访问广告后台。

    Project2026-06-05github.com原文 ↗
  • SheetMog - OSS Excel alternative and headless SDK

    SheetMog 做的是 Rust/WASM spreadsheet engine,目标是开源 Excel 替代和 headless SDK 的结合体。它把表格能力拆成可嵌入前端与程序化 API,对 agent 场景尤其有用,因为模型可以操作表格计算结构,而不必依赖屏幕坐标和 Excel 自动化。

    Project2026-06-05github.com原文 ↗
  • NeuroAnswer

    NeuroAnswer 是给 Claude 使用的大规模脑图数据 MCP server,作用是把神经科学图谱查询封装成模型可调用工具。它的技术点在接口层:让 agent 通过 MCP 导航专业数据,而不是把整套脑图材料塞进普通上下文。

    Project2026-06-05github.com原文 ↗
  • Designing the hf CLI as an agent-optimized way to work with the Hub

    Hugging Face 把 hf CLI 明确设计成 agent 可用接口,而不是只服务人类终端用户。文档提到 Claude Code、OpenAI Codex、Open Code 可通过 `hf` 操作 Hub,并提供 `agent`、`json`、`quiet` 等输出模式;这类 CLI 细节会直接影响 agent 调用工具时的可解析性和失败恢复。

    Blog2026-06-05huggingface.co原文 ↗
  • AIP: A Graph Representation for Learning and Governing Agent Skills

    AIP 把 agent skill 从一段说明文档改成有类型边的有向执行图,节点可以绑定脚本,也可以保留自然语言步骤。摘要提到 schema-validated YAML 和 typed input/output,这让 skill 可以被校验、组合和治理,减少“技能库越长越像提示词垃圾堆”的风险。

    Paper2026-06-05arxiv.org原文 ↗
  • modelscope/FunASR

    FunASR 是工业级语音识别工具包,README 摘要列出 ASR、VAD、标点恢复、语言模型、说话人验证、说话人分离、多说话人 ASR、情绪识别、streaming 和 OpenAI-compatible API。项目标题称支持 50+ languages、170x realtime。它的价值在于把语音前处理、识别和服务接口集中在一个开源工具包里。对实时语音 agent,streaming 与…

    Trending2026-06-04github.com原文 ↗
  • googleworkspace/cli

    Google Workspace CLI 用一个 `gws` 命令覆盖 Drive、Gmail、Calendar、Sheets、Docs、Chat、Admin 等 API,并由 Google Discovery Service 动态构建。README 摘要称它包含 100+ Agent Skills,一个支持 API 对应一个 SKILL.md,另有 50 个 Gmail、Drive、Docs、C…

    Trending2026-06-04github.com原文 ↗
  • agentgateway/agentgateway

    agentgateway 是开源 HTTP/gRPC gateway,把传统应用流量和 AI-native protocols 放在同一 data plane。项目站点说明它可 route、secure、observe、govern services、LLM provider traffic、MCP tools 和 agent-to-agent communication,并支持 OpenAI、C…

    Trending2026-06-04github.com原文 ↗
  • ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

    研究 VLM agent 在 OCR、检测、分割等感知工具真正执行前,是否应该跳过该调用。作者发现 baseline 的局部选择性很差,helpful 和 harmful calls 比例接近 11.8% vs 9.9%,多数调用也不会改变 forced-answer prediction。ToolGate 用轨迹文本和结构特征做轻量 execute/skip 控制,在两个 Qwen3-VL ba…

    Paper2026-06-04arxiv.org原文 ↗
  • The Sequence AI of the Week #871: Inside the Loop with Claude Opus 4.8

    TheSequence 讨论 Claude Opus 4.8 在 agent 和 coding 场景中的行为变化。digest 没给出细节,因此正文只按文章主题处理:它关注模型在 loop 内执行、工具调用和代码任务中的表现,而不是静态 benchmark。此类评论的价值在于观察 agent 行为的质感变化,例如坚持性、错误恢复和上下文处理。

    Blog2026-06-04thesequence.substack.com原文 ↗
  • SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

    把大型 skill library 的选择问题建模成 typed directed graph,而不是单纯 embedding 相似度检索。图边表达依赖、冲突、特化和重复关系;每次检索返回 vector matches、typed-edge neighbors 和 conflict signals,agent 还能通过 propose-then-commit 把执行证据写回图。论文在 ALFWor…

    Paper2026-06-04arxiv.org原文 ↗
  • Now AI agents need what RSS does

    Julien Reszka 讨论 RSS 作为 agent 可读信息接口的作用。文章核心是:AI agents 需要稳定、可订阅、结构化的信息源,而 RSS 已经提供了类似能力。它把 RSS 从人类阅读器时代的遗产,重新解释为 agent 获取更新、追踪站点和减少网页抓取噪音的基础协议。

    Blog2026-06-04julienreszka.com原文 ↗
  • Introducing new capabilities to GPT-Rosalind

    OpenAI 更新 GPT-Rosalind 的生命科学能力,覆盖生物推理、药物化学、基因组分析和实验工作流。此前 GPT-Rosalind 作为 research preview 面向合格客户在 ChatGPT、Codex 和 API 中提供,并配套 Codex 的 Life Sciences research plugin,连接 50 多个科学工具和数据源。它的关键点是把 domain mod…

    News2026-06-04openai.com原文 ↗
  • Inducing Reasoning Primitives from Agent Traces

    提出 Reasoning Primitive Induction,从成功 ReAct traces 中单遍挖掘、聚类重复推理动作,并转成 typed pseudo-tools。每个 pseudo-tool 由自然语言 docstring 说明,测试时由普通 ReAct loop 组合调用。作者报告 induced libraries 反超生成它们的原 agent:RuleArena NBA 从 3…

    Paper2026-06-04arxiv.org原文 ↗
  • pbakaus/impeccable

    impeccable 是面向 AI coding harness 的前端设计技能与命令集合,帮助 agent 在 UI 任务中遵守更具体的设计规范。项目把布局、组件、视觉检查和交互细节沉淀成可复用命令。值得看的是,它把“AI 写前端不好看”拆成技能、约束和审查流程问题。

    Trending2026-06-03github.com原文 ↗
  • Agent Skills Should Go Beyond Text: The Case for Visual Skills

    论文指出文本技能文件对视觉任务存在表达瓶颈,提出把可复用 agent skill 扩展到视觉形式。

    Paper2026-06-03arxiv.org原文 ↗
  • ASys

    给 AI agent 操作服务器用的 typed binary protocol,目标是替代 SSH 式交互。

    Project2026-06-03github.com原文 ↗
  • AERF, signed receipts for AI agent actions

    为 agent 动作生成签名收据的规范项目。

    Project2026-06-03github.com原文 ↗
  • Skill Availability and Presentation Granularity in Large-Language-Model Agents

    SkillsBench 控制实验研究 skill 是否可用以及呈现粒度是否影响 agent 成功率。实验用 30 个领域均衡任务、两个 reasoning 模型、六种 skill 条件,每个 task-condition-model cell 五次试验,共 1,800 行数据。skill availability 提升最强:GPT-5.5 相比无 skill 提升 26.7-36.0 个百分点,D…

    Paper2026-06-02arxiv.org原文 ↗
  • D4Vinci/Scrapling

    Scrapling 是 adaptive web scraping framework,从单次请求到 full-scale crawl 都覆盖。README 强调 parser 可学习页面变化并自动重新定位元素,fetchers 可处理 Cloudflare Turnstile 等 anti-bot,spider framework 支持并发、多 session、pause/resume 和 pr…

    Trending2026-06-02github.com原文 ↗
  • May 2026 newsletter

    Simon Willison 的月度通讯回顾 2026 年 5 月模型发布、工具使用和 Datasette 进展。它的价值在于把一整月的模型、工具和个人项目实践放进同一时间线,而不是只列发布链接。对跟踪 AI tooling 的读者来说,Simon 的月报通常更接近“实际用过后的技术日志”。

    Blog2026-06-01simonwillison.net原文 ↗
  • MAVEN: Improving Generalization in Agentic Tool Calling

    MAVEN 是一个 lightweight symbolic reasoning scaffold,用结构化分解、自适应工具编排和 intermediate verification 改善工具调用泛化。论文评测 BFCL v3、TauBench、Tau2Bench、AceBench,并引入 MAVEN-Bench 测多步数学/物理推理与对抗组合;在 MAVEN-Bench 上,它把 GPT-OSS…

    Paper2026-06-01arxiv.org原文 ↗

2026 年 5 月14

  • cursor/plugins

    cursor/plugins 是 Cursor 官方插件规范和插件集合,每个插件目录带 `.cursor-plugin/plugin.json` manifest。README 列出 continual-learning、cursor-team-kit、thermos、create-plugin、agent-compatibility、cli-for-agent、pr-review-canvas、…

    Trending2026-05-31github.com原文 ↗
  • Ego lite - why our browser agent writes JavaScript not CLI commands

    ego-lite 是面向人和 agent 并行工作的浏览器,agent 在独立 Space 中通过 `ego-browser` 操作页面。README 的核心设计是暴露 snapshot、fill、click、wait、navigate、capture 等 in-page JavaScript 工具,让 agent 组合 JS 任务,而不是多轮 CLI 调用;项目称复杂任务最多快 2.5 倍。值得…

    Project2026-05-31github.com原文 ↗
  • A Claude Code skill that scopes problems like Peter Naur

    Cartographer skill 把 coding request 前置成 problem-theory 产物,而不是直接进入方案设计。它要求 agent 先写 World、Actors、Program correspondence、Known、Assumed、Thin spots 等字段,并把每个需求追溯到现实世界中的对应关系。值得看的是它把“需求澄清”变成可检查 artifact,适合领域…

    Project2026-05-31github.com原文 ↗
  • theta-spec

    它试图解决 agent 配置被各家 CLI/harness 锁死的问题。统一规格的价值在团队可迁移和可审计;真正难点会在语义差异,例如不同工具权限、hook 生命周期和 skill 调度并不总能无损映射。

    Project2026-05-30github.com原文 ↗
  • anthropics/skills

    这个仓库把 skills 从产品功能变成可共享工件。其重要性在于技能不只是 prompt 片段,还能携带脚本和资源;长期看,skill 版本化、权限和依赖声明会成为 agent 生态的基础设施。

    Trending2026-05-30github.com原文 ↗
  • SkillsInjector: Dynamic Skill Context Construction for LLM Agents

    这篇工作抓住了 skills 机制的核心矛盾:技能库越丰富,静态塞进上下文越容易把模型带偏。动态规划器把 skill 选择变成执行相关的检索和改写问题,但效果会依赖 skill 描述质量以及训练时的任务分布。

    Paper2026-05-30arxiv.org原文 ↗
  • P2P proof of concept for ACP decentralized agent communication

    这类项目的技术问题不在“能发消息”,而在身份、路由、权限和失败恢复。作为 POC,它适合验证 agent 通信协议形态;距离生产系统还需要认证、审计和流控设计。

    Project2026-05-30github.com原文 ↗
  • obra/superpowers

    面向 coding agent 的软件开发方法论和可组合 skills 框架。

    Trending2026-05-29github.com原文 ↗
  • hardikpandya/stop-slop

    Stop Slop 是一个写作 skill,结构包含核心 SKILL.md 和 phrases、structures、examples 三类参考文件,用于识别并移除 AI prose 中的套路短语、结构 cliché、节奏问题和 meta-commentary。它更像可移植编辑准则,而不是自动检测器。

    Trending2026-05-29github.com原文 ↗
  • anthropics/knowledge-work-plugins

    这说明 Anthropic 正把 Cowork/Claude Code 的能力生态做成插件市场,而不是只提供通用 agent。插件化降低入门成本,但也把权限、数据访问和组织流程固化进可执行包。

    Trending2026-05-29github.com原文 ↗
  • Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution

    Tool Forge 的价值不在“又做一个工具注册表”,而在把工具生成、验证、生命周期和路由合成一个可审计工件链。它的局限也在摘要里说得很清楚:当前数字是初始系统 benchmark,尚未证明面对对抗路由、真实 API grounding 和跨系统评估时仍成立。

    Paper2026-05-29arxiv.org原文 ↗
  • Open Agent Tools Coder

    本地编码 agent,实验将工具调用委派给较小模型。

    Project2026-05-29github.com原文 ↗
  • LiteParse

    LiteParse 的定位很清晰:把“够快、够本地、够结构化”的解析能力给 agent,而不是用云端 LLM 做重型文档理解。复杂表格、手写和扫描 PDF 仍被明确让位给 LlamaParse。

    Project2026-05-29github.com原文 ↗
  • Leonxlnx/taste-skill

    taste-skill 是前端设计类 agent skills 集合,默认 `design-taste-frontend` v2 会读 brief、推断设计语言,并通过 VARIANCE、MOTION、DENSITY 三个 dial 约束布局、动效和信息密度;还包含 image-to-code、redesign、minimalist、brutalist、brandkit 等分支技能。

    Trending2026-05-29github.com原文 ↗