自研 Agent 实战:构建 Skill 运行最小系统

Skill AI 工具 加载 SKILL.md
发布于 2026-09-16
3

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:AI 工具能否运行标准 Skill,关键不在模型本身,而在其外围是否具备可发现、解析、按需加载并执行 Skill 的“Skill 运行时引擎”;自研 Agent 也应围绕该引擎的最小闭环属性来构建。

关键要点:

  1. AI 工具支持标准 Skill,依赖的是“Skill 运行时引擎(Runtime Engine)”。目前行业没有真正统一的标准 Skill,只有事实标准。
  2. Skill Runtime Engine 最小闭环依赖 4 个关键属性:固定 Skill 发现路径、元数据预加载机制、意图识别与按需加载机制、Skill 执行器封装为 Tool。
  3. 渐进式披露先让 LLM 每轮只看到 name 和 description,匹配后再加载完整 SKILL.md,以解决“上下文窗口有限 vs 能力需求无限”的矛盾。
  4. 豆包、普通 ChatGPT 缺少文件扫描、元数据加载、渐进式加载、Tool Executor,因此即使放入 SKILL.md 也无法自动发现和运行;Codex、Claude Code、OpenClaw、Cursor 将 4 个属性写死在代码中。
  5. 自研 Agent 需具备上述 4 个属性,并从代码实现角度对应 6 个方面:硬编码扫描路径、YAML frontmatter 解析器、LLM 意图匹配、按需文件读取、Skill Tool 封装、可选脚本沙盒执行器。

内容结构:

  • 引言:提出“为什么某些 AI 工具支持 Skill,而有些不支持”“自研能应用标准 Skill 的 AI 工具需要什么属性”“为什么 OpenClaw 运行丝滑”,本质是在问:什么样的 AI 应用才能成为 Skill 容器。本文基于中台自研 Agent 运行 Skill 的实战总结,拆解 Skill 运行时引擎的关键条件。
  • 01 Skill 运行时引擎(Runtime Engine):
    • 一个 AI 工具能运行标准 Skill,不是因为 AI 模型本身的能力,而是因为外围有“Skill 运行时引擎”。
    • 该引擎是让 AI Agent 能发现、解析、调用和执行 Skill 的底层基础设施,负责发现、加载、解析和执行 Skill。
    • 只有具备「Agent Runtime」结构的 AI 工具,才能识别并运行标准 Skill。AI 模型只是“决策层”,真正“执行层”是代码实现的引擎。
  • 02 Skill 运行 4 个关键属性:
    • 1. 固定的 Skill 发现路径:AI 工具启动时递归扫描指定目录,找到包含 SKILL.md 的子文件夹。常见路径包括 .claude/skills、.codex/skills、.cursor/skills、.openclaw/skills;项目级优先,用户级次之。不同路径用于避免冲突。“SKILL.md 跨平台兼容”主要指 frontmatter 格式兼容,跨工具使用仍需手工复制或软链接。
    • 2. 元数据预加载机制(渐进式披露):AI 工具不会一次性加载所有 Skill 的完整内容,而是通常分三层或多层按需加载。LLM 每轮对话只看到 name 和 description,据此判断是否需要加载完整 Skill。该机制解决上下文窗口有限与能力需求无限的核心矛盾。
    • 3. 意图识别与按需加载机制:用户输入任务后,工具需判断哪个 Skill 的 description 匹配任务。豆包等工具没有元数据注册表和按需加载机制,喂给它 SKILL.md 也只会当作文本处理。匹配成功后才加载完整 SKILL.md,此时才占用大量上下文。
    • 4. Skill 执行器(封装为 Tool):加载完整 SKILL.md 后,工具需让 LLM 能调用 Skill。SkillTool 在 LLM 视角中与其他工具平等,LLM 可自主决定调用,参数如 skill_name="pdf_processor"。OpenClaw 的特殊性在于它是 Agent 架构而非纯 Skill 架构,具备四层完整架构(Gateway→Agent 核心→工具链→执行环境),预置 200+ 标准化工具接口,因此 Skill 能调用更多底层能力。
    • 5. 完整执行流程示例:用户输入“帮我分析这个 PDF”后,依次执行:生成可用技能列表;LLM 判断需要 pdf 技能;加载完整 SKILL.md;通过 SkillTool 注入完整指令并加载相关脚本;LLM 按 SKILL.md 步骤调用脚本提取文本、分析内容并返回结果。
  • 03 自研 Agent 跑 Skill:
    • 1. 常见 Agent 跑 Skill 对比:豆包等聊天机器人核心链路是“用户 → LLM → 回复”,内部没有文件扫描、元数据加载、渐进式加载、Tool Executor,因此不能自动读取 SKILL.md。Codex、Claude Code、OpenClaw、Cursor 的代码中写死了这 4 个属性。OpenClaw 强在真正实现了完整 Skill Runtime,并具备 Agent 四层架构与 200+ 标准化工具接口。
    • 2. 自研 Agent:自研 Agent 也需要具备上述 4 个属性;从实现角度看,4 个属性可对应 6 个方面。4 个属性是从“系统怎么工作”描述功能模块,6 个方面是从“代码要写什么”拆解实现细节,二者是同一座山的正反面。6 个方面包括:固定扫描路径并硬编码如 .myagent/skills/;YAML frontmatter 解析器提取 name 和 description 并存入注册表;LLM 基于 description 进行意图匹配;匹配成功后再读取完整 SKILL.md;将 Skill 调用封装为 Agent 可用工具函数;如包含 scripts/,则需要可选沙盒环境执行脚本。

文章总结:全文强调,Skill 能力落地是系统工程:AI 应用要成为 Skill 容器,必须补齐 Skill 运行时引擎;自研 Agent 可从 4 个关键属性与 6 个实现项构建最小闭环。

产品参赵

垂直行业SaaS产品十年,书籍《TOB产品之美》《后端产品经理宝典》《产品经理修炼之路》作者

123 篇文章
浏览 158.9K

还在用多套工具管项目?

一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。

加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线