我用 Karpathy 的 autoresearch 思路优化了一个 Skill,可测性从 8.6 拉到满分 10

Skill 规则 autoresearch 迭代 可测性
发布于 2026-08-12
24

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:通过将 Karpathy 开源的 autoresearch 方法迁移到 AI Skill 优化中,用“可测试的规则 + 固定评估指标 + Keep/Discard 二元决策”驱动 agent 自主迭代,可以显著提升 Skill 输出质量,形成可复用的进化路径。

关键要点:

  • 可测性是 AI Skill 质量的核心:模糊的验收标准无法转化为自动化断言,必须用 Yes/No 规则明确“好”的定义。
  • autoresearch 迁移的三个关键设计:单文件修改(只能改 Skill 本体)、固定评估指标(不靠感觉)、Keep/Discard 二元决策(避免模糊判断)。
  • 连续 Discard 是正常且必要的搜索过程,回退到上一个 keep 点再换方向,比在错误路径上补丁有效。
  • Eval 指标不宜过多(3-6 个最佳),过少则失去信号,过多则 agent 会“刷冷门指标”钻空子。
  • 可测性本质上也是递归问题:最终需要把“可测”本身拆分成交互无歧义的、二元 Yes/No 的规则。

内容结构:

  1. 背景与动机:作者用自己开发的 story-builder Skill 做实验,将 autoresearch 方法迁移到 Skill 优化中。该 Skill 将任意格式需求转化为指定粒度的用户故事(epic/feature/story),原输出“感觉还行”但存在模糊不可测、覆盖率偶有遗漏、粒度边界不准等问题。

  2. 定义“好”的规则:为“可测性”明确 6 条 Yes/No 规则,例如每个 then 必须包含至少 2 种信号类型、禁止模糊词、禁止模糊一致性表述、Exception 场景双断言、具体计数、NFR 涉及具体阈值等。

  3. 迁移 autoresearch 的三个核心设计

    • 单文件修改:只能改 SKILL.md,禁止改基准、测试用例和评分规则;
    • 固定评估指标:testability(0-10)、coverage(0-100%)、grade(A/B/C/D);
    • Keep / Discard 二元决策:涨则 keep,跌或未涨则 discard。
  4. 11 轮真实迭代过程:从 testability 8.6、coverage 98%、grade A 提升到 testability 10.0、coverage 100%、grade A。其中 iter 4-6 连续丢弃,iter 3/7/8/10/11 保留,中间多次尝试不同改进方向。

  5. 三个重要教训

    • 连续 Discard 是缩小搜索空间而非失败;
    • Eval 指标不能太多,3-6 个最佳;
    • “可测”本身需要递归拆成二元规则。
  6. 具体反例→正例:从“系统正常处理,库存恢复”改进为“订单状态变为「已取消」,商品 A 库存恢复为 52(原 50 + 回补 2)”,后者可直接写 assert。

  7. 方法的适用范围:只要能将定义评分规则,即可让 agent 自主迭代优化。作者已应用于内容生产、OKR 拆解、代码生成等 Skill。所有 eval 均为 Yes/No 二元题,而非量表。

  8. 给管理者的行动建议:选一个高频 Skill,定义 3 个 Yes/No eval,跑 10 轮迭代,记录 keep/discard 和 changelog;未来模型升级或平台迁移时,这些进化记录最有价值。

文章总结:本文以实操案例展示了如何将 autoresearch 的自动化迭代方法论迁移到 AI Skill 优化中,强调“可测定义”和“二元决策”是质量提升的关键,最终给出了可直接落地的行动建议,全文调性务实、技术含量高,暗含对“好 Skill”的进阶认知。

OKR社区

OKR真经就在这里! 只传播可落地的OKR知识!

46 篇文章
浏览 68.7K

还在用多套工具管项目?

一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。

加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线