为什么你的Openclaw龙虾总是智障,ClaudeCode源码泄露揭露:Agent 的差距不在模型,在 Harness Engineering

模型 Agent AI 重试 ClaudeCode
发布于 2026-06-11
98

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:

Agent的性能下限取决于Harness工程而非模型本身,通过对比OpenClaw与Claude Code揭示Harness Engineering是AI稳定运行的关键。

关键要点:

  • OpenClaw的不稳定源于架构设计的必然结果,包括心跳无法真正调度、Sub-Agent生命周期不可靠、消息机制无法纠偏、容错链不完整等问题。
  • Claude Code源码显示其拥有生产级Agent Runtime:长状态机、渐进式上下文压缩、自动输出校验与容错链路,使得运行更稳定。
  • Harness Engineering是衔接模型调度、任务执行、会话记录的工程体系,LangChain定义:如果你不是模型,那你就是Harness。
  • Anthropic提出Managed Agents架构:Brain(模型+Harness,负责思考与规划)、Hands(Sandbox+Tools,负责执行)、Session(记录全过程),三者相互独立。
  • AI进化从Prompt Engineering到Context Engineering再到Harness Engineering,Harness为AI装上了安全带。

内容结构:

问题引入:OpenClaw使用中频繁出现中断、执行不完整、无反馈、限流等问题,且相同模型在不同环境中表现差异巨大。

OpenClaw不稳定原因分析:

  • 心跳:定时唤醒但不能调度,唤醒后不创建任务记录,无完成确认和失败重试,且可能重复唤醒导致限流。
  • Sub-Agent:是否拆解由模型决定,缺乏稳定性;生命周期管理为Best Effort,重启后可能遗忘前期任务,任务完成可能未关闭进程占用资源。
  • 消息机制:默认按消息顺序串行处理,无法中途纠偏;需切换steer模式才能实现实时调整。
  • 容错性:事件流不是可靠日志(错过不补发),重试基于请求而非整段任务(已完成的步骤不自动恢复),队列是进程内轻量串行器,不持久化。局部容错未形成端到端链路。

Claude Code源码揭示的Harness:

  • 长状态机:每次循环完成10件事,包括上下文活跃度检查、token预算检查、模型调用、工具流式执行、额外上下文注入等。
  • 渐进式上下文压缩管线:先裁大工具输出保留预览,再清理旧结果,最后折叠总结,低成本接近全量效果。
  • 容错机制:最近文件、技能、工具声明重新注入上下文,防止模型断片。

Harness Engineering定义与架构:

  • Brain – 模型和Harness,负责思考规划;Hands – Sandbox和Tools,负责执行;Session – 记录全过程。三者独立后恢复检查变少。
  • 六个组件:Session(状态日志)、Orchestration(唤醒调度)、Harness(意图审批与执行重试)、Sandbox(隔离环境)、Resources(文件系统)、Tools(能力接口)。

结论与展望:OpenClaw的开放架构带来灵活性的代价是不稳定;成熟的Agent需适应复杂长程任务,Anthropic提出meta-harness:Brain可换,Hands可换。

文章总结:

文章通过对比OpenClaw与Claude Code,论证了Agent稳定性的核心在于Harness Engineering,而非模型本身,并指出Infra和Harness的结合是AI工程的重要方向。