为什么单 Agent 自评总是失真

系统 模型 评估 判断 Agent
发布于 2026-06-09
141

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:

生成与评估必须分离,并通过具体标准让主观判断可验证,系统设计需要随模型能力演进不断主动优化(移除不必要的结构),而非简单堆叠复杂度。

关键要点:

  1. 自评不可靠:同一模型执行生成与评估时,会继承自身偏好、假设和盲点,倾向于合理化已有结果,而非独立审题,尤其在有主观任务中容易遗漏硬伤。
  2. 多Agent结构核心在于任务拆解:将模糊需求分解为三类独立工作——Planner(定义规格)、Generator(实现)、Evaluator(验证),每个子问题可单独优化。
  3. 提升评估可靠性的三层改造:从观察结果转向操作验证(如真实交互);从主观判断转向验收标准(具体检查项);从训练模型转向训练prompt(识别评估模式并纠偏)。
  4. 模型能力进步使系统设计反向演化:早期依赖复杂流程补短板,新模型长上下文与推理能力增强后,原结构可能成为摩擦源,需删除冗余机制(如简化多轮协商)。
  5. 持续实验与重新审视Harness:模型假设会随时间过期,应主动移除不再提供净收益的模块,优化方向从增加能力转向移除不必要的复杂性。

内容结构:

自评问题的本质:

  • 自评看似增加一道保险,实际是同一偏好体系的延续,模型倾向于自我合理化,尤其在主观任务中(如UI设计),问题不因自评而暴露。
  • 关键不在模型能力,而在任务结构:生成与评估必须分离,否则任何后续检查都是同一判断的重复放大。

多Agent如何拆解复杂问题:

  • 引入独立Evaluator后仍需解决输入模糊问题,由此引出完整三段式结构:Planner(转换需求为规格)、Generator(实现)、Evaluator(独立验证)。
  • 核心价值是将任务重新分解为三类不同性质的问题:定义完成、构造实现、验证正确,每个子问题可单独优化,系统从“能跑”走向“可用”,但代价是耗时更长、成本更高。

让主观问题可验证:

  • 系统演进后真正瓶颈是评估不准,而非生成不出。即使Evaluator能发现bug,结论仍可能偏宽松。
  • 三层改造:操作验证(通过真实交互暴露隐藏问题)、验收标准(模糊目标拆为具体检查项,使主观任务工程化)、Prompt训练(分析评估日志纠正偏差)。
  • 核心原则:用具体标准让主观判断可打分;评估系统本身需持续调校,与生成系统同等重要。

模型进步如何重塑系统设计:

  • 早期模型长上下文退化,依赖复杂流程;新模型具备强推理与压缩能力后,原结构成为摩擦源,系统反向演化(删除多轮、简化交互)。
  • 关键方法论:持续实验(模型假设会过期)、新模型发布时重新审视并主动删除不必要的复杂性;真正优化是识别并移除不再提供净收益的结构。
  • 最终结论:模型变强不会让系统设计消失,而是改变优化方向——复杂性不会消失,只会转移到更高层级。

文章总结:

本文系统性地论证了Agent系统中生成与评估分离的必然性,并指出随模型能力进化,设计者应主动简化结构、以具体标准量化主观判断,从而在成本与效果间取得更优平衡。

FunTester