为什么单 Agent 自评总是失真
版权声明
我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。
FunTester
扫码关注公众号
扫码阅读
手机扫码阅读
文章主旨:
生成与评估必须分离,并通过具体标准让主观判断可验证,系统设计需要随模型能力演进不断主动优化(移除不必要的结构),而非简单堆叠复杂度。
关键要点:
- 自评不可靠:同一模型执行生成与评估时,会继承自身偏好、假设和盲点,倾向于合理化已有结果,而非独立审题,尤其在有主观任务中容易遗漏硬伤。
- 多Agent结构核心在于任务拆解:将模糊需求分解为三类独立工作——Planner(定义规格)、Generator(实现)、Evaluator(验证),每个子问题可单独优化。
- 提升评估可靠性的三层改造:从观察结果转向操作验证(如真实交互);从主观判断转向验收标准(具体检查项);从训练模型转向训练prompt(识别评估模式并纠偏)。
- 模型能力进步使系统设计反向演化:早期依赖复杂流程补短板,新模型长上下文与推理能力增强后,原结构可能成为摩擦源,需删除冗余机制(如简化多轮协商)。
- 持续实验与重新审视Harness:模型假设会随时间过期,应主动移除不再提供净收益的模块,优化方向从增加能力转向移除不必要的复杂性。
内容结构:
自评问题的本质:
- 自评看似增加一道保险,实际是同一偏好体系的延续,模型倾向于自我合理化,尤其在主观任务中(如UI设计),问题不因自评而暴露。
- 关键不在模型能力,而在任务结构:生成与评估必须分离,否则任何后续检查都是同一判断的重复放大。
多Agent如何拆解复杂问题:
- 引入独立Evaluator后仍需解决输入模糊问题,由此引出完整三段式结构:Planner(转换需求为规格)、Generator(实现)、Evaluator(独立验证)。
- 核心价值是将任务重新分解为三类不同性质的问题:定义完成、构造实现、验证正确,每个子问题可单独优化,系统从“能跑”走向“可用”,但代价是耗时更长、成本更高。
让主观问题可验证:
- 系统演进后真正瓶颈是评估不准,而非生成不出。即使Evaluator能发现bug,结论仍可能偏宽松。
- 三层改造:操作验证(通过真实交互暴露隐藏问题)、验收标准(模糊目标拆为具体检查项,使主观任务工程化)、Prompt训练(分析评估日志纠正偏差)。
- 核心原则:用具体标准让主观判断可打分;评估系统本身需持续调校,与生成系统同等重要。
模型进步如何重塑系统设计:
- 早期模型长上下文退化,依赖复杂流程;新模型具备强推理与压缩能力后,原结构成为摩擦源,系统反向演化(删除多轮、简化交互)。
- 关键方法论:持续实验(模型假设会过期)、新模型发布时重新审视并主动删除不必要的复杂性;真正优化是识别并移除不再提供净收益的结构。
- 最终结论:模型变强不会让系统设计消失,而是改变优化方向——复杂性不会消失,只会转移到更高层级。
文章总结:
本文系统性地论证了Agent系统中生成与评估分离的必然性,并指出随模型能力进化,设计者应主动简化结构、以具体标准量化主观判断,从而在成本与效果间取得更优平衡。
FunTester
FunTester
扫码关注公众号
还在用多套工具管项目?
一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。
查看方案
FunTester的其他文章
加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线
白皮书上线