2026年7月23日更新:ChatGPT Plus / Pro 与 Codex——多智能体协作的真相:为什么三个 AI 一起干活,常常不如一个(GPT-5.6 最新技术分享)
Multi-Agent 是 2026 年 AI 圈最热的词之一。
一个 Agent 负责规划。
一个 Agent 负责执行。
一个 Agent 负责审查。
一个 Agent 负责测试。
它们互相讨论、互相纠错、自动分工,像一个不知疲倦的虚拟团队。
演示视频里,这个画面非常迷人。
但真正把 Multi-Agent 系统投入使用的团队,很多会经历一个幻灭的过程:
三个 AI 一起干活,常常不如一个。
不是 Multi-Agent 的方向错了。
而是大多数人低估了协作本身的成本。
一个朴素的事实:协作是有价格的
人类社会早就验证过这件事。
一个人干活,效率最高,但能力有上限。
十个人协作,能力上限高了,但沟通成本、协调成本、等待成本全都来了。
管理学的很大一部分,就是在研究怎么让协作的收益大于协作的损耗。
AI Agent 的协作,逃不开同一个规律。
每增加一个 Agent,增加的究竟是什么?
多一次规划与执行之间的信息传递。
多一轮执行与审查之间的往返确认。
多一层"你说的和我说的不是一个意思"的理解偏差。
多一份上下文在多个智能体之间同步的消耗。
一个 Agent 犯错,是它自己犯错。
三个 Agent 协作犯错,是错误在传递中被放大、被稀释、被推诿——最后没有人能说清错误是从哪一环开始的。
Multi-Agent 系统的三种典型死法
观察失败的多智能体项目,死法高度集中。
第一种:会议死。
规划 Agent 出一个方案。
执行 Agent 提出疑问。
审查 Agent 表示担忧。
规划 Agent 修订方案。
审查 Agent 再次表示担忧。
五个 Agent 讨论了二十轮,Token 烧掉一大把,任务本身一步没动。
AI 不会累,不会不耐烦,不会说"先干起来再说"。
所以它们可以永远礼貌地讨论下去。
没有终止机制的协作,就是无限会议。
第二种:传话死。
第一个 Agent 理解了用户意图的 90%。
传给第二个 Agent,信息保真度再打九折。
第三个 Agent 拿到的,已经是原意 70% 的残片。
每个 Agent 都没犯明显的错。
但最终产出和最初的目标,已经南辕北辙。
这就是传话游戏的工程版。
链路上的每一次转述,都是一次有损压缩。
第三种:甩锅死。
执行 Agent 产出了一个错误结果。
审查 Agent 的责任是发现问题——但它和执行 Agent 共享同样的上下文、同样的偏差、同样的盲区。
自己审自己,大概率审不出问题。
等人类发现错误时,五个 Agent 都"完成了自己的工作"。
没有哪个环节可以问责。
系统整体对了还是错了,没人负责。
什么时候 Multi-Agent 才真正有价值
批评了这么多,不是为了否定多智能体。
而是为了说清楚:它只在特定的任务结构里,收益才大于成本。
第一种值得的场景:任务天然可以并行拆解。
分析五十份文档。
扫描几百个文件的代码规范问题。
对二十个候选方案做独立评估。
这类任务的特点是:子任务之间几乎不需要沟通。
各干各的,最后汇总。
协作成本趋近于零,并行收益是纯粹的。
第二种值得的场景:需要真正的视角对抗。
生成方案的是一个 Agent。
挑毛病的是另一个 Agent——关键是,它必须有不同的上下文、不同的目标函数。
红队 Agent 的任务就是攻击方案的漏洞。
它的"立场"和生成者是对立的。
这种对抗性结构有价值,因为它不是同一个人换了个头衔。
它是真的换了一个脑子。
第三种值得的场景:环节之间需要强制隔离。
生成代码的 Agent 不能碰生产环境。
审查安全的 Agent 不能修改代码。
拥有写权限的 Agent 看不到用户的隐私数据。
这里的多智能体不是为了效率,是为了安全。
用物理隔离代替信任假设。
工程上,怎么让多智能体不翻车
如果确实要用 Multi-Agent,有几条经过验证的工程纪律。
纪律一:默认单 Agent,多 Agent 需要举证。
先问:一个足够强的 Agent 加上好的上下文,能不能完成?
能,就不要拆。
拆分的理由必须写清楚:是并行收益?是对抗需要?还是权限隔离?
纪律二:Agent 之间传递的是结构化产物,不是自由对话。
Handoff
├── task_id 任务编号
├── input 上游产出的结构化结果
├── constraints 不可违反的约束
├── expected 下游必须交付的格式
└── deadline 最多允许几轮交互
自由对话是协作成本的黑洞。
结构化交接把"传话游戏"变成"流水线传递"。
纪律三:给协作设预算。
最多讨论几轮。
最多消耗多少 token。
超时之后是自动收敛还是上报人类。
没有预算的协作,就是前面说的"无限会议"。
纪律四:审查者必须与生成者隔离。
不同的上下文。
不同的提示目标。
最好能拿到生成者没见过的信息——比如独立的测试数据、独立的验收标准。
否则审查只是形式主义的盖章。
纪律五:人类握有最终的合并权和裁决权。
多个 Agent 意见不一致时,必须有一个明确的仲裁者。
这个仲裁者,在关键任务上只能是人。
一个更冷静的判断
Multi-Agent 的叙事之所以迷人,是因为它迎合了一个直觉:
一个 AI 已经这么强了,一群 AI 岂不是无敌?
但工程史一再证明:
系统的能力,不取决于组件能力的简单相加。
取决于组件之间的连接质量。
连接不好,三个臭皮匠不如一个诸葛亮。
连接好了,才真正可能出现"整体大于部分之和"。
而连接质量——接口设计、交接协议、终止机制、仲裁规则——这些都不性感,都不会出现在演示视频里。
但它们是 Multi-Agent 从玩具变成工具的全部秘密。
写在最后
ChatGPT 和 Codex 的单体能力还在快速进化。
这意味着一个反直觉的结论:
今天需要五个 Agent 分工的任务,明年可能一个 Agent 就够了。
单体能力的提升速度,常常快过协作框架的成熟速度。
所以押注 Multi-Agent 的正确姿势,不是追求 Agent 的数量。
而是把协作的协议、接口、纪律做扎实。
这些工程资产,不会因为模型升级而贬值。
Agent 越强,好的协作协议发挥的价值越大。
数量制造热闹。
结构产生能力。
未来优秀的系统设计,不是 Agent 最多的系统。
而是每一个 Agent 的存在都有不可替代理由的系统。
更多推荐



所有评论(0)