大模型也会'过度协作':Kim 等 2026 的 Nature Machine Intelligence 研究

MIT 等机构团队在《Nature Machine Intelligence》发表受控实验:在 260 种配置、6 个基准、5 种架构、3 个 LLM 家族上,研究多智能体协作何时优于单一强智能体。核心发现——存在一个'能力饱和阈值':当底层单智能体已足够强,再加协作反而可能拖累表现。

研究背景

多智能体系统(multi-agent LLM systems)正在被广泛部署。但一个根本问题长期不清:什么时候让多个 AI 协作,真的优于让一个强 AI 单干?

MIT Media Lab 等机构的团队(通讯/资深作者含 Xin Liu、Hae Won Park、Paul Pu Liang 等)在 Nature Machine Intelligence 2026 发表一篇受控实验,试图给出定量回答。

研究方法

核心发现:能力饱和阈值

研究发现:

  1. 单智能体基线表现是预测协作是否有用的强信号:当底层单一智能体已经很强,再加协作往往不再带来提升,甚至可能下降。
  2. 存在一个"能力饱和阈值(capability-saturation threshold)"——超过该阈值后,增加智能体数量不太可能改善表现。该阈值在 SWE-bench Verified 与 Terminal-Bench 上能正确预测 94% 验证配置的效果方向。
  3. 第二个稳健效应是"基线放大的错误(baseline-scaled error amplification)":协作会放大单智能体已有的错误模式。

这意味着:多智能体协作不是"越多越好",而是有一个可定量判断的适用边界

(注:本文此前曾被本站在"超级思维"书页中误链,现已正名并独立成篇。)

为什么重要

这是把"AI 协作"从口号推向工程化选型的关键一步:它提供了一个框架,用来判断"何时该用多智能体、何时该用单一强智能体"。对企业部署 AI 协作系统有直接决策价值。

与 DSG 框架的呼应

Kim 等的"能力饱和阈值"与 DSG 的 生成式协作五步法 - Generative Collaboration 形成有趣对照:

这再次印证:集体智慧的前提从来不是"把人聚在一起",而是"每个个体先到位、再被有效接住"。

来源