Vals AI 研究发现智能体团队多耗大量 token 但质量提升很有限
AI agent teams waste massive tokens for barely measurable quality gains, research finds
Vals AI 在 Vibe Code Bench 上以中等和最大推理档测试 GPT-6 Sol 与 Claude Opus 5.5 的单智能体和团队,团队成本高出 1.8 至 5.1 倍,四组对比里只有中等推理的 GPT-6 Sol 团队显著高出 7.3 分。
Oct 11, 2026
研究发现,AI 智能体团队的结果几乎并不比单个智能体更好。
评测公司 Vals AI 在“Vibe Code Bench”上测试了 GPT-6 Sol 和 Claude Opus 5.5,分别以单独和团队形式、在中等与最大两种推理力度下运行。团队的成本比单个智能体高出 1.8 倍到 5.1 倍。
在团队与单独智能体的四项对比中,只有一项显示出统计上显著的提升:GPT-6 Sol 在中等推理力度下,团队得分高出 7.3 分。在最大推理力度下,团队配置对 Sol 和 Opus 5.5 都没有带来真正的优势。结果表明,在大多数情况下,智能体团队的额外成本并不划算,尤其是当模型已经以满算力运行时。

Anthropic 在其使用 Opus 5.5 进行的两项自有测试中发现,随着智能体数量增加,质量提升幅度缩小。更大的团队能更快达到给定的性能水平,但从 10 个增加到 100 个智能体,在 24 小时后得分仅略有上升。在另一项 ProgramBench 测试中,速度提升伴随着更高的 token 用量。
| 使用 Opus 5.5 的任务 | 1 个智能体 | 10 个智能体 | 30 个智能体 | 100 个智能体 |
|---|---|---|---|---|
| 知识库 | 0.53 | 0.70 | 0.71 | 0.74 |
| Lean 定理证明 | 0.39 | 0.66 | 0.66 | 0.68 |
Fable 5.1 在超过十个智能体的 Lean 定理证明任务上显示出更强的质量提升,但在所有测试中得分仍低于 Opus 5.5。在知识库任务上,当从 30 个扩展到 100 个智能体时,Fable 的得分实际上略有下降。
更多智能体换来的是速度,而非更好的输出
OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 中证实,多智能体系统主要换来的是速度,而非更好的质量。四个智能体解决问题的速度快了一倍,但成本也高出一倍。在 16 个智能体时,这一规律仍然成立,但效率略有下降。
他说,这种效果在很大程度上取决于任务。网络研究和数学很容易并行,但写小说则不然。让 10,000 个智能体去写一部小说,就像让 10,000 个人去写一样毫无意义。Brown 承认,扩展到非常大量的智能体在很大程度上仍未被探索,因为成本实在太高。
OpenAI 开发者 Eric Provencher 最近正是出于这一原因警告不要使用智能体蜂群。他认为这很可能是在浪费钱,因为智能体之间的协调会崩溃。他称之为协调税。
没有炒作的 AI 新闻 – 由人工精选
订阅 THE DECODER,即可无广告阅读、获取每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限,以及评论区访问权限。
- 完整访问 THE DECODER 上的每一篇文章
- 无广告
- 参与评论和社区讨论
- 每周通过邮件发送的 AI 新闻回顾
- 6 次/年:“AI Radar”——深入探讨最重要的 AI 话题
- 每日 AI 新闻,始终保持最新
- 我们完整的十年档案
- 由在 AI 领域拥有 10 年以上经验的团队报道
来源:The Decoder · the-decoder.com