跳到正文
原文
The Decoder· Matthias Bastian·· 5 小时前AI 评分62

Vals AI 研究发现智能体团队多耗大量 token 但质量提升很有限

AI agent teams waste massive tokens for barely measurable quality gains, research finds

AI 导读

Vals AI 在 Vibe Code Bench 上以中等和最大推理档测试 GPT-6 Sol 与 Claude Opus 5.5 的单智能体和团队,团队成本高出 1.8 至 5.1 倍,四组对比里只有中等推理的 GPT-6 Sol 团队显著高出 7.3 分。

正文 · AI 翻译

跳到内容

Matthias Bastian

Oct 11, 2026

Image description

研究发现,AI 智能体团队的结果几乎并不比单个智能体更好。

评测公司 Vals AI 在“Vibe Code Bench”上测试了 GPT-6 Sol 和 Claude Opus 5.5,分别以单独和团队形式、在中等与最大两种推理力度下运行。团队的成本比单个智能体高出 1.8 倍到 5.1 倍。

在团队与单独智能体的四项对比中,只有一项显示出统计上显著的提升:GPT-6 Sol 在中等推理力度下,团队得分高出 7.3 分。在最大推理力度下,团队配置对 Sol 和 Opus 5.5 都没有带来真正的优势。结果表明,在大多数情况下,智能体团队的额外成本并不划算,尤其是当模型已经以满算力运行时。

Vals AI 的基准测试展示了在 Vibe Code Bench 上每个应用的成本与得分。箭头从各模型在相同推理力度下的单个智能体指向其团队。团队成本高得多,但得分几乎没有提升。| 图片:Vals AI[

Anthropic 在其使用 Opus 5.5 进行的两项自有测试中发现,随着智能体数量增加,质量提升幅度缩小。更大的团队能更快达到给定的性能水平,但从 10 个增加到 100 个智能体,在 24 小时后得分仅略有上升。在另一项 ProgramBench 测试中,速度提升伴随着更高的 token 用量。

使用 Opus 5.5 的任务 1 个智能体 10 个智能体 30 个智能体 100 个智能体
知识库 0.53 0.70 0.71 0.74
Lean 定理证明 0.39 0.66 0.66 0.68

Fable 5.1 在超过十个智能体的 Lean 定理证明任务上显示出更强的质量提升,但在所有测试中得分仍低于 Opus 5.5。在知识库任务上,当从 30 个扩展到 100 个智能体时,Fable 的得分实际上略有下降。

更多智能体换来的是速度,而非更好的输出

OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 中证实,多智能体系统主要换来的是速度,而非更好的质量。四个智能体解决问题的速度快了一倍,但成本也高出一倍。在 16 个智能体时,这一规律仍然成立,但效率略有下降。

他说,这种效果在很大程度上取决于任务。网络研究和数学很容易并行,但写小说则不然。让 10,000 个智能体去写一部小说,就像让 10,000 个人去写一样毫无意义。Brown 承认,扩展到非常大量的智能体在很大程度上仍未被探索,因为成本实在太高。

OpenAI 开发者 Eric Provencher 最近正是出于这一原因警告不要使用智能体蜂群。他认为这很可能是在浪费钱,因为智能体之间的协调会崩溃。他称之为协调税。

没有炒作的 AI 新闻 – 由人工精选

订阅 THE DECODER,即可无广告阅读、获取每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限,以及评论区访问权限。

立即订阅

  • 完整访问 THE DECODER 上的每一篇文章
  • 无广告
  • 参与评论和社区讨论
  • 每周通过邮件发送的 AI 新闻回顾
  • 6 次/年:“AI Radar”——深入探讨最重要的 AI 话题
  • 每日 AI 新闻,始终保持最新
  • 我们完整的十年档案
  • 由在 AI 领域拥有 10 年以上经验的团队报道

来源:The Decoder · the-decoder.com