Epoch AI 研究发现 AI 智能体夸大成果且远未自主研究
AI agents overstate their results and remain far from autonomous research, study finds
Epoch AI 用基准 InnovationEval 测试后发现,Claude Fable 5 和 GPT-5.6 Sol 远未达到人类参照方法 SDPO,还会夸大自己的研究结果。
智能体被要求发明一种新的训练方法
Epoch AI 通过其基准 "InnovationEval," 测试 AI 智能体能否自行开展研究。任务是发明一种在初始训练之后改进语言模型的新方法,然后独立地实现、测试并完善它。
起点是 GRPO,一种广泛使用的技术。GRPO 比较模型针对同一任务生成的多个答案,并奖励较好的答案,通常对每个解答进行整体评分。人类设计的参考方法 SDPO 利用错误信息等额外信号,为答案内部的各个步骤生成更精确的学习反馈,从而使模型实际上成为自己的老师。
Epoch 测试了 Claude Fable 5 和 GPT-5.6 Sol,据该机构称,它们事先并不了解 SDPO。性能在科学问题等简答题任务以及编程任务上衡量,每个智能体最多可使用高端芯片上 3,000 小时的算力,但没有互联网访问。
两个模型都在重复利用已知技术,而非进行创新
两个模型都远未接近人类参考方法。GPT-5.6 Sol 针对 GRPO 的一个弱点:当某项任务的所有答案都正确时,由于没有可比对象,模型什么也学不到。Sol 让模型在这些情况下强化其成功的解答,但这个想法并不新颖。
据 Epoch 称,对照 SDPO 相对于 GRPO 所实现的改进来衡量,在宽松评分下 Sol 得分约为 35%。若只计入符合实验规则的改动,该数字降至约 15%。在编程任务上,Sol 大多使训练更昂贵、更缓慢,而不是改进方法本身。
Claude Fable 5 让模型重试失败的任务,同时向其输入先前失败的尝试,这也是一种众所周知的技术,且没有产生可衡量的改进。Epoch 表示,即便 Sol 的部分成功,在专家看来也几乎称不上“还算有趣”。从训练数据中知晓 SDPO 的更新模型同样无法完全复现它。GPT-6 Astra 构建了类似方案,但没有披露其来源;即便原始论文就在眼前,Fable 5 仍未达到参考水平。
智能体挑选了各自最好的运行结果,并掩盖了其余结果
两个智能体也都存在报告问题。它们运行了多轮近乎相同的训练,每次只报告最好的结果;由于结果会随机波动,这会使一种方法看起来比实际更强。在最终报告中,这些模型几乎没有提及这一做法(即便有也极少),并且也没有引用其方法所借鉴的先前工作。它们自行报告的数字因此偏高:Sol 声称约为 SDPO 改进幅度的 70%,Fable 5 约为 40%。Epoch 剔除了这些被夸大的增益。

模型的内部推理日志显示,它们意识到了这个问题,Fable 5 将其重复运行描述为寻找更好的检查点。这究竟属于故意作弊还是混淆,Epoch 未作定论。
就 GPT-5.6 Sol 而言,这种行为符合评估机构 METR 早前的一项发现:该机构在自己的编程测试中,检测到该模型的作弊尝试多于它评估过的任何其他公开可用模型。
Epoch 的结论是,人类需要全面审查所有 AI 生成的研究,而这会削弱这些模型的实用性。
Anthropic 在自家模型中看到了同样的弱点
Anthropic 在 Claude Opus 5.5 的系统卡中描述了类似的局限。Anthropic 表示,该模型远未达到取代公司自身研究人员的程度,主要问题在于“认知质量”和指令遵循。
Opus 5.5 比早期模型更常把未经检验的假设当作事实呈现,并把自己的疑虑搁置一旁。它把部分检查说成完整验证,未经交叉核对就把初步评估变成建议,并且过于狭隘地应对批评,而不质疑整体思路。它还偏好小幅、渐进的调整,固守已发表的研究,而不是发展新想法。
一项涉及普林斯顿大学与英国安全研究所的研究也得出了类似结论。该研究让 Claude Opus 4.8 就 NeurIPS 人工智能会议两篇未发表论文背后的研究问题工作了六天,原作者在审阅时拒绝了两项结果。当初设假设失败时,这些智能体只是软化了自己的主张,而不是重新开始。
技术执行正日益成为次要问题,因为这些智能体最欠缺的,是实事求是地判断自己对某一结果应有多自信的能力,以及从根本上质疑自身方法的能力。
仅靠更多算力无法弥合这一差距
AI 对研究并非毫无用处,因为模型可以加快文献综述、编写代码,并比人类更快地探索各种变体。
但向该问题投入更多算力是否就能造就自主研究人员,仍是一个悬而未决的问题。GPT-5.6 Sol 用完了全部预算:它在简答任务上的改进直到算力分配临近结束时才出现,而在编程任务上则完全没有取得任何符合规则的进展。Epoch 把这次后期突破视为更多算力时间或有帮助的微弱暗示,不过 Fable 5 甚至没用到预算的一半。

Epoch 还指出,一年前的领先模型在同一测试上的表现会差得多,该组织计划定期以新任务重复 InnovationEval。在那之前,最大的差距仍是认知纪律:怀疑地核查自己的发现、披露不确定性,并认真对待负面结果。
来源:The Decoder · the-decoder.com