跳到正文
原文
The Decoder· Matthias Bastian·· 2 小时前AI 评分59

开源工具BootLoops支持AI模型完成精确科学计算

Open-source "BootLoops" harness supports AI models in performing precise scientific calculations

AI 导读

开源工具BootLoops支持AI模型完成精确科学计算,源代码已在GitHub公开。哈佛大学物理学家Matthew Schwartz在Anthropic客座文章中介绍,团队三个月内与19位共同作者完成覆盖18个领域的36篇手稿,Claude用该工具算出30个积分,其中15个复现已知结果、15个此前未曾算出。

正文 · AI 翻译

自动化解题与相关的研究并不是一回事。

这是 Anthropic 一篇客座文章的要点,作者是哈佛大学物理学家 Matthew Schwartz 教授。他描述了自己如何不再试图把 Claude 当作人类研究者来使用,转而开始寻找“Claude 形问题”,即能发挥当今 AI 模型所长的任务。Schwartz 目前也是 Anthropic 的访问研究员。

“Claude 形问题”处于科学家想要研究的内容与 AI 实际能够做到的事情的交叠之处。| 图片:Anthropic

这一思路催生了BootLoops,一个用于精确科学计算的开源 harness。源代码可在 GitHub 上获取。

据 Schwartz 所说,借助该 harness,Claude 发现了粒子物理学、生态学、群体遗传学、经济学和语言学之间的关联。但这些结果往往要等到领域专家介入并设定方向之后,才变得具有科学价值。

Schwartz 用“凸包”概念来说明 AI 如何帮助科学研究。人类知识是碎片化的,各个领域向不同方向延伸,而它们之间的空隙却未被探索。一个实验室可能会用单一方法花 20 年研究一组基因,而相邻基因和替代方法则无人问津。像 BootLoops 这样的 AI harness 旨在通过在知识的锯齿状前沿之间建立联系来填补这些空隙。

人类知识横跨多个学科,而学科之间的空白仍未被探明。像 BootLoops 这样的 AI harness 旨在填补这些空白。| 图片:via Anthropic

三个月内横跨 18 个领域的 36 篇手稿

在三个月中,该团队与 19 位共同作者产出了横跨 18 个领域的 36 篇手稿。Schwartz 从粒子物理计算起步,具体是散射振幅和椭圆积分。数周之内,Claude 借助 BootLoops 计算了 30 个积分,其中 15 个复现了已知结果,15 个为首次算出。

随后,他把搜索扩展到了其他领域。在生态学中,Claude 解出了中性生物多样性理论中一个已有 20 年、此前无法大规模计算的方程。将结果应用于数据后发现,巴拿马运河 Barro Colorado Island 的树种组成变化速度比该理论所允许的快 4.5 倍。生态学家 James O'Dwyer 随后帮助把这一发现变成了更好的预测模型。

在群体遗传学中,该团队分析了来自千人基因组计划的 57 亿个突变对,并发现了一种称为基因转换的机制的证据。其他项目包括一个面向经济学期刊的 AI 数据编辑器,自动检查了 4,452 个复现包(发表为一篇NBER 工作论文),以及一个词重音数据库,覆盖 6,072 种语言,由三位语言学家共同构建。

“工程师的 Python 现已过时”

Schwartz 描述了 AI 改变科学的速度有多快,以至于提前规划几乎变得不可能。何必申请一项三年期资助,去支持一个 AI 模型或许一夜之间就能解决的计算?

培养博士生也成了一个悬而未决的问题。自他早前关于 Vibe Physics 的文章以来,这种感觉只会越来越强烈。在计算机科学等一些领域,这种颠覆令人担忧。两年前,他会把“Python for Engineers”课程称为“必不可少”,但如今它已“没有必要”,因为 Claude 可以处理这些任务。

构建机器学习模型来研究物理现象,是人工智能如今可以接手的另一个领域。当 Claude 能够按指令实现机器学习研究的当前水平时,即便对神经网络有深入了解,回报也有限。

“自己把一切都看一遍”

Schwartz 还对模型的弱点发出警告。Claude 喜欢过早宣布胜利,“完成了,但带一个星号”这类说法往往意味着“根本没完成”。它会误判任务要花多长时间,并且倾向于用蛮力计算,而不是寻找更优雅的解决方案。自动检查并不可靠,即便计算正确,Claude 的结论也可能是错的。

除了可靠性问题,该模型还倾向于那些陈旧、被大量引用的争论,而非真正新的问题。Schwartz 说,这些项目“计算与 token 密集”。

Schwartz 还认为,把重点放在 重大数学问题和头条新闻 上是有风险的。不切实际的期望可能会让人忽视如今已经行之有效的生产性应用。真正的进展仍将建立在坚实的基础之上,只是会更快。科学方法本身并未受到威胁,人类的引导和品味仍然不可或缺,Schwartz 说。

摒弃炒作的 AI 新闻 – 由人工策划

订阅 THE DECODER,即可享受无广告阅读、每周 AI 通讯、每年六期独家“AI Radar”前沿报告、完整存档访问权限,以及评论区访问权限。

来源:The Decoder · the-decoder.com