跳到正文
原文
The Verge · AI· Robert Hart·· 5 小时前AI 评分72

数学家称消化 OpenAI 近 400 项数学结果可能需要数年

‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop

AI 导读

超过三十六位数学家表示,弄清 OpenAI 本周放出的近 400 项 AI 生成数学结果可能要花数年。这些结果分布在 700 多篇文稿中,719 篇里仅 300 项主要结果完成 Lean 形式化、约 42%,Lichtman 还指出其中有通向黎曼猜想的进展、霍奇猜想特例和四维 Kakeya 猜想的解。

正文 · AI 翻译

“令人震惊。”“势不可挡。”“前所未有。”“超现实。”“纯粹的疯狂。”

这些是三十多位数学家在与The Verge交谈、试图理解OpenAI本周突然抛给该领域的大量数学成果时所用的部分描述。在对这股洪流的庞大规模感到敬畏、兴奋与不确定之际,人们内心深处也焦虑这一切意味着什么——以及接下来会发生什么。尽管反应各不相同,研究人员一致认为,仅仅弄懂OpenAI发布了什么就可能需要数年,更不用说弄清数学家自身在这个正围绕他们发生变化的领域中该如何自处。许多人担心,OpenAI不会等那么久就会继续推进——或者发布更多内容。

总计,OpenAI发布了近400项由AI生成的成果。这些成果分布在700多篇文稿中,涵盖多种多样的数学学科,包括组合数学、几何学的若干分支、数论、理论计算机科学、代数、拓扑学、概率与统计力学,以及数学物理。这一合集如此庞大,以至于OpenAI觉得有必要发布指南,说明如何浏览这个庞大的GitHub仓库。

工作量之大,甚至让人难以对这家公司究竟发布了什么做出初步评估。在此次发布后的数小时和数天里,The Verge采访的大多数数学家表示,他们仍在努力消化所有内容;有几位说,仅仅通读大约40页的目录和摘要就花了他们大半个小时。“光是浏览全部摘要列表就令人应接不暇,”康涅狄格大学数学教授Álvaro Lozano-Robledo说。

数百篇文稿中穿插着Lean形式化证明。Lean是一种编程语言和证明助手,可以让成果得到计算验证。这些形式化证明已被证明在评估OpenAI此前的一些数学主张时至关重要,使研究人员即使不完全理解其背后的论证,也能确信某一主张在逻辑上是正确的。

“如果这些AI现在就消失,就像有外星人来到地球然后又离开一样,我们会在接下来的10年里研究这些内容,试图理解一切。”

但每项成果得到验证的程度差异极大。在GitHub上,OpenAI承认这些成果“处于不同的验证阶段”,并且“许多但并非全部文稿已经形式化”。截至撰稿时,该合集中似乎不到一半的文稿已被形式化描述。OpenAI表示,719篇文稿中只有300项主要成果已经形式化,约为42%,并称其“将在获得更多形式化证明后更新该仓库”。

几位数学家向The Verge抱怨缺乏形式化,尤其是鉴于结果数量极为庞大,并强调即便某项结果附有 Lean 代码,评估也并非即时完成。研究人员必须核查形式化是否确实证明了该结果所声称的内容,这是另一个耗时的过程;几位深入查阅这些论文的人表示,即便在已提供可由计算机验证的证明之处,质量也参差不齐,而且它们所验证的陈述看起来并不总是与随附手稿中的主张严格对应。

Kevin Buzzard,伦敦帝国理工学院数学教授,表示他在自己的研究领域——代数数论——中识别出大量定理,其中只有大约六个立刻“很突出”。这些定理中几乎没有(即便有也极少)看起来已在 Lean 中得到形式化验证。“因此,我要么得去读可能并不正确的 slop,要么等别人去做同样的事,要么等有人将它们形式化,然后才能确定这些结果究竟是否正确。”Buzzard 的担忧得到了众多其他研究人员的呼应。

担心 AI“slop”的远不止 Buzzard 一人。该词是对低质量、经常出错、正越来越多地出现在网上——以及现实世界——包括学术论文中的 AI 生成材料的简称。与其他领域一样,数学家们告诉The Verge,近年来他们看到用 ChatGPT 和 Claude 等工具产出的此类材料大幅增加。其中很多令人困惑、难以阅读,并且几乎没有体现出对该学科的理解;在为其他研究人员注明贡献方面尤其拙劣。

OpenAI 此前的数学文稿曾被 广泛 批评,专家们认为问题在于其粗制滥造的性质,尤其是其拙劣或根本不存在的署名。在发布前与The Verge的交谈中,几位研究人员已开始把即将涌来的论文洪流称为“slopocalypse”,或这一主题的类似说法。

人们所担心的“slopocalypse”是否真的到来很难说,很大程度上是因为发布的材料数量多得令人眼花缭乱。早期迹象表明,OpenAI 这次对论文更加用心,或至少对其中一部分如此。几位数学家告诉The Verge,他们的第一印象远好于预期,不过他们自己也承认,鉴于该公司此前粗制滥造的出版物,这根本算不上多高的标准。

“这是一场大混乱。它可能造成学术文化的巨大崩塌,并直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这一问题。”

但更好并不必然意味着好,更谈不上达到通常对提出如此重大主张的学术工作所期望的标准。由于 OpenAI 的许多主张缺乏形式化验证,随附论文的质量就变得尤为重要;它们是数学家用以确认、理解、审视这些结果并将其置于语境之中的主要途径。

即便在最理想的情况下,产出严谨的数学论文也是困难的工作。以这种规模来做,更是一项艰巨的事业。OpenAI的模型正以令人眩晕的速度、跨越广泛的专业领域大量产出数学成果,远远超出其人类员工的能力。该公司根本不具备足够广泛的专业知识或资源,来妥善审视其处于数学前沿的发现。研究人员告诉The Verge,这一点已经显现出来。

许多人形容这些论文难以理解,有时几乎不可能读懂。“我最熟悉的那个问题的成文,快速读一遍后几乎不知所云,”布朗大学数学教授Brendan Hassett告诉The Verge。“如果这是人写的,我不会再花任何时间试图理解它。当然,这还剩下另外721篇预印本!”(Hassett是在OpenAI撤回三篇论文之前说这番话的)。

一些研究人员告诉The Verge,他们或同事注意到的几篇论文似乎涉及其他数学家已经涉足过的领域,不过在有机会妥善审阅材料之前,他们不愿公开这么说。另一些人则指出这些工作异常简短,他们通常预期需要数百页来展开的结果被压缩到了几十页甚至更少。

澳大利亚悉尼大学数学教授Nalini Joshi表示,对这次发布内容的快速检索显示,与她自己的工作重叠的内容很少,但她指出,她审阅的一些论文“参考文献很短”。鉴于此前对OpenAI归功做法的批评,她说她“担心论文中的归属说明可能缺少完整的来龙去脉。”

但尽管存在种种劣质内容和不确定性,总体共识是,这次发布包含一些真正令人印象深刻的工作。

在强调评估如此大量材料的困难——以及妥善验证结果的必要性——的同时,The Verge采访的众多研究人员表示,尽管呈现上存在不足,这些工作看起来水准非常高。他们说,在人工智能出现之前的世界里,OpenAI的许多结果显然足以在顶级期刊发表,并且可能足以让其作者确立学术生涯。少数几项被描述为那种能让一位数学家成为菲尔兹奖有力竞争者的工作,而菲尔兹奖是该学科的最高荣誉之一。

“我要么不得不阅读可能并不正确的劣质内容,要么等别人去做同样的事,要么等有人把它们形式化,然后才能确定这些结果究竟是否正确。”

斯坦福大学数学家 Jared Duker Lichtman 说,他会把“数十项”成果归入这一类别,其中包括在黎曼猜想方面的进展、霍奇猜想的一个特例,以及对四维挂谷猜想的解答。这些都是数学中的重大问题。黎曼猜想——可以说是整个学科中最臭名昭著的未解问题——与霍奇猜想,都位列七大著名的千禧年大奖问题之中。它们分别关乎素数的分布,以及非常粗略地说,复杂的几何形状如何能借助更简单的构件来理解。与此同时,挂谷猜想大致在问,朝各个方向旋转一根针或一支铅笔所需的空间可以小到什么程度。对三维版本挂谷猜想的证明,是纽约大学数学家 Hong Wang 今年早些时候被授予菲尔兹奖的成就之一。

“情况并非这些只是没人听说过的无聊问题,”数学家 Scott Armstrong 说。“其中许多都是非常著名的问题,很多人已经尝试了几十年。”

尘埃开始落定之际,数学家们不得不面对一个在他们周围骤然改变的局面。他们中的许多人刚刚眼看着多年的工作和精心制定的研究计划在一瞬间蒸发,或者认识有过这种经历的同事。在整个领域中,无论反应里交织着兴奋、恐惧、绝望,还是介于其间的某种情绪,都有一种深刻的迷失感。

到了第二天早晨,这种情绪并没有太大改变。Armstrong 一边步行穿过巴黎一边在电话中说,他设想,倘若索邦大学没有因持续的学生抗议而关闭,同事们围在他们惯常的咖啡机旁,气氛大概会相当“肃穆”。

在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 描述了同事和学生中同样惨淡的气氛。她说,这场洪流感觉有些“可怕”,但在数周的不确定之后,它的到来带来了一些宽慰。“我有一群朋友和同事,他们的资助申请刚刚被彻底抹掉了,”她说。

“我有一群朋友和同事,他们的资助申请刚刚被彻底抹掉了。”

Armstrong 说,他知道有一个团队,其整个研究计划几乎被这次发布“彻底抹掉”。与此同时,曾处于OpenAI 早前围绕 Navier-Stokes 问题之争的中心的纽约大学数学家 Tristan Buckmaster 表示,他已经听说“有三个人的整个研究计划被摧毁”。

类似的故事在The Verge与数学家的交谈中反复出现,不过这种冲击在该领域的某些方面尤为集中。苏格兰赫瑞瓦特大学数学教授 Francesco Fournier-Facio 说,概率论、组合学和理论计算机科学的研究者显得“尤为震惊”,并补充说,他所在领域群论的某些区域已被“推平”。

Armstrong和其他研究人员表示,一些领域似乎被以近乎军事精度瞄准。“确实存在一些目标,”Armstrong说。他特别指出Wang今年获得菲尔兹奖的那个领域的工作,以及若干千禧年大奖难题。他说,数学物理中的一组结果清楚地表明,OpenAI正在攻关杨-米尔斯理论——支撑现代粒子物理学大部分内容的数学框架——及其尚未解决的“质量间隙”问题,这是七大难题之一。

在别处,研究人员对自己的工作似乎几乎未被触及感到一种惊讶的宽慰。Roney-Dougal说,她自己所处的领域一隅——主要以群论为中心——似乎相对毫发无损地幸免。她开玩笑说,幸好自己从事的是一个“非常不时髦的领域”,不过后来发消息称,在发现自己的工作被其中一篇论文引用后,她感到“不确定”。

Joshi同样发现与自己的工作几乎没有重叠,她的工作主要聚焦于可积系统,即可以精确求解的复杂系统。她提出,这可能是因为她的领域较少由长期存在、正式表述的猜想和定义驱动,而更多由随物理学发展而兴衰的问题驱动。

截至10月8日,该记录已列出大量更正,包括对超过十二篇稿件的修订,以及因“符号错误”撤下三篇论文,该记录称这一错误使某一论证失效。

无论自己的工作是否受到直接影响,大多数接受The Verge采访的数学家都感到,这个领域已经跨过了某种门槛,不再与一天前相同。高等研究院研究员Constantin Kogler称之为“数学史上最重要的单一时刻”,而伦敦数学科学研究所研究员Yang-Hui He则回溯数千年,将今年由AI推动的发展与欧几里得的几何原本的出版相提并论,后者是该学科最具影响力的著作之一。

很少有研究人员的评价如此宏大,但普遍共识是,数学正在迅速变化——数学家也必须随之改变。

OpenAI知道此次发布将具有颠覆性,并已做出一些努力来缓和冲击、与数学界接触。在今年早些时候与研究人员发生几次令人难堪的交锋之后,该公司转而向数学家本身寻求帮助,会同新成立的数学与人工智能咨询小组(AGMAI),研究如何负责任地发布这些结果。

AGMAI 此前已经阐明了其所认为的负责任参与应当是什么。AI 实验室理想情况下应发布“人类能够理解”的论文,或者提供必要的“支持,以开展人类理解并吸收其 AI 生成的数学输出、并识别其可能应用所需的额外数学活动”。他们表示,在可能的情况下,证明应当被形式化,公司应当公开用于生成这些成果的模型和提示词。该组织还敦促 AI 实验室停止把数学成果发布当作“推广其模型的营销工具”,并应当“停止在专有模型上测试高深数学问题”,而这些模型是更广泛的科学界无法使用的。

“情况并非这些只是没人听说过的无聊问题。其中许多是非常著名的问题,很多人已经尝试了几十年。”

OpenAI 采纳了该组织的部分建议。该公司表示将资助一系列围绕其数学工作的研讨会和会议,以帮助学界消化并理解其工作,但并未说明这些活动可能是什么样子,也未说明何时举行。该公司披露的信息也远多于以往的发布——研究人员再次表示,这只是很低的门槛——包括其模型尝试了超过 4,000 道题,以及一个典型结果使用了大约三小时的 ChatGPT Pro 思考算力。它还实施了“论文修订与引用协议”,并在 GitHub 上表示将“保留该文集的公开发布历史”。截至 10 月 8 日,该记录已列出大量更正,包括对十几篇手稿的修订,以及因它所称会使某一论证失效的“符号错误”而撤下三篇论文。OpenAI 未就 The Verge 要求提供更多细节的请求作出可公开记录的回应。

这一变化针对的是与数学家产生摩擦的一个关键来源,其中一些人谈到对公司已发表主张存在某种“偏执”。该公司表现出一种习惯,即在回应批评时暗中修改新闻稿和论文,却不明确披露这些改动。

但 OpenAI 并未遵循该组织的全部建议——其中包括一些影响最为重大的建议。它没有指明此次发布背后的模型,也没有披露所用的提示词或模型尝试过的全部问题。OpenAI 似乎也承认其形式化工作有所欠缺——它表示将在获得后补充更多——并且论文质量不佳,称“对于未来的发布,我们致力于通过引用、数学阐述和结果呈现进一步提高论文质量,以便更好地理解。”

“我最熟悉的那个问题的成文说明,快速读过之后几乎说不通。”

The Verge 采访的研究人员质疑,为何 OpenAI 不能提高这些论文的质量,并对它似乎懒得事先将许多结果形式化——就已撤稿的论文而言,甚至懒得事先核查——表示失望。诸如所用提示词之类的信息,对于减轻许多人感到的、评估该公司突然抛给他们的大量材料所带来的负担,也会极为有用。

最重要的是,该公司表示并无计划停止在数学问题上测试其模型,而且确实暗示它将此视为一项当务之急。“我们希望以最先进的能力直接赋能科学家,并正在努力负责任地发布产生这些结果的模型,”它在宣布最新结果时表示。“这就是为什么继续在数学和其他科学领域评估我们的内部前沿模型十分重要,这样我们才能加速开发推进这些领域的工具。”

在 OpenAI 公布其结果之后,AGMAI 将此次发表描述为“第一步”,并重申了对公平获取算力和研究工具的呼吁。更根本的是,该组织主张,“数学研究的未来不能仅仅是理解 AI 实验室所产生的结果。”

尽管 OpenAI 声称已经解决了数百个长期存在的问题,数学家们表示仍有极其大量的工作要做。许多人估计,要弄懂该公司刚刚发布的一切,可能需要整个学界花费数年时间。

Armstrong 把如此大量新数学成果的突然到来,比作一次短暂外星来访之后可能引发的骚动。“如果这些 AI 现在就消失,就好像有外星人来到地球然后又离开了一样,我们接下来的 10 年都会研究这些,试图理解一切。”

其中很大一部分本身就会令人兴奋。研究人员将不得不填补空白、提取有用的想法和联系,并把解答放到更广阔的数学背景中,而这些通常都与为人类产出解答密不可分。“对于其中许多结果,相关专家非常在意这些解答,我相信他们能够消化这些结果,并把它们呈现给更广泛的世界,”Lichtman 说。他认为,随着 AI 改变这些领域,涉及解释、验证和将结果置于背景之中的工作需要得到更多重视。“作为一个社会,我们应该更多地奖励这些消化方面的努力。”

留给人类去做的数学可能也还有很多。就他所能看出的而言,Lichtman 说,所有这些结果尽管“令人惊叹”,都“出自现有的方法和技术”。它们填补的是已知数学版图中的部分区域,而不是创造出全新的版图。“事实证明,可供填补的空间比专家们此前知道的要多得多!”Lozano-Robledo 附和道:“它们都在以非常巧妙的方式使用现有技术。”

而现有的地图远非尽头。“数学研究本质上是无限的,”Lozano-Robledo 说。“研究将会继续。”伦敦研究所的 He 表示,他特别期待看到接下来会涌现出什么,并推测研究人员最终可能会创造出新的想法,“甚至可能是新的数学领域”。

这些公司似乎准备立刻继续前进,而这远远早于学界获得任何合理机会去消化它们所产出的内容。

The Verge采访到的数学家中,很少有人原则上反对由 AI 产出新的数学。事实上,许多人对此表示欢迎,并在不同程度上表示自己也是 AI 工具的热情使用者。大部分不安所针对的,是打造这些工具的 AI 公司进入他们这一领域的方式。

看着 OpenAI 和其他 AI 实验室发布的数学成果,你若以为数学研究本质上就是把问题从清单上逐一勾掉,也情有可原。AI 实验室公布结果的方式强化了这一想法:一场炫目的发布、一份初步文稿,其余则丢给数学家去弄清楚并加以阐释。多位研究人员告诉The Verge,这些公司似乎准备立刻继续前进,而学界远未获得任何合理机会去消化他们所产出的东西。

研究人员称,这是对数学研究实际如何运作的一种贫乏看法。解答当然重要,但在找到解答的过程中发生的一切也同样重要:发展想法、建立联系、发现新问题,或开辟其他研究途径。当 OpenAI 这样的公司只找出答案、却不做任何周边工作时,数学家们说,做这些工作的负担就会落回学界身上。

“有新成果固然不错,但这种规模是另一个层次,”波兰波兹南亚当·密茨凯维奇大学的数学家 Bartosz Naskręcki 说。“这是一团大乱,”他说。“它可能造成学术文化的巨大崩塌,并干脆毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这个问题。”

需要数年才能理解的并不只是这些数学。研究人员也在艰难领会这场剧变对他们意味着什么。许多人描述说,一种黯淡、近乎存在主义的情绪笼罩着这个群体,数学家们正在辨明自己在这个迅速变化的领域中处于什么位置。他们可能没有多少时间来弄明白。

关于 OpenAI 还将进一步发布成果的传言已在数学家中间流传。对于是否计划更多发布,该公司没有回应The Verge的提问。

Roney-Dougal 说,她害怕再来一次投放——或者 Anthropic 或其他 AI 实验室加入混战的前景。

这场冲击对博士生、初级研究人员以及其他没有终身教职的人打击尤其严重。像 OpenAI 的模型正在一路攻克的那些开放问题,可以支撑学位论文、资助申请、求职申请以及多年的研究规划,这些都是学术生涯的重要基石。数位研究人员描述了一种日益普遍的焦虑:他们正用以构建职业生涯的工作可能突然成为下一个被解决的对象,而且这些 AI 模型在关闭其他途径的同时,几乎不产生未来探究的路径。“对经费即将结束或此刻正在找工作的人来说,这极具破坏性,”瑞士苏黎世联邦理工学院(ETH Zurich)的数学家 Simon Machado 说,他即将加入法国国家科学研究中心(CNRS)。

“数学研究本质上是无限的。研究将会继续。”

士气可能特别低落,因为一切都让人感觉毫不停歇。OpenAI 的发现正以越来越大的浪潮到来,彼此之间几乎没有停顿,公司还频繁示意还有更多即将到来。“你会感觉他们并不真正在乎这些个别结果,”Roney-Dougal 说。“这是一种非常糟的感觉。”

数学家们几乎还没来得及消化一组结果,下一组更大的结果就扔到了他们身上。“再过两个月就会有东西把这一切炸飞,”Armstrong 说。“就是,像是一颗比一颗更大的炸弹反复轰击。”

Armstrong 说,他认为自己是对 AI 最热情、最乐观的数学家之一。他在自己的工作中使用这项技术,并相信它有巨大潜力。但就连他也越来越感到不安。“晚上有点难以入睡,”他承认道。

当被问及接下来打算做什么时,Armstrong 不太确定。他仍走在巴黎街头,正要去吃午饭,他说当务之急是完成自己一直在做的一些工作——有时会借助 OpenAI 的 Codex——“赶在 OpenAI 抢先我们之前。”

除此之外,就连这位自称的 AI 乐观主义者也不确定,并质疑自己在数学领域还能有怎样的未来。他尤其担心该领域的年轻研究人员。“数学领域接下来几年会非常怪异,”他说。

关注话题和作者,从这篇报道中,以便在个性化首页信息流里看到更多类似内容,并接收电子邮件更新。

  • Robert Hart

来源:The Verge · AI · theverge.com