跳到正文
The Verge · AI· Robert Hart·· 2 小时前精选

OpenAI 一次性发布近 400 项数学成果,数学家称需数年才能消化

‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop

AI 导读

OpenAI 本周突然发布近 400 项 AI 生成的数学结果,分布在 700 多篇手稿中,涵盖组合数学、几何、数论、拓扑、概率等多个领域。OpenAI 称 719 篇手稿中仅 300 项主要结果完成 Lean 形式化,约 42%,并承认论文处于不同验证阶段。

推荐理由

通过数十位数学家的第一手反应,呈现OpenAI一次性放出近400项成果对学术生态的冲击。

正文 · AI 翻译

“令人震惊。”“铺天盖地。”“前所未有。”“超现实。”“纯粹疯狂。”

这是三十多位数学家在与The Verge交谈时用来形容自己感受的词语,他们试图理解OpenAI本周突然向该领域抛出的海量数学成果。在敬畏、兴奋和对这场洪流规模之巨的不确定之中,还潜藏着一种深层的焦虑——这一切意味着什么,以及接下来会发生什么。尽管反应各异,研究人员一致认为,仅仅理解OpenAI发布了什么就可能需要数年时间,更不用说弄清楚数学家们自己在这个正围绕他们发生变化的领域中该处于什么位置了。许多人担心,OpenAI不会等那么久才继续前进——或者发布更多成果。

总体而言,OpenAI发布了近400项AI生成的成果。这些成果分布在700多份手稿中,涵盖了多个数学学科,包括组合数学、几何学的若干分支、数论、理论计算机科学、代数、拓扑学、概率论与统计力学,以及数学物理。这批成果规模如此庞大,以至于OpenAI觉得有必要发布指南,说明如何浏览这个庞大的GitHub仓库。

工作量之巨,使得即便只是初步评估该公司究竟发布了什么都很困难。在发布后的数小时和数天里,大多数接受The Verge采访的数学家表示,他们仍在努力消化所有内容;有几位说,仅仅浏览大约40页的目录和摘要就花了他们将近一个小时。“光是看完整份摘要列表就让人不堪重负,”康涅狄格大学数学教授Álvaro Lozano-Robledo说。

在数百份手稿中,还散布着用Lean完成的形式化——Lean是一种编程语言和证明助手,可以通过计算来验证结果。这些形式化在评估OpenAI此前一些数学主张时已被证明至关重要,让研究人员即便并不完全理解其背后的论证,也能对某个主张在逻辑上是否正确抱有信心。

“如果AI现在消失,就好像有外星人来到地球然后又离开了,我们接下来十年都会研究这些东西,试图理解一切。”

但每项成果被验证的程度差异极大。在GitHub上,OpenAI承认这些成果“处于不同的验证阶段”,并且“许多——但并非全部——手稿已被形式化”。截至撰写本文时,该合集中似乎只有不到一半的手稿被正式描述过。OpenAI表示,719份手稿中只有300项顶层结果已被形式化,约占42%,并称“随着我们获得更多形式化结果,将更新该仓库”。

多位数学家向 The Verge 抱怨缺乏形式化,尤其是考虑到成果数量之庞大,并强调即便某项结果附带了 Lean 代码,评估也并非即时完成。研究人员必须核查形式化是否真正证明了该结果所声称的内容,这又是一个耗时的过程,而几位深入研读论文的人表示,即便提供了可由计算机验证的证明,其质量也参差不齐,所验证的陈述也并不总能与随附手稿中的主张严丝合缝地对应。

伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己的研究领域——代数数论——中识别出了大量定理,其中只有大约六个立刻“脱颖而出”。这些定理中,几乎没有几个似乎在 Lean 中得到了形式化验证。“因此,我要么得去读那些可能并不正确的垃圾内容,要么等别人也去读,要么等有人把它们形式化之后,我才能确定这些结果究竟是否正确。”Buzzard 的担忧得到了众多其他研究者的呼应。

对 AI“垃圾内容”感到担忧的远不止 Buzzard 一人。这个词是低质量、常常错误的 AI 生成材料的简称,这类内容正越来越多地出现在网上——以及现实世界中——包括学术论文。与其他领域一样,数学家们告诉 The Verge,近年来他们看到用 ChatGPT 和 Claude 等工具生成的此类材料大幅增加。其中许多内容令人困惑、难以阅读,且几乎不体现对主题的理解;在给其他研究者署名方面尤其粗劣。

OpenAI 之前的数学论文被广泛批评,专家认为其草率,尤其是引用质量差或完全缺失。在发布前与 The Verge 的对话中,多位研究人员将即将到来的论文洪流称为“slopocalypse”,或类似的说法。

所担忧的“slopocalypse”是否真的成为现实,很难说,很大程度上是因为发布的材料数量多得令人眼花缭乱。早期迹象表明,OpenAI 这一次在论文上更加用心,或者至少对其中一些如此。几位数学家告诉 The Verge,他们的第一印象远好于预期,尽管他们自己也承认,鉴于该公司此前粗劣的出版物,这个门槛本来就不高。

“这是一团大乱。它可能导致学术文化的大崩溃,并直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视了这个问题。”

但更好并不一定意味着好,更不用说达到通常对做出如此重大主张的学术工作所期望的标准了。由于 OpenAI 的许多主张缺乏形式化验证,随附论文的质量就变得尤为重要;它们是数学家们确认、理解、审视并为这些结果提供背景的主要途径。

即使在最好的情况下,产出严谨的数学论文也是一项艰难的工作。以这种规模来做,更是一项艰巨的任务。OpenAI 的模型正以令人眼花缭乱的速度、跨越广泛的专业领域大量产出数学成果,远远超出了其人类员工的处理能力。该公司根本不具备足够的专业广度或资源,来妥善审查其在数学前沿的发现。研究人员告诉 The Verge,这一点已经显现出来。

许多人描述这些论文难以理解,有时几乎无法读懂。“我最熟悉的那篇问题的论文,快速读一遍后几乎不知所云,”布朗大学的数学教授 Brendan Hassett 告诉 The Verge。“如果这是一个人写的,我不会再花时间去试图理解它。当然,这还剩下另外 721 篇预印本!”(Hassett 是在 OpenAI 撤回三篇论文之前说这番话的)。

一些研究人员告诉 The Verge,他们或同事注意到有几篇论文似乎覆盖了其他数学家已经涉足的领域,但在有机会妥善审阅材料之前,他们不愿公开这么说。其他人则指出这些工作异常简短,通常他们预期需要数百页才能展开的结果,被压缩到了几十页甚至更少。

澳大利亚悉尼大学的数学教授 Nalini Joshi 表示,快速检索这批发布内容后,她发现与自己工作重叠的部分很少,但她指出,她检查的一些论文“参考文献很短”。鉴于此前对 OpenAI 署名做法的批评,她说她“担心论文中的署名可能缺少完整的信息”。

但尽管存在这些粗制滥造和不确定性,总体共识是,这批发布内容中包含一些确实令人印象深刻的工作。

在强调评估如此大量材料的困难——以及妥善核实结果的必要性——的同时,许多接受 The Verge 采访的研究人员表示,尽管在呈现方式上存在不足,这些工作似乎水准非常高。他们说,在前 AI 时代,OpenAI 的许多成果显然足以发表在顶级期刊上,也足以让作者获得一份学术生涯。有少数成果被描述为那种能让一位数学家成为菲尔兹奖——该领域最高荣誉之一——有力竞争者的工作。

“我要么得去读那些可能并不正确的粗制滥造之作,要么等别人去读,要么等有人把它们形式化,然后我才能确定这些结果是否正确。”

斯坦福数学家 Jared Duker Lichtman 表示,他会把“数十项”成果归入这一类,包括在黎曼猜想上的进展、霍奇猜想的一个特例,以及四维挂谷猜想的解决。这些都是数学中的重大问题。黎曼——可以说是整个学科中最臭名昭著的未解难题——和霍奇都位列著名的七大千禧年大奖难题之中。它们分别关注素数的分布,以及大致说来,如何用更简单的构件来理解复杂的几何形状。而挂谷猜想大致问的是,要让一根针或铅笔朝各个方向旋转,所需的空间能有多小。三维挂谷猜想的证明,正是纽约大学数学家王虹今年早些时候被授予菲尔兹奖的成果之一。

“并不是说这些只是没人听说过的无聊问题,”数学家 Scott Armstrong 说。“其中许多都是非常著名的问题,很多人已经尝试了几十年。”

随着尘埃开始落定,数学家们发现自己面对的是一个骤然改变的环境。他们中的许多人刚刚目睹多年的工作和精心制定的研究计划瞬间化为乌有,或者认识这样的人。在整个领域,无论反应中夹杂着兴奋、恐惧、绝望还是介于其间的情绪,都有一种深深的迷失感。

到第二天早上,这种情绪并没有太大改变。Armstrong 在穿过巴黎时通过电话说,他想象如果索邦大学没有因持续的学生抗议而关闭,他的同事们像往常一样聚在咖啡机旁,气氛会相当“肃穆”。

在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 描述了同事和学生中同样阴郁的气氛。她说,这场洪流感觉有些“可怕”,但在数周的不确定之后,它的到来也带来了一些解脱。“我有一大群朋友和同事的经费申请刚刚被一笔勾销,”她说。

“我有一大群朋友和同事的经费申请刚刚被一笔勾销。”

Armstrong 说,他知道有一个团队,其整个研究计划几乎被这次发布“一笔勾销”。与此同时,曾处于OpenAI 早前纳维-斯托克斯问题争议中心的纽约大学数学家 Tristan Buckmaster 表示,他已经听说“有三个人整个研究计划被彻底摧毁”。

类似的故事在 The Verge 与数学家的交谈中反复出现,不过这种冲击主要集中在领域的某些方向。苏格兰赫瑞瓦特大学数学教授 Francesco Fournier-Facio 说,概率论、组合学和理论计算机科学的研究者似乎“尤其震惊”,并补充说,他所在领域中的某些方向,即群论,已经被“推平”。

Armstrong 和其他研究人员表示,一些领域似乎是以近乎军事级的精度被瞄准的。“确实有一些目标,”Armstrong 说。他特别指出了 Wang 今年获得菲尔兹奖所涉领域的工作,以及几个千禧年大奖难题。他说,数学物理领域的一批成果清楚表明,OpenAI 正在研究 Yang-Mills 理论——支撑现代粒子物理学大部分内容的数学框架——及其未解决的“质量间隙”问题,这是七个大奖难题之一。

在其他地方,研究人员对自己工作似乎很少被触及表达了一种惊讶的宽慰。Roney-Dougal 说,她自己所在的领域角落——主要围绕群论——似乎相对未受波及。她开玩笑说,幸好她研究的是一个“非常不时髦的领域”,不过后来发消息说,在发现自己的作品被其中一篇论文引用后,她感到“不确定”。

Joshi 同样发现与自己的工作几乎没有重叠,她的工作主要聚焦于可积系统,即可以精确求解的复杂系统。她提出,这可能是因为她的领域较少由长期存在、正式表述的猜想和定义驱动,而更多由随着物理学发展而起伏的问题驱动。

截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因一个“符号错误”而撤下三篇论文,该错误据称使某个论证无效。

无论他们自己的工作是否受到直接影响,大多数接受 The Verge 采访的数学家都共同感到,这个领域已经跨过了某种门槛,不再是一天前的样子。高等研究院研究员 Constantin Kogler 称其为“数学史上最重要的单一时刻”,而伦敦数学科学研究所研究员 Yang-Hui He 则回溯数千年,将今年 AI 驱动的发展比作欧几里得《几何原本》的出版,这是该学科最具影响力的著作之一。

很少有研究人员的评价如此宏大,但人们普遍认为,数学正在快速变化——数学家也必须随之改变。

OpenAI 知道这次发布将带来颠覆性影响,并做出了一些努力来缓和冲击并与数学界接触。在今年早些时候与研究人员发生几次不愉快交锋后,该公司转向数学家本人寻求帮助,与新成立的数学与人工智能咨询小组(AGMAI)合作,研究如何负责任地发布这些成果。

AGMAI 已经 阐明 了它认为负责任的参与方式应该是什么样的。AI 实验室最好发布“人类能理解”的论文,或者以其他方式提供必要的“支持,以开展额外的数学活动,使人类能够理解和吸收其 AI 生成的数学成果,并识别其可能的应用”。他们表示,在可能的情况下,证明应当形式化,并且公司应公开他们用来创建这些证明的模型和提示。该组织还敦促 AI 实验室停止将数学发布视为“推广其模型的营销工具”,并应“停止在专有模型上测试高级数学问题”,因为这些模型对更广泛的科学界来说是无法访问的。

“并不是说这些只是没人听说过的无聊问题。其中许多都是非常著名的问题,许多人已经尝试了几十年。”

OpenAI 采纳了该组织的一些建议。它表示将围绕其在数学方面的工作资助一系列研讨会和会议,以帮助社区处理和理解其工作,不过它没有提供这些活动可能是什么样子或何时举行的细节。该公司还披露了比以往发布中多得多的信息——研究人员再次表示,这是一个很低的标准——包括其模型尝试了 4,000 多个问题,以及一个典型结果使用了约三个小时的 ChatGPT Pro 思考计算。它还实施了“论文修订和引用协议”,并在 GitHub 上表示它“将保留该集合的公开版本历史”。截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因一个“符号错误”而撤下三篇论文,该公司称该错误使某个论证无效。OpenAI 没有就 The Verge 要求提供更多细节的请求作出正式回应。

这一变化解决了与数学家之间一个关键的摩擦来源,其中一些人谈到围绕该公司所发布声明的一种“偏执”。该公司有 习惯 在回应批评时暗中修改新闻稿和论文,而不明确披露这些更改。

但 OpenAI 并没有遵循该组织的所有建议——包括其中一些最重要的建议。它没有说明此次发布背后的模型,也没有披露所使用的提示或模型尝试过的完整问题集。OpenAI 似乎还承认其形式化工作有所欠缺——它表示将在获得更多形式化内容后添加更多——并且论文质量不达标,称“对于未来的发布,我们致力于通过引用、数学阐述和结果呈现来进一步提高论文质量,以便更好地理解。”

“我最了解的那个问题的文稿,快速读完后几乎说不通。”

The Verge 采访的研究人员质疑,为什么 OpenAI 不能提高这些论文的质量,并对它似乎不愿提前形式化——甚至在撤稿论文的情况下连检查都不愿做——许多结果表示失望。诸如所使用的提示之类的信息,也会在减轻许多人感到的负担方面极其有用,这种负担来自评估该公司突然抛给他们的海量材料。

最重要的是,该公司表示没有计划停止在数学问题上测试其模型,并且实际上暗示它认为这样做是必须的。“我们希望直接赋予科学家最先进的能力,并正在努力负责任地发布产生这些结果的模型,”它在宣布最新结果时表示。“这就是为什么继续在数学和其他科学领域评估我们的内部前沿模型很重要,这样我们就能加速开发推动这些领域进步的工具。”

在 OpenAI 公布其成果后,AGMAI 称该发布是“第一步”,并再次呼吁公平获取计算和研究工具。更根本的是,该组织认为“数学研究的未来不能仅仅是理解 AI 实验室产生的结果。”

尽管 OpenAI 声称解决了数百个长期存在的问题,数学家们表示还有大量工作要做。许多人估计,理解该公司刚刚发布的所有内容可能需要数学界花费数年时间。

阿姆斯特朗将如此多新数学的突然涌现比作一次短暂的外星访问可能引发的骚动。“如果 AI 现在消失,就像外星人来到地球然后离开一样,我们会在接下来的 10 年里研究这些,试图理解一切。”

其中很多工作本身就会令人兴奋。研究人员将不得不填补空白、提取有用的想法和联系,并将解决方案置于更广泛的数学背景中,所有这些通常与为人类产生解决方案相伴而行。“对于许多这些结果,相关专家非常关心这些解决方案,我相信他们能够消化并向更广泛的世界展示它们,”利希特曼说。他认为,随着 AI 改变这些领域,涉及解释、验证和情境化结果的工作需要被更加重视。“作为一个社会,我们应该更多地奖励这些消化工作。”

可能还有大量数学留给人类去做。据他所知,利希特曼说所有结果,尽管“令人惊叹”,都“来自现有的方法和技术”。它们填补了已知数学版图的部分,而不是创造全新的领域。“事实证明,可填补的空间比专家们之前知道的要多得多!”洛萨诺-罗夫莱多呼应了这一观点:“它们都在以非常巧妙的方式使用现有技术。”

而现有的版图远非极限。“数学研究本质上是无限的,”洛萨诺-罗夫莱多说。“研究将继续下去。”伦敦研究所的何说,他特别兴奋地看到接下来会出现什么,推测研究人员最终可能会创造新的想法,“甚至可能是新的数学领域”。

这些公司似乎准备立即继续前进,远在数学界有任何合理机会消化它们所产生的东西之前。

《The Verge》采访的数学家很少有人在原则上反对 AI 产生新数学。事实上,许多人对此表示欢迎,并在不同程度上表示他们自己是 AI 工具的狂热用户。大多数不安针对的是构建这些工具的 AI 公司进入他们领域的方式。

看看 OpenAI 和其他 AI 实验室发布的数学成果,你会觉得研究数学基本上就是把问题从清单上一个个划掉。AI 实验室公布结果的方式也强化了这种印象:一场炫目的发布会、一份初步的文稿,剩下的就丢给数学家去弄明白并加以阐释。多位研究人员告诉 The Verge,这些公司似乎准备立刻转向下一个目标,远在学界有任何合理机会消化他们产出的东西之前。

研究人员形容,这是对数学研究实际运作方式的贫乏理解。解答固然重要,但通往解答过程中发生的一切同样重要:发展想法、建立联系、发现新问题或开辟其他研究路径。当 OpenAI 这样的公司只是找到答案而不做任何周边工作时,数学家们说,这些工作的负担就落回了学界身上。

“有新结果当然是好事,但这个规模是另一个层级,”波兰波兹南密茨凯维奇大学的数学家 Bartosz Naskręcki 说。“这是一团大乱,”他说。“它可能导致学术文化的巨大崩塌,直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这个问题。”

需要数年才能理解的不仅是数学本身。研究人员也在艰难地理解这场剧变对他们意味着什么。许多人描述,随着数学家们试图弄清自己在快速变化的领域中处于什么位置,一种黯淡、近乎存在主义式的情绪笼罩着学界。他们可能没有多少时间去想明白。

数学家之间已经在流传关于 OpenAI 进一步发布成果的传闻。对于是否还有更多发布计划,OpenAI 未回应 The Verge 的提问。

Roney-Dougal 说,她害怕又一次发布——或者 Anthropic 或其他 AI 实验室加入战局的前景。

这场冲击对博士生、初级研究人员以及其他没有终身教职的人打击尤为沉重。像 OpenAI 模型正在攻克的那些开放问题,可能是学位论文、经费申请、求职材料以及多年研究计划的基础,而这些都是学术生涯的重要基石。几位研究人员描述了一种日益普遍的焦虑:他们赖以为生的研究工作可能突然成为下一个目标,而 AI 模型在堵死一些方向的同时,几乎没有开辟多少未来探究的路径。“对于经费即将到期或正在找工作的人来说,这极具破坏性,”瑞士苏黎世联邦理工学院的数学家 Simon Machado 说,他即将加入法国国家科学研究中心(CNRS)。

“数学研究本质上是无限的。研究还会继续。”

士气可能尤其低落,因为一切都让人感到没有喘息之机。OpenAI 的发现一波比一波大,之间几乎没有停顿,而且公司频繁暗示还有更多成果即将到来。“你会感觉到他们并不真正在乎这些单个结果,”Roney-Dougal 说。“这种感觉真的很糟糕。”

数学家们还没来得及消化一组结果,下一组更大的结果就砸了下来。“再过两个月就会有东西把这一切彻底比下去,”Armstrong 说。“就像是一轮又一轮越来越大的炸弹轰炸。”

Armstrong 说,他认为自己是对 AI 最热情、最乐观的数学家之一。他在自己的工作中使用这项技术,并相信它潜力巨大。但即便是他,也越来越感到不安。“晚上有点难以入睡,”他承认道。

当被问及接下来打算做什么时,Armstrong 不太确定。他仍在巴黎街头走着,准备去吃午饭,他说自己眼下的首要任务是完成一些他一直在做的工作——有时是在 OpenAI 的 Codex 帮助下完成的——“赶在 OpenAI 抢在我们前面之前。”

除此之外,就连这位自称的 AI 乐观主义者也不确定,并质疑自己在数学领域还有什么未来。他尤其担心这一领域的年轻研究者。“数学界接下来几年会非常诡异,”他说。

关注本报道的话题和作者,以便在个性化首页信息流中看到更多类似内容,并接收邮件更新。

  • Robert Hart

来源:The Verge · AI · theverge.com