2026年9月,25位菲尔兹奖得主在Math and AI发布联合声明,警告将著名数学问题作为AI能力基准会导致研究目标偏离。声明承认AI在数学上有助益,但呼吁对验证、归属、发布和评测激励做出制度性调整。
2026年9月11日,25位菲尔兹奖得主在Math and AI网站发布《A Severe Misalignment of AI in Mathematics》联合声明,批评人工智能公司把解决著名数学问题作为能力基准的做法,可能正在损害数学研究本身。
声明并非反对人工智能进入数学领域。相反,签署者承认,近几个月大型语言模型的数学能力明显提升,已经能够在多个数学领域处理过去被视为重大挑战的问题。但他们认为,企业追求“更快解决问题”的激励,与数学共同体长期重视的概念理解、方法解释、成果归属和知识传承之间,出现了严重错位。
声明的发起人包括陶哲轩(Terence Tao)、彼得·舒尔策(Peter Scholze)、皮埃尔·德利涅(Pierre Deligne)、玛丽娜·维亚佐夫斯卡(Maryna Viazovska)、塞德里克·维拉尼(Cédric Villani)以及2026年菲尔兹奖得主邓宇等25人。陶哲轩在个人博客中表示,他很荣幸成为最初签署者之一,并说这份声明源于过去一周数学家之间的讨论。声明同时邀请更多人签名。
数学家担心的不是“AI会不会做题”,而是做题意味着什么
在陶哲轩的说明中,签署者把数学研究描述为一项跨世代积累的工作:数学家不仅要得到结论,还要理解形状、数字和自然现象背后的结构,发展可复用的方法,并通过讲座、讨论和严谨的论文把新思想纳入已有知识体系。
声明认为,著名问题之所以重要,通常不只是因为它们可以被标记为“已解决”,而是因为解决过程往往带来新的洞见和方法。一个结果需要经过同行讨论、简化、解释和教学,才能真正进入数学知识体系,并最终成为后来研究者可以使用的工具。
签署者担心,人工智能公司把这些问题当作排行榜或能力展示的指标后,可能促使研究结果以越来越快的速度被批量生产。声明写道,大量快速出现的“真或假”结论,可能破坏孕育新思想的研究环境;如果解答仓促发布,缺少完整论证、方法提炼和对前人工作的引用,也会引发归属和抄袭问题。
这场争论与AI评测长期存在的解释性问题相呼应。AIFlux此前报道的BenchMIRT基准审计就指出,单一平均分可能混合多种能力信号,不能简单等同于某一种能力。对数学而言,能否生成一个正确答案,也未必等同于是否形成了可解释、可传播和可继续发展的数学理解。
新型数学基准试图解决污染问题,但也改变了研究激励
数学领域近年已经出现多种更接近研究级任务的AI评测。由数学家发起的First Proof项目强调独立、透明地评估AI参与研究数学的能力。项目使用此前没有公开在互联网上出现的问题,并在模型作答前加密答案,以降低训练数据污染带来的影响。其第二批测试还把未发表的研究数学问题组织成正式基准和开放社区评测。
另一项由Epoch AI维护的FrontierMath则收集由数学家创作和审阅的高难度问题,并将研究级开放问题和形式化的厄尔多斯问题纳入评测框架。Epoch AI称,领先模型在传统数学基准上已取得很高分数,但在FrontierMath上的表现仍显示出明显差距。
这些项目说明,数学家并不一定反对用问题测试AI能力。相反,许多人正在参与设计更难、更不容易被训练数据污染的评测。争议的核心在于:当评测结果成为公司展示模型能力、争夺声誉和资本的工具时,数学问题是否会被压缩成脱离研究语境的分数。
声明没有否认AI的潜在价值
《A Severe Misalignment of AI in Mathematics》明确承认,AI有潜力增强并加速真正的数学研究。它可以帮助研究者探索猜想、检查计算、寻找相关结构,或处理数学家不愿意投入大量时间的重复性工作。
但声明认为,AI最终会促进数学,还是产生破坏性影响,取决于开发者、研究机构和社会如何作出治理选择。数学家需要调整职业和研究流程,AI公司也需要对结果的验证、归属、引用和发布方式承担更多责任。
这与科学计算领域正在出现的另一种判断相近:AI代理可以降低代码实现成本,但人类仍需投入大量时间验证结果、处理边界条件并确认研究目标没有被悄悄改变。AIFlux此前在科学计算进入代理时代的报道中也提到,随着生成和实现变得更便宜,验证、责任归属和长期维护可能成为新的瓶颈。
这是一份立场声明,而不是行业共识
尽管签署者包括相当多具有国际影响力的数学家,这份文件仍然是一份由25位菲尔兹奖得主最初签署的立场声明,并不代表所有数学家或AI研究人员的共识,也不是对某一具体模型性能的独立评测。声明本身也承认,发布前没有进行类似《莱顿宣言》那样充分的广泛协商,但签署者认为形势紧迫,需要尽快表达立场。
声明发布之际,围绕AI解决重大数学问题的报道和争论仍在增加。《经济学人》在相关报道中提到,数学家对OpenAI处理相关问题的方法产生不满;但陶哲轩的文章和Math and AI页面主要讨论的是更广泛的研究目标与制度问题,而不是对某一家公司或某一模型作出独立技术裁定。
接下来需要观察的,不只是AI能否解决更多数学难题,还包括这些解答能否经过公开验证,是否清楚说明方法和贡献来源,以及数学共同体能否把有价值的结果纳入可教学、可复用、可继续发展的知识体系。对这25位菲尔兹奖得主而言,真正的问题不是数学应不应该使用AI,而是当AI改变“做数学”的方式时,数学究竟要保留什么。
来源:
- Math and AI:A Severe Misalignment of AI in Mathematics
- Terence Tao:A Severe Misalignment of AI in Mathematics
- First Proof Project
- Epoch AI:FrontierMath
- [The Economist:Top mathematicians are outraged by OpenAI’s methods](https://www.economist.com/science-and-technology/2026/09/11/top-mathematicians-are-outraged-by-openais-