OpenAI 成立数学与人工智能顾问组:AI 攻下百余个数学开放问题之后
事件概述
OpenAI 于 2026 年 9 月 21 日发布公告,宣布正在与一个独立的「数学与人工智能顾问组」(Advisory Group on Mathematics and Artificial Intelligence)合作,用于指导新兴 AI 成果的评审与对外沟通。
公告披露了一项颇为引人注目的进展:OpenAI 称其于 8 月 28 日开始训练一个新的内部模型,该模型除了解决纳维–斯托克斯方程(Navier–Stokes)千禧年大奖难题之外,目前已解决数学大多数领域中超过 100 个长期悬而未决的开放问题。OpenAI 表示,这一进展速度令其内部数学家感到意外,并由此引发了关于如何以最佳方式告知学界、以便整个领域做好准备并适应变化的内部讨论。
需要强调的是,以上均为 OpenAI 单方面的说法。原文未说明该内部模型的具体名称、架构、参数规模,也未说明这些「解决」结果是否经过形式化验证或同行评审,原文同样未给出被解决问题的清单。
顾问组的定位与机制
公告提到,数学家们近期在一封题为《A Severe Misalignment of AI in Mathematics》的公开信中,对「以解决开放问题作为新 AI 系统基准」所带来的负面外部性表达了担忧。OpenAI 将这类批评视为 AI 公司与数学界需要认真沟通的信号,因此支持数学家们组建了这个独立顾问组。
根据公告,该顾问组将:
- 作为连接数学界与更广泛公众的桥梁,让数学家在相关决策中拥有发言权;
- 协助 OpenAI 评估新兴成果的重要性,就成果发布节奏的协调提供建议,并就数学研究的学术与职业标准提供建议;
- 就 OpenAI 的工具如何支持数学研究与学习提供建议。
在独立性方面,公告给出了几条明确约束:顾问组独立于 OpenAI 运作;有权提出 OpenAI 未主动征询的建议、评论 OpenAI 对数学领域的影响,并可公开其建议;成员不领取 OpenAI 的报酬;顾问组可自行调整成员构成。
一个关键的边界是:顾问组不负责就 OpenAI 内部数学进展的推进节奏提供建议。OpenAI 表示,与该组的合作只是第一步,未来在「AI 如何支持数学理解」以及「这些能力的好处如何惠及更广泛社区」上仍有难题待解。
初始成员名单
顾问组由高等研究院(Institute for Advanced Study, IAS)托管,初始成员包括:
- François Charles(ENS-PSL)
- Camillo De Lellis(IAS, GSSI)
- Timothy Gowers(法兰西公学院、剑桥大学)
- Martin Hairer(EPFL、帝国理工学院)
- Nikhil Srivastava(伯克利、西蒙斯研究所)
- Ulrike Tillmann(牛津大学、INI)
- Ravi Vakil(斯坦福大学)
- Edward Witten(IAS)
- Melanie Matchett Wood(哈佛大学)
从名单看,涵盖了偏微分方程、代数几何、拓扑、数论与数学物理等方向的知名学者,其中不乏菲尔兹奖级别的研究者。
对数据科学与 AI Agent 落地的意义
第一,数学正在从「评测集」变成「能力展示场」。 公开信的核心担忧正在于此:当开放数学问题被当作新模型的刷分基准,问题本身可能被消耗掉、其结果的可信度也可能被稀释。对做模型评估的团队而言,这是一个提醒——高难度、可自动验证的任务域既是理想的评测信号,也是最容易被滥用的信号。
第二,可验证性带来的闭环优势。 数学问题的特殊之处在于答案原则上可被严格验证,这使得它天然适合作为 Agent 的推理训练与自我检验环境。如果 AI 系统真能在数学上稳定产出正确结果,其方法论很可能迁移到代码生成、形式化验证、科学计算等同样要求高可靠性的 Agent 场景。不过原文未说明这一内部模型是否具备可交互的工具使用或形式化证明能力。
第三,治理机制的工程化。 公告给出的机制设计——独立运作、成员无薪酬、可公开异议、可自行改组、且明确不介入内部研发节奏——本质上是在为一个高风险能力域建立外部的「评审委员会 + 沟通通道」。对任何准备部署高能力 Agent 的组织来说,这都是一个值得参照的模板:把外部专家嵌进流程,但明确其权力边界。
我的技术点评
这份公告最值得关注的地方,其实不是「解决了 100 多个数学问题」这一声明本身,而是它与公开信之间的因果关系:是数学界的批评,而不是模型的能力,催生了这个顾问组。
从技术角度看,公告的信息密度偏低。原文未说明模型对问题的「解决」如何定义——是给出了正确证明、是形式上验证通过的证明,还是被领域专家判断为有希望的方向?这三者的可信度差异是数量级的。同样,原文未说明是否有独立的第三方复现或形式化验证流程,而这恰恰是数学界衡量新结果的标准做法。在这种信息缺位下,顾问组的「评估与沟通」职能就显得格外关键:它实际上是在填补一份官方公告与学术可信度之间的空隙。
机制设计上也有一个耐人寻味的张力:顾问组可以对影响、标准、传播方式发言,却被明确排除在「研发节奏」的决策之外。这意味着该组更像是一个解释器与风险提示者,而不是刹车。对于一项 OpenAI 自己都说「进展速度超出预期」的能力,这种安排是否足够,可能需要时间来回答。
从更长的周期看,如果 AI 在数学上的产出持续加速,真正稀缺的资源将从「解题能力」转向「验证能力」与「理解能力」。谁能建立起可信、可扩展的数学结果验证流水线——无论是形式化证明助手,还是人机协同的评审流程——谁就掌握了让这些成果真正进入科学共同体的钥匙。顾问组的成立是这一步的开始,但公告本身并未给出任何关于验证基础设施的信息,这部分原文未说明,值得后续持续跟踪。
原文链接
- OpenAI News:Advisory Group on Mathematics and Artificial Intelligence
https://openai.com/index/advisory-group-on-mathematics-and-ai
