BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年10月08日

注册 / 登录

OpenAI公布722篇数学手稿:AI把算力和人类智力赛跑

如果一个人需要耗费整个博士生涯去攻克一道世界级数学难题,那么一台超级计算机加上几个小时的训练时间就能做到吗?本周,全球最大的AI实验室OpenAI在公开渠道扔出了一颗重磅“深水炸弹”:他们在一个名为“math”的代码托管平台上,一口气公开了722篇由自身前沿大模型自动生成的数学证明手稿。

这组清单不仅包含了让全球数学界为之侧目的重大命题,更附带了一个惊人的执行数据——大多数手稿在模型的“思考”模式下仅用时不到半天。面对这份体量庞大的答卷,外界的第一反应往往是震撼与狂喜,但当我们拨开媒体的喧嚣回到纸面本身,AI究竟是把数学研究的护城河拓宽了,还是仅仅进行了一场昂贵的算力炫耀?

一次“算力堆砌”出的数学狂欢

这次发布的规模令人咋舌。在公开的仓库目录中,总计收录了722篇最终版手稿,它们共同构成了372个结果家族,覆盖了数百个悬而未决的数学命题。

要知道,在传统学术研究体系里,一名顶尖学者花费数年甚至数十年去啃一块硬骨头,最后只拿得出几百行公式的场景比比皆是。而OpenAI的这套系统,在面临大约4000个命题请求时,每一个最终入选的高质量证明结果,平均只消耗了该模型不到3个小时的极高强度推理成本。

这是一个非常反直觉的账本。如果用“时间”来衡量生产力,意味着一套具备超强自然语言理解能力的神经网络,可以在人类专家吃早饭的时间里,产出一份足以冲击专业期刊的研究材料。在这个意义上,AI不是在模拟人类的思考速度,它是在用指数级的算力,对人类线性增长的脑力进行降维打击。

然而,这份成绩单里并不全是完美无瑕的满分答卷。OpenAI自身的Readme文档中罕见地承认:“部分未经过形式化的推导结果可能存在瑕疵。”这意味着,这722篇手稿更像是一个初筛后的粗犷原石池,而非已经打磨抛光可以直接上架的艺术品。

并未真正跨过的“最后一公里”

公众往往会被大标题吓一跳,仿佛AI马上就要宣布“万有理论”或“费马大定理”已经被彻底终结。但深入到具体的数学结论来看,真实的画面远比 headline(新闻标题)复杂得多。

在这些手稿中,最受关注的莫过于对“黎曼ζ函数零自由区域”的理论推导。黎曼猜想被誉为现代数学皇冠上的明珠,它与素数的分布规律紧密相连。虽然目前仍有大量数学家未能在实部等于1/2的整条临界线上完成终极闭环,但此次OpenAI的模型成功将已知无零点区域的边界进一步向内收缩(据开源资料显示推至实部大于11/12的区域)。这种物理意义上的空间压缩,虽然在宏观上不算完全“通关”,但在微积分的深邃迷宫里,每往前挪动一寸都是实打实的台阶。

此外,在被称为千禧年大奖难题之一的“Hodge猜想”领域,模型也给出了具有启发意义的答案。尽管它证明的是该命题在特殊复乘(CM)阿贝尔簇条件下的一个特定子集,而非全貌,但对于专门从事该分支的研究员来说,这些AI给出的线索完全可以转化为下一步的人工突破支点。

值得注意的是,这些证明并不是写在黑板上让人一眼看穿的几何直觉,而是需要通过极其严格的编译器检验。目前,OpenAI仅为其配套提供了部分 Lean 码库供对照验证。正如一位参与评测的程序员所言,能把文字转写成能被机器确认无误运行的代码,本身就是一道横亘在“常识理解”与“绝对真理”之间的鸿沟。

高昂试错背后的商业野心

当我们将目光从纯粹的学术殿堂移向现实世界,OpenAI此举的另一层深意便浮出水面:这是一种针对高智商行业的暴力破局。

长久以来,金融市场中的量化对冲基金、大型律师事务所的合规则检部门,以及审计公司的财务校验环节,都在承受着巨大的人力压力。因为这些行业本质上是由海量的逻辑链条、条文比对和风险排查构成的——而这恰恰是大模型最擅长的“强逻辑推理”赛道。

虽然目前我们看到的722份手稿还挂在GitHub的仓库里供人免费查阅,但这更像是企业展示其核心技术壁垒的“橱窗产品”。通过向社会证明自家模型在处理超深度长文本逻辑推演时的极限能力,OpenAI实际上是在为自己的商业护城河添砖加瓦。一旦这种自动化定理由学术圈溢出进入金融和法律服务市场,它将意味着巨大的成本重构:原本需要数十名顶尖分析师团队耗时一周的工作,可能只需要一个部署在服务器上的API接口即可瞬间完成。

谁受益?当然是那些率先掌握并使用高阶逻辑AI工具的专业机构;谁承压?则是传统的、靠信息不对称和基础脑力劳动来获取超额利润的中低端专业服务市场。

未来观察的几个刻度

AI是否会像当年的AlphaGo颠覆围棋界一样,颠覆现有的科学研究范式?要回答这个问题,不必急于下注,我们可以关注以下三个核心指标的演变:

第一,同行评审的接纳率。在接下来的6到12个月内,这722篇手稿中会有多少篇被《Annals of Mathematics》等传统顶刊正式接收?这是判定AI证明是否具有学术合法性的第一道硬门槛。

第二,形式化验证的转化率。目前仅有一部分实现了Lean语言的编译通关。随着验证工具的升级,那些起初因为微小疏漏被淘汰的手稿,是否能够被二次召回?这将反映出AI生成内容的容错修复能力。

第三,垂类场景的付费渗透度。除了炫技,我们需要看到诸如高频量化交易、知识产权纠纷判定等领域中,基于此类底层强化逻辑引擎的B端订阅服务是否有实质性的收入爆发。只有真金白银的买单,才能印证这场数学狂欢是否真正完成了商业闭环。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。