AI数学的最后一道高墙塌了:FrontierMath Tier 4从”几十年解不出”到被GPT-6 Astra刷穿仅用了一年零两个月

AI数学的最后一道高墙塌了:FrontierMath Tier 4从”几十年解不出”到被GPT-6 Astra刷穿仅用了一年零两个月

2025年7月,Epoch AI推出FrontierMath Tier 4时,所有模型加起来只解出了50道题中的3道。官网上赫然写着:”其中一些题,可能几十年都不会被AI解决。” 2026年9月,GPT-6 Astra拿到了97.6%,最后一道从未被解出的题也被攻破了。Epoch AI正式宣告:Tier 4,饱和了。

一年零两个月。从3道到全部43道(修正后的v2版本)。这不是”爬到了山顶”,而是”把山铲平了”。

FrontMath Tier 4到底有多难?

先理解一下这个基准测试的定位。

FrontierMath是Epoch AI构建的研究级数学测试套件,从Tier 1到Tier 4难度递增。前几层覆盖本科生到研究生水平的数学。但Tier 4不同——它是专门为最强模型加出来的。

每道题大多由数学教授和博士后设计,围绕自己的研究方向花数周思考,再把研究成果压缩成一道可以被自动验证的题目。覆盖范围包括分析、数论、组合数学、拓扑、代数几何——数学的每个角落。

在发布之初的前几个月里,所有顶级模型的累计成绩加在一起,也只解出了3道题。有些解答还依赖了一些”正确但没有被充分论证的假设”。

当时Epoch AI的预判是:这几道难题中的一部分,可能几十年都不会被AI触碰到。

现在回头看,这个判断只保守了一年零两个月。

97.6%之后,速度还在加快

看看这个演变有多快:

2025年7月:最高成绩约5% – 前GPT-6 Astra时代(GPT-5.6 Sol等):83% – Claude Fable 5:90.2% – 2026年9月,GPT-6 Astra:97.6%——还补上了此前唯一从未被AI解出的题

出题人马凯特大学数学副教授Jay Pantone在验证了Astra的解答后说:”以往AI都会找数值捷径来绕过真正的推理,但这一次,AI的解法和自己相当接近。”

这句话比任何分数都更能说明问题。一年前AI还在靠”取巧”和”猜捷径”应付数学题,现在已经能走通数学家认可的推理路径了。

当然,出题人说的是”相当接近”,不是”完全一致”。这说明Astra的解法和Pantone的解法不是同一套——AI找到了另一条人类数学家没想到的路。这在数学里是常有的事,但以前这通常发生在数学家之间。

修正的门槛:题库本身也需要”进化”

OpenAI在测试过程中发现了一个意想不到的问题:FrontierMath题库本身也存在错误。

Epoch随后启动了独立审计——先用GPT-5.5和Claude Opus 4.7做自动筛查疑点,再交给数学家逐题复核。这个过程本身就很有趣:用AI去检查AI题的命题质量。

最终在2026年6月推出的v2版本中,Tier 4修正了12道题、移除了7道题,留下43题。

修正后模型的成绩反而更真实了,而且一路往上冲得更猛。

今天还有第二个炸弹:霍奇猜想

如果FrontierMath Tier 4的攻破还不够震撼,量子位今天还发了另一条消息——”OpenAI这是拿千禧年难题当Benchmark刷啊,最新爆料直指霍奇猜想。”

霍奇猜想,千禧年七大数学难题之一。纳维-斯托克斯方程(已被Bel攻克)、庞加莱猜想(已解)、霍奇猜想……也就是说,OpenAI可能已经在攻克第三个千禧年难题了

等一等,让我确认一下时间线:9月7日有报道说OpenAI Bel攻克了N-S方程,9月11日又爆料霍奇猜想。中间隔了四天。如果这是真的,意味着OpenAI的模型线正在以”每周一个千禧年难题”的速度刷题。

量子位的文章描述很克制:”最新爆料直指霍奇猜想”——但没说是谁爆料、证据是什么。这可能是OpenAI内部消息走漏,也可能是社交媒体上的研究者猜测。不过结合FME(5道Erdős问题满分)、孪生素数246→186、N-S方程100页证明、FrontierMath Tier 4全刷穿这一连串事件来看,霍奇猜想被AI攻破已经不再是”会不会发生”的问题,而是”什么时候公布”的问题。

我的判断:FrontierMath已经不够用了

Epoch AI自己也意识到了这个问题。

他们现在把FrontierMath分成了多个层级:Tier 1-4用于常规评测、Tier 4已经饱和,接下来是Open Problems(真正未被解决的数学研究问题)和FrontierMath Erdős(把Erdős开放问题形式化进Lean,要求AI写出通过形式化验证的完整证明)。

换句话说,评测本身正在被AI的进步逼着进化

一年前,”可能几十年都不会被AI解决”的题,一年后被刷穿了。那么”Open Problems”和”Erdős形式化证明”对GPT-6 Astra来说能撑多久?半年?三个月?

再往前推一步:如果AI能以”每周一个千禧年难题”的速度解决人类悬而未决了几十年的数学问题,那么”数学被AI解决了”这句从前听起来像科幻小说的话,可能真的要在2026年变成一句不需要打引号的陈述了。

但别忘了Jay Pantone那句话的最后几个字——”相当接近”。

接近不是完全相同。AI能走通数学家认可的推理路径,不代表它真正”理解”了数学。FrontierMath饱和了,但霍奇猜想、黎曼猜想、P vs NP这些千禧年硬骨头还在那里。AI刷穿了AI的考场,但数学家的考场,可能才刚刚开始。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注