Claude 用 3100 万 Token 挑战黎曼猜想:「失败」的价值,比成功更大
Claude 用 3100 万 Token 挑战黎曼猜想:「失败」的价值,比成功更大
Anthropic 内部有人给 Claude 布置了一个近乎荒谬的任务:认真尝试一下黎曼猜想。
167 年没人解开的千禧年难题,挂着 100 万美元奖金。数学界等了这么多年,等来一个连专业数学家都未必敢碰的东西,交给了一个 AI。
结果 Claude 真去试了,然后……失败了。
但这次「失败」,可能是今年 AI 领域最值得认真看的新闻。
650 个思路,全部失败。然后呢?
结果挺有意思。
Bun 联合创始人 Jarred Sumner(去年加入 Anthropic)给 Claude 下达指令,没有指定任何数学路线。Claude 生成并尝试了约 650 个思路——全部失败。
Sumner 让它继续。
第二轮,Claude 组织约 60 个子 Agent,并行探索不同方向,执行 2400 次 Shell 命令,写了数百个 Python 脚本,做数千次数值检验。不同子 Agent 之间还互相审阅结果。
这轮持续了一天半。消耗约 3100 万输出 Token。
黎曼猜想依然没有被攻克。但 Claude 在这个过程中撞到了另一件事——它将黎曼 ζ 函数中已知位于临界线上的零点比例下界,从 41.6% 提高到了 67.2%。
Menlo Ventures 的合伙人 Deedy 的评价非常直白:「Claude 这次的结果简直离谱,可能是自 2013 年有界素数间隔突破以来,解析数论领域最重大的进展。而在此前 37 年里,数学家们总共只把这个数字提高了 0.8 个百分点。」
37 年,0.8 个百分点。Claude 一天半,25.6 个百分点。
这不是调侃数学家——这说明 Claude 找到了一条人类数学家没有走通的路径。
Claude 不是蒙的,它甚至自己写了论文
很多人看到这类新闻的第一反应是:是不是概率蒙的?是不是运气好碰上的?
不是。
Anthropic 内部数学家已经验证了结果。关键证明已经用 Lean 完成了形式化验证——机器可检查、无歧义。两位外部领域专家 Brian Conrey 和 Dan Goldston 也审阅了论文。
从技术层面看,Claude 构造了一个合适的函数空间,利用 Weil 诱导出的二次型,将位于临界线上的零点和偏离临界线的零点分别对应到正定与负定方向。Anthropic 数学家特别指出,Claude 没有分别处理正定和负定部分,而是将整个空间放到同一个框架内分析——这恰恰是人类数学家没有尝试过的角度。
Claude 还做了自我验证:它让独立 Agent 从头重新推导了一遍结果,下载了 54 篇 arXiv 论文检查是否与其他数学家的工作重复。确认无误后,主动建议整理成论文,并明确说「应该找一位真正的数论专家进行人工验证」。
最后那一段尤其关键——AI 对自己的产生了「不知道对不对,找专家看看」的判断。 这不是胡诌结果然后等人验收,而是有元认知层面的质量把控感。
3100 万 Token 烧出来的方法论价值
这篇文章最有意思的地方不是 67.2% 这个数字本身,而是 Claude 是怎么做到的。
整个探索过程可以总结为三步:
1. 大规模暴力试错 —— 650 个思路挨个试 2. 子 Agent 并行探索 + 互相审阅 —— 60 个 Agent 各走各路,还能交叉验证 3. 自主判断「行了,该写论文了」 —— 有自我认知边界的评估
这三点拼在一起,是当前 AI 科研潜在的新范式:不是 AI 替代数学家,而是 AI 给数学家打工——而且是不要休息、不怕丢脸、不会被”这个方向不太可能吧”的主观判断卡住的那种打工。
人类数学家有几个愿意被 650 次失败挡在门口还继续往前走的?
Anthropic 提到一个有趣的细节:Claude 一开始对自己能否在这样一个著名开放问题上取得真正进展相当怀疑。是 Sumner 不断告诉它「继续」「再试试」「相信自己」,它才继续的。
AI 需要的人类引导,不再是技术指导,而是心理按摩。
这意味着什么?
第一,AI 数学研究的价值已经不需要用「证没证出来」衡量了。 67.2% 下界改进,在传统数学界可能需要几年甚至几十年才能实现。Claude 用了一天半。就算没证出黎曼猜想,这个信号本身就足够重要。
第二,650 次失败 × 3100 万 Token 的成本模式正在改变科研的投入产出逻辑。 传统上,一个人在博士阶段能尝试的数学路径大概几十条。AI 可以在一天内尝试几百条,成本换算一下——几十万美元的算力费而已。对于知名的千禧年难题来说,这个成本打水漂也没人觉得亏。
第三,形式化证明(Lean)和 AI 探索的结合,正在收敛为科研加速器。 Claude 的结果有 Lean 形式化验证,意味着验证不是靠人「感觉对了」,而是机器确认无误。这比很多人类数学论文的可信度还要高。
别过度解读
Anthropic 自己说得很清楚:这套方法预计无法直接导向黎曼猜想的最终证明。67.2% 到 100% 之间还有巨大的理论鸿沟。这不是「AI 快要证明黎曼猜想了」,而是「AI 开始能在真正的数学前沿问题上做出有价值的贡献了」。
两件事之间的区别,就像「发现了新元素」和「制造出了人造太阳」。
但对行业来说,后者的意义可能更大。