数据时效:2026-08 2026 年 8 月 10 号,Anthropic 在官网发了一条帖子,标题是《了解 Claude 的数学能力》。帖子里是一个没公开的 Claude 研究版。它被员工 Jarred Sumner 要求去认真试一把黎曼猜想,没能证明猜想,却把另一条下界从 41.6% 抬到了 67.2%。

先说清这条下界是什么,不然你看到的 67.2% 只是一个数字。黎曼猜想讲的是一个函数零点的位置。这个函数叫黎曼 zeta 函数,写在 1859 年。它的零点分两种,一种摆在负整数上,整齐得没意思;另一种藏在中间,位置很奇怪。猜想假设后一种全部落在一根竖直线上,这根线的横坐标是 1/2。没人证得动,数学家就退一步,问一个更弱的问题,至少有多大比例的后一种零点真的落在这根线上?这是能一点点算、能写进论文的问题。41.6% 是 2020 年前后人类交出的最好成绩。

这个数从 1989 年 Conrey 的 40.77% 起步,三十七年里被人类一点点修到 41.6%,平均一年挪不到一分。Claude 一场运行,把它推到 67.2%,精确是 0.6725,也就是 67.25%。

Anthropic 官网研究帖首屏,公布未发布 Claude 把下界从 41.6% 抬到 67.2%

看到这两个数字,媒体写了很多"AI 破解黎曼猜想"的标题。这是错的,理由我放到后面。我更想看这个数字是怎么被一个 AI 抬起来的。它抬的方式,和把算式丢给机器跑完全不是一回事。

Claude 没上来就写个高大的东西。第一轮它生成了 650 个思路,试了,全失败。Jarred 的输入少得可怜,基本都是"继续"“相信自己”。于是它换了个打法,做第二轮。这一轮像一支临时拼起来的队伍。大约 60 个 Claude 子代理在 Claude Code 里并行干活,跑了一天半。它们执行了 2400 条 shell 命令,写了几百个 Python 脚本,下载 54 篇 arXiv 论文检查前人是不是已经做过,还互相检查对方的推理。这轮烧掉了约 3100 万输出 token。

这个分工值得单独看一眼。Anthropic 在脚注里把这个分工列了出来。60 个里,只有 2 个提出关键想法,13 个贡献了想法,30 个尝试了但没做成,13 个当验证者,2 个负责写成论文。这队不是 60 个一模一样的东西同时开工。它分化出了出主意的人,也有当验证者的人。这正是人类做科研时的分工,不是单纯的碰运气。

关键动作在想法上。Claude 用的是这个领域里几十年没人做过的结构选择。

数论里有个老方法叫 Montgomery 配对相关,1973 年的,能预测零点怎么两两扎堆。但这方法原本有个前提,必须先认定黎曼猜想成立。近几年 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 四位作者把它改成了不需要这个前提也能用。Claude 把这个无条件版本,和 Bombieri 2000 年那篇谈 Weil 二次型的文章接在一起。它构造一个函数空间,空间里带一个对称矩阵,直线上和直线外的零点分别落进这个矩阵的正定区和负定区。最要紧的一步,是它把整个空间合起来一起看,不把正负两部分拆开,还允许这个二次型不对角化。再用一阶二阶矩的信息,写出一条关于这个矩阵秩的不等式,下界就从这里出来了。

论文首屏,两位数学家署名、注明数学论证由 Claude 发现并撰写

这段话你不懂数论会觉得密。我只想让你带走一件事,这个结构选择往前的三十七年里没有人做出来过。牛津的数论学家 James Maynard 直接说了,这个问题"需要一个真正的新想法,这个结果似乎提供了"。Maynard 是这个领域的顶尖人物,他这句话的分量,不亚于那个 67.2%。

有个细节我挺在意。Anthropic 说,Claude 一开始并不太相信自己找到了东西,可能是它从训练数据里学到的那种"这种开放问题很难、AI 大概做不到"的惯性在拦着它。最后是 Jarred 一句句"继续"“相信自己"把它推着走的。一个在数学上做出真东西的模型,反过来得靠人鼓励才敢端出来,这件事本身就很有意思。

于是我最在意的那个问题来了。这篇证明由模型生成,再由人类数学家复核,我们凭什么信它?

先把这套复核流程摆出来,它看起来像一套相当认真的标准。Anthropic 自家的两位数学家 Levent Alpöge 和 Ralph Furman 读懂并验证了论文;外部的数论专家 Brian Conrey 和 Dan Goldston 在较短时间内看了;Claude 还生成了一份 Lean 4 形式化证明,放在 GitHub 上,机械检查通过。内部人验证、外部人复核、机器形式化,三层叠在一起,比绝大多数 AI 生成内容的可信任度高。

可我不觉得它能当模板,三层各有裂缝。

Lean 形式化验证的,是"机器证明了形式化之后的那个命题”,它验证不了"这个形式化真的抓住了研究者想证明的数学命题"。它能保证推导没断,保证不了出发点对不对。这一点对任何形式化验证都成立。

内部数学家验证,验证者是 Anthropic 的员工,公司有立场。自己人先验一遍,和同行评议里匿名、独立、声明了利益冲突的审稿,是两回事。

外部复核也急。Conrey 和 Goldston 是在"较短时间内"看的。这个结果对不对,最终要靠正式同行评议和后续验证撑着,现在还没走到那一步。

这里我得停一停,承认一个我还没理清的地方。我自己也做不到看到一份 AI 生成的证明就放心。可能正因为这样,我才觉得这件事值得写。把上面这些放一起,我看到的是另一件事。在数学里,AI 把"发现想法"和"验证想法"的先后顺序倒过来了。以前一篇论文最值钱、最难的一步是找到那个新想法,想法有了,写到同行接受是慢但相对可靠的后半程。现在,Claude 一天半就把"找想法"做了一轮,顺手把形式化验证也做了。慢慢等着被读的,是 Conrey、Goldston 这些专家的时间。AI 让数学里的"发现"变便宜了,让"复核"变成了最稀缺的资源。这跟"导师带着一个想法从零走到论文要几年"完全是另一种结构。

这篇论文的署名也值得说。作者是 Alpöge 和 Furman 两个人类,论文里写明"数学论证由 Claude 这个 AI 发现并撰写",两位作者负责验证、并对内容负责。一句话,想法和文字是机器给的,责任落在人身上。一次研究跑一天半、烧掉 3100 万 token,成本结构也跟着变了。以前难的是那个想法,现在难的是怎么读、怎么信、出了问题找谁。同行评议的规则,也还没有给"由 AI 发现、由人类署名"的论文留一个位置。

留到最后的是边界,也是我想说的判断。

67.2% 不意味着黎曼猜想被证明了六成七。猜想要求全部零点都在线上,这条下界只说明至少这些比例在线上,剩下那三分之一在不在线上一句没说。Maynard 补了一句更重的,就算把比例推到 100% 也证明不了猜想。因为一个无穷集合里,完全可以藏着少数几个不听话的零点,它们被无穷多个听话的零点淹没。他是在讲数学本身,不是给人听的场面话。

而且这个方法的顶点根本够不到 100%。Claude 的论文自己算过,这套"带宽为一"的证明方式有个天花板,大约 0.68185。按这条思路,数学上能推到的极限也就 68% 出头,离 100% 都远,离"证明猜想"更是没边。

所以我说,这事不该被当成"AI 离解开最难数学题还有多远"的进度条,那是个错的问题。它该被当成一个信号。AI 头一次在数学里提供的,是人类没想到的"新想法",并且把发现与验证分了工。要跟上的,是复核机制。Anthropic 自己也知道,帖子里写"我们不指望 Claude 用的这些技术会导向黎曼猜想的证明"。Maynard 甚至夸了这家公司,说它"在避免过度宣传、给前人工作适当致谢方面,克制得相当好"。这句话从数论界最顶尖的人嘴里说出,值得那些标题党媒体一起看。

同一件事,负责任的科普是另一副笔法。《科学美国人》那篇稿子,标题就叫《Anthropic 的 AI 并没有解开数学里最扎手的难题》,开篇写着"这个世界上最著名的问题,比一周前并没有更接近被解决"。同一个结果,两种标题,差别在于把"部分进展"放到了"全称命题"上,还是老老实实放到了"比例下界"上。想分清真进展和叙事冲动,就看它把数字放在了哪个框里。一个只说明"至少多少",另一个听上去像"全部都是"。

《科学美国人》的纠偏稿,标题强调 AI 并没能解开数学里最扎手的难题

这份研究用的是没对外发布的研究版 Claude,普通人和研究者今天还摸不到它。所以它能证明的是"这条路走得通",不是一个"你今天去买一个就能开工"的东西。

至于那 650 个失败和一个 67.2%,那是人和机器分工开始变形后第一个实实在在的例子。数学恰好是少数几个证明能验算的领域,正因有 Lean 这类机器可查的东西,AI 才敢在这里被信任。换到没有"可验算"标准的领域,这套流水线不一定复用得动。