前沿热点
前沿热点

OpenAI Astra 解十道数学悬案,Lean 证明开源可验证

2026-08-01 OpenAI 官宣:内部版 Astra(下一代主力模型,未公开)为 10 个至少悬置十年的数学/理论计算机开放问题给出新结果,覆盖高维几何、群论、格密码等 8 领域,算力成本约 2000 美元。每个证明形式化为 Lean 证书、开源在 github.com/openai/ten-proofs 可机器验证。对比 2025-10 Kevin Weil「GPT-5 解 10 Erdős」被 Thomas Bloom 打脸翻车--这次靠 Lean 可验证翻盘。

发布于 2026年8月4日4 分钟阅读
<!-- openai-astra-math-hotspot | hotspot | OpenAI Astra 解十道数学悬案,Lean 证明开源可验证 -->

8 月 1 日,OpenAI 在官方博客丢出一条不算常规的发布:内部版 Astra--它下一代主力模型--为 10 个至少悬置十年(多数更久)的开放数学/理论计算机问题给出了新结果。不是发推文声称,是把每个证明用 Lean 形式化、开源在 GitHub 上让全世界跑一遍。

发生了什么:10 道悬题,约 2000 美元算力

这 10 个问题覆盖高维几何、编码论、算术电路复杂性、群论、算子代数、量子复杂性、格密码、极值组合--纯数学和理论计算机的硬骨头。举几个:高维球堆积(把密度上界推进到 Cohn–Elkies 阈值)、非 sofic 群的存在性构造(群论一个中心开放问题)、Connes 刚度猜想的证伪。

OpenAI 说,找到这些解所消耗的 token 总量,按 Sol API 费率折算约 2000 美元。论证先由人配合模型整理成手稿,再由模型把每个论证形式化为 Lean 证书。Lean 是一个证明助手--它不关心你说得像不像对,只认能否机器验证。OpenAI 把 10 个 Lean 证书开源在 github.com/openai/ten-proofs,同时放出论文和模型的推理过程 walkthrough。

为什么这次值得信:从「嘴上说说」到「机器可验证」

这是关键。去年 10 月,OpenAI 时任 VP Kevin Weil 在 X 发帖称 GPT-5「解了 10 个 Erdős 问题」。几天内被数学家 Thomas Bloom(erdosproblems.com 维护者)公开打脸,称其为「dramatic misrepresentation」--GPT-5 只是找到了已有的参考文献,并非自己解出。TechCrunch 当时以「OpenAI's embarrassing math」报道。

今年 5 月,OpenAI 用未公开模型真正证伪了 Erdős 单位距离猜想(悬置近 80 年),这次是真的,Thomas Bloom 本人参与了后续论文。到 8 月这 10 题,OpenAI 干脆把证明形式化成 Lean、开源--你不必信厂商的话,自己 clone 仓库跑一遍 Lean 就行。从「声称」到「可验证」,是 AI 做数学的信任基建变了。

Astra 是谁:未公开的下一代主力

OpenAI 在博客里称 Astra 是「our next major model」。它还没公开发布,这次等于提前秀肌肉--用「能解开放数学题」来给下一代模型立标。对普通用户来说,Astra 暂时摸不到;对行业来说,这是一个信号:前沿模型开始把「长程推理 + 可验证产出」当成核心卖点,而不是单纯刷跑分。

看法

真正值得盯的不是「AI 解了数学题」这个标题,是「证明开源、机器可验证」这个做法。它把 AI 数学发现的公信力从「信不信厂商」转移到了「跑不跑得通」。当然,这 10 个结果的纯数学价值、模型是否真正「理解」而非搜索加形式化,仍需各自领域的同行评议--Lean 验证的是证明逻辑自洽,不等于问题的重要性或最优解。

但方向是对的。当 AI 的产出可以被独立验证,关于「AI 能不能做数学」的争论就从哲学变成了工程。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-04

常见问题

Astra 是什么模型?
Astra 是 OpenAI 的下一代主力模型(next major model),目前仍为内部未公开版本。本次用「内部版 Astra」解 10 道开放数学题,相当于在正式发布前提前展示其长程推理能力。
为什么这次数学突破值得信?
OpenAI 把 10 个证明形式化为 Lean 证书并开源在 github.com/openai/ten-proofs,任何人都能机器验证。这区别于 2025 年 10 月 Kevin Weil 口头声称「GPT-5 解了 10 个 Erdős 问题」、几天内被数学家 Thomas Bloom 打脸为「严重误导」的翻车--Lean 可验证让公信力从「信厂商」变成「跑得通」。
这 10 道题成本多少?
OpenAI 称找到这些解所消耗的 token 总量按 Sol API 费率折算约 2000 美元。论证先由人配合模型整理成手稿,再由模型形式化为 Lean 证书,同时发布论文与推理过程 walkthrough。

相关文章