OpenAI Astra 是什么?2,000 美元的数学突破详解
Aug 5, 2026

OpenAI Astra 是什么?2,000 美元的数学突破详解

OpenAI Astra 详解:十个新数学成果与约 2,000 美元 token 消耗背后、尚未发布的下一代模型。证明、Lean 证书及其意义。

你看到了那条标题:"OpenAI 的 Astra 花 $2,000 解决了 10 个开放数学问题。"然后你大概有两种冲突的反应——要么这是自推理模型以来 AI 领域最大的事,要么这是一个披着 Lean 语法的营销数字。这两种反应之间的差距,正是这篇文章要弥合的。

一句话说清现状。2026 年 8 月 1 日,OpenAI 公布了数学与理论计算机科学领域的十项新成果,将其归功于 Astra 的一个内部版本——它下一代、尚未发布的主要模型——估计按 Sol API 费率计算的总 token 成本约为 $2,000,并把每个证明都以机器可检查的 Lean 4 证书形式发布在 GitHub 上。这就是事件本身。大多数报道没有做的是:解释这十项成果到底意味着什么、为什么 $2,000 这个数字重要(以及它漏掉了什么)、以及在你自己的验证流程变成人类同行评审之前,机器检查的证明能走多远。这篇文章做这些事。

可信度说明:下面的一切都基于 OpenAI 的官方公告和论文、公开的 openai/ten-proofs 仓库、OpenAI 的 GPT-5.6 页面,以及 Yahoo Tech 等一手报道,截至 2026 年 8 月 5 日交叉核对。Astra 本身尚未发布,这些成果也未经同行评审;在数学界表态之前,请把时间线和能力声明当作 OpenAI 自己的说法。

OpenAI Astra 是什么?

OpenAI Astra 是 OpenAI 的下一代主要模型家族,截至撰写本文时尚未公开发布。新闻里的每一条声明都关于 OpenAI 在开发中用来评估模型的 Astra 内部版本——与 5 月份那次用 AI 反驳 Erdős 单位距离猜想的是同一个评估闭环。

有两件事容易混淆,先把它们分开:

  • Astra 还不是产品。 ChatGPT 模型选择器里没有它,没有 API 端点,OpenAI 也没有承诺任何发布日期。它是当前 GPT-5 家族进行中的继任者。
  • 证明是公开的,模型不是。 OpenAI 发布了成果、Lean 证书和推理过程讲解,但明确没有发布模型权重或公开预览。

这个不对称——证据公开、模型封闭——是任何读报道的人最重要的单条事实。它意味着数学今天任何人都能检查,而能力声明在模型发布、独立基准出现之前,只能倚仗 OpenAI 自己的话。

$2,000 的 token 运行:为什么这个数字重要

OpenAI 的确切措辞很重要,因为"花 $2,000 解决数学问题"并不是字面上发生的事:

找到这些问题的解所需的总 token 数,按 Sol API 费率计算大约要花 $2,000。

要拆解三个部分:

这是 token 成本换算,不是研究预算。 OpenAI 并没有花掉 $2,000。公司的意思是:如果你按它当前推理模型的零售 API 价格GPT-5.6 Sol 买下这些解消耗的原始 token,账单约为 $2,000。这是一种传达推理有多便宜的方式——不是 OpenAI 付出去的一笔开销。

便宜才是真正的主标题。 十个开放了十年或更久的问题,用大约一台像样笔记本电脑的价格总量解决,这才是值得品味的事。几年前,前沿数学进展以研究员年和昂贵的超级计算机机时来衡量。Astra 的运行把这种经济学颠倒了:一个新数学思想的边际成本崩塌成了一次长 API 调用的价格。

它是真实成本的下限,不是全貌。 $2,000 排除了开发和训练 Astra 的成本、把原始模型输出整理成 249 页手稿的人类研究员、Lean 里的形式化工作,以及产出这些论证的内部版本背后的算力。这个数字是推理成本的地板,不是总成本。当有人把它引为"一杯咖啡钱的研究"时,记住这一点。

经验法则:$2,000 这个数字对推理成本是诚实的,对除此之外的一切保持沉默。 把它当作运行有多便宜的证据,而不是这项成就的完整经济学。

十项成果,大白话解读

以下是 OpenAI 发布时的完整列表,附每项成果的通俗解读。大多数报道到这里只停在名字上;这张表的意义是让每一项都能被理解。

#领域一句话概括成果之前开放的是什么
1高维球堆积高维空间中相同球体可堆积密度的新上界,直抵 Cohn–Elkies 阈值几十年来,最佳上界悬在 Cohn–Elkies 设定的理论下限之上;Astra 的界达到了那个下限
2二元码与球面码任意最小距离下二元纠错码最大规模的指数级更强上界(外加球面码)码规模上界从未整体推进一个指数因子
3非 sofic 群构造了一个非 sofic 群——一个无法被有限置换群逼近的群自 Gromov 于 1999 年引入 sofic 性以来,这类群是否存在一直是开放问题
4Connes 刚性猜想一个反例:某些群并不能被其 von Neumann 代数唯一确定算子代数领域的长期猜想,争议了几十年
5算术电路复杂度计算 permanent 的新下界,包括 n⁴/log n 阶的公式下界n³ 类壁垒多年来阻挡着进展
6量子并行重复一般双人量子博弈的指数级并行重复定理经典复杂度的基础性结果,却一直没有一般量子版本
7最近向量问题(CVP)CVP 的多项式因子不可近似性,对解码和格问题有推论基于格的抗量子密码的核心;近似难度一直完全开放
8Ehrhart 体积猜想在每个维度,质心是唯一内部格点的凸体的最大体积该猜想只在低维被证明
9多色 Ramsey 数多色三角 Ramsey 数的超指数下界,解决了 Erdős 第 183 号问题Erdős 在 1973 年提出;增长率一直未知
10极值数猜想紧致性和退化性猜想的反例,解决了 Erdős 第 146 和 180 号问题两个塑造了极值图论的猜想

深挖三个值得的

非 sofic 群(成果 3)——头条成果。 "Sofic"群粗略说就是可以被有限置换群任意好地逼近的群——那种你真的能计算出来的对称性。大量群论和遍历理论悄悄假设每个群可能都是 sofic 的,因为这个性质解锁了强大的逼近论证。非 sofic 群是否存在,自 Gromov 于 1999 年提出以来一直是该领域最核心的开放问题之一。Astra 的构造在 Lean 中显式地产生了一个。如果它站得住,意味着整整一类逼近论证有了边界,研究者将不得不说明它们适用于哪些群。

球堆积(成果 1)——触到地板。 在 n 维空间堆等球容易描述、难以解决:最密堆积只在几个维度内已知。Cohn 和 Elkies 的 2003 年定理用线性规划设定了理论上界,但几十年来没有构造在高维接近它。Astra 的新上界达到了那个 Cohn–Elkies 阈值。日常后果:停滞多年的密度界整体推进了一个指数因子,而同一套线性规划机制可能迁移到编码理论(成果 2 同步改善了)。

多色 Ramsey 数(成果 9)——53 年老的 Erdős 问题。 Erdős 的第 183 号问题问多色三角 Ramsey 数 R_k(3) 的增长:最小的 n,使得对 n 个顶点的完全图任意 k 色边染色都必然产生一个单色三角形。答案竟然是超指数的——一个比任何简单指数增长都快的下界。这是一个干净、几十年的数论风格问题,它的解决构成一个满意的故事,即使对永远不会碰图论的人也是如此。

Lean 证书:为什么机器检查的证明改变游戏

这次发布中最有后果的决定不是一条定理——而是证据的形式。十项成果每一项都以 Lean 4 形式证明发布在公开的 openai/ten-proofs 仓库中,Apache-2.0 许可,旁边是 249 页手稿推理过程讲解——模型如何思考每个问题的叙述。

为什么这是大事:

  • Lean 证明是"你可以自己验证"的标准。 Lean 证明是一组由 Lean 内核机械检查的语句——没有信任作者这回事,没有扫视找缺口的空间。OpenAI 说仓库用 Lean 4.32.0 和 mathlib 构建,并公布了确切命令,任何人都能重建。
  • 它把"论证是对的"和"模型很聪明"分开。 如果 Lean 证书有缺陷,它会编译失败——不需要主观解读。这正是证明而非模型成为公告最强部分的原因。
  • 它仍然给人类判断留了空间。 Lean 证书证明形式语句是可推导的。它们不证明数学解释是对的、所选语句与学界理解的非正式问题一致,也不证明这些结果有趣。那是学界仍然拥有的工作。

一句话结论:OpenAI 给了数学界独立核查这些声明所需的一切——而由学界来说这些声明是否像宣传的那样大。

它对你意味着什么:发布日期、开源与追赶竞赛

读者真正会问的问题:

Astra 发布了或开源了吗? 两者都没有。它未发布且封闭,OpenAI 没有给任何发布日期。证明是开放的(Apache-2.0);模型不是。

这是 GPT-5.6 的继任者吗? 从模型家族意义上说,是的。OpenAI 的 GPT-5.6 页面记录当前已发布的世代;Astra 是仍在开发中的下一个主要家族。$2,000 这个数字以 GPT-5.6 Sol API 费率计价,正是因为那是当前的前沿 token 价格。

OpenAI 说它打算用这个做什么? 伴随公告,OpenAI 指向它的 ChatGPT for Academic Researchers 计划——为 100,000 名科学家和数学家提供免费访问——以及 5 月对 Erdős 单位距离猜想的反驳,它说这已经启发了 Bloom–Sawin–Schildkraut–Zhelezov 等在 sum-product 猜想上的后续工作。

为什么有些数学家感到不安? OpenAI 自己指出了这种张力,引用了莱顿人工智能与数学宣言,签署者担心 AI 在该领域的作用。核心争议是署名:OpenAI 说它帮助准备和形式化了手稿、对正确性负责,而数学论证由系统生成。这种功劳划分是否恰当是一个开放的文化问题,不是技术问题。

注意事项:公告没有声称的东西

如果你想像研究者一样思考这件事,同时握住三个注意事项:

  1. 未经同行评审。 这里的"发布"指公开张贴,不是期刊接收。十项这个深度的成果,学界要花几个月验证、解读和扩展——这正常且健康,不是危险信号。
  2. $2,000 是零售 token 换算,不是研究成本,且排除了训练和人力(见上文)。
  3. 能力 ≠ 已验证。 模型未发布、未在公开测试上跑过基准,其数学能力通过这些证明展示——令人印象深刻,但不同于可复现的公开基准。

这些都不意味着工作很弱。它们意味着诚实的立场是有前景且可检查,而不是尘埃落定。证明本身是今天就能行动的东西——克隆仓库并构建它。

今天如何接近它

如果 Astra 的故事让你想拿一个有能力的模型去攻克真正困难的推理——数学、证明、多步骤逻辑——OpenAI 的封闭路径和开放路径之间存在有意义的差异。Astra 未发布且封闭。GLM 5.2 走相反的路:它是智谱 AI 当前的旗舰,MIT 许可开放权重,1M token 上下文窗口,对推理、编码和多步骤智能体工作有强调优——而且现在就能试用,不被锁在内部评估闭环后面。对研究型负载,在承诺封闭模型路线图之前,值得看看这个体量的开放模型如何处理困难提示词。

你可以**在浏览器里免费试用 GLM 5.2,地址是 glm5.app**——无需 API key——直接对着它跑你在意的推理密集型提示词。想更深入了解它在研究型任务上的表现,见我们的 GLM 5.2 科研场景指南。

FAQ

OpenAI Astra 是什么?

OpenAI Astra 是 OpenAI 下一代的主要模型家族,目前未发布。一个内部版本于 2026 年 8 月 1 日宣布的数学与理论计算机科学领域产出了十项新成果,Lean 验证的证明发布在 GitHub 上。

OpenAI Astra 什么时候发布?

OpenAI 没有公布发布日期。迄今发布的一切都关于内部开发版本;公开发布的时间线未知。

OpenAI Astra 开源吗?

不开源。模型封闭且未发布。只有产物是开放的:证明、249 页手稿和推理过程讲解,以 Apache-2.0 许可发布在 openai/ten-proofs 仓库中。

OpenAI Astra 的数学运行花了多少钱?

OpenAI 说找到这些解所需的 token 按 GPT-5.6 Sol API 费率计算约需 $2,000。这是零售 token 成本换算,不是完整研究预算——它排除了模型训练和人力。

那十个证明被验证了吗?

机械上是的:每一项都以 Lean 4 形式证明发布,可以重建和检查。这与同行评审不同——数学界仍需要验证形式语句是否与预期问题一致,并评估这些结果的意义。

Astra vs GPT-5.6——有什么区别?

GPT-5.6 是 OpenAI 当前已发布的推理模型(其 API 定价是 $2,000 估算的基础)。Astra 是下一个主要模型家族,仍在开发中、未发布。

什么是非 sofic 群?

一个群是 sofic 的,如果它能被有限置换群任意好地逼近。每个群是否 sofic 自 1999 年以来一直开放;Astra 显式构造了一个不是 sofic 的群。

写在最后

截至 2026 年 8 月,OpenAI Astra 是一个未发布的下一代主要模型,其内部版本在数学和理论计算机科学领域产出了十项新成果——包括第一个非 sofic 群构造和直抵 Cohn–Elkies 阈值的球堆积界——按当前 API 费率约花 $2,000 token 成本,每个证明都以机器可检查的 Lean 4 证书发布。证明是真正开放、可检查的。能力声明则确实尚未尘埃落定。

理解这个事件最有用的方式,既不是"AI 花 $2,000 解决了数学",也不是"全是营销"。而是:一个新数学思想的边际成本已经崩塌,证据现在可以机器验证——但它背后的模型仍然是封闭的。 如果你不想等封闭发布,而是今天就开始在难题上用开放的、能推理的模型干活,glm5.app 上的 GLM 5.2 是一个现在就验证这一点的免费方式。

作者:GLM 5 Team。最后审阅于 2026 年 8 月。本文覆盖 OpenAI 截至 2026 年 8 月 1 日的公告;Astra 仍未发布,成果未经同行评审。在依赖任何时间线或能力声明之前,请到 OpenAI 官方页面核实当前状态。

Sources

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。