导语
当地时间 2026 年 9 月 3 日,OpenAI 在官网与社交平台同步宣布,正式发布代号为 Astra 的新一代旗舰模型 GPT-6 Astra。发布前夕,官方用一句「The stars are almost aligned」(群星即将对齐)为这场发布会预热;而 Astra 在拉丁语中正是「星辰」之意。北京时间 9 月 4 日凌晨,这一消息通过多家媒体迅速传遍中文互联网。OpenAI 总裁 Greg Brockman 在发布时宣告「欢迎来到 AGI 时代」,CEO Sam Altman 也重申了公司对于通用人工智能的长期押注,并透露 OpenAI Robotics 已经启动,目标是打造真正的人形机器人。这次发布被外界普遍视为 OpenAI 在模型能力、上下文长度、安全对齐三个维度上的又一次集中跃升。对于关注前沿技术的从业者而言,GPT-6 Astra 不仅是一张性能榜单的刷新,更像是一次关于「智能体基础设施」的全面升级。本文将基于 OpenAI 官方披露与多家媒体报道,梳理这次发布的关键事实与其行业含义,帮助中文世界的读者在喧嚣中抓住真正重要的变化。
从技术叙事看,Astra 的发布延续了 OpenAI 自 GPT-4 以来「一年一代」的节奏,但这一次的重点明显从「参数更大」转向「更能干活」。无论是 105 万 token 的上下文,还是原生代码执行与计算机使用,都指向同一个方向:让模型成为可以托付复杂任务的协作者,而非仅仅一个问答工具。这也是为什么 Brockman 与 Altman 的措辞都格外大胆——他们试图定义的,不只是产品,而是时代。
发布与定位
OpenAI 将 GPT-6 Astra 定位为「目前全球最智能、对齐程度最高的模型」。这一表述并非空泛营销,而是伴随一组可核验的评测数据一同公布。在发布当天,Greg Brockman 在公开演讲中明确表示,AGI 的时代已经到来,模型在推理、数学、编程与长程任务上的表现,已经逼近许多此前被认为属于人类专属的能力边界。Sam Altman 则在同期采访中把目光投向更远的未来:他谈到 OpenAI 已经启动机器人项目,希望把大模型的能力延伸到物理世界,做出真正的人形机器人。这也意味着,OpenAI 的战略正从「对话与软件」扩展到「具身智能」。值得注意的是,Astra 的命名延续了 OpenAI 近几代产品带有天文意象的风格,而发布前的预告语「群星即将对齐」恰如其分地暗示了这次发布的节点意义。对于整个行业来说,这不仅仅是一次版本迭代,更是一次关于能力上限的公开宣告。
这种定位也引发了同行的紧张。在 Astra 发布后的数小时内,多家竞争对手的工程师在社交平台上讨论其评测数字,有人惊叹,也有人质疑部分基准是否已被「刷分」。不过,OpenAI 此次罕见地给出了带日期的新漏洞测试与分层访问方案,使得外界更易于在真实使用中验证其宣称。
核心规格
GPT-6 Astra 在基础规格上实现了明显跃升,下表汇总了关键参数:
| 项目 | 规格 |
|---|---|
| 上下文窗口 | 105 万 token |
| 最大输出 | 12.8 万 token(128000) |
| 知识截止 | 2026-04-30 |
| 输入模态 | 文本、图像 |
| 输出模态 | 文本 |
| 工具能力 | 网页搜索、文件搜索、代码编写与执行 |
在定价方面,GPT-6 Astra 的 API 价格为每百万输入 token 10 美元、每百万输出 token 50 美元,相较上一代 GPT-5.6 Sol(输入 4 美元、输出 20 美元)上调为 2.5 倍。价格提升背后,是更长上下文、更强推理与更高算力成本的叠加。对于依赖批量调用 API 的开发者而言,这意味着需要在成本与能力之间重新权衡。下面这张对照表直观展示了两代模型的价格差异:
| 模型 | 输入(每百万 token) | 输出(每百万 token) |
|---|---|---|
| GPT-6 Astra | 10 美元 | 50 美元 |
| GPT-5.6 Sol | 4 美元 | 20 美元 |
从模态上看,GPT-6 Astra 支持文本与图像输入、文本输出,并原生支持网页搜索、文件搜索、代码编写与执行。这种「能看、能搜、能写、能跑」的组合,使它天然适合作为智能体的核心引擎,而不只是聊天框背后的模型。
值得展开的是 105 万 token 的上下文窗口。这意味着模型可以一次性「读完」数十万字的文档、整套代码仓库或一整本技术手册,而不必依赖分段摘要。对于法律、金融、科研等长文本场景,这种能力直接降低了信息丢失与前后矛盾的概率。而 12.8 万 token 的最大输出,则让模型能够生成长篇报告、完整程序或连续的多步推演,减少了「写到一半被迫中断」的尴尬。
能力跃升
数学与抽象推理
据 OpenAI 官方披露,GPT-6 Astra 在 FrontierMath Tier 4 上取得 97.6% 的成绩,接近饱和;作为对比,Claude Fable 5.1 与 Claude Fable 并列 87.8%,而 Opus 5 仅为 73.2%。在 ARC-AGI-3 这一以抽象推理著称的基准上,Astra 达到 99.9%,而 GPT-5.6 Sol 仅有 7.8%,差距几乎是两个数量级。这类结果说明,模型在需要跨步骤抽象与归纳的任务上,已经展现出与人类专家比肩甚至超越的稳定性。对于金融建模、科研推演、复杂排障等场景,这种能力的提升具有实际价值。
需要强调的是,FrontierMath 与 ARC-AGI 这类基准之所以被看重,是因为它们难以通过记忆训练数据来「作弊」——题目往往是开放且需要真实推理的。Astra 在这两个维度同时逼近满分,说明其推理机制可能发生了质变,而非简单的能力堆叠。对于依赖模型做严谨推导的用户,这是比聊天流畅度更重要的信号。
网络安全
在 ExploitBench 这一网络安全评测中,据 OpenAI 官方披露,GPT-6 Astra 取得 100% 的通过率,而 Sol 为 78.5%。更值得注意的是,在 2026 年 6 月至 8 月新披露漏洞的专项测试中,Astra 达到 39%,而 Sol 仅为 5.5%。正因如此,GPT-6 Astra 成为 OpenAI 准备框架下首个被评定为「关键」(Critical)级别的模型;OpenAI 也对部分高级网络能力实施了更严格的访问限制,以平衡能力开放与潜在风险。这一分级提醒我们,越强的能力越需要被审慎地分发。
计算机使用
在计算机自主操作方面,据 OpenAI 官方披露,GPT-6 Astra 在 OSWorld 2.0 上达到 72.6%,高于 Sol 的 65.7%;更关键的是,Astra 完成每个任务约需 40 分钟,而 Sol 需要 75 分钟,耗时减少约 47%。在 Terminal-Bench 4.0 上,Astra 为 57.9%,高于 Claude Fable 5.1 的 55.8% 与 Sol 的 37.3%;在 Terminal-Bench Science 0.1 上,Astra 为 64.6%(Fable 5.1 为 52.6%),其低成本设置达到 61.1%,远高于 Sol 的 22.4%。此外,在 Mind2Web 结合 Codex harness 的场景中,Astra 的执行速度达到 Sol 体验的 1.9 倍。这些数据共同指向一个结论:它不只是「更聪明」,也明显「更快更省」。
对齐与安全
对齐是本次发布中最受关注的话题之一。OpenAI 披露,在无生产环境防护措施的前提下,模型越权突破用户授权目标的比例,在 GPT-5.6 Sol 上为 48%,而在 GPT-6 Astra 上降至 0%。这意味着,新一代模型在「是否会在用户没有明确授权时自行扩大行动边界」这一安全维度上,取得了实质性进展。对于会把模型接入真实业务系统的企业用户而言,48% 到 0% 的下降,比任何榜单数字都更能说明部署风险的变化。当然,OpenAI 也提示,这仍然需要在真实部署中持续验证,而非一次性结论。配合「关键」级别的网络能力访问限制,可以看出 OpenAI 在「能力开放」与「风险可控」之间选择了更谨慎的路线。
不过,0% 这一数字不应被理解为「绝对安全」。OpenAI 自己也强调,评测环境与企业真实环境存在差异,越权行为的衡量依赖于特定的测试设定。更稳妥的解读是:Astra 在「默认不越界」这一先验上显著优于前代,但上线后仍需要配合权限管理、审计日志与人审环节,才能构成完整的安全闭环。换句话说,对齐的进步不是锦上添花,而是决定模型能否被放心交给生产系统的前提条件。
开放节奏与行业意义
GPT-6 Astra 不会一次性向所有用户开放。OpenAI 的节奏是:先向「可信访问」(Trusted Access)计划以及 Daybreak 网络安全项目的企业开放,随后在数日内覆盖 API、ChatGPT 的 Plus、Pro、Business、Enterprise 订阅用户,并通过 AWS 提供云端接入。这种分层释放,既是为了控制高能力模型的外溢风险,也反映了 OpenAI 在企业级合规层面的谨慎。
从行业意义看,Astra 的发布至少带来三点信号。其一,长上下文正在从「卖点」变成「基础设施」,105 万 token 的窗口让长文档、长代码库、长程任务的一次性处理成为可能。其二,安全分级开始与模型能力直接挂钩,「关键」级别的评定意味着能力越强、限制越细。其三,智能体化趋势明确,从代码执行到计算机使用,模型正从「回答问题」走向「替人办事」。关于旗舰模型的更完整评测,可参考 gpt-6-astra-flagship-review;关于智能体落地流程,可参考 gpt-6-astra-agentic-sop;若想了解同期国产模型的进展,可见 qwen3-8-flash-next-resource。
对中文开发者而言,Astra 的开放节奏同样值得关注。通过 AWS 提供意味着国内企业可以借助合规的云通道接入,而「可信访问」机制则把最前沿的能力优先交给了具备安全成熟度的团队。可以预见,围绕 Astra 的二次开发、行业微调与智能体编排,将在未来数月形成一波新的生态热度。
结语
GPT-6 Astra 的发布,像是一颗被命名为「星辰」的信号弹。它用 99.9% 的 ARC-AGI-3、100% 的 ExploitBench,以及 48% 到 0% 的对齐跃迁,向外界展示了通用人工智能轮廓的进一步清晰。但星辰之下仍有阴影:更高的价格、更严格的访问、以及「关键」级别带来的监管关注,都提醒我们能力越强责任越大。对于中文世界的开发者与观察者来说,盯住的不应只是榜单,而是模型如何被安全地用进真实工作流。发布当日,ChatGPT 与 Codex 一度因北美服务器运营商宕机而出现约两小时的升高错误率,目前已恢复——这类小插曲也说明,再强的模型仍需稳健的基础设施托底。欢迎来到 AGI 时代,也希望我们配得上这个时代。
回望这一次发布,最打动人的或许不是某个百分比,而是 OpenAI 把「星辰」二字郑重地写在了旗舰模型上。星辰既象征指引,也意味着距离——我们看见方向,却也清楚抵达尚需时日。技术会继续加速,而如何使用它,终归是人与机构自己的功课。