2026 年 9 月 29 日,OpenAI 把一年一度的 DevDay 办成了一场信息密度近乎超载的发布会。官方口径(OpenAI DevDay 2026 回顾原文)称这次有「20 多项重大发布」,我们逐项清点下来是 25 项;同一天,官方确认 ChatGPT 周活跃用户已达 12 亿。发布的清单很长,从协作幻灯片到 Sign in with ChatGPT 的 16 家额度互通合作方,但真正值得普通用户连夜重排工作流的,是两件事:一只叫 Dots 的常驻 Agent 正式上岗,以及一块叫 GPT-6.1 Sol 的新型号,把接近旗舰的智能卖到了旗舰五分之一的价格。
这篇文章按热点拆解:Dots 到底是什么、谁能用;GPT-6.1 Sol 的完整定价表,以及从官方基准里挑出的几个最有说服力的数字;再往后是 Ultrafast 极速档、Codex 云端闭环四件套、Agents API 的 Computer Use,以及和 AWS 的合作。所有定价与基准数字均来自官方回顾原文,转述口径会逐一标注。
Dots:从「你去找 AI」到「AI 常驻」
官方对 Dots 的定义其实很克制:一个「能力极强、始终在线(always-on)的 Agent」,了解对你重要的事、始终代你执行工作、接手重要工作,把时间还给你。这句话里最值钱的不是「能力极强」,而是「始终在线」——它意味着 OpenAI 官方把 Agent 的落点从「你打开一个会话去找它」,挪到了「它常驻在你的账户里替你盯着事」。产品形态变了,使用预期也得跟着变:它不是你随叫随到的工具,而是一个默认在线的同事。
可用性上划了两条线:Pro 与 Business Premium 用户在符合条件的市场可以直接用;Enterprise、Edu、Healthcare 则需要工作区管理员手动启用 beta,且默认关闭。换句话说,消费端与高端商业端先行,大企业的观望期被制度性地保留了下来。
还有一处转述需要澄清。发布会后网上流传的「长期跟踪任务、主动汇报、自主操作软件」这组描述,出自量子位与 AI工具集的概括,不是回顾原文的逐字表述;其中「自主操作软件」一条,更接近 Agents API 的 Computer Use 能力,官方在回顾里是分开陈述的。看热点报道时把二次概括当成官方口径,是这类发布会次生传播里最常见的失真点,这里替读者把线画清楚。
值得多想一步的是 Dots 与既有产品的关系。过去一年我们习惯了两种 Agent 形态:一种是聊天框里的助手,你说一句它做一句;另一种是开发者侧的编码 Agent,任务发起后挂在后台跑完再汇报。Dots 的「常驻」是第三种:它不等你开口,而是被设计成持续了解你的偏好与工作内容,主动把事接过去。这件事的技术前提是 Agents API 与 Computer Use 的成熟,商业前提是订阅档位足够承载一个新的高级权益——Pro 与 Business Premium 正好同时满足这两点。至于它实际能接管多少工作、出错率如何,官方回顾没有给出量化数据,我们也就不替它描绘,留待真实使用检验。
GPT-6.1 Sol:near-Astra 的智能,五分之一的价格
GPT-6.1 Sol 是 GPT-6 Sol 的重大升级,官方口径是 agentic coding、Computer Use 与专业工作表现增强,智能水平「接近 Astra(near-Astra intelligence)」。Astra 是 GPT-6 系列的旗舰(本站此前做过完整评测,见 GPT-6 Astra 登顶后,四大旗舰真实差距),而 Sol 一直站在性价比位上,首发定价的来龙去脉当时也写过(见 GPT-6 双子星腰斩定价),本篇只讲 6.1 相对它们的变化。这次升级的重点不在冲顶,而在把旗舰级智能压到可日常大规模使用的价位上。
先看定价表(每百万 token,官方原文):
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GPT-6.1 Sol | $2 | $0.10 | $10 |
| GPT-6 Astra | $10 | $1 | $50 |
| GPT-6 Luna | $0.10 | $0.01 | $0.50 |
标准输入与输出价格均为 Astra 的五分之一,这就是标题里「降到五分之一」的出处。更值得注意的是缓存输入那一列:$0.10 的价格比标准输入便宜 95%,也比 GPT-6 Sol 的缓存便宜 50%。对 Agent 类负载——大量重复上下文、反复调用工具——缓存命中率直接决定实际账单,这个数字的杠杆比表面上的「五分之一」更大。想把这些价格放进更大的盘子里比较,可以对照本站的 2026 年 10 月编码模型价格盘点。
可用性上还有一条容易忽略的线:即日起面向 ChatGPT Plus、Pro、Business、Enterprise、Edu 全部用户开放,可用场景是 ChatGPT Work 与 Codex,API 模型名为 gpt-6.1-sol。但它在 Chat 里还用不了。想让 6.1 Sol 干活,你得把它放进工作流,而不是对话框。这个限制本身就很说明 OpenAI 对它的定位:这是一块为 Agent 场景设计的模型。
官方基准:挑四个最有说服力的
官方给出了一整面墙的基准数据,我们不做复读机,挑四个最能说明问题的(以下全部为官方口径)。
第一,Terminal-Bench Science 0.1 的每任务平均成本:GPT-6.1 Sol 为 $5.47,Opus 5.5 为 $23.21,Astra 为 $23.80,降本超过 75%。要注意这个基准里 Astra 仍是受测模型中的最高分(68.1%),所以这不是「旗舰被打败」的故事,而是「分数贴近旗舰,账单砍到四分之一不到」的故事。
第二,OSWorld 2.0 离线集(v2026.08.08):最大推理强度下比 GPT-6 Sol 高 7 个百分点、成本不到一半;距 Astra 差 2.1 个百分点,而每任务成本约为 Astra 的七分之一。OSWorld 测的是计算机操作,正是 Agent 场景的主战场,这个差距结构比单一分数更有信息量。
第三,AutomationBench 1.0.6(覆盖 47 种工具):中等推理强度下比 Opus 5.5 高 2.2 个百分点、成本约三分之一;比同设置下的 GPT-6 Sol 高 4.8 个百分点。工具调用密度高的自动化任务,正是前面说的缓存杠杆最吃香的地方。
第四,DeepSWE v1.1:以约五分之一的成本与 Astra 持平,同时比 GPT-6 Sol 的最佳成绩高 6.4 个百分点。再叠加 GDP.pdf 上得分高于 Opus 5.5(含 fallbacks)、每任务成本不到其一半的表现,四组数据指向同一个结论。
还有两个数字值得单独记录。事实性方面,低推理强度下的事实错误率从 11.4% 降到 7.7%,约降三成,各设置下与 Astra 的错误率差距不超过 1.9 个百分点。安全披露测试(破损搜索工具场景,最大推理强度)里,未告知用户工具破损的比例分别是:GPT-6.1 Sol 为 2.1%,GPT-6 Sol 为 4.9%,Astra 为 1.5%,Luna 为 28.7%。Luna 的数字一眼惊人,也提醒我们便宜档位的模型在诚实性上仍有明显差距,关键业务别只看价格表。
把四组基准与两个补充数字放在一起看,模式是清晰的:6.1 Sol 不追求在每个榜单上登顶,而是把「旗舰附近的表现」与「旗舰几分之一的账单」同时端上来。对跑批量 Agent 任务的团队,这种组合往往比单纯的高分更有决策价值——同样的预算,意味着能跑的试验次数多出好几倍。当然,所有基准均为官方口径,第三方复现与真实账单验证仍需时间,这一点与其他厂商发布会上的数字并无区别。
Ultrafast、Codex 四件套,与跑进 AWS 的 Agent 运行时
速度上,Ultrafast 极速档在 Codex 内最高 8 倍提速、300 tokens/秒,API 最高 6 倍。GPT-6 Astra Ultrafast 即日可用(API、ChatGPT Work,以及 Codex 的 Pro 500 与 Enterprise),GPT-6.1 Sol Ultrafast 则标注为「即将推出」。对写代码的人来说,300 tokens/秒意味着交互手感的变化,不再只是账单数字。
Codex 这边凑齐了云端闭环四件套。其一,Codex in the cloud:云端、手机、任意设备接入,可复用开发环境,团队共享设置与已批权限,面向 Plus、Pro、Business、Healthcare、Education、Enterprise。其二,Codex CLI 刷新:语音启动、/agents 视图同时跟踪多任务、编辑提示词、恢复会话、worktrees,覆盖全部计划。其三,Code Review:桌面端读摘要看 diff、在 GitHub PR 与 GitLab MR 上提问,自动评审模式在你离开时于云端完成首轮,同样全计划可用。其四,Codex Security Cloud:按需或定时扫描整个 GitHub 仓库、对新提交持续检查、调查与去重并云端备好修复,内含 Daybreak Blue 模型,面向 Pro、Business、Enterprise、Edu。本站此前写过 Codex 在真实工作里的使用观察(见 OpenAI 数据说:agent 半年把 Codex 用成了生产力主力),这次的四件套等于把「云端有环境、评审有通道、安全有哨兵」三块拼图补上了。
Agents API 的更新是把 Codex 的能力向外输出:支持 Computer Use,用于构建与软件交互完成任务的 Agent;Codex 的多 Agent 能力、工具搜索、工具调用、上下文压缩都进入 API,底层由 OpenAI 运行;经 API 提供,并在 Codex 与 ChatGPT Work 面向 Pro 500 与 Enterprise。更值得注意的是与 AWS 的合作:Bedrock Managed Agents, powered by OpenAI——Agents API 的核心能力原生跑在 AWS 上、集成 AWS 资源,可以构建完全运行在 AWS 内的 OpenAI Agent。Agent 的运行时,从此不只在 OpenAI 自己的机房里。
清单里还有几张牌
除了两大头条,清单里还有几张牌值得点名。其一是 Pro 500 档:官方口径是 ChatGPT Plus 额度的 25 倍,配合 Ultrafast 与 Agents API 的高强度用法,这个档位显然是给重度 Agent 用户准备的。其二是 Sign in with ChatGPT 的额度互通扩展到 16 个合作方,名单里包括 Cognition 的 Devin、Notion、Vercel、T3、OpenClaw、Dactyl——登录态与额度开始跨产品流动,ChatGPT 账户正在变成一层身份与额度基础设施。其三是 OpenAI Marketplace 首批 32 个合作方,应用分发的故事也开始铺开。
隐私方向上还有一个容易被忽略的发布:Private Intelligence,主打零数据保留与 Private Safety Processing,Private Inference 预览定在今秋。企业客户在把 Agent 接进内部流程时,最担心的从来不是能力而是数据去向,这块拼图的补齐速度值得持续关注。
常驻 Agent 的元年,与同日的开源回声
把 DevDay 的发布清单合上,趋势其实很清楚:模型在降价(Sol 降到五分之一),Agent 在常驻化(Dots 上岗),运行时在去中心化(跑进 AWS)。三条线交叉的位置,就是「常驻 Agent」这个新品类。Manus 同期推出的 Cue 走得更远——手机与桌面独立应用,每个 Agent 配独立邮箱、独立电话号码、独立钱包、独立电脑,能在你设的预算内付款,目前凭邀请码免费体验。本站此前讨论过计算机操作型 Agent 的整体拐点(见 computer use Agent 时代),现在各家正把「会操作电脑的模型」包装成「住在你账户里的同事」。
还有一个耐人寻味的细节:就在 DevDay 同一天,一个与 OpenAI 毫无关系的开源项目把「dots」这个名字提前占了——仓库 feder-cr/dots,一个自带浏览器的网页 Agent,MIT 许可,README 末尾明确写着与 OpenAI 无关,发布三天左右已经拿到两千四百多颗星。官方 Dots 是托管在订阅里的常驻 Agent,这个开源 dots 则是可以自托管、模型随便换的另一条路线,两者的详细对比与自托管教程,本站会另开篇幅展开。
对普通用户,我的判断是:2026 年下半年最值得做的实验,不是再换一个更强的聊天模型,而是认真挑一只常驻 Agent 请进日常,给它几件真正重复的事——盯数据、理邮件、守 CI——然后观察它值不值得信任。模型的价格战打到这个位置,便宜的智能已经不缺,缺的是替你把时间省下来的那只「常驻」。
互动
Dots、Cue、开源 dots:你会把哪只常驻 Agent 请进日常?评论区报个名。