前沿热点
前沿热点

OpenAI 数据说:agent 半年把 Codex 用成了生产力主力

OpenAI 自家报告显示 Codex 半年从尝鲜到主力——Research 部门内部用量涨 56 倍、70.2% 抽样用户做过 ≥1 小时任务、25.6% 超 8 小时。非开发者正成为企业 agent 增长主力,长任务能不能交给 agent 取决于边界清不清晰。

发布于 2026年7月29日7 分钟阅读
<!-- openai-codex-agent-work-hotspot | hotspot | OpenAI 数据说:agent 半年把 Codex 用成了生产力主力 -->

OpenAI 自己发了一份报告,《How agents are transforming work》。过去 6 个月,Codex 在 OpenAI 内部用得越来越深。看活跃内部用户合并输出 token 这个指标:Research 部门 2026 年 6 月比 2025 年 11 月高了 56 倍,Customer Support 高了 32 倍,Engineering 也在涨。一家公司拿自己人当样本跑出来的数字,最能说明 agent 这半年发生了什么。

一、从尝鲜到主力:OpenAI 自家那份报告说了啥

看内部数据先得承认它的价值:OpenAI 是真在全员用 Codex,不是发个 demo 视频完事。这也带一个限制,OpenAI 给的是"自家公司加自家产品"的样本,能不能外推到其他公司要打折。但几组数字仍值得拆开看。

第一组,内部使用深度。按活跃内部用户合并输出 token 算,Research 半年翻了 56 倍,Customer Support 翻 32 倍,Engineering 同样在涨。这不是注册数,不是登录数,是真正在产出 token 的合并量,能直接反映"用得深不深"。一个新工具从尝鲜到生产主力,分水岭就是从"偶尔点一下"到"天天产出"。OpenAI 自己已经过了这道坎。

第二组,任务复杂度。据 OpenAI 论文和 TechTimes 报道,2025 年 12 月,35.4% 的用户提交过至少一个"人工需要 ≥1 小时"才能做完的任务;到 2026 年 5 月,这个比例升到 70.2%。25.6% 的用户委派过"人工需要 >8 小时"的任务。Axios 在 2026 年 6 月 25 日也报了同样口径的数字:70.2% Codex 用户做过至少一个节省 >1 小时人工的请求,25.6% 超过 8 小时。

这组数字比"内部 token 涨 56 倍"更有信号意义。它说明用户不再拿 agent 改改注释、写写函数名,开始把真正耗时的活儿往它身上甩。

但必须把口径说清楚。Axios 在报道里点明:这是基于 0.1% 随机抽样个人用户、阈值由模型估算的,不是全量统计。"70.2%"别拿来当行业普适的定论,它是一个抽样比例。把它当成"agent 用户里大概有这个量级的人在用长任务"的趋势信号,比较合理;当成精确百分比去对外引用,就是误用。

二、非开发者崛起:谁在用 Codex 干活

TechTimes 在 6 月 26 日那篇报道里点了一个常被忽视的趋势:非开发者正在成为企业 agent 增长的主力。

这和大多数人想象的不一样。一提 Codex,默认是程序员工具。可 OpenAI 报告里把 Research、Customer Support 两个部门单拎出来,本就在暗示 agent 早就溢出工程部了。客服写工单纪要、研究员跑文献综述、运营做数据透视,这些活的共同点是"流程长、步骤多、但每一步都有明确产出物"。这类活儿过去靠人堆时间,现在天然是 agent 的菜。

这件事的意义在于,agent 的市场天花板比想象中高得多。如果只是程序员工具,它撑死吃几百万专业用户;一旦它能在非开发者的长流程任务上稳定干活,天花板直接换一套,数千万知识工作者都是潜在用户。OpenAI 把"非开发者增长"作为亮点放进报告,等于自己确认了这条路径。

三、长任务能交给 agent 吗:看边界清不清晰

数据好看,但落到"我现在该把哪个任务交给 agent"这个决策上,还得看可靠性边界。

第三方实测可以参考。zackproser 在 2026 年的 Codex 评测里给出一个观察:对边界清晰的维护类任务,Codex 成功率从约 40-60% 升到约 85-90%。这里必须标清楚,这是第三方主观体感,不是官方数据,样本和方法都没经过独立复现,只能作为"边界清晰的任务 agent 确实能跑稳"的旁证。

这个旁证恰好点出关键变量:边界清不清晰。维护类任务天然适合 agent,代码库结构固定、问题可定位、有测试用例做客观验证、改坏了能立刻知道。这种闭环反馈的环境,agent 跑 85-90% 不奇怪。

反过来看,那些边界模糊的任务,比如"帮我想一个增长策略""写一篇能引爆的内容",agent 至今跑不稳。不是模型笨,是这种任务没有客观验证回路,agent 自己判断不了"做完了没""做得对不对",只能一路往下走直到 token 用完。判断一个任务边界清不清晰,有个简单办法:你能不能一句话写出"做完"的标准。能写出来,agent 就有客观锚点;写不出来,agent 只能猜,猜得好不好你也不一定知道。

分界线因此很清楚:任务能不能被客观验证、有没有快速反馈回路,决定它适不适合交给 agent。维护、客服摘要、文档整理这种"对就是对、错就是错"的活,agent 已经能扛主力;战略、创意、判断这种"做得好不好得人来评"的活,agent 还得退回辅助位。

四、三点启示

第一,别被"agent 还在尝鲜"的旧印象骗了。半年内 OpenAI 内部 Research 用量翻 56 倍、70.2% 抽样用户做过 ≥1 小时的任务,agent 已经在过"主力"这道坎。还在拿"它偶尔出 bug"当不学习的借口,等于在 2023 年说"手机不安全我不用"。

第二,非开发者才是 agent 增长的真主战场。TechTimes 把这条挑出来报不是偶然。如果你做产品、运营、客服,这波红利指向的就是你,不是程序员。判断手里哪个活能交给 agent,看一条就够:这个活有没有客观的对错反馈。

第三,看 agent 数据必须带口径。70.2% 是 0.1% 抽样、阈值模型估的;85-90% 是第三方主观体感;56 倍是 OpenAI 自家内部用户。每个数字背后都站着一组假设,把假设和数字一起带出去,才不会误导自己和团队。

OpenAI 这份报告的价值在于它是少见的厂商拿自家全员当样本的硬数据。但数据再硬也替不了你自己跑一遍。挑手里那个最耗时的活,看它有没有客观反馈回路,有的话就交给 agent 试一次。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-29

相关文章