2026 年 9 月 20 日,阶跃星辰(StepFun)推出新一代旗舰基座模型 Step 5 Preview。消息由阶跃星辰官方放出,并被 ai-bot.cn 9 月 20 日每日快讯收录。这条消息值得中国技术从业者认真看一眼:它不是又一款"参数更大"的基座模型,而是一台面向真实世界 Agentic 任务设计的稀疏 MoE 旗舰。它总参 600B、推理仅激活 27B,原生 100 万 Token 上下文,原生多模态(文本加视觉),在 Artificial Analysis Intelligence Index 拿到 44 分、位居开源模型前三,而单任务成本据称仅为 Claude Opus 5 的 1/8。本文不吹不黑,只谈五个判断:发布与硬参数速览、"44 分只花 1/8 的钱"该怎么读、22 小时连续 Agent 任务意味着什么、开源时间表值得等的三个理由与两个风险、以及一轮冷思考。关于本批国产开源编码代理的配套资源,可看本站 MiniMax Code CLI 开源资源盘点;关于终端编码代理的横评,可看本站 终端编码代理横评;关于把模型接进建站流程的 SOP,可看本站 Qoder Sites 建站 SOP。
一、发布与硬参数速览:600B 总参,27B 激活,百万上下文
先说清楚它是什么。Step 5 Preview 是阶跃星辰推出的新一代旗舰基座模型,面向真实世界 Agentic 任务设计,不是纯聊天模型,也不是单点工具。据 ai-bot.cn 9 月 20 日收录,它采用稀疏 MoE 架构,总参数 600B,每次推理只激活 27B,支持 100 万 Token 上下文,原生多模态(文本加视觉)。这意味着它和过去"全家桶一起算"的稠密模型不同:推理时只唤醒与当前任务相关的专家,把旗舰级能力和更低的单次算力成本分开。
100 万 Token 上下文是这次的地基。官方口径下,1M token 能原生容纳数十小时任务链里的历史执行记录、工具返回结果与调试反馈,避免分段导致的上下文割裂。对长程 Agent 任务来说,分段是老痛点:切错了边界就会丢掉前后文,后续所有规划都建立在残缺输入上。原生长上下文把"一次跑完"变成可能,这也是它敢于宣称"连续自主任务"的硬件前提。
使用入口分三层。网页端在 studio.stepfun.com 直接对话,最适合先体验能力边界。国内 API 走 platform.stepfun.com,海外 API 走 platform.stepfun.ai,创建 API Key 后按文档调用接口,适合把能力接进自己的系统或 Agent 工作流。官网在 stepfun.com/step-5-preview。三层入口把"模型能力"和"交付流程"分开:模型负责规划与执行,外部工具负责落地,这种分工在后文会反复出现。
关于多模态,要补一句口径。当前原生输入是文本加视觉,没有音频与视频。也就是说它现在能读文档、截图、界面,并基于视觉信息迭代产出,但"看视频""听语音"不在本次原生范围里。对中文市场,视觉理解是真差异点;但对音视频原生的场景,这里还不是它的主战场,选型时别把范围读大。横向看多模态格局,可对照本站 Qwen3.8-Omni-Flash 全模态热点。
二、"44 分只花 1/8 的钱"该怎么读:效率路线的真实含义
这一节是本文的第一个核心判断。据 ai-bot.cn 9 月 20 日收录,Step 5 Preview 在 Artificial Analysis Intelligence Index 拿到 44 分,位居开源模型前三,仅次于 GPT-6 Astra 与 Claude Opus 5;而单任务成本据称仅为 Claude Opus 5 的 1/8。把"44 分"和"1/8 成本"并读,结论不是"它打赢了 Opus 5",而是"它走出了一条和闭源旗舰不同的帕累托路线"。
先拆解 1/8 是怎么来的。据 ai-bot.cn 9 月 20 日收录,核心原因是稀疏 MoE:总参 600B 但每次只激活 27B,"按需调用专家"让旗舰级能力不必每次都付全价。这种路线和"把模型做得更大更贵"相反,它追求的是"同样的能力花更少的钱"。所以 1/8 不是营销话术里那种凭空打出来的折扣,而是架构选择带来的结构性后果。换句话,它的便宜来自架构,而不是来自补贴。
再逐项对比和 Opus 5 的输赢,口径必须如实写。据 ai-bot.cn 9 月 20 日收录的竞品表:上下文窗口 Step 5 Preview 100 万 Token 对 Opus 5 的 200K,Step 5 大幅胜,这对长程任务是关键。GPU Kernel 优化 508 TFLOPS 对 Opus 5 的 493 TFLOPS,Step 5 略优。AIME24 后训练从 53.3% 提升到 60%,双方持平,但 Step 5 的 token 消耗更少。Intelligence Index 上 Opus 5 略高于 44 分,Opus 5 胜这一项。开源情况上,Step 5 预告 2026 年 10 月 15 日释权重,而 Opus 5 闭源仅 API。把这几项摆在一起:Step 5 在成本、上下文、单位算力三项占优,在绝对智力指数一项落后,在"是否开源"上两者性质不同(一个预告开放,一个永久闭源)。
必须补一句:这些数字来自厂商竞品表,口径由官方给定,benchmark 不等于全部真实场景,单点分数更不等于产品体验。尤其"单任务成本 1/8"是厂商口径下的对比,真实账单还取决于你的任务长度、调用频次和上下文占用。本文如此陈列,是为了把"花更少的钱拿到接近旗舰的智力"这个事实摆平,而不是替任何一方站台。真正落地时,建议拿自己的数据跑一轮小样本,再决定主用哪家。关于长上下文的真实成本账,可看本站 长上下文 Agent 成本横评。
三、22 小时连续 Agent 任务意味着什么:长程自主的真实边界
这一节是本文的第二个核心判断,也是最需要泼冷水的地方。据 ai-bot.cn 9 月 20 日收录,Step 5 Preview 可连续执行超 22 小时的自主任务,如把 GPU 内核优化到 508 TFLOPS、超越 Claude Opus 5;而详情页另一处口径写的是"可在 24 小时内持续执行复杂任务"。两处不一致,本文如实说明:快讯口径是"超 22 小时",详情页口径是"24 小时内"。无论取哪个,指向的都是同一件事——它能在数十小时的任务链里持续规划、调用工具、读取反馈、自我纠错,而不是跑完一轮就交差。
长程自主为什么值钱?因为真实工程任务从来不是单轮问答。优化一个 GPU 内核、自动化一条后训练数据流程、把一个项目从零搭起来,这些活都要"规划、执行、观测、修正"的循环反复跑几十轮。过去模型在长任务里会"忘了前面干了啥",上下文一满就断片,后面全错。Step 5 用 100 万 Token 上下文把整条任务链的历史留在窗口里,并据官方披露形成自主的"规划、执行、观测、修正"闭环,可访问串口、摄像头、API 等外部工具,根据真实环境返回的状态和报错持续改代码,直到任务完成。这才是它和"只会答一轮"的模型最本质的区别。
但边界要讲清楚。第一,口径本身不一致,22 小时和 24 小时是两个数字,说明厂商自己也没给一个被严格公证的连续运行时长,把它当作"已验证的 24 小时无人值守"是过度解读。第二,"连续执行"不等于"一次成功"。在数十小时的链条里,任何一次工具返回异常、环境变动或目标漂移,都可能让后续动作跑偏,而这类错误的修复目前仍主要靠人在回路里兜底。第三,可操作真实硬件这块有具体案例支撑:据 ai-bot.cn 9 月 20 日收录,它能操作串口和摄像头、基于真实硬件返回的报错持续调试代码超过 3 小时,ESP32 开发板改造是其中的代表。3 小时是有实证锚点的,22/24 小时是更上层的整体口径,两者强度不同,别混为一谈。
把边界说透:Step 5 把"长程 Agent"从演示推到了"可用"的门槛,但它现在更像"能连续干几十小时活的强辅助",而不是"关上门就不用人管的全自动工厂"。对从业者来说,正确姿态是把长任务拆成可观测的阶段,在关键节点留人工确认,别把整条链路焊死在单一模型上。
四、开源时间表值得等的三个理由与两个风险:10 月 15 日释权重
这一节必须先把事实摆正。据 ai-bot.cn 9 月 20 日收录,Step 5 Preview 预告 2026 年 10 月 15 日释放完整权重——也就是说,当前是 Preview 阶段,权重尚未放出,它现在还不是开源模型。本次也没有独立 GitHub 代码仓,按站内纪律只能做热点篇,不做开源篇。因此,整篇都要记住一句话:你现在能在 studio 和 API 上体验的是 Preview,能下载权重要等到 10 月 15 日。
值得等的三个理由。第一,权重真放出后,你就能本地部署、私有化、改架构、做蒸馏,把"用 API"升级成"自己掌握模型",对数据敏感和金融、政企场景尤其关键。第二,600B 总参、27B 激活的稀疏 MoE 一旦开源,社区可以拿它做大量可复现的效率研究,"1/8 成本"这个命题才有第三方验证的空间,而不是只停在厂商口径。第三,它在长上下文和 Agentic 闭环上的设计思路,开源后会成为后来者的参考基线,推动整个国产基座的效率路线往前走。
但有两个风险必须讲。第一,"预告"不等于"一定准时"。大模型开源历史上跳票、分阶段放、先放小模型后放大模型的情况不少见,10 月 15 日这个日期是厂商口径,是否如期、放出的是不是完整权重、用什么许可,都要等当天核实,别提前当成已发生的事实。第二,硬件操作类任务的真实可用度待证。它能调试 ESP32 超过 3 小时是实证,但串口、摄像头之外的真实工业设备、不同接线、不同固件,泛化到什么程度没有公开评测。也就是说,"能操作真实硬件"目前是个有锚点但范围有限的结论,别读成"什么硬件都能接"。
一句话收束:10 月 15 日这个日期值得在日历上标,但标的是"待验证",不是"已确定"。等权重真正放出、许可明确、社区跑出复现结果,再把它写进你的技术选型,才是稳妥的工程姿态。
五、冷思考:评测分与真实交付的落差,以及 Preview 阶段的两大未知
最后一轮冷思考,也必须泼。第一,评测分和真实交付之间有落差。44 分、508 TFLOPS、AIME24 60%、553 仓库 33 语言,这些数字很亮,但都来自厂商口径或厂商选定的场景。Intelligence Index 是综合智力代理,不等于你项目里那一个具体任务的交付质量;AIME24 是数学竞赛题,不等于生产环境的鲁棒性;553 仓库是厂商公布的覆盖,不等于你私有代码库里一次就修对。把榜单优势直接当成交付优势,是这一轮国产旗舰最容易让人误读的地方。务必用你自己的小样本去压,再下结论。
第二,Preview 阶段有两大未知,现在都答不了。其一是 API 价格未知。这次只给了"单任务成本 1/8 Opus 5"的对比口径,没有给出你接入时要付的每 token 单价、阶梯价、长上下文的计费方式。对要把它接进生产的人,真实的月度账单才是决策依据,而这个号码现在没有。其二是稳定性未知。Preview 意味着还在迭代,速率限制、可用性、工具调用的一致性、长任务的断点恢复,这些只有大规模公测后才看得到。把关键链路现在就绑死在 Preview 上,风险自担。关于把模型接进建站类 Agent 工作流的落地方法,可看本站 Qoder Sites 建站 SOP;关于终端编码代理的横向能力,可看本站 终端编码代理横评。
第三,竞品不会坐视。Opus 5 在绝对智力指数上仍略胜,GPT-6 Astra 排在它前面,阿里、腾讯、字节、智谱等也都有长上下文或 Agent 布局。Step 5 Preview 今天领先的是"用稀疏 MoE 把成本打到 1/8 且保持接近旗舰的智力",这个窗口会不会被快速追上,取决于对手把效率路线补到什么程度。对从业者来说,正确姿态是:把今天能体验的能力接进工作流,同时留好多模型切换的接口,别把关键链路绑死在单一厂商。今天赢在效率,明天可能别人赢在别处,留好退路才是工程上的成熟。
本文的判断收束为一句话:Step 5 Preview 的意义,不在于它把某项 benchmark 刷到了第一(它没刷到),而在于它用稀疏 MoE 把"接近旗舰的智力"和"1/8 的成本"第一次摆到了同一张表上,并用 22 小时级的长程 Agent 展示了国产基座往"能干活"方向走的一步。它是否成为你的生产工具,留给 10 月 15 日的权重和你的场景决定;但"效率路线正在成为国产旗舰的主战场"这个趋势,阶跃星辰用 9 月 20 日的这一发布替行业说清楚了。