前沿热点
前沿热点

花 1/8 的钱硬刚 Opus 5:Step 5 Preview 值得等吗

据 ai-bot.cn 2026-09-20 收录,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview:稀疏 MoE 架构,总参 600B、每次推理仅激活 27B,原生 100 万 Token 上下文加文本与视觉多模态,面向真实世界 Agentic 任务设计。Artificial Analysis Intelligence Index 拿到 44 分、位居开源模型前三,单任务成本据称仅为 Claude Opus 5 的 1/8,GPU Kernel 优化 508 TFLOPS 略高于 Opus 5 的 493,并展示 22 小时级连续自主 Agent 任务。口径如实标注:数字来自厂商竞品表,每 token 单价与稳定性仍是 Preview 阶段两大未知,权重预告 2026-10-15 才释放,本文不吹不黑只给五个判断。

发布于 2026年9月20日7 分钟阅读
<!-- step-5-preview-hotspot | hotspot | 花 1/8 的钱硬刚 Opus 5:Step 5 Preview 值得等吗 -->

2026 年 9 月 20 日,阶跃星辰(StepFun)推出新一代旗舰基座模型 Step 5 Preview。消息由阶跃星辰官方放出,并被 ai-bot.cn 9 月 20 日每日快讯收录。这条消息值得中国技术从业者认真看一眼:它不是又一款"参数更大"的基座模型,而是一台面向真实世界 Agentic 任务设计的稀疏 MoE 旗舰。它总参 600B、推理仅激活 27B,原生 100 万 Token 上下文,原生多模态(文本加视觉),在 Artificial Analysis Intelligence Index 拿到 44 分、位居开源模型前三,而单任务成本据称仅为 Claude Opus 5 的 1/8。本文不吹不黑,只谈五个判断:发布与硬参数速览、"44 分只花 1/8 的钱"该怎么读、22 小时连续 Agent 任务意味着什么、开源时间表值得等的三个理由与两个风险、以及一轮冷思考。关于本批国产开源编码代理的配套资源,可看本站 MiniMax Code CLI 开源资源盘点;关于终端编码代理的横评,可看本站 终端编码代理横评;关于把模型接进建站流程的 SOP,可看本站 Qoder Sites 建站 SOP

一、发布与硬参数速览:600B 总参,27B 激活,百万上下文

先说清楚它是什么。Step 5 Preview 是阶跃星辰推出的新一代旗舰基座模型,面向真实世界 Agentic 任务设计,不是纯聊天模型,也不是单点工具。据 ai-bot.cn 9 月 20 日收录,它采用稀疏 MoE 架构,总参数 600B,每次推理只激活 27B,支持 100 万 Token 上下文,原生多模态(文本加视觉)。这意味着它和过去"全家桶一起算"的稠密模型不同:推理时只唤醒与当前任务相关的专家,把旗舰级能力和更低的单次算力成本分开。

100 万 Token 上下文是这次的地基。官方口径下,1M token 能原生容纳数十小时任务链里的历史执行记录、工具返回结果与调试反馈,避免分段导致的上下文割裂。对长程 Agent 任务来说,分段是老痛点:切错了边界就会丢掉前后文,后续所有规划都建立在残缺输入上。原生长上下文把"一次跑完"变成可能,这也是它敢于宣称"连续自主任务"的硬件前提。

使用入口分三层。网页端在 studio.stepfun.com 直接对话,最适合先体验能力边界。国内 API 走 platform.stepfun.com,海外 API 走 platform.stepfun.ai,创建 API Key 后按文档调用接口,适合把能力接进自己的系统或 Agent 工作流。官网在 stepfun.com/step-5-preview。三层入口把"模型能力"和"交付流程"分开:模型负责规划与执行,外部工具负责落地,这种分工在后文会反复出现。

关于多模态,要补一句口径。当前原生输入是文本加视觉,没有音频与视频。也就是说它现在能读文档、截图、界面,并基于视觉信息迭代产出,但"看视频""听语音"不在本次原生范围里。对中文市场,视觉理解是真差异点;但对音视频原生的场景,这里还不是它的主战场,选型时别把范围读大。横向看多模态格局,可对照本站 Qwen3.8-Omni-Flash 全模态热点

二、"44 分只花 1/8 的钱"该怎么读:效率路线的真实含义

这一节是本文的第一个核心判断。据 ai-bot.cn 9 月 20 日收录,Step 5 Preview 在 Artificial Analysis Intelligence Index 拿到 44 分,位居开源模型前三,仅次于 GPT-6 Astra 与 Claude Opus 5;而单任务成本据称仅为 Claude Opus 5 的 1/8。把"44 分"和"1/8 成本"并读,结论不是"它打赢了 Opus 5",而是"它走出了一条和闭源旗舰不同的帕累托路线"。

先拆解 1/8 是怎么来的。据 ai-bot.cn 9 月 20 日收录,核心原因是稀疏 MoE:总参 600B 但每次只激活 27B,"按需调用专家"让旗舰级能力不必每次都付全价。这种路线和"把模型做得更大更贵"相反,它追求的是"同样的能力花更少的钱"。所以 1/8 不是营销话术里那种凭空打出来的折扣,而是架构选择带来的结构性后果。换句话,它的便宜来自架构,而不是来自补贴。

再逐项对比和 Opus 5 的输赢,口径必须如实写。据 ai-bot.cn 9 月 20 日收录的竞品表:上下文窗口 Step 5 Preview 100 万 Token 对 Opus 5 的 200K,Step 5 大幅胜,这对长程任务是关键。GPU Kernel 优化 508 TFLOPS 对 Opus 5 的 493 TFLOPS,Step 5 略优。AIME24 后训练从 53.3% 提升到 60%,双方持平,但 Step 5 的 token 消耗更少。Intelligence Index 上 Opus 5 略高于 44 分,Opus 5 胜这一项。开源情况上,Step 5 预告 2026 年 10 月 15 日释权重,而 Opus 5 闭源仅 API。把这几项摆在一起:Step 5 在成本、上下文、单位算力三项占优,在绝对智力指数一项落后,在"是否开源"上两者性质不同(一个预告开放,一个永久闭源)。

必须补一句:这些数字来自厂商竞品表,口径由官方给定,benchmark 不等于全部真实场景,单点分数更不等于产品体验。尤其"单任务成本 1/8"是厂商口径下的对比,真实账单还取决于你的任务长度、调用频次和上下文占用。本文如此陈列,是为了把"花更少的钱拿到接近旗舰的智力"这个事实摆平,而不是替任何一方站台。真正落地时,建议拿自己的数据跑一轮小样本,再决定主用哪家。关于长上下文的真实成本账,可看本站 长上下文 Agent 成本横评

三、22 小时连续 Agent 任务意味着什么:长程自主的真实边界

这一节是本文的第二个核心判断,也是最需要泼冷水的地方。据 ai-bot.cn 9 月 20 日收录,Step 5 Preview 可连续执行超 22 小时的自主任务,如把 GPU 内核优化到 508 TFLOPS、超越 Claude Opus 5;而详情页另一处口径写的是"可在 24 小时内持续执行复杂任务"。两处不一致,本文如实说明:快讯口径是"超 22 小时",详情页口径是"24 小时内"。无论取哪个,指向的都是同一件事——它能在数十小时的任务链里持续规划、调用工具、读取反馈、自我纠错,而不是跑完一轮就交差。

长程自主为什么值钱?因为真实工程任务从来不是单轮问答。优化一个 GPU 内核、自动化一条后训练数据流程、把一个项目从零搭起来,这些活都要"规划、执行、观测、修正"的循环反复跑几十轮。过去模型在长任务里会"忘了前面干了啥",上下文一满就断片,后面全错。Step 5 用 100 万 Token 上下文把整条任务链的历史留在窗口里,并据官方披露形成自主的"规划、执行、观测、修正"闭环,可访问串口、摄像头、API 等外部工具,根据真实环境返回的状态和报错持续改代码,直到任务完成。这才是它和"只会答一轮"的模型最本质的区别。

但边界要讲清楚。第一,口径本身不一致,22 小时和 24 小时是两个数字,说明厂商自己也没给一个被严格公证的连续运行时长,把它当作"已验证的 24 小时无人值守"是过度解读。第二,"连续执行"不等于"一次成功"。在数十小时的链条里,任何一次工具返回异常、环境变动或目标漂移,都可能让后续动作跑偏,而这类错误的修复目前仍主要靠人在回路里兜底。第三,可操作真实硬件这块有具体案例支撑:据 ai-bot.cn 9 月 20 日收录,它能操作串口和摄像头、基于真实硬件返回的报错持续调试代码超过 3 小时,ESP32 开发板改造是其中的代表。3 小时是有实证锚点的,22/24 小时是更上层的整体口径,两者强度不同,别混为一谈。

把边界说透:Step 5 把"长程 Agent"从演示推到了"可用"的门槛,但它现在更像"能连续干几十小时活的强辅助",而不是"关上门就不用人管的全自动工厂"。对从业者来说,正确姿态是把长任务拆成可观测的阶段,在关键节点留人工确认,别把整条链路焊死在单一模型上。

四、开源时间表值得等的三个理由与两个风险:10 月 15 日释权重

这一节必须先把事实摆正。据 ai-bot.cn 9 月 20 日收录,Step 5 Preview 预告 2026 年 10 月 15 日释放完整权重——也就是说,当前是 Preview 阶段,权重尚未放出,它现在还不是开源模型。本次也没有独立 GitHub 代码仓,按站内纪律只能做热点篇,不做开源篇。因此,整篇都要记住一句话:你现在能在 studio 和 API 上体验的是 Preview,能下载权重要等到 10 月 15 日。

值得等的三个理由。第一,权重真放出后,你就能本地部署、私有化、改架构、做蒸馏,把"用 API"升级成"自己掌握模型",对数据敏感和金融、政企场景尤其关键。第二,600B 总参、27B 激活的稀疏 MoE 一旦开源,社区可以拿它做大量可复现的效率研究,"1/8 成本"这个命题才有第三方验证的空间,而不是只停在厂商口径。第三,它在长上下文和 Agentic 闭环上的设计思路,开源后会成为后来者的参考基线,推动整个国产基座的效率路线往前走。

但有两个风险必须讲。第一,"预告"不等于"一定准时"。大模型开源历史上跳票、分阶段放、先放小模型后放大模型的情况不少见,10 月 15 日这个日期是厂商口径,是否如期、放出的是不是完整权重、用什么许可,都要等当天核实,别提前当成已发生的事实。第二,硬件操作类任务的真实可用度待证。它能调试 ESP32 超过 3 小时是实证,但串口、摄像头之外的真实工业设备、不同接线、不同固件,泛化到什么程度没有公开评测。也就是说,"能操作真实硬件"目前是个有锚点但范围有限的结论,别读成"什么硬件都能接"。

一句话收束:10 月 15 日这个日期值得在日历上标,但标的是"待验证",不是"已确定"。等权重真正放出、许可明确、社区跑出复现结果,再把它写进你的技术选型,才是稳妥的工程姿态。

五、冷思考:评测分与真实交付的落差,以及 Preview 阶段的两大未知

最后一轮冷思考,也必须泼。第一,评测分和真实交付之间有落差。44 分、508 TFLOPS、AIME24 60%、553 仓库 33 语言,这些数字很亮,但都来自厂商口径或厂商选定的场景。Intelligence Index 是综合智力代理,不等于你项目里那一个具体任务的交付质量;AIME24 是数学竞赛题,不等于生产环境的鲁棒性;553 仓库是厂商公布的覆盖,不等于你私有代码库里一次就修对。把榜单优势直接当成交付优势,是这一轮国产旗舰最容易让人误读的地方。务必用你自己的小样本去压,再下结论。

第二,Preview 阶段有两大未知,现在都答不了。其一是 API 价格未知。这次只给了"单任务成本 1/8 Opus 5"的对比口径,没有给出你接入时要付的每 token 单价、阶梯价、长上下文的计费方式。对要把它接进生产的人,真实的月度账单才是决策依据,而这个号码现在没有。其二是稳定性未知。Preview 意味着还在迭代,速率限制、可用性、工具调用的一致性、长任务的断点恢复,这些只有大规模公测后才看得到。把关键链路现在就绑死在 Preview 上,风险自担。关于把模型接进建站类 Agent 工作流的落地方法,可看本站 Qoder Sites 建站 SOP;关于终端编码代理的横向能力,可看本站 终端编码代理横评

第三,竞品不会坐视。Opus 5 在绝对智力指数上仍略胜,GPT-6 Astra 排在它前面,阿里、腾讯、字节、智谱等也都有长上下文或 Agent 布局。Step 5 Preview 今天领先的是"用稀疏 MoE 把成本打到 1/8 且保持接近旗舰的智力",这个窗口会不会被快速追上,取决于对手把效率路线补到什么程度。对从业者来说,正确姿态是:把今天能体验的能力接进工作流,同时留好多模型切换的接口,别把关键链路绑死在单一厂商。今天赢在效率,明天可能别人赢在别处,留好退路才是工程上的成熟。

本文的判断收束为一句话:Step 5 Preview 的意义,不在于它把某项 benchmark 刷到了第一(它没刷到),而在于它用稀疏 MoE 把"接近旗舰的智力"和"1/8 的成本"第一次摆到了同一张表上,并用 22 小时级的长程 Agent 展示了国产基座往"能干活"方向走的一步。它是否成为你的生产工具,留给 10 月 15 日的权重和你的场景决定;但"效率路线正在成为国产旗舰的主战场"这个趋势,阶跃星辰用 9 月 20 日的这一发布替行业说清楚了。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-20

相关文章

前沿热点

一句话出片:剪映 Hub 把生成和剪辑焊在一起

据量子位 9-21 报道,字节跳动旗下剪映推出 PC 端一站式 AI 视频创作入口「剪映 Hub」,产品动作不在模型参数而在工作流:把生成与剪辑焊进同一入口。官方定位为 PC 端一站式 AI 视频创作工作台,官方页面给出九项核心功能(AI 生图与素材生成、分镜脚本、模块连线与资产管理、分镜提示词批量生成、多模型视频生成与预览成片、生成后直入剪辑、AI 后编辑、剪映助手 Agent、字节系素材导入),并给出十四步上手路径与一张与即梦 AI 的官方口径对照表(来源方口径,非本站复测)。两个真变化:一是生成结果不导出导入、点「更多剪辑」直接进剪映多轨时间线做 AI 智能延长、超清、补帧、调色、消除、人声分离,本质是"工程内闭环"取代"文件交换";二是剪映助手 Agent 用文字调用剪口播、解说、字幕改误、批量成片等 Skill,把重复劳动压成一句指令。本站判断:工作台解决的是素材到成片的最后一公里,不是画质上限,Hub 是编排层不是生成引擎;闭环代价有三笔账——生态绑定、素材与账号强耦合、定价不透明。定价、免费额度、并发、积分规则、可用地域、单条时长与分辨率上限官方均未公布,一律以官方与客户端实际界面为准,不编数字;上线时间只有二手报道口径。

2026年9月22日7 分钟阅读
前沿热点

2.8 秒压到 2.3 秒:Qwen3.8 同传能替人工译员吗

2026 年 9 月阿里通义千问推出实时同声传译大模型 Qwen3.8-LiveTranslate,已通过千问 AI 平台与阿里云百炼以 WebSocket 实时接口开放,可嵌入会议系统、直播推流与客服坐席。硬指标:字均延迟(LAAL)从 2.8 秒压到 2.3 秒;60 种语言识别输入、29 种语音输出;三大能力为实时说话人分离与音色克隆、原文译文同帧同出、长上下文消歧,另支持视频音频输入辅助消歧。技术上靠 Interleave 单流架构(音频与文本交织,已听音频与已出译文缓存复用,不再每句从头处理)加 Hybrid MoE 的 Thinker–Talker 双模块(Thinker 把视频音频原文译文编进同一条因果序列,Talker 结合译文与源音频合成保留原说话人音色的译文语音)。本文严守口径:2.3 秒是字均延迟不是端到端首包延迟,60 与 29 是两个不同口径,竞品对比表来自官方来源而非本站独立复测,"未公布指标"不等于"做不到",定价限流并发地域均未公开故不编数字,并明确它是 API 服务而非开源模型。

2026年9月21日7 分钟阅读
前沿热点

Qwen3.8-Omni-Flash:从理解到交付的全模态分水岭

据 ai-bot.cn 2026-09-18 收录,阿里千问发布新一代原生全模态模型 Qwen3.8-Omni-Flash:文本/图像/音频/视频输入加 1M 长上下文,主打"从理解到交付"的 Agent 能力,端到端跑通会议纪要、短剧翻译、电影解说等工作流。与 Gemini 3.8 Flash 的对比如实呈现胜三败三:AliMeeting DER 3.4 对 72.6 与 WildClawBench-MM 71.0 对 58.9 大幅胜出,OmniVideoBench、LVOmniBench、FLEURS WER 三项仍落后;API 音频输入降价超 98%、音视频降超 93%,音频成本门槛被打到地板。配套开源 Qwen-MM-Plugins,模型加工具链协同演进。

2026年9月19日7 分钟阅读