前沿热点
前沿热点

Qwen3.8-Omni-Flash:从理解到交付的全模态分水岭

据 ai-bot.cn 2026-09-18 收录,阿里千问发布新一代原生全模态模型 Qwen3.8-Omni-Flash:文本/图像/音频/视频输入加 1M 长上下文,主打"从理解到交付"的 Agent 能力,端到端跑通会议纪要、短剧翻译、电影解说等工作流。与 Gemini 3.8 Flash 的对比如实呈现胜三败三:AliMeeting DER 3.4 对 72.6 与 WildClawBench-MM 71.0 对 58.9 大幅胜出,OmniVideoBench、LVOmniBench、FLEURS WER 三项仍落后;API 音频输入降价超 98%、音视频降超 93%,音频成本门槛被打到地板。配套开源 Qwen-MM-Plugins,模型加工具链协同演进。

发布于 2026年9月19日7 分钟阅读
<!-- qwen3-8-omni-flash-hotspot | hotspot | Qwen3.8-Omni-Flash:从理解到交付的全模态分水岭 -->

2026 年 9 月 18 日,阿里千问发布新一代原生全模态模型 Qwen3.8-Omni-Flash。消息由千问官方放出,并被 ai-bot.cn 9 月 18 日每日快讯收录。这条消息值得中国技术从业者认真看一眼:它不是又一款"能看图说话"的多模态模型,而是把"从理解到交付"写进产品定位的全模态 Agent。它支持文本、图像、音频、视频四类输入,原生 1M 长上下文,可端到端完成视频剪辑、MV 创作、短剧翻译、电影解说、会议纪要执行等长程工作流。据 ai-bot.cn 9 月 18 日收录,相较上代平均提升超 26%,API 音频输入价格降幅超 98%,音视频输入降价超 93%。本文不吹不黑,只谈五个判断:模型定位、从理解到交付的分水岭、与 Gemini 3.8 Flash 的如实对比、降价 98% 的战略意图、以及全模态 Agent 的冷思考。关于开源配套,可看本站 Qwen-MM-Plugins 开源资源盘点;关于接入成本,可看本站 音视频模型成本横评;关于 API 落地,可看本站 Qwen3.8-Omni-Flash API 接入 SOP

一、事件与模型定位:原生全模态,1M 上下文

先说清楚它是什么。Qwen3.8-Omni-Flash 是阿里千问推出的原生全模态模型,所谓"原生",指文本、图像、音频、视频四类模态在单一架构内联合建模,而不是把几个单模态模型拼起来再接一个路由器。"全模态"和"统一架构"是这次定位里最关键的两个词:跨模态的理解来自统一的表示空间,而不是后处理拼接。据千问官方披露,它保持与同尺寸纯文本模型相当的文本能力,这意味着加模态没有以牺牲语言能力为代价,模型不会因为"眼睛变多"而"嘴变笨"。

1M 长上下文是另一个支点。官方口径下,1M token 能原生容纳数小时音视频输入,避免分段处理导致的信息割裂。对长会议、长电影、长课程这类场景,分段是老痛点:切错了边界就会丢掉前后文,理解跟着断片,后面所有推理都建立在残缺的输入上。原生长上下文把"一次看完"变成可能,这是后面所有 Agent 工作流的地基,也是它敢于宣称"端到端交付"的硬件前提。

配套的使用入口有三层。网页端在 qianwenai.com 的模型页直接对话,最适合先体验能力边界。API 走阿里云 DashScope,兼容 OpenAI 接口,传图片、音频、视频链接加文字问题即可,适合把能力接进自己的系统。插件侧在 Claude Code、Qwen Code 等工具里装 Qwen-MM-Plugins,用"@视频.mp4 帮我做成解说视频"这种自然语言驱动端到端流程,适合把能力接进 Agent 工作流。三层入口把"模型能力"和"交付流程"分开了:模型负责理解与规划,插件负责调用工具与执行,这种分工在后文会反复出现。

二、"从理解到交付":理解型模型到交付型 Agent 的分水岭

这一节是本文的核心判断。过去几年多模态模型的叙事是"理解":你给它一张图、一段视频,它告诉你里面有什么、发生了什么。Qwen3.8-Omni-Flash 把卖点从"理解"推进到"交付",这是一次定位跃迁,值得当成分水岭来看。理解回答的是"这是什么",交付回答的是"你要的成品做好了没有"。

具体看它交付了什么。可控音视频 Caption 让你可以指定描述对象、时间范围、信息粒度与输出格式,模型输出的是"你想知道的"而不是"它看到的",把字幕、摘要、标签的生成权交回用户。Agentic 长音视频理解从问题出发,自主决定看哪里、听什么,由粗到细多轮取证,据 ai-bot.cn 9 月 18 日收录,token 消耗降低约 45.7%,准确不降反升,这一条对长视频成本尤其关键。长会议理解与执行原生支持一小时音视频输入,端到端完成说话人切分、转录、身份对齐、纪要生成与待办执行,把"开会"到"有行动项"的链路一次性拉通。Music2MV 把歌曲结构、节奏、情绪理解成带时间戳歌词,贯穿 MV 创作全流程。短剧翻译一句话完成台词识别、口语化翻译、音色克隆配音、音轨重混与质检,把译制这种原本要多人协作的活压成一句指令。长电影解说输入影片加一句话需求,自动跑完全片理解、情节提炼、解说文案、配音配乐、剪辑渲染与质检。Video2Note 把数小时视频压成图文对应、带时间戳的 PDF 笔记,并自动审阅迭代修正。Omni Skill Creator 从演示或专家教学提炼 SOP,转成经校验的可复用 Agent Skill,把"人会做"变成"Agent 会做"。

这些不是 Demo 式的单点功能,而是一条价值链:理解之后是规划,规划之后是工具调用,工具调用之后是成片与文档。判断一家模型公司是否进入"交付"阶段,就看它是否把最后一步"成片与文档"也包进来了。Qwen3.8-Omni-Flash 把这步包进来了,这是它和纯理解型模型最本质的区别,也是它敢于用"Omni"而不是"VL"给自己命名的原因。

但分水岭不等于终点。从理解到交付这条路,卡点从来不在模型聪不聪明,而在 harness 有没有原生音视频支持。官方也承认,长音视频 Agent 化的瓶颈在于 harness 缺乏原生音视频能力,所以这次是模型加工具链协同演进:Qwen-MM-Plugins 提供按需感知、工具调用与工作流执行,接入 Claude Code、OpenClaw 等主流 Agent 框架。换句话说,模型负责"想明白",插件负责"办得成"。这个分工值得记下来,因为后面第四节的降价和第五节的风险都绕不开它:交付型 Agent 的上限,取决于模型与 harness 哪一边更短。

三、与 Gemini 3.8 Flash 的如实对比:胜三败三

竞品表的口径必须如实写,不吹不黑。据 ai-bot.cn 9 月 18 日收录的详情页竞品表,Qwen3.8-Omni-Flash 与 Gemini 3.8 Flash 在六项基准上交手,两者上下文窗口都是 1M token,最终结果是胜三败三。下面把六项拆开,每一项都标注口径方向,避免误读。

先写 Qwen 赢的三项。多说话人识别 AliMeeting DER,Qwen 3.4 对 Gemini 72.6,注意 DER 越低越好,这个差距是数量级的,Qwen 大幅胜,对应的是会议、访谈、多人对话这类高频场景。音视频 Agent 基准 WildClawBench-MM,Qwen 71.0 对 Gemini 58.9,Qwen 胜,对应的是端到端交付这类它主打的能力。音频能力的整体叙事也站在 Qwen 这边:60 项语言语音识别、39 种中文方言,而 Gemini 的中文方言支持明显更少,这对中文市场是实打实的差异。

再写 Gemini 赢的三项,这三项必须如实带出,不能因为主角是 Qwen 就藏起来。OmniVideoBench 音视频理解,Qwen 63.4 对 Gemini 65.2,Gemini 略胜。LVOmniBench 长视频推理,Qwen 63.3 对 Gemini 70.7,Gemini 胜,且差距不小,说明在长片内容的结构化理解上 Qwen 仍有补课空间。FLEURS WER 多语言 ASR,Qwen 9.3 对 Gemini 7.9,WER 越低越好,Gemini 略胜,对应的是多语言语音识别的准确度。

把六项摆在一起看,结论很清楚:Qwen 的护城河在音频与 Agent,泛视频理解仍有差距。音频是多说话人、多方言、低延迟交互的底座,Agent 是端到端交付的引擎,这两块恰好是"从理解到交付"最需要的能力,也是它能打出差异化标签的地方。而 Gemini 在纯视频理解与长视频推理上更稳,说明它在海量视频预训练上的积累还没被追平。对用户来说,这意味着选型要看场景:做会议纪要、语音交互、音视频 Agent,Qwen 眼下更合适;做长片内容理解、纯视频推理,Gemini 仍值得比较。横向价格对比可看本站 音视频模型成本横评

必须补一句:这些数字来自厂商竞品表,口径由官方给定,benchmark 不代表全部真实场景,单点分数更不等于产品体验。本文如此陈列,是为了把"胜三败三"这个事实摆平,而不是替任何一方站台。真正落地时,建议拿自己的数据跑一轮小样本,再决定主用哪家。

四、降价 98% 的战略意图:音频输入成本打到地板价

如果说模型能力是明线,降价就是暗线,而且可能是更狠的一招。据 ai-bot.cn 9 月 18 日收录,API 音频输入价格降幅超 98%,音视频输入降价超 93%。把音频输入成本打到接近地板价,意图很清楚:让"喂音频"这件事不再有心理负担,把语音从"高级功能"降级成"默认输入"。

为什么要专门打音频?因为音频是所有语音交互场景的入口。会议纪要、客服录音、口语陪练、播客转写、电话质检,这些场景的共同点是音视频输入量大、调用频次高、对单价敏感。过去音频模型贵,开发者会在"要不要上语音"上犹豫,结果语音功能被排到路线图末尾;当单价降到可以忽略,犹豫就消失了,原本不做语音的产品会开始做语音,原本小规模的语音功能会放大成主流程。这是一种需求创造,比单纯在大模型榜上赢一分更持久,因为它改变的是产品形态,而不只是榜单名次。

更值得看的是它对生态的撬动。Qwen-MM-Plugins 把模型能力接进 Claude Code、Qwen Code 等 Agent 框架,而低价音频输入让"在 Agent 里顺手处理一段录音"变成零成本动作。模型便宜加插件顺手,这两件事叠在一起,会催生一批以音视频为原生输入的新 Agent:会议录音自动出纪要并建任务、客服录音自动出质检报告、课程录音自动出带时间戳笔记。对中小团队来说,这意味着可以用很低的边际成本,把过去要专门采购语音服务的流程产品化,把语音从成本中心变成功能亮点。

但地板价也有代价。超低价往往伴随厂商的变现压力后移:先用价格把规模做起来,再在更高层的 Agent 平台、云资源、存储上回收。这本身合理,是云厂商常见的打法,但选型时要算长期账,别只盯首发价。当你的产品深度依赖低价音频输入,厂商任何一次调价都会直接打到你的毛利。本站 Qwen3.8-Omni-Flash API 接入 SOP 会带你把 DashScope 接口跑通,建议你同时记下用量与单价,并在架构里留好切换余地,别把语音链路焊死在单一供应商上。

五、冷思考:全模态 Agent 的 harness 短板与竞品回应预期

最后泼一点冷水,也必须泼。第一,harness 仍是短板。官方自己点明,长音视频 Agent 化的瓶颈在于 harness 缺乏原生音视频支持,所以才用 Qwen-MM-Plugins 去补。但插件补的是"能不能调工具",补不了"长程任务会不会跑偏"。端到端剪辑、解说、翻译这条链路越长,中间出错的概率越高:一句台词翻译错了、一段镜头切错了、一个待办建错了,而这类错误的修复成本,目前还主要靠人在回路里兜底。换句话说,交付型 Agent 离"无人值守交付"还有距离,它现在更像"强辅助"而不是"全自动工厂"。

第二,开源配套要分清真假。本次真正开源的是 Qwen-MM-Plugins,据 GitHub API 核实(2026 年 9 月 19 日口径),仓库 QwenLM/Qwen-MM-Plugins 当时约 2,908 star、183 fork,使用 Python、Apache-2.0 许可,创建于 2026 年 7 月 29 日,最近一次 push 为 2026 年 9 月 18 日,描述为 Make any agent harness multimodal-native。本站 Qwen-MM-Plugins 开源资源盘点 会展开讲它的架构与接法。注意:网上有些页面把另一个名为 Qwen-Live-Harness 的仓库也列进开源清单,但截至本文核实该仓并无公开地址,不要把它当成已开源项目,避免引用错误、误导读者去找一个不存在的仓库。

第三,竞品不会坐视。Gemini 在三项视频基准上胜出,Google 大概率会继续加注视频理解;OpenAI、字节、腾讯等也都有全模态或 Agent 布局。Qwen3.8-Omni-Flash 今天领先的是音频与 Agent 交付,这个窗口会不会被快速追上,取决于对手把"理解到交付"的链路补到什么程度。对从业者来说,正确姿态是:把今天能用的能力接进工作流,同时留好多模型切换的接口,别把关键链路绑死在单一厂商。今天赢在音频,明天可能别人赢在视频,留好退路才是工程上的成熟。

本文的判断收束为一句话:Qwen3.8-Omni-Flash 的意义,不在于它把某项 benchmark 刷到了第一,而在于它把"全模态加 1M 上下文加从理解到交付"作为产品定位交到开发者手里,并用 98% 的降价把音频输入的门槛砍到了地板。它是否成为你的生产工具,留给你的场景决定;但"理解型模型正在让位于交付型 Agent"这个趋势,阿里用 9 月 18 日的这一发布替行业说清楚了。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-19

相关文章

前沿热点

Qwen3.8-Flash 在 Qoder 限时免费:13 天窗口期怎么用

据 IT之家 2026-09-18 报道,Qoder 推出双福利:9 月 18 日 10:00 至 9 月 30 日 23:59:59,Qwen3.8-Flash 计费系数从 0.1 降为 0,调用完全免费;同期每日 10:00 起发放 100 Credits,30 天有效期、可叠加,国际版与国内版全体个人用户均可参与。本文拆解"免费窗口期"为何是编程工具赛道的标准营销打法(拉新、习惯养成、窗口期后留存),给出 Qwen3.8-Flash 的适用任务定位与行动清单,并提醒:这是限免不是永久免费,9 月 30 日后系数恢复 0.1。

2026年9月18日7 分钟阅读