本篇与站内已有三篇横评的分工先讲清楚,避免踩彼此的田。agnes-free-multimodal-api-review 比的是免费多模态 API 的"有没有"和"够不够用";kimi-vs-qwen-vs-glm-long-context-review 比的是国产三强的长文本与综合力;post-aug31-token-cost-comparison-review 比的是 11 个模型涨价后的真实 token 成本。这三篇都不专攻"把音视频原样喂给模型"这条锋面。本篇只算这一笔账:音频输入、视频输入、输出价、上下文与效率,能力只做速览不深评。你要是冲着"谁最聪明"来的,本篇给不了,它只回答"谁最便宜把一段会议录音或一段长视频塞进模型"。
一、评测口径与入选标准
第一,本篇只算"把音视频喂给模型"的账。我们关心四件事:音频输入单价、视频输入单价、输出单价、以及上下文窗口带来的工程省心程度。模型在基准上谁高谁低,本篇不拍板,只在速览里点一句,且全部标注来源与方向。凡是跑分,均来自各厂官方发布与第三方追踪,标为"代表性数值,非亲自压测"。
第二,所有价格数字以官方定价页为准,取数日期 2026-09-19。本篇定价的来源依次是:阿里云百炼 / DashScope 定价页、Google Gemini 开发者 API 定价页、火山引擎方舟定价页、OpenAI 官方定价页。海外模型以美元计价、按每百万 token 折算;国内模型以人民币计价,标注"元 / 百万 tokens"。汇率不折算,避免引入又一层会变的变量。凡是我查不到确切数字的,一律定性描述并写"以官方定价页为准",绝不编造价格。
第三,计费口径容易踩坑,先钉死三条。其一是模态是否同价:有的模型文本、图像、音频、视频一个价,有的音频单列高价。其二是 token 折算:同样一小时音频,不同厂的 tokenizer 吐出的 token 数不同,按 token 比价前要先确认两边的 token 是不是同一个东西。其三是输出是否含思考:Gemini 3.8 Flash 的输出价包含 thinking token,OpenAI 部分模型同理,这会显著拉高实际账单。
第四,入选标准。我们选了四个在"音视频输入"这条锋面上真正能打的:Qwen3.8-Omni-Flash(本次降价主角,原生全模态)、Gemini 3.8 Flash(原生多模态、上下文大)、豆包(火山引擎,国内视频理解按链接计费)、OpenAI GPT-5.x 与实时系列(音频输入成熟、视频需拆帧)。讯飞等以纯转写(ASR)见长的厂商,不在"理解型多模态"主表里,只在冷思考里点一句,因为它卖的是"转成文字"而不是"边看边想"。
二、逐家过:Qwen3.8-Omni-Flash
阿里这次把账算得很直白:Qwen3.8-Omni-Flash 全模态同价,输入不再区分文本、图像、音频或视频。中国大陆(阿里云百炼)定价为输入 0.8 元 / 百万 tokens、缓存命中 0.1 元 / 百万 tokens、输出 2.7 元 / 百万 tokens。国际区域(Model Studio,新加坡、中国香港、东京、法兰克福、弗吉尼亚)为输入 0.15 美元 / 百万 tokens、缓存命中 0.016 美元、输出 0.47 美元。来源:阿里云百炼定价页与阿里官方发布博客,取数 2026-09-19。
降价的幅度是这篇的主线。上一代 Qwen3.5-Omni-Plus 在国际区域音频输入要 11 美元 / 百万 tokens,新模型压到 0.15 美元,降幅约 98.6%。按官方口径,每小时音频成本下降超过 98%,音频加视频输入每小时下降超过 93%(官方以两分钟素材处理价乘 30 折算,视频按 720p、每秒 1 帧输入)。中国大陆上代音频输入约 18 元 / 百万 tokens,新模型降到 0.8 元,同一个量级。
能力速览(来源:Qwen 官方发布与 ai-bot.cn 2026-09-18 收录)。在多说话人识别 AliMeeting DER 上,Qwen 3.4 对 Gemini 3.8 Flash 72.6(越低越好,Qwen 大幅领先);WildClawBench-MM 音视频 Agent 71.0 对 58.9(Qwen 胜)。但也要如实写 Gemini 略胜的三项:OmniVideoBench 63.4 对 65.2、LVOmniBench 长视频推理 63.3 对 70.7、FLEURS WER 9.3 对 7.9(越低越好)。也就是说,降价没有以全面能力塌陷为代价,但在长视频推理与多语言 ASR 上 Gemini 仍占优。
工程上 Qwen 给的关键甜头是 1M token 上下文,原生容纳约一小时音视频,且 Agentic 取证把 token 消耗降低约 45.7%。这对"场景账"一节影响很大:同样一小时视频,你不用先切片、抽帧、串多个模型,一次喂进去即可。相关用法与插件见本批的 Qwen3.8-Omni-Flash 热点解读 与 Qwen-MM-Plugins 开源资源,落地步骤见 Qwen3.8-Omni-Flash API 接入 SOP。
三、逐家过:Gemini 3.8 Flash
Google 给 Gemini 3.8 Flash 定的是"全输入模态一个价"。文本、图像、视频、音频、PDF 统一按输入 0.75 美元 / 百万 tokens、输出 3.75 美元(含 thinking token)、缓存命中 0.075 美元计费。来源:Google Gemini 开发者 API 定价页,取数 2026-09-19。这里有两个坑必须标:其一,0.75 / 3.75 是到 2026-12-31 的入门价,2027-01-01 起翻一倍到 1.50 / 7.50;其二,输出价包含思考 token,复杂任务上思考越多账单越厚。
和 Qwen 比,Gemini 的输入单价(0.75 美元)是 Qwen 国际价(0.15 美元)的 5 倍,但输出单价(3.75 美元)只比 Qwen(0.47 美元)贵约 8 倍。换句话说,Gemini 在"喂入"这端更贵,在"产出"这端贵得更多。对长视频这种"输入巨大、输出中等"的负载,Gemini 的贵主要在输入。
能力上 Gemini 在三项基准略胜 Qwen(见上节),且同样 1M 上下文。它的隐性优势是生态成熟、工具链现成、实时 API(Live API)独立计费。但实时语音这条线不在本篇主表,因为它走的是按分钟而非按 token 的实时通道,口径不同。
四、逐家过:豆包与 OpenAI
豆包(火山引擎)的计费要分"理解"和"识别"两本账。理解侧,Doubao-Seed-2.0-pro 接受视频链接输入,公网链接输入约 8.6 元 / 百万 tokens、输出约 28.9 元(输入长度 0-32k 档);若是同地域 TOS 路径,输入可降到约 6.6 元。纯文本 / 图片 / 视频的 Seed-2.1-pro 输入 6 元、输出 30 元、缓存命中 1.2 元 / 百万 tokens;Seed-2.1-turbo 更便宜,输入 3 元、输出 15 元。来源:火山引擎方舟定价页与产品页,取数 2026-09-19。豆包的分段计费(按输入长度 0-32k、32-128k、128-256k 三档递增)是它和"全模态同价"模型最大的不同,长视频若落在高档,单价会明显上浮。
识别侧,豆包的录音文件识别(ASR)是 0.8 元 / 小时、流式语音识别 1.0 元 / 小时。这是"转成文字"的价,不是"理解型多模态"的价,所以本篇不把它和 Qwen、Gemini 的输入价直接比,只在冷思考里提醒:如果你只要转写,ASR 按小时计费往往比把整段音频当 token 喂给大模型便宜得多。
OpenAI 这边,GPT-5.x 原生支持音频输入。GPT-5.4 音频输入 5 美元 / 百万 tokens、音频输出 20 美元、文本输入 2.5 美元、输出 15 美元;GPT-5.5 音频输入 10 美元、文本输入 5 美元、输出 30 美元。来源:OpenAI 官方定价页与多家比价站交叉核对,取数 2026-09-19。视频这一项要特别说明:GPT-5.x 的输入模态以文本、图像、音频为主,原生视频理解需把视频拆成帧当图像喂,没有"一段视频一个价"的官方口径,所以我们按"图像帧输入"估算,并以官方定价页为准。实时语音走 gpt-realtime-2,音频输入约 32 美元 / 百万 tokens,另有按分钟的翻译通道(约 0.034 美元 / 分钟),口径独立于 Chat Completions。
把 OpenAI 放进来比,结论是它在这条锋面上最贵:音频输入 5-10 美元,是 Qwen(0.15 美元)的 30-65 倍。它的强项在推理质量与生态,不在"便宜地吃音视频"。本站更早的 token 成本横评 也指出,OpenAI 的贵主要在输出与思考,与本文结论一致。
五、总对比表:音频、视频、输出、上下文一览
下表把四家的核心数字摊平。所有价格为 2026-09-19 官方定价页快照,币种不同不折算,单位统一标在表头。Gemini 标的是入门价(2026-12-31 前),2027 年起翻倍。
| 模型 | 音频输入 | 视频输入 | 输出 | 缓存命中 | 上下文 | 币种与口径 |
|---|---|---|---|---|---|---|
| Qwen3.8-Omni-Flash | 0.15 美元 / 百万(国际);0.8 元 / 百万(大陆) | 同音频输入(全模态同价) | 0.47 美元 / 2.7 元 | 0.016 美元 / 0.1 元 | 1M | 全模态同价 |
| Gemini 3.8 Flash | 0.75 美元 / 百万(含音视频) | 同输入 | 3.75 美元(含 thinking) | 0.075 美元 | 1M | 入门价,2027 翻倍 |
| 豆包 Seed-2.1-pro | 文本/图/视频 6 元 / 百万 | 视频链接约 8.6 元 / 百万(公网) | 30 元 | 1.2 元 | 256k | 分段计费,按链接类型 |
| OpenAI GPT-5.4 | 5 美元 / 百万(音频) | 拆帧按图像算 | 15 美元 | 0.25 美元 | 400k | 音频单列高价 |
| OpenAI GPT-5.5 | 10 美元 / 百万(音频) | 拆帧按图像算 | 30 美元 | 0.5 美元 | 400k | 音频单列高价 |
这张表一眼能看出锋面:Qwen 在"喂入"这端把价格打到了文本模型的水平,Gemini 便宜在入门价但输出贵且会翻倍,豆包按链接与分段计费对长视频不友好,OpenAI 音频最贵。注意豆包与 OpenAI 的"视频输入"不是原生整段视频价,前者按链接、后者按帧,口径不同,不能直接当成"一段视频一个价"来读。
另一张表补上能力速览的方向,便于把"成本"和"够不够用"放在一张图里看。所有数字为各厂官方发布与第三方追踪的代表性数值,非亲自压测。
| 基准(方向) | Qwen3.8-Omni-Flash | Gemini 3.8 Flash | 说明 |
|---|---|---|---|
| AliMeeting DER(越低越好) | 3.4 | 72.6 | Qwen 大幅领先 |
| WildClawBench-MM(越高越好) | 71.0 | 58.9 | Qwen 胜 |
| OmniVideoBench(越高越好) | 63.4 | 65.2 | Gemini 略胜 |
| LVOmniBench 长视频推理 | 63.3 | 70.7 | Gemini 胜 |
| FLEURS WER(越低越好) | 9.3 | 7.9 | Gemini 略胜 |
六、场景账:三种活各家的钱
下面三个场景都用透明假设,目的是看到相对差距,不是精确报价。假设以官方定价页为准,token 折算因模型而异。为方便比较,国内模型按"元"、海外按"美元"分列,不折算汇率。
场景一:一小时会议录音转纪要。假设一小时单声道会议音频约折合 60K 输入 token(原生音频 tokenizer 估算,实际因厂而异),输出纪要约 2K token。Qwen 国际价:输入 60K × 0.15 / 1M ≈ 0.009 美元,输出 2K × 0.47 / 1M ≈ 0.0009 美元,合计约 0.01 美元(约 0.07 元)。Gemini:输入 0.045 美元、输出 0.0075 美元(含 thinking 会更高),合计约 0.05 美元以上。豆包若用 Seed-2.1-pro 走音频理解约 60K × 6 / 1M ≈ 0.36 元;但若只转写用 ASR 0.8 元 / 小时,明显更贵一档但免 token 折算。OpenAI GPT-5.4 音频:60K × 5 / 1M = 0.3 美元,是 Qwen 的约 30 倍。结论:会议场景 Qwen 与 Gemini 按 token 吃最省,纯转写豆包 ASR 简单但无理解。
场景二:一小时视频转带时间戳笔记。假设一小时 720p、1fps 视频加音频约折合 200K 输入 token、输出约 3K token。Qwen 国际价:输入 200K × 0.15 / 1M = 0.03 美元、输出 3K × 0.47 / 1M ≈ 0.0014 美元,合计约 0.03 美元(约 0.2 元),且 1M 上下文一次喂完不用切片。Gemini:输入 0.15 美元、输出含 thinking 更高,合计约 0.2 美元量级。豆包 Seed-2.0-pro 视频链接(公网)约 200K × 8.6 / 1M ≈ 1.72 元输入、加输出约 1.9 元。OpenAI 需拆帧,按图像帧估算成本与豆包同级甚至更高。结论:长视频 Qwen 的"全模态同价 + 大上下文"优势最明显,能把成本压到美分级别。
场景三:实时语音客服。这条线走实时通道而非 Chat Completions。OpenAI gpt-realtime-2 按分钟约 0.034 美元 / 分钟翻译通道,或按音频 token 约 32 美元 / 百万;Gemini Live API 独立计费,本篇不展开;Qwen3.8-Omni-Flash-Realtime 已发布但定价页 2026-09-19 尚无独立行,以官方定价页为准。实时场景比的不是单价而是延迟与并发,账单结构不同,本篇只点方向不报价。
七、冷思考:降价战、token 优化与隐性成本
第一,降价战的逻辑。Qwen 把音频输入从 11 美元砍到 0.15 美元,本质是把"全模态"从奢侈品拉成日用品。这会改变一类工作负载的经济学:过去因为音频贵而绕开模型的团队,现在可以把长会议、播客、直播直接喂模型。但降价是动态的,Gemini 的入门价 2027 年翻倍,说明"今天最便宜"不代表"永远最便宜",选型要留后路。
第二,token 消耗优化比单价更重要。Qwen 官方说 Agentic 取证把 token 消耗降约 45.7%,这等于在单价之外又打了个对折多。对长音视频,你是用"粗扫定位 + 细粒度取证"还是"整段塞进去",账单能差出近一半。Gemini 的 thinking 同理:把思考档从 high 调到 medium,输出 token 可能少三成。所以比价时先看自己能不能压 token,再看单价。
第三,价格之外的隐性成本。其一,预处理:OpenAI 视频要拆帧、豆包视频要传链接、Gemini 要控抽样率,这些都是工程活,算进人力就是真钱。其二,上传与存储:大视频的 TOS 路径比公网便宜,但你要先搬家。其三,工程复杂度:多模型串接(切片 + 抽帧 + 转写 + 理解)看似单价低,实则维护成本高、出错点多;Qwen 一类"一次喂完"的方案贵在单价低且省工程。其四,合规与数据出境:国内负载走阿里云百炼或火山引擎,数据不出境,这部分成本不在价目表上。讯飞这类纯 ASR 厂商在"只要转写"的场景仍有位置,但它不在理解型多模态主表里。
最后一句收口:本篇只算账不算能力,能力速览已逐家标源。真正选型,把本篇的"成本锋面"和 国产三强长上下文横评、免费多模态 API 横评 一起看,才是一张完整的表。
常见问题
问题一:这篇和站内已有的 token 成本横评有什么区别?
那篇比的是 11 个模型涨价后的真实 token 成本,覆盖文本为主的全家桶;本篇只专攻"把音视频原样喂给模型"这条锋面,算音频输入、视频输入、输出与上下文。两者互补,不踩彼此的田。
问题二:Qwen3.8-Omni-Flash 的降价数字靠谱吗?
音频输入从 11 美元 / 百万 tokens(上代 Qwen3.5-Omni-Plus 国际价)降到 0.15 美元,降幅约 98.6%,来自阿里云定价页与官方发布;每小时音频成本降超 98%、音视频降超 93% 是官方口径(两分钟素材价乘 30)。数字以官方定价页为准,本文取数 2026-09-19。
问题三:为什么 OpenAI 视频没有"一个价"?
GPT-5.x 原生输入以文本、图像、音频为主,视频需拆成帧当图像喂,没有"一段视频一个价"的官方口径,所以本篇按图像帧估算并标注以官方定价页为准。这本身就是 OpenAI 在音视频锋面上的隐性工程成本。
问题四:豆包按小时计费的 ASR 和按 token 的理解,该选哪个?
只要你转写不要理解,豆包录音文件识别 0.8 元 / 小时往往比把整段音频当 token 喂模型便宜;要的是"边听边想"的理解,才走 Seed 系列的理解价(视频链接约 8.6 元 / 百万 tokens 公网)。按需求选,不要混比。
问题五:Gemini 的入门价 2027 年翻倍,现在能信吗?
0.75 / 3.75 是到 2026-12-31 的入门价,Google 文档写明 2027-01-01 起 1.50 / 7.50。这是官方已宣告的变动,不是传闻。long-running 负载要把翻倍后的运行价算进预算,不能只看今天的价。