硬核横评
硬核横评

音视频模型成本账:长音视频喂给 AI,谁最划算

本篇只算"把音视频喂给模型"的账:横向对比 Qwen3.8-Omni-Flash、Gemini 3.8 Flash、豆包 Seed 系与 OpenAI GPT-5.x(取数 2026-09-19,均以官方定价页为准)的音频/视频输入价格与能力速览。核心发现:Qwen3.8-Omni-Flash 大陆全模态同价 0.8 元/百万输入、2.7 元输出,相对上代音频输入降幅约 98.6%;Gemini 3.8 Flash 输入 0.75 美元/百万(2026-12-31 前入门价,2027 年起翻倍);OpenAI 音频输入 5-10 美元/百万,实时音频约 32 美元/百万。文末给一小时会议、一小时视频转笔记、实时客服三种场景账,并提醒:token 消耗优化与隐性工程成本比单价更值得算。

发布于 2026年9月19日8 分钟阅读
<!-- audio-video-model-cost-comparison-review | review | 音视频模型成本账:长音视频喂给 AI,谁最划算 -->

本篇与站内已有三篇横评的分工先讲清楚,避免踩彼此的田。agnes-free-multimodal-api-review 比的是免费多模态 API 的"有没有"和"够不够用";kimi-vs-qwen-vs-glm-long-context-review 比的是国产三强的长文本与综合力;post-aug31-token-cost-comparison-review 比的是 11 个模型涨价后的真实 token 成本。这三篇都不专攻"把音视频原样喂给模型"这条锋面。本篇只算这一笔账:音频输入、视频输入、输出价、上下文与效率,能力只做速览不深评。你要是冲着"谁最聪明"来的,本篇给不了,它只回答"谁最便宜把一段会议录音或一段长视频塞进模型"。

一、评测口径与入选标准

第一,本篇只算"把音视频喂给模型"的账。我们关心四件事:音频输入单价、视频输入单价、输出单价、以及上下文窗口带来的工程省心程度。模型在基准上谁高谁低,本篇不拍板,只在速览里点一句,且全部标注来源与方向。凡是跑分,均来自各厂官方发布与第三方追踪,标为"代表性数值,非亲自压测"。

第二,所有价格数字以官方定价页为准,取数日期 2026-09-19。本篇定价的来源依次是:阿里云百炼 / DashScope 定价页、Google Gemini 开发者 API 定价页、火山引擎方舟定价页、OpenAI 官方定价页。海外模型以美元计价、按每百万 token 折算;国内模型以人民币计价,标注"元 / 百万 tokens"。汇率不折算,避免引入又一层会变的变量。凡是我查不到确切数字的,一律定性描述并写"以官方定价页为准",绝不编造价格。

第三,计费口径容易踩坑,先钉死三条。其一是模态是否同价:有的模型文本、图像、音频、视频一个价,有的音频单列高价。其二是 token 折算:同样一小时音频,不同厂的 tokenizer 吐出的 token 数不同,按 token 比价前要先确认两边的 token 是不是同一个东西。其三是输出是否含思考:Gemini 3.8 Flash 的输出价包含 thinking token,OpenAI 部分模型同理,这会显著拉高实际账单。

第四,入选标准。我们选了四个在"音视频输入"这条锋面上真正能打的:Qwen3.8-Omni-Flash(本次降价主角,原生全模态)、Gemini 3.8 Flash(原生多模态、上下文大)、豆包(火山引擎,国内视频理解按链接计费)、OpenAI GPT-5.x 与实时系列(音频输入成熟、视频需拆帧)。讯飞等以纯转写(ASR)见长的厂商,不在"理解型多模态"主表里,只在冷思考里点一句,因为它卖的是"转成文字"而不是"边看边想"。

二、逐家过:Qwen3.8-Omni-Flash

阿里这次把账算得很直白:Qwen3.8-Omni-Flash 全模态同价,输入不再区分文本、图像、音频或视频。中国大陆(阿里云百炼)定价为输入 0.8 元 / 百万 tokens、缓存命中 0.1 元 / 百万 tokens、输出 2.7 元 / 百万 tokens。国际区域(Model Studio,新加坡、中国香港、东京、法兰克福、弗吉尼亚)为输入 0.15 美元 / 百万 tokens、缓存命中 0.016 美元、输出 0.47 美元。来源:阿里云百炼定价页与阿里官方发布博客,取数 2026-09-19。

降价的幅度是这篇的主线。上一代 Qwen3.5-Omni-Plus 在国际区域音频输入要 11 美元 / 百万 tokens,新模型压到 0.15 美元,降幅约 98.6%。按官方口径,每小时音频成本下降超过 98%,音频加视频输入每小时下降超过 93%(官方以两分钟素材处理价乘 30 折算,视频按 720p、每秒 1 帧输入)。中国大陆上代音频输入约 18 元 / 百万 tokens,新模型降到 0.8 元,同一个量级。

能力速览(来源:Qwen 官方发布与 ai-bot.cn 2026-09-18 收录)。在多说话人识别 AliMeeting DER 上,Qwen 3.4 对 Gemini 3.8 Flash 72.6(越低越好,Qwen 大幅领先);WildClawBench-MM 音视频 Agent 71.0 对 58.9(Qwen 胜)。但也要如实写 Gemini 略胜的三项:OmniVideoBench 63.4 对 65.2、LVOmniBench 长视频推理 63.3 对 70.7、FLEURS WER 9.3 对 7.9(越低越好)。也就是说,降价没有以全面能力塌陷为代价,但在长视频推理与多语言 ASR 上 Gemini 仍占优。

工程上 Qwen 给的关键甜头是 1M token 上下文,原生容纳约一小时音视频,且 Agentic 取证把 token 消耗降低约 45.7%。这对"场景账"一节影响很大:同样一小时视频,你不用先切片、抽帧、串多个模型,一次喂进去即可。相关用法与插件见本批的 Qwen3.8-Omni-Flash 热点解读Qwen-MM-Plugins 开源资源,落地步骤见 Qwen3.8-Omni-Flash API 接入 SOP

三、逐家过:Gemini 3.8 Flash

Google 给 Gemini 3.8 Flash 定的是"全输入模态一个价"。文本、图像、视频、音频、PDF 统一按输入 0.75 美元 / 百万 tokens、输出 3.75 美元(含 thinking token)、缓存命中 0.075 美元计费。来源:Google Gemini 开发者 API 定价页,取数 2026-09-19。这里有两个坑必须标:其一,0.75 / 3.75 是到 2026-12-31 的入门价,2027-01-01 起翻一倍到 1.50 / 7.50;其二,输出价包含思考 token,复杂任务上思考越多账单越厚。

和 Qwen 比,Gemini 的输入单价(0.75 美元)是 Qwen 国际价(0.15 美元)的 5 倍,但输出单价(3.75 美元)只比 Qwen(0.47 美元)贵约 8 倍。换句话说,Gemini 在"喂入"这端更贵,在"产出"这端贵得更多。对长视频这种"输入巨大、输出中等"的负载,Gemini 的贵主要在输入。

能力上 Gemini 在三项基准略胜 Qwen(见上节),且同样 1M 上下文。它的隐性优势是生态成熟、工具链现成、实时 API(Live API)独立计费。但实时语音这条线不在本篇主表,因为它走的是按分钟而非按 token 的实时通道,口径不同。

四、逐家过:豆包与 OpenAI

豆包(火山引擎)的计费要分"理解"和"识别"两本账。理解侧,Doubao-Seed-2.0-pro 接受视频链接输入,公网链接输入约 8.6 元 / 百万 tokens、输出约 28.9 元(输入长度 0-32k 档);若是同地域 TOS 路径,输入可降到约 6.6 元。纯文本 / 图片 / 视频的 Seed-2.1-pro 输入 6 元、输出 30 元、缓存命中 1.2 元 / 百万 tokens;Seed-2.1-turbo 更便宜,输入 3 元、输出 15 元。来源:火山引擎方舟定价页与产品页,取数 2026-09-19。豆包的分段计费(按输入长度 0-32k、32-128k、128-256k 三档递增)是它和"全模态同价"模型最大的不同,长视频若落在高档,单价会明显上浮。

识别侧,豆包的录音文件识别(ASR)是 0.8 元 / 小时、流式语音识别 1.0 元 / 小时。这是"转成文字"的价,不是"理解型多模态"的价,所以本篇不把它和 Qwen、Gemini 的输入价直接比,只在冷思考里提醒:如果你只要转写,ASR 按小时计费往往比把整段音频当 token 喂给大模型便宜得多。

OpenAI 这边,GPT-5.x 原生支持音频输入。GPT-5.4 音频输入 5 美元 / 百万 tokens、音频输出 20 美元、文本输入 2.5 美元、输出 15 美元;GPT-5.5 音频输入 10 美元、文本输入 5 美元、输出 30 美元。来源:OpenAI 官方定价页与多家比价站交叉核对,取数 2026-09-19。视频这一项要特别说明:GPT-5.x 的输入模态以文本、图像、音频为主,原生视频理解需把视频拆成帧当图像喂,没有"一段视频一个价"的官方口径,所以我们按"图像帧输入"估算,并以官方定价页为准。实时语音走 gpt-realtime-2,音频输入约 32 美元 / 百万 tokens,另有按分钟的翻译通道(约 0.034 美元 / 分钟),口径独立于 Chat Completions。

把 OpenAI 放进来比,结论是它在这条锋面上最贵:音频输入 5-10 美元,是 Qwen(0.15 美元)的 30-65 倍。它的强项在推理质量与生态,不在"便宜地吃音视频"。本站更早的 token 成本横评 也指出,OpenAI 的贵主要在输出与思考,与本文结论一致。

五、总对比表:音频、视频、输出、上下文一览

下表把四家的核心数字摊平。所有价格为 2026-09-19 官方定价页快照,币种不同不折算,单位统一标在表头。Gemini 标的是入门价(2026-12-31 前),2027 年起翻倍。

模型音频输入视频输入输出缓存命中上下文币种与口径
Qwen3.8-Omni-Flash0.15 美元 / 百万(国际);0.8 元 / 百万(大陆)同音频输入(全模态同价)0.47 美元 / 2.7 元0.016 美元 / 0.1 元1M全模态同价
Gemini 3.8 Flash0.75 美元 / 百万(含音视频)同输入3.75 美元(含 thinking)0.075 美元1M入门价,2027 翻倍
豆包 Seed-2.1-pro文本/图/视频 6 元 / 百万视频链接约 8.6 元 / 百万(公网)30 元1.2 元256k分段计费,按链接类型
OpenAI GPT-5.45 美元 / 百万(音频)拆帧按图像算15 美元0.25 美元400k音频单列高价
OpenAI GPT-5.510 美元 / 百万(音频)拆帧按图像算30 美元0.5 美元400k音频单列高价

这张表一眼能看出锋面:Qwen 在"喂入"这端把价格打到了文本模型的水平,Gemini 便宜在入门价但输出贵且会翻倍,豆包按链接与分段计费对长视频不友好,OpenAI 音频最贵。注意豆包与 OpenAI 的"视频输入"不是原生整段视频价,前者按链接、后者按帧,口径不同,不能直接当成"一段视频一个价"来读。

另一张表补上能力速览的方向,便于把"成本"和"够不够用"放在一张图里看。所有数字为各厂官方发布与第三方追踪的代表性数值,非亲自压测。

基准(方向)Qwen3.8-Omni-FlashGemini 3.8 Flash说明
AliMeeting DER(越低越好)3.472.6Qwen 大幅领先
WildClawBench-MM(越高越好)71.058.9Qwen 胜
OmniVideoBench(越高越好)63.465.2Gemini 略胜
LVOmniBench 长视频推理63.370.7Gemini 胜
FLEURS WER(越低越好)9.37.9Gemini 略胜

六、场景账:三种活各家的钱

下面三个场景都用透明假设,目的是看到相对差距,不是精确报价。假设以官方定价页为准,token 折算因模型而异。为方便比较,国内模型按"元"、海外按"美元"分列,不折算汇率。

场景一:一小时会议录音转纪要。假设一小时单声道会议音频约折合 60K 输入 token(原生音频 tokenizer 估算,实际因厂而异),输出纪要约 2K token。Qwen 国际价:输入 60K × 0.15 / 1M ≈ 0.009 美元,输出 2K × 0.47 / 1M ≈ 0.0009 美元,合计约 0.01 美元(约 0.07 元)。Gemini:输入 0.045 美元、输出 0.0075 美元(含 thinking 会更高),合计约 0.05 美元以上。豆包若用 Seed-2.1-pro 走音频理解约 60K × 6 / 1M ≈ 0.36 元;但若只转写用 ASR 0.8 元 / 小时,明显更贵一档但免 token 折算。OpenAI GPT-5.4 音频:60K × 5 / 1M = 0.3 美元,是 Qwen 的约 30 倍。结论:会议场景 Qwen 与 Gemini 按 token 吃最省,纯转写豆包 ASR 简单但无理解。

场景二:一小时视频转带时间戳笔记。假设一小时 720p、1fps 视频加音频约折合 200K 输入 token、输出约 3K token。Qwen 国际价:输入 200K × 0.15 / 1M = 0.03 美元、输出 3K × 0.47 / 1M ≈ 0.0014 美元,合计约 0.03 美元(约 0.2 元),且 1M 上下文一次喂完不用切片。Gemini:输入 0.15 美元、输出含 thinking 更高,合计约 0.2 美元量级。豆包 Seed-2.0-pro 视频链接(公网)约 200K × 8.6 / 1M ≈ 1.72 元输入、加输出约 1.9 元。OpenAI 需拆帧,按图像帧估算成本与豆包同级甚至更高。结论:长视频 Qwen 的"全模态同价 + 大上下文"优势最明显,能把成本压到美分级别。

场景三:实时语音客服。这条线走实时通道而非 Chat Completions。OpenAI gpt-realtime-2 按分钟约 0.034 美元 / 分钟翻译通道,或按音频 token 约 32 美元 / 百万;Gemini Live API 独立计费,本篇不展开;Qwen3.8-Omni-Flash-Realtime 已发布但定价页 2026-09-19 尚无独立行,以官方定价页为准。实时场景比的不是单价而是延迟与并发,账单结构不同,本篇只点方向不报价。

七、冷思考:降价战、token 优化与隐性成本

第一,降价战的逻辑。Qwen 把音频输入从 11 美元砍到 0.15 美元,本质是把"全模态"从奢侈品拉成日用品。这会改变一类工作负载的经济学:过去因为音频贵而绕开模型的团队,现在可以把长会议、播客、直播直接喂模型。但降价是动态的,Gemini 的入门价 2027 年翻倍,说明"今天最便宜"不代表"永远最便宜",选型要留后路。

第二,token 消耗优化比单价更重要。Qwen 官方说 Agentic 取证把 token 消耗降约 45.7%,这等于在单价之外又打了个对折多。对长音视频,你是用"粗扫定位 + 细粒度取证"还是"整段塞进去",账单能差出近一半。Gemini 的 thinking 同理:把思考档从 high 调到 medium,输出 token 可能少三成。所以比价时先看自己能不能压 token,再看单价。

第三,价格之外的隐性成本。其一,预处理:OpenAI 视频要拆帧、豆包视频要传链接、Gemini 要控抽样率,这些都是工程活,算进人力就是真钱。其二,上传与存储:大视频的 TOS 路径比公网便宜,但你要先搬家。其三,工程复杂度:多模型串接(切片 + 抽帧 + 转写 + 理解)看似单价低,实则维护成本高、出错点多;Qwen 一类"一次喂完"的方案贵在单价低且省工程。其四,合规与数据出境:国内负载走阿里云百炼或火山引擎,数据不出境,这部分成本不在价目表上。讯飞这类纯 ASR 厂商在"只要转写"的场景仍有位置,但它不在理解型多模态主表里。

最后一句收口:本篇只算账不算能力,能力速览已逐家标源。真正选型,把本篇的"成本锋面"和 国产三强长上下文横评免费多模态 API 横评 一起看,才是一张完整的表。

常见问题

问题一:这篇和站内已有的 token 成本横评有什么区别?

那篇比的是 11 个模型涨价后的真实 token 成本,覆盖文本为主的全家桶;本篇只专攻"把音视频原样喂给模型"这条锋面,算音频输入、视频输入、输出与上下文。两者互补,不踩彼此的田。

问题二:Qwen3.8-Omni-Flash 的降价数字靠谱吗?

音频输入从 11 美元 / 百万 tokens(上代 Qwen3.5-Omni-Plus 国际价)降到 0.15 美元,降幅约 98.6%,来自阿里云定价页与官方发布;每小时音频成本降超 98%、音视频降超 93% 是官方口径(两分钟素材价乘 30)。数字以官方定价页为准,本文取数 2026-09-19。

问题三:为什么 OpenAI 视频没有"一个价"?

GPT-5.x 原生输入以文本、图像、音频为主,视频需拆成帧当图像喂,没有"一段视频一个价"的官方口径,所以本篇按图像帧估算并标注以官方定价页为准。这本身就是 OpenAI 在音视频锋面上的隐性工程成本。

问题四:豆包按小时计费的 ASR 和按 token 的理解,该选哪个?

只要你转写不要理解,豆包录音文件识别 0.8 元 / 小时往往比把整段音频当 token 喂模型便宜;要的是"边听边想"的理解,才走 Seed 系列的理解价(视频链接约 8.6 元 / 百万 tokens 公网)。按需求选,不要混比。

问题五:Gemini 的入门价 2027 年翻倍,现在能信吗?

0.75 / 3.75 是到 2026-12-31 的入门价,Google 文档写明 2027-01-01 起 1.50 / 7.50。这是官方已宣告的变动,不是传闻。long-running 负载要把翻倍后的运行价算进预算,不能只看今天的价。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-19

常见问题

这篇和站内已有的 token 成本横评有什么区别?
那篇比的是 11 个模型涨价后的真实 token 成本,覆盖文本为主的全家桶;本篇只专攻"把音视频原样喂给模型"这条锋面,算音频输入、视频输入、输出与上下文。两者互补,不踩彼此的田。
Qwen3.8-Omni-Flash 的降价数字靠谱吗?
音频输入从 11 美元 / 百万 tokens(上代 Qwen3.5-Omni-Plus 国际价)降到 0.15 美元,降幅约 98.6%,来自阿里云定价页与官方发布;每小时音频成本降超 98%、音视频降超 93% 是官方口径(两分钟素材价乘 30)。数字以官方定价页为准,本文取数 2026-09-19。
为什么 OpenAI 视频没有"一个价"?
GPT-5.x 原生输入以文本、图像、音频为主,视频需拆成帧当图像喂,没有"一段视频一个价"的官方口径,所以本篇按图像帧估算并标注以官方定价页为准。这本身就是 OpenAI 在音视频锋面上的隐性工程成本。
豆包按小时计费的 ASR 和按 token 的理解,该选哪个?
只要你转写不要理解,豆包录音文件识别 0.8 元 / 小时往往比把整段音频当 token 喂模型便宜;要的是"边听边想"的理解,才走 Seed 系列的理解价(视频链接约 8.6 元 / 百万 tokens 公网)。按需求选,不要混比。
Gemini 的入门价 2027 年翻倍,现在能信吗?
0.75 / 3.75 是到 2026-12-31 的入门价,Google 文档写明 2027-01-01 起 1.50 / 7.50。这是官方已宣告的变动,不是传闻。long-running 负载要把翻倍后的运行价算进预算,不能只看今天的价。

相关文章

硬核横评

AI 编程工具免费额度横评:只算不花钱的账

本篇只算免费账、不比模型能力:横向对比 Qoder、Cursor、Trae、Windsurf、Claude Code、Codex 六家(取数 2026-09-18,均以官方定价页为准)的免费档内容与限制。核心发现:Trae 免费档账面最厚(1000 高级请求 + 5000 补全每月)、Cursor Hobby 给 2000 补全 + 50 慢速请求、Windsurf 每月 25 prompt credits + 每日 5 次 Cascade;Claude Code 与 Codex 无真正免费档,完整使用需 $20/月订阅。窗口期内 Qoder 的 Qwen3.8-Flash 限免 + 每日 100 Credits 是当前白嫖上限。文末按白嫖党、轻度、重度三类人群给组合策略,并提醒免费的真实成本:数据、锁定与窗口期后涨价。

2026年9月18日8 分钟阅读
硬核横评

自托管 AI 助手五方横评:形态与归属

本篇不比模型能力、只比"形态与归属":横向对比 Octop、Open WebUI、Dify、FastGPT、LibreChat 五方(星数均为 2026-09-17 GitHub API 快照)在定位分层、多用户能力、部署形态、开源许可、模型接入、数据归属六个维度的差异。核心发现:MIT(Octop/LibreChat)与自定义许可(Open WebUI/Dify/FastGPT)在商用与再分发上差别实在;"家庭/小团队每人独立记忆"的多用户隔离目前只有 Octop 以第一设计目标实现。文末按个人尝鲜、家庭共享、小团队、知识库应用、工作流编排五类人群给选型建议,企业引入前务必读各仓 LICENSE 原文。

2026年9月17日8 分钟阅读
硬核横评

实时视频生成模型横评:谁能边聊边改

本篇不比画质、只比"形态与归属":横向对比 Vidu S2、可灵 Kling、即梦 Jimeng、豆包 Seedance、Sora 2、HiDream-O1-Video 在实时交互与实时编辑能力、交付形态(网页/API/开源权重/商业产品)、开源闭源归属、适用场景上的差异。核心判断:选实时视频工具买的不是画质,而是工作流——能否边聊边改、改稿成本多高、产物归谁。文末给出按电商试穿、虚拟人直播、广告短片、个人玩票等场景的选型建议,并提醒实时画质与成本尚无第三方统一评测,别被"实时"营销词带节奏。

2026年9月17日10 分钟阅读