硬核横评
硬核横评

开会不用请翻译?五款实时同传方案硬核横评

本篇只比"实时同传与流式语音翻译"这一锋面,先立三条入选硬门槛:必须流式输入、至少一方有公开可查的工程口径、云 API 与开源自托管都要覆盖,最终收三云加两开源自托管共五款:Qwen3.8-LiveTranslate、OpenAI GPT-4o Realtime API、kyutai-labs/hibiki、ictnlp/StreamSpeech(MIT、1,291 星、Python)与讯飞同传。开篇即钉死纪律:延迟口径不可直接横比,绝不把字均延迟、首包延迟、端到端延迟与未公布指标摆在一起排快慢,无统一基准就不替你下谁快的结论。逐家拆部署形态、语种覆盖、许可边界与同日仓库快照,点出能力半径差异(三家闭源云 API 覆盖广但数据出境且不可改,两家开源自托管可改可本地但覆盖面窄)。文末按场景给选型建议,并与站内云端对本地成本账、语音克隆工具横评、实时语音对话模型发布三篇划清分工,确保几篇横评不混谈。

发布于 2026年9月21日8 分钟阅读
<!-- realtime-interpretation-comparison-review | review | 开会不用请翻译?五款实时同传方案硬核横评 -->

实时同传正从发布会演示搬进真实生产线。跨国会议要字幕,跨境直播要配音,视频本地化要双语成片,出海客服培训要实时旁译。需求很实,可方案口径乱得很:有人报字均延迟,有人报首包延迟,有人只说端到端很快,还有人不报数。本文只把五款方案放一张桌,按工程可用性逐项对照,帮选型少踩坑。

一、评测口径与入选标准

先说站内分工,免得几篇横评混谈。本篇只比实时同传与流式语音翻译这一锋面,边听边译、边说边出。云端对比本地语音的成本账,另有 云端对比本地语音的成本账;语音克隆工具横评,见 语音克隆工具横评;实时语音对话模型发布脉络,见 实时语音对话模型发布。本篇不碰纯语音克隆、离线质量基准、通用语音助手,三篇各守各的田。

入选三条。第一,必须流式输入,音频边进边出,不等整句说完。第二,至少一方有公开可查工程口径,云看文档,开源看仓库与论文。第三,云 API 与开源自托管都要有,所以收了三家云 API 加两家开源自托管。

最重要纪律写前面:延迟口径不可直接横比。每家延迟都注哪种口径,绝不把字均延迟、首包延迟、端到端延迟和未公布指标摆一起排快慢。无统一基准,本站不替你下谁快结论。

二、五方总览

下表先总览,细节第三节逐家展开。仓库数字统一标截至 2026-09-21 GitHub API 快照,星标每日变,只当同日快照,勿当长期排行。

方案形态部署语种许可快照数字
Qwen3.8-LiveTranslate端到端同传大模型云 API60 识别 / 29 语音输出闭源 API 服务无公开代码仓
OpenAI GPT-4o Realtime API实时语音对话加 gpt-realtime-translate云 API70 加输入 / 13 输出专有闭源无公开代码仓
kyutai-labs/hibiki流式语音翻译自托管仅 FR 到 EN代码 MIT/Apache,权重 CC-BY 4.01,519 星 / Rust
ictnlp/StreamSpeech离线加同时 ASR/ST/TTS自托管FR/ES/DE 到 ENMIT1,291 星 / Python
讯飞同传(iFlytek)端到端同传,SaaS 加 API 加私有化云 SaaS/API,可私有化约 14 到 16 种互译专有闭源无公开代码仓

三家闭源云 API,两家开源自托管,分布刚好,能力半径差异大,下文拆开。

三、逐家过

1. Qwen3.8-LiveTranslate

阿里通义千问的实时同声传译大模型,已通过千问 AI 平台开放 API。架构是 Interleave 单流,把音频与文本交织进一条序列,已听音频与已出译文都缓存复用,再配 Hybrid MoE 的 Thinker 与 Talker 双模块,前者编排视频、音频、原文、译文做理解翻译,后者合成保留原说话人音色的译文语音。

延迟官方口径是字均延迟从 2.8 秒压到 2.3 秒,这 2.3 秒是 LAAL,不是端到端首包延迟,不能外推成整体速度。语种是 60 种识别输入加 29 种语音输出,两口径不同,不能混成一个数。输出上原文译文在同序列对齐,天然双语同帧同出。说话人分离原生支持,先做 Diarization 再分说话人复刻音色朗读。部署是云 API,入口为千问 AI 平台与阿里云百炼 WebSocket API,在线体验在 omni.qwen.ai/live-translate。定价、限流、并发、地域官方未公开,以官方文档为准,不编单价。它是 API 服务,无公开代码仓,不得声称开源。背景见 Qwen3.8 同传发布热点,接入见 Qwen3.8 同传 API 实战

2. OpenAI GPT-4o Realtime API

OpenAI 实时语音体系,主体是端到端多模态语音进语音出。2026 年 5 月 7 日上线专用同传模型 gpt-realtime-translate,经实时翻译端点,把 70 多种语言口语实时译到 13 种输出语言,说话人无需停顿。通用 Realtime 约支持 50 多种语言对话。

延迟要小心。OpenAI 不公布官方端到端同传延迟。第三方 2026 基准实测 gpt-realtime-translate,首段译出音频中位约 711 毫秒,连续语音滞后中位约 3.8 秒、密集可漂到 20 秒以上,这是基准口径非官方,且和 Qwen 的 LAAL 不是一把尺。维度表标未公布官方同传指标,不写更慢。

输出返回译文语音加双文本,默认单语为主,不保证双语同帧。音色会动态跟随原说话人语调音高,新说话人进入时切换声音,属有限适配,非分说话人真实克隆。说话人分离有限,靠 VAD 轮次切分。部署云 API,走 WebSocket 或 WebRTC。成本上 gpt-realtime-translate 每分钟 0.034 美元,通用系列按 token,具体以 OpenAI 官方为准。许可专有闭源。脉络见 实时语音对话模型发布

3. kyutai-labs/hibiki

法国开源实验室 Kyutai 的流式语音翻译模型,论文 arXiv 2502.03382,High-Fidelity Simultaneous Speech-To-Speech Translation。定位流式语音翻译,语音到语音,可选音色迁移,同时输出文本。架构复用 Moshi 的 multistream,decoder-only,源与目标语音联合建模,边处理输入边生成目标语音。

延迟 README 未给端到端数。它恒定 12.5Hz 帧率产出文本与音频 token,形成连续音频流加带时间戳文本。训练最长 120 秒,上下文窗口 40 秒,是工程约束非延迟承诺,故标未公布,不横比。

语种是最大短板,仅法语到英语。输出文本音频同步,音色保真可调,改 CFG 系数,默认 1,经验 3,越大越像但过大会伤翻译。说话人分离非主打。部署自托管,多后端覆盖 PyTorch、MLX、MLX-Swift、Rust,小模型 Hibiki-M 可手机本地跑。许可按仓库实写:代码 MIT 覆盖 Python 与 web,Rust 后端 Apache-2.0,权重 CC-BY 4.0,权重需署名,勿笼统写 Apache 或 MIT。实读见 hibiki 资源页。快照 2026-09-21:1,519 星、119 派生、Rust、push 2026-09-09。

4. ictnlp/StreamSpeech

中科院计算所 NLP 组的 All in One 无缝模型,ACL 2024 论文。把离线与时序 simultaneously 的 ASR、语音翻译、语音合成收进一个模型,two-pass 架构,靠 CTC 对齐控制边说边生成。CVSS 基准上离线与同时传的语音到语音翻译都超 Meta 的 UnitY。

延迟官方称端到端低至约 320 毫秒,是 CVSS 数字,含 S2ST 开销,度量用 Average Lagging,是已公布最具体的同传延迟,但和 Qwen 的 LAAL 不同口径,不能摆一起比。语种 Fr-En、Es-En、De-En 三组检查点,目标皆英语。输出 ASR、翻译、合成同出,还能逐词增量合成。说话人分离与音色不是能力,TTS 固定音色。

部署自托管,需 Python 3.10、PyTorch 2.0.1、fairseq 加 SimulEval 与 GPU。许可 MIT,商用友好。快照 2026-09-21:1,291 星、Python、push 2025-06-29。

5. 讯飞同传(iFlytek)

科大讯飞的 AI 同声传译产品族,底层星火语音同传大模型,官方称国内首个端到端语音同传大模型。三个入口:消费端 App、PC 客户端与网页悬浮字幕;开发者用的讯飞开放平台同声传译 API;政企用的讯飞听见多语言会议系统,支持全链路私有化部署。

延迟须注意。官方宣传反复出现两个数字:中英同传首字响应最快约 2 秒,语音播报延迟约 2 秒,都是首字或首音响应口径,非 LAAL 也非端到端稳定滞后,不能和 Qwen 的 2.3 秒 LAAL 摆一起。维度表标未公布官方同传指标,注宣传首字约 2 秒,不下快慢结论。

语种相对能打。宣传约 14 到 16 种互译,覆盖中、英、日、韩、法、德、俄、西、意、阿、泰、越、粤语等,比 hibiki 单语对和 StreamSpeech 三组方向宽,但少于 Qwen 60 识别加 29 输出、也少于 GPT-4o 70 加输入加 13 输出。具体方向以官方页面为准,不下全 16 种任意互译结论。

输出实时返原文加译文双语字幕,用 AI 合成语音播报,文本加语音。2025 年 10 月起新增声音复刻,用户可用自己声音播报,官方称相似度超 90%,是有限度音色保留,非分说话人自动克隆。说话人分离非 headline 参数,会议产品靠自身 ASR 切分,未给细粒度复刻承诺。

部署区别于纯云 API。主形态是云端 SaaS 与开放平台 API,但听见多语言会议系统提供全链路私有化,音频文本可内网加密流转、全程离线,对涉密与数据出境敏感场景是硬优势。成本上消费端网页每月免费 2 小时、App/PC 每日免费 20 分钟,超出约 0.8 元每分钟;开放平台 API 按套餐时长,100 小时 2000 元、1000 小时 15000 元、5000 小时 60000 元(均 5 路并发、一年),折合约 0.2 到 0.33 元每分钟,具体以讯飞开放平台定价页为准。许可专有闭源商业服务,无公开代码仓,不得声称开源。

四、分维度对比总表

下表压成七个维度。延迟一栏逐家标口径,一眼看出谁报了什么、谁没报。

维度Qwen3.8GPT-4o RealtimehibikiStreamSpeech讯飞同传
延迟口径与可达性LAAL 2.3 秒,官方未公布官方,基准首译约 711 毫秒、连续滞后约 3.8 秒未公布,12.5Hz 帧CVSS 约 320 毫秒 AL宣传首字约 2 秒,未公布官方 LAAL
语种覆盖60 识别 / 29 输出70 加输入 / 13 输出仅 FR 到 ENFR/ES/DE 到 EN约 14 到 16 种互译
输出形态文本加语音,双语同帧语音加文本,单语为主文本加语音,带时间戳多结果同出,增量 TTS文本加语音,双语字幕,声音复刻
说话人分离与音色保留原生,分说话人克隆有限,动态适配语调,非克隆非主打,可选音色迁移无,固定合成音色会议 ASR 切分,声音复刻有限度
部署形态云 API云 API自托管多后端自托管 GPU云 SaaS/API,可私有化
成本结构官方文档为准0.034 美元每分起,以官方为准算力成本,无 API 费算力成本消费端 0.8 元/分起;API 套餐 100h 2000 元起
许可与数据边界闭源 API专有闭源代码 MIT/Apache,权重 CC-BY 4.0MIT专有闭源;可私有化保数据本地

表的价值不在排名,在把不可比延迟并排摊开。Qwen 2.3 秒、StreamSpeech 320 毫秒、讯飞宣传 2 秒首字、GPT-4o 基准 711 毫秒,度量对象完全不同,当一把尺会错。

五、场景账

选型落到场景。四个常见场景各给第一顺位与一句话理由,只基于工程口径,不赌翻译质量。

跨国会议。第一顺位 Qwen3.8,同帧双语字幕加原生说话人分离,多人轮替最省心,前提接受云 API 与数据出境。涉密不可上云,退用讯飞同传私有化把数据留内网,或本地跑 hibiki,但仅法语到英语。

跨境直播。第一顺位 Qwen3.8,双语同帧加音色复刻,观众听译文像原主播。预算紧且源语法语,用 hibiki 本地音色迁移压成本;要主播用自己的声音,讯飞同传声音复刻也可,但宽语种不如 Qwen 与 GPT-4o。

视频本地化。第一顺位 StreamSpeech,一体离线加同时传,逐词增量合成,配剪辑做双语成片顺手,MIT 商用无负担。现成视频轻量加字幕,讯飞同传网页或客户端后期约 0.48 元每分钟也能顶。

出海客服培训。第一顺位 OpenAI gpt-realtime-translate,70 多输入加 13 输出,覆盖广、接 Realtime 生态快,培训对同帧字幕要求低。内训边听边译,讯飞同传宽语种加可私有化也能低成本搭,但要补并发与合规评估。

六、冷思考

同传共性短板,选型前认清。第一,延迟口径普遍不透明。云多报首包或体验时延,开源多报基准 AL 或帧率,无统一基准,排快慢是伪命题。第二,小语种质量不可验证。除少数基准语种,真实口音、专有名词、行业术语公开评测覆盖不到,须自己语料实测。第三,合规与数据出境是硬约束。闭源云 API 把音频传出,跨境与涉密先过合规;开源自托管留本地,讯飞也提供私有化留内网,按数据归属选部署。第四,人工兜底不可省。无论哪家,正式场合保留译员或质检工位,机器同传是辅助非替代。语音到语音翻译脉络,另见 语音到语音翻译资源页

仓库星标均 2026-09-21 快照,每日浮动,不当长期排行。许可证以当日实读为准,商用前再核。

常见问题

Q1:为什么不能把各家延迟直接排个快慢?

A1:因为各家报不同口径。Qwen 2.3 秒是字均延迟 LAAL,StreamSpeech 320 毫秒是 CVSS 的 Average Lagging,讯飞宣传 2 秒是首字响应,GPT-4o 基准 711 毫秒是首段译出音频中位且连续会滞后。度量对象不同,摆一起比会错,故逐项标口径,不排座次。

Q2:开源方案里哪家语种覆盖最宽?

A2:直接能跑的开源语音同传,hibiki 仅法语到英语,StreamSpeech 只有 FR/ES/DE 到 EN,都窄。要真能跑的宽覆盖语音同传,开源没有一家直接满足,闭源云 API(Qwen 60 识别加 29 输出、GPT-4o 70 加输入加 13 输出、讯飞约 14 到 16 种)反而更宽。

Q3:数据不能出境的涉密会议能用哪家?

A3:优先数据本地的方案。讯飞同传私有化把音频文本留内网、可全程离线;hibiki 与 StreamSpeech 自托管本地 GPU。纯公有云 API(Qwen、GPT-4o)把音频传出境外,涉密不建议直接上,须先过合规评估。

Q4:Qwen3.8 和 hibiki 能本地跑吗,源码开放吗?

A4:Qwen3.8 是 API 服务,无公开代码仓,不能本地自托管,也不得声称开源。hibiki 代码 MIT 与 Apache-2.0 分离、权重 CC-BY 4.0,可自托管,小模型手机端本地跑,但仅法语到英语。讯飞同传不可本地自托管源码,但提供私有化把数据留本地。

Q5:成本上云 API 和自托管哪个更省?

A5:无统一答案。云 API 按量计费,OpenAI gpt-realtime-translate 每分 0.034 美元起,讯飞开放平台同声传译 API 100 小时 2000 元起(约 0.2 到 0.33 元每分钟),Qwen 以官方为准;自托管省 API 费但背算力运维。低并发自用往往自托管划算,高并发规模化要宽语种,云 API 省心但账单随量走,以自己流量画像测算。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-21

常见问题

为什么不能把各家延迟直接排个快慢?
因为各家报不同口径。Qwen 2.3 秒是字均延迟 LAAL,StreamSpeech 320 毫秒是 CVSS 的 Average Lagging,讯飞宣传 2 秒是首字响应,GPT-4o 基准 711 毫秒是首段译出音频中位且连续会滞后。度量对象不同,摆一起比会错,故逐项标口径,不排座次。
开源方案里哪家语种覆盖最宽?
直接能跑的开源语音同传,hibiki 仅法语到英语,StreamSpeech 只有 FR/ES/DE 到 EN,都窄。要真能跑的宽覆盖语音同传,开源没有一家直接满足,闭源云 API(Qwen 60 识别加 29 输出、GPT-4o 70 加输入加 13 输出、讯飞约 14 到 16 种)反而更宽。
数据不能出境的涉密会议能用哪家?
优先数据本地的方案。讯飞同传私有化把音频文本留内网、可全程离线;hibiki 与 StreamSpeech 自托管本地 GPU。纯公有云 API(Qwen、GPT-4o)把音频传出境外,涉密不建议直接上,须先过合规评估。
Qwen3.8 和 hibiki 能本地跑吗,源码开放吗?
Qwen3.8 是 API 服务,无公开代码仓,不能本地自托管,也不得声称开源。hibiki 代码 MIT 与 Apache-2.0 分离、权重 CC-BY 4.0,可自托管,小模型手机端本地跑,但仅法语到英语。讯飞同传不可本地自托管源码,但提供私有化把数据留本地。
成本上云 API 和自托管哪个更省?
无统一答案。云 API 按量计费,OpenAI gpt-realtime-translate 每分 0.034 美元起,讯飞开放平台同声传译 API 100 小时 2000 元起(约 0.2 到 0.33 元每分钟),Qwen 以官方为准;自托管省 API 费但背算力运维。低并发自用往往自托管划算,高并发规模化要宽语种,云 API 省心但账单随量走,以自己流量画像测算。

相关文章

硬核横评

终端里养一支工程队:五款命令行编程 agent 横评

本篇只比"终端编码代理"这一形态,不比谁的模型更聪明:横向对比 MiniMax Code CLI、Claude Code、Codex CLI、Qwen Code 与 Gemini CLI 七个维度(安装、无头与 CI、模型自由度 BYOK、权限与沙箱、扩展面、开源许可、计费模式),仓库数字统一取 2026-09-20 GitHub API 快照。核心发现:模型自由度是最大分野,五款里只有 MiniMax 与 Qwen Code 支持 BYOK 到别家厂商;沙箱做得最实的是 Codex CLI 的 full-auto 断网加目录围栏;Claude Code 扩展面最成熟但闭源且只吃自家模型。文末给个人日常、无人值守 CI、企业合规、换模省钱四类场景的选型账,并点出上下文可读性、权限误判、模型锁定三项共性弱点。

2026年9月20日8 分钟阅读
硬核横评

音视频模型成本账:长音视频喂给 AI,谁最划算

本篇只算"把音视频喂给模型"的账:横向对比 Qwen3.8-Omni-Flash、Gemini 3.8 Flash、豆包 Seed 系与 OpenAI GPT-5.x(取数 2026-09-19,均以官方定价页为准)的音频/视频输入价格与能力速览。核心发现:Qwen3.8-Omni-Flash 大陆全模态同价 0.8 元/百万输入、2.7 元输出,相对上代音频输入降幅约 98.6%;Gemini 3.8 Flash 输入 0.75 美元/百万(2026-12-31 前入门价,2027 年起翻倍);OpenAI 音频输入 5-10 美元/百万,实时音频约 32 美元/百万。文末给一小时会议、一小时视频转笔记、实时客服三种场景账,并提醒:token 消耗优化与隐性工程成本比单价更值得算。

2026年9月19日8 分钟阅读
硬核横评

AI 编程工具免费额度横评:只算不花钱的账

本篇只算免费账、不比模型能力:横向对比 Qoder、Cursor、Trae、Windsurf、Claude Code、Codex 六家(取数 2026-09-18,均以官方定价页为准)的免费档内容与限制。核心发现:Trae 免费档账面最厚(1000 高级请求 + 5000 补全每月)、Cursor Hobby 给 2000 补全 + 50 慢速请求、Windsurf 每月 25 prompt credits + 每日 5 次 Cascade;Claude Code 与 Codex 无真正免费档,完整使用需 $20/月订阅。窗口期内 Qoder 的 Qwen3.8-Flash 限免 + 每日 100 Credits 是当前白嫖上限。文末按白嫖党、轻度、重度三类人群给组合策略,并提醒免费的真实成本:数据、锁定与窗口期后涨价。

2026年9月18日8 分钟阅读