实时同传正从发布会演示搬进真实生产线。跨国会议要字幕,跨境直播要配音,视频本地化要双语成片,出海客服培训要实时旁译。需求很实,可方案口径乱得很:有人报字均延迟,有人报首包延迟,有人只说端到端很快,还有人不报数。本文只把五款方案放一张桌,按工程可用性逐项对照,帮选型少踩坑。
一、评测口径与入选标准
先说站内分工,免得几篇横评混谈。本篇只比实时同传与流式语音翻译这一锋面,边听边译、边说边出。云端对比本地语音的成本账,另有 云端对比本地语音的成本账;语音克隆工具横评,见 语音克隆工具横评;实时语音对话模型发布脉络,见 实时语音对话模型发布。本篇不碰纯语音克隆、离线质量基准、通用语音助手,三篇各守各的田。
入选三条。第一,必须流式输入,音频边进边出,不等整句说完。第二,至少一方有公开可查工程口径,云看文档,开源看仓库与论文。第三,云 API 与开源自托管都要有,所以收了三家云 API 加两家开源自托管。
最重要纪律写前面:延迟口径不可直接横比。每家延迟都注哪种口径,绝不把字均延迟、首包延迟、端到端延迟和未公布指标摆一起排快慢。无统一基准,本站不替你下谁快结论。
二、五方总览
下表先总览,细节第三节逐家展开。仓库数字统一标截至 2026-09-21 GitHub API 快照,星标每日变,只当同日快照,勿当长期排行。
| 方案 | 形态 | 部署 | 语种 | 许可 | 快照数字 |
|---|---|---|---|---|---|
| Qwen3.8-LiveTranslate | 端到端同传大模型 | 云 API | 60 识别 / 29 语音输出 | 闭源 API 服务 | 无公开代码仓 |
| OpenAI GPT-4o Realtime API | 实时语音对话加 gpt-realtime-translate | 云 API | 70 加输入 / 13 输出 | 专有闭源 | 无公开代码仓 |
| kyutai-labs/hibiki | 流式语音翻译 | 自托管 | 仅 FR 到 EN | 代码 MIT/Apache,权重 CC-BY 4.0 | 1,519 星 / Rust |
| ictnlp/StreamSpeech | 离线加同时 ASR/ST/TTS | 自托管 | FR/ES/DE 到 EN | MIT | 1,291 星 / Python |
| 讯飞同传(iFlytek) | 端到端同传,SaaS 加 API 加私有化 | 云 SaaS/API,可私有化 | 约 14 到 16 种互译 | 专有闭源 | 无公开代码仓 |
三家闭源云 API,两家开源自托管,分布刚好,能力半径差异大,下文拆开。
三、逐家过
1. Qwen3.8-LiveTranslate
阿里通义千问的实时同声传译大模型,已通过千问 AI 平台开放 API。架构是 Interleave 单流,把音频与文本交织进一条序列,已听音频与已出译文都缓存复用,再配 Hybrid MoE 的 Thinker 与 Talker 双模块,前者编排视频、音频、原文、译文做理解翻译,后者合成保留原说话人音色的译文语音。
延迟官方口径是字均延迟从 2.8 秒压到 2.3 秒,这 2.3 秒是 LAAL,不是端到端首包延迟,不能外推成整体速度。语种是 60 种识别输入加 29 种语音输出,两口径不同,不能混成一个数。输出上原文译文在同序列对齐,天然双语同帧同出。说话人分离原生支持,先做 Diarization 再分说话人复刻音色朗读。部署是云 API,入口为千问 AI 平台与阿里云百炼 WebSocket API,在线体验在 omni.qwen.ai/live-translate。定价、限流、并发、地域官方未公开,以官方文档为准,不编单价。它是 API 服务,无公开代码仓,不得声称开源。背景见 Qwen3.8 同传发布热点,接入见 Qwen3.8 同传 API 实战。
2. OpenAI GPT-4o Realtime API
OpenAI 实时语音体系,主体是端到端多模态语音进语音出。2026 年 5 月 7 日上线专用同传模型 gpt-realtime-translate,经实时翻译端点,把 70 多种语言口语实时译到 13 种输出语言,说话人无需停顿。通用 Realtime 约支持 50 多种语言对话。
延迟要小心。OpenAI 不公布官方端到端同传延迟。第三方 2026 基准实测 gpt-realtime-translate,首段译出音频中位约 711 毫秒,连续语音滞后中位约 3.8 秒、密集可漂到 20 秒以上,这是基准口径非官方,且和 Qwen 的 LAAL 不是一把尺。维度表标未公布官方同传指标,不写更慢。
输出返回译文语音加双文本,默认单语为主,不保证双语同帧。音色会动态跟随原说话人语调音高,新说话人进入时切换声音,属有限适配,非分说话人真实克隆。说话人分离有限,靠 VAD 轮次切分。部署云 API,走 WebSocket 或 WebRTC。成本上 gpt-realtime-translate 每分钟 0.034 美元,通用系列按 token,具体以 OpenAI 官方为准。许可专有闭源。脉络见 实时语音对话模型发布。
3. kyutai-labs/hibiki
法国开源实验室 Kyutai 的流式语音翻译模型,论文 arXiv 2502.03382,High-Fidelity Simultaneous Speech-To-Speech Translation。定位流式语音翻译,语音到语音,可选音色迁移,同时输出文本。架构复用 Moshi 的 multistream,decoder-only,源与目标语音联合建模,边处理输入边生成目标语音。
延迟 README 未给端到端数。它恒定 12.5Hz 帧率产出文本与音频 token,形成连续音频流加带时间戳文本。训练最长 120 秒,上下文窗口 40 秒,是工程约束非延迟承诺,故标未公布,不横比。
语种是最大短板,仅法语到英语。输出文本音频同步,音色保真可调,改 CFG 系数,默认 1,经验 3,越大越像但过大会伤翻译。说话人分离非主打。部署自托管,多后端覆盖 PyTorch、MLX、MLX-Swift、Rust,小模型 Hibiki-M 可手机本地跑。许可按仓库实写:代码 MIT 覆盖 Python 与 web,Rust 后端 Apache-2.0,权重 CC-BY 4.0,权重需署名,勿笼统写 Apache 或 MIT。实读见 hibiki 资源页。快照 2026-09-21:1,519 星、119 派生、Rust、push 2026-09-09。
4. ictnlp/StreamSpeech
中科院计算所 NLP 组的 All in One 无缝模型,ACL 2024 论文。把离线与时序 simultaneously 的 ASR、语音翻译、语音合成收进一个模型,two-pass 架构,靠 CTC 对齐控制边说边生成。CVSS 基准上离线与同时传的语音到语音翻译都超 Meta 的 UnitY。
延迟官方称端到端低至约 320 毫秒,是 CVSS 数字,含 S2ST 开销,度量用 Average Lagging,是已公布最具体的同传延迟,但和 Qwen 的 LAAL 不同口径,不能摆一起比。语种 Fr-En、Es-En、De-En 三组检查点,目标皆英语。输出 ASR、翻译、合成同出,还能逐词增量合成。说话人分离与音色不是能力,TTS 固定音色。
部署自托管,需 Python 3.10、PyTorch 2.0.1、fairseq 加 SimulEval 与 GPU。许可 MIT,商用友好。快照 2026-09-21:1,291 星、Python、push 2025-06-29。
5. 讯飞同传(iFlytek)
科大讯飞的 AI 同声传译产品族,底层星火语音同传大模型,官方称国内首个端到端语音同传大模型。三个入口:消费端 App、PC 客户端与网页悬浮字幕;开发者用的讯飞开放平台同声传译 API;政企用的讯飞听见多语言会议系统,支持全链路私有化部署。
延迟须注意。官方宣传反复出现两个数字:中英同传首字响应最快约 2 秒,语音播报延迟约 2 秒,都是首字或首音响应口径,非 LAAL 也非端到端稳定滞后,不能和 Qwen 的 2.3 秒 LAAL 摆一起。维度表标未公布官方同传指标,注宣传首字约 2 秒,不下快慢结论。
语种相对能打。宣传约 14 到 16 种互译,覆盖中、英、日、韩、法、德、俄、西、意、阿、泰、越、粤语等,比 hibiki 单语对和 StreamSpeech 三组方向宽,但少于 Qwen 60 识别加 29 输出、也少于 GPT-4o 70 加输入加 13 输出。具体方向以官方页面为准,不下全 16 种任意互译结论。
输出实时返原文加译文双语字幕,用 AI 合成语音播报,文本加语音。2025 年 10 月起新增声音复刻,用户可用自己声音播报,官方称相似度超 90%,是有限度音色保留,非分说话人自动克隆。说话人分离非 headline 参数,会议产品靠自身 ASR 切分,未给细粒度复刻承诺。
部署区别于纯云 API。主形态是云端 SaaS 与开放平台 API,但听见多语言会议系统提供全链路私有化,音频文本可内网加密流转、全程离线,对涉密与数据出境敏感场景是硬优势。成本上消费端网页每月免费 2 小时、App/PC 每日免费 20 分钟,超出约 0.8 元每分钟;开放平台 API 按套餐时长,100 小时 2000 元、1000 小时 15000 元、5000 小时 60000 元(均 5 路并发、一年),折合约 0.2 到 0.33 元每分钟,具体以讯飞开放平台定价页为准。许可专有闭源商业服务,无公开代码仓,不得声称开源。
四、分维度对比总表
下表压成七个维度。延迟一栏逐家标口径,一眼看出谁报了什么、谁没报。
| 维度 | Qwen3.8 | GPT-4o Realtime | hibiki | StreamSpeech | 讯飞同传 |
|---|---|---|---|---|---|
| 延迟口径与可达性 | LAAL 2.3 秒,官方 | 未公布官方,基准首译约 711 毫秒、连续滞后约 3.8 秒 | 未公布,12.5Hz 帧 | CVSS 约 320 毫秒 AL | 宣传首字约 2 秒,未公布官方 LAAL |
| 语种覆盖 | 60 识别 / 29 输出 | 70 加输入 / 13 输出 | 仅 FR 到 EN | FR/ES/DE 到 EN | 约 14 到 16 种互译 |
| 输出形态 | 文本加语音,双语同帧 | 语音加文本,单语为主 | 文本加语音,带时间戳 | 多结果同出,增量 TTS | 文本加语音,双语字幕,声音复刻 |
| 说话人分离与音色保留 | 原生,分说话人克隆 | 有限,动态适配语调,非克隆 | 非主打,可选音色迁移 | 无,固定合成音色 | 会议 ASR 切分,声音复刻有限度 |
| 部署形态 | 云 API | 云 API | 自托管多后端 | 自托管 GPU | 云 SaaS/API,可私有化 |
| 成本结构 | 官方文档为准 | 0.034 美元每分起,以官方为准 | 算力成本,无 API 费 | 算力成本 | 消费端 0.8 元/分起;API 套餐 100h 2000 元起 |
| 许可与数据边界 | 闭源 API | 专有闭源 | 代码 MIT/Apache,权重 CC-BY 4.0 | MIT | 专有闭源;可私有化保数据本地 |
表的价值不在排名,在把不可比延迟并排摊开。Qwen 2.3 秒、StreamSpeech 320 毫秒、讯飞宣传 2 秒首字、GPT-4o 基准 711 毫秒,度量对象完全不同,当一把尺会错。
五、场景账
选型落到场景。四个常见场景各给第一顺位与一句话理由,只基于工程口径,不赌翻译质量。
跨国会议。第一顺位 Qwen3.8,同帧双语字幕加原生说话人分离,多人轮替最省心,前提接受云 API 与数据出境。涉密不可上云,退用讯飞同传私有化把数据留内网,或本地跑 hibiki,但仅法语到英语。
跨境直播。第一顺位 Qwen3.8,双语同帧加音色复刻,观众听译文像原主播。预算紧且源语法语,用 hibiki 本地音色迁移压成本;要主播用自己的声音,讯飞同传声音复刻也可,但宽语种不如 Qwen 与 GPT-4o。
视频本地化。第一顺位 StreamSpeech,一体离线加同时传,逐词增量合成,配剪辑做双语成片顺手,MIT 商用无负担。现成视频轻量加字幕,讯飞同传网页或客户端后期约 0.48 元每分钟也能顶。
出海客服培训。第一顺位 OpenAI gpt-realtime-translate,70 多输入加 13 输出,覆盖广、接 Realtime 生态快,培训对同帧字幕要求低。内训边听边译,讯飞同传宽语种加可私有化也能低成本搭,但要补并发与合规评估。
六、冷思考
同传共性短板,选型前认清。第一,延迟口径普遍不透明。云多报首包或体验时延,开源多报基准 AL 或帧率,无统一基准,排快慢是伪命题。第二,小语种质量不可验证。除少数基准语种,真实口音、专有名词、行业术语公开评测覆盖不到,须自己语料实测。第三,合规与数据出境是硬约束。闭源云 API 把音频传出,跨境与涉密先过合规;开源自托管留本地,讯飞也提供私有化留内网,按数据归属选部署。第四,人工兜底不可省。无论哪家,正式场合保留译员或质检工位,机器同传是辅助非替代。语音到语音翻译脉络,另见 语音到语音翻译资源页。
仓库星标均 2026-09-21 快照,每日浮动,不当长期排行。许可证以当日实读为准,商用前再核。
常见问题
Q1:为什么不能把各家延迟直接排个快慢?
A1:因为各家报不同口径。Qwen 2.3 秒是字均延迟 LAAL,StreamSpeech 320 毫秒是 CVSS 的 Average Lagging,讯飞宣传 2 秒是首字响应,GPT-4o 基准 711 毫秒是首段译出音频中位且连续会滞后。度量对象不同,摆一起比会错,故逐项标口径,不排座次。
Q2:开源方案里哪家语种覆盖最宽?
A2:直接能跑的开源语音同传,hibiki 仅法语到英语,StreamSpeech 只有 FR/ES/DE 到 EN,都窄。要真能跑的宽覆盖语音同传,开源没有一家直接满足,闭源云 API(Qwen 60 识别加 29 输出、GPT-4o 70 加输入加 13 输出、讯飞约 14 到 16 种)反而更宽。
Q3:数据不能出境的涉密会议能用哪家?
A3:优先数据本地的方案。讯飞同传私有化把音频文本留内网、可全程离线;hibiki 与 StreamSpeech 自托管本地 GPU。纯公有云 API(Qwen、GPT-4o)把音频传出境外,涉密不建议直接上,须先过合规评估。
Q4:Qwen3.8 和 hibiki 能本地跑吗,源码开放吗?
A4:Qwen3.8 是 API 服务,无公开代码仓,不能本地自托管,也不得声称开源。hibiki 代码 MIT 与 Apache-2.0 分离、权重 CC-BY 4.0,可自托管,小模型手机端本地跑,但仅法语到英语。讯飞同传不可本地自托管源码,但提供私有化把数据留本地。
Q5:成本上云 API 和自托管哪个更省?
A5:无统一答案。云 API 按量计费,OpenAI gpt-realtime-translate 每分 0.034 美元起,讯飞开放平台同声传译 API 100 小时 2000 元起(约 0.2 到 0.33 元每分钟),Qwen 以官方为准;自托管省 API 费但背算力运维。低并发自用往往自托管划算,高并发规模化要宽语种,云 API 省心但账单随量走,以自己流量画像测算。