硬核横评
硬核横评

手机 AI 助手怎么选?五种落点,三道许可红线

本篇只比「手机上的 AI Agent 有哪几种落地形态」这一锋面,不比谁家模型分数高。开篇钉死口径:全部为代表性对比,基于各官方页面、仓库 README 与公开报道整理,非本站同一环境独立压测,具体数字以各官方实时界面为准;并写明与站内三篇的分工——已有桌面 computer-use agent 横评、已有 agent harness 横评(包裹模型的执行脚手架,属不同层)、已有 phone-harness 开源篇,本篇只比手机侧。五方为阿里 Qwen Intelligence(面向厂商的 B2B 全栈底座)、Apple Intelligence 与 Siri AI(系统级自用闭环)、OmniBot(Android 端侧原生开源 Agent)、OpenGUI(Android 手机 GUI agent 框架)、MobileGym(浏览器里的手机仿真与评测平台)。MobileGym 单列说明它是「另一层:评测与仿真底座,不是助手本身」,不当同类助手比较。三道许可红线单独立节写透:OmniBot 是 AGPL v3 加商业的分段双许可且禁止用于任何组织;OpenGUI 是 Business Source License 1.1,源码可见但非 OSI 开源,Additional Use Grant 为 None 即仅非生产用途,生产与商用需商业许可,Change Date 2030-04-29 转 Apache 2.0;MobileGym 代码 Apache-2.0 但数据 CC BY-NC 4.0 非商业。三家 GitHub API 的 license 字段均报 NOASSERTION 或不准确,结论均来自 LICENSE 原文。成本一维明确写「不可直接横比」:Qwen 是每千次任务约 2.41 美元(官方口径)、Apple 是不单独计费但仅限高价机型且付费扩容无定价、开源侧是软件免费但要自备模型与设备且商用可能需付费许可,绝不换算成同一数字排行。Apple 的口径分层标注:公开发布信息(2026-09-14 随 iOS 27 上线、Beta 仅英文、五语 10 月跟进、16 种语言含简繁中文、中国大陆不在首发、欧盟 iOS 与 iPadOS 与 watchOS 初期不可用而 macOS 与 visionOS 可用、服务器端功能有每日用量限制且额度与付费扩容价格均未公布)、Qwen 对照表对 Apple 的描述标为来源方口径、中关村在线报道的国行千问底座标为媒体口径并说明它与 Qwen Intelligence 不是同一件事。

发布于 2026年9月23日10 分钟阅读
<!-- mobile-gui-agent-comparison-review | review | 手机 AI 助手怎么选?五种落点,三道许可红线 -->

把 AI 装进手机,眼下至少是五条互不重叠的路:有人做卖给厂商的底座,有人做系统自带助手,有人做跑在手机本地的开源 App,有人做跨 App 自动化框架,还有人干脆不进手机,只在浏览器里搭一座手机仿真城。这一篇不评谁家模型分数高,只回答一个问题:手机上的 AI Agent 到底有哪几种落地形态,各自的边界、开放度与许可红线在哪。

先把口径钉死:本篇是代表性对比,信息来自各官方页面、仓库 README、LICENSE 原文与公开报道,采集于 2026-09-23,不是本站同一环境下的独立压测;具体数字以各官方实时界面与官方文档为准。

站内已有三篇容易混淆,分工必须说清:Computer Use Agent 横评比的是桌面侧 computer-use agent(Claude、OpenAI、Mariner、cua、Agent-S、fara),操作对象是浏览器与桌面,本篇只聊手机侧Agent Harness 横评比的是包裹模型的执行脚手架(DSH、Claude Code、OpenCode、Codex),那是另一层,本篇不重复;站内 phone-harness 篇讲的是 iPhone 经 Mac harness 被操控,本篇不重复拆解该仓库,只在 Android 端侧原生的对照里说明区别。

一、五方总览:五种落点,各在各的层

#方案开发方形态跑在哪归属层
1Qwen Intelligence阿里通义千问面向手机厂商的 AI 全栈方案(模型 + 平台 + 场景)手机 + 后端 / 云B2B 底座
2Apple Intelligence / Siri AI苹果系统级自用助手(端侧模型 + 云侧 AFM)端侧 + 云侧系统级自用闭环
3OmniBotomnimind-ai(开源)直接跑在 Android 设备上的端侧 AI AgentAndroid 设备本地开源端侧 App
4OpenGUICore-MateAndroid 手机 GUI agent 框架手机 + 本地后端源可见框架
5MobileGymPurewhiter(学术)浏览器里的手机仿真环境与评测平台浏览器仿真评测 / 仿真底座

这张表最容易误读的是第五行。前四家都是「助手」或「准助手」,第五家不是——MobileGym 是另一层:它不下场当助手,而是用来量化上面那几种。把它和前四家并列成「同类助手比大小」,是这一领域最常见的错误归类,本篇不做。

二、逐家拆解

阿里 Qwen Intelligence:卖给厂商的底座,不是给你下载的 App。 B2B 全栈方案,不造硬件,向手机厂商提供「模型 + 平台 + 场景化方案」的一站式 AI 底座,已与荣耀合作落地。三大 Agent 分工明确:Mobile Planner 负责规划与决策,支持长程任务交付(官方示例为规划 100 步以上的复杂任务),配工作记忆与长期用户画像双层记忆;Mobile-Use 负责跨 App 操作,走「API 优先 + GUI 兜底」路线,可查信息、填表单,关键决策需用户确认;Mobile Creative 负责影像创作,口语化需求直出图。

官方口径数字(均为厂商口径,非本站复测):综合任务准确率 91.8%;Planner 每千次任务调用成本约 2.41 美元;Mobile-Use 端到端成功率 90%、完成时间压缩 28.8%、费用降低 20%、单任务耗时 59.5 秒;Creative 首图 3 秒;安全评分高出头部方案 23 个百分点。开放度上,它对厂商可定制、开放四套评测集;但消费者侧只有荣耀落地机型与千问 AI 平台体验专区,普通用户无法像装 App 一样装上它。许可与定价细节官方未公布,以官方为准。发布背景见站内 阿里 Qwen Intelligence 发布热点

Apple Intelligence / Siri AI:系统自用闭环,但有三条硬约束。 口径必须分层标注。第一层是 Apple 公开发布信息(经多家媒体转述):2026-09-14 随 iOS 27 等系统上线,Beta 阶段仅英文,法、日、韩、葡、西五语 10 月跟进;Apple Intelligence 覆盖 16 种语言,含简繁中文。地区红线最关键:中国大陆不在首发范围,Apple 原话是相关功能「在中国将不可用,直至 Apple 走完监管要求」;欧盟在 iOS、iPadOS、watchOS 上初期不可用,但 macOS 与 visionOS 可用,Apple 称与 DMA 要求相关。依赖服务器端模型的功能受每日用量限制,额度未公布;未来有付费扩容档,价格与时间均未公布。硬件门槛以官方页面为准,如 iPhone 15 Pro 及更新、M 系 iPad 与 Mac。

第二层是来源方口径:Qwen Intelligence 官方对照表把 Apple 描述为「端侧自研模型 + Google Gemini 驱动」,并称 iPhone 15 Pro 以上才可用,这属来源方说法,与上面的 Apple 公开发布信息分开看。第三层是媒体口径:中关村在线 2026-09-10 报道称,苹果智能初始版本已于 2026 年 7 月完成境内大模型备案,底层由阿里巴巴千问大模型支撑。这与 Qwen Intelligence 不是同一件事——一个是国行系统的底层能力,一个是面向手机厂商卖的 B2B 全栈方案,不能混为一谈。

OmniBot:真正跑在 Android 手机本地的开源端侧 Agent。 2026-09-23 GitHub API 快照:2,007 星、144 fork、主语言 Dart、创建于 2026-03-18、最近 push 就在当天(快照数字,每日变动)。形态是直接运行在 Android 设备上的端侧 Agent(Android 原生 Kotlin + Flutter,另有 React + TypeScript 的 WebUI),追求「理解、决策、执行、反馈」闭环。能力面很宽:Skills、在手机上跑 Linux 的 Alpine 环境、浏览器、MCP、安卓系统级工具;定时任务、闹钟、日历、音频控制;短长期记忆;读写文件、工作区、终端。另有 Remote Codex bridge:在已登录 Codex CLI 的电脑上执行 npx @thuocean/codex-bridge,手机扫码连上后即可用电脑的 Codex 干活。本地服务默认端口 8899,以应用实际显示为准。

它和站内 phone-harness 篇完全不是一回事:那篇是 iPhone 经 Mac harness,这篇是 Android 端侧原生,平台、架构、许可都不同。它不是 iOS 方案,也不是云端 SaaS。仓库速览见 OmniBot 开源端侧 Agent,许可红线见第三节。

OpenGUI:Android 真机 GUI agent 框架,源码可见但非开源。 2026-09-23 GitHub API 快照:1,804 星、114 fork、TypeScript、创建于 2026-04-18、最近 push 2026-09-17。它让 agent 在真机上「看见、理解、操作」Android App 界面。最短路径是作为 DeepSeek Harness(DSH)插件,用一句话让 Codex 装上,也提供 WorkBuddy 插件候选,同时支持全栈自建。兼容 DSH 0.1.0-rc.7 到 0.1.1-rc.2(新装默认 0.1.1-rc.2),不支持 DSH 0.1.2-alpha.4;macOS 安装器要求 Node.js 22.19+ 或 24+。

架构上,README 明列主图 mobile-agent.graph.ts、执行子图 executor.graph.ts、待命派发 standby.gateway.ts,Android 侧有 StandbySocketManager.kt 与 GestureService.kt。设计要点是「先规划后动作、执行后给结构化总结」:Plan Supervisor 维持任务状态与续跑,Executor Graph 跑「截屏、视觉、动作、回问」循环,Summarizer 收尾出结构化结果;模型可按角色分配,规划与 VLM 执行能分开选供应商;支持飞书、Telegram、Discord、REST 待命派发。官方自述面向小时级长任务(徽标称最长 12 小时)。限制照 README 原文:需 Android 11(API 30)或更新设备;需 USB 调试与 AccessibilityService 权限;效果取决于模型、App UI、网络与任务长度;尚不是常开式系统级助手;长任务可靠性仍需更多真实测试;缺更多即用示例与基准。

MobileGym:另一层——评测与仿真底座,不是助手本身。 先说明:MobileGym 不是手机上的 AI 助手,而是用来量化上面几种的评测与仿真底座,本篇不把它硬当同类助手比较。它是浏览器里运行、状态完全可编程的手机仿真环境。论文口径(arXiv 2605.26114,已中 EMNLP 2026 主会):28 个仿真 App、416 个参数化任务模板、确定性亚毫秒级判分器;单台服务器可跑 256 个并行实例,每实例约 400 MB 内存、冷启动约 3 秒。Sim-to-Real 验证:在 Qwen3-VL-4B 上跑 GRPO,仿真内提升 42.8 分,迁移到真机后保留 95.1% 增益,即真机提升 40.7 分。以上为论文与 README 口径,不是本站复测。 它的价值是把「判分」从随机性的 VLM 评委换成读状态的确定性判据。想动手装一套端侧 Agent,站内另有 手机装 Agent 上手 SOP

把五家横向排到同一组维度上,差距更直观:

维度Qwen IntelligenceApple IntelligenceOmniBotOpenGUIMobileGym
跨 App 操作路径API 优先 + GUI 兜底系统深度集成系统级工具 + Skills + MCPAccessibilityService 纯 GUI 视觉不适用(评测底座)
授权与安全三层安全管控,关键决策需用户确认端侧处理 + 服务器功能每日用量限制用途受许可约束需 USB 调试与无障碍权限沙箱、可回滚、确定性判分
开放度面向厂商可定制,开放四套评测集封闭生态,仅开发者 API开源(AGPL v3,限范围)源可见(BSL 1.1,非 OSI 开源)代码 Apache-2.0,数据 CC BY-NC 4.0
许可红线未公布,以官方为准不适用商用须签商业许可生产与商用须商业许可数据非商业,仅供学术
成本口径每千次任务约 2.41 美元(官方口径)不单独计费但限高价机型软件免费,自备模型与设备软件免费,自备模型与设备开源,自备服务器与算力

三、三道许可红线

这一节是骨架。三家的 GitHub API license 字段都报 NOASSERTION 或不准,下面的结论全部来自 LICENSE 原文,不简写、不臆测。

红线一,OmniBot 是用户分段双重许可(Segmented Dual Licensing)。 仓库 LICENSE 明确写着:开源侧是 GNU AGPL v3,但仅在非商业用途、或个人 / 教育 / 研究目的下免费,且明确「禁止用于任何组织」;即便在 AGPL v3 下也仍需遵守开源义务(例如公开源代码)。商业用途,或想避免 AGPL 开源义务,必须事先与维护者签署商业许可,维护者保留更新许可政策的权利。要点是:它不是「随便用」的开源项目组织即便做研究也不在免费范围内不能写成「AGPL 开源软件」了事,更不能说「免费可商用」

红线二,OpenGUI 是 Business Source License 1.1(BSL 1.1),源码可见但非 OSI 开源。 你可以为非生产用途复制、修改、分发与使用源码;但生产使用、商业使用、托管服务,以及集成进商业产品,均需向 Core-Mate 单独购买商业许可。该版本 Additional Use Grant: None,即仅授予非生产用途Change Date 为 2030-04-29,届时转为 Apache License 2.0。也就是说,2026 年的它是「公开源码」而非「开源软件」,要等变更日才转为 OSI 认可的开源许可。GitHub API 对此报 NOASSERTION,不能据此判断。

红线三,MobileGym 走代码与数据分离许可。 代码(核心源码与 mobilegym-rl/ 训练代码)是 Apache License 2.0;但数据与内容——mobilegym-data/、各 App 的 data 与 assets、合成与 AI 生成内容、模拟 UGC 与图标——是 CC BY-NC 4.0,仅限非商业学术用途。官方解释说这个拆分是有意的:平台代码要能宽松复用,内容(含第三方品牌的衍生表示)则留在研究范围内。学术评测没问题,做商业产品或商业服务,数据侧就踩线。

四、成本口径:三种计费逻辑,不可横比

这段最容易写坏,所以只分列口径、绝不做同一数字的排行

  • Qwen Intelligence:官方口径是 Planner 每千次任务调用成本约 2.41 美元,称是头部模型的几分之一。这是按次计价,且定价细则官方尚未公布。
  • Apple Intelligence:不单独计费,但仅限高价新机型;服务器端功能有每日用量限制,付费扩容档未公布价格与时间。这是绑硬件的口径。
  • 开源侧(OmniBot、OpenGUI):软件免费,但要自备模型 API 或算力、自备设备与后端,且商用可能还要再付一笔商业许可费。这是免费软件加自付基础设施的口径。
  • MobileGym:开源,但要自备服务器与算力

四套口径分别对应「按次」「绑硬件」「自付基础设施」「自付算力」,换算成同一个数字再排行,是错的

五、场景选型与结论

你的需求推荐理由
要厂商定制底座Qwen Intelligence面向厂商的一站式 AI 全栈方案,模块化可定制
要系统自带助手Apple Intelligence系统深度集成、端云协同,但受地区与机型约束
要端侧可控开源OmniBot直接跑在 Android 本地,能力面最广;商用须先过许可关
要跨 App 自动化框架OpenGUI真机 GUI 框架,可作 DSH 插件接入;生产用要商业许可
要规模化评测MobileGym另一层:仿真底座,换来可复现的量化结果

结论有三条。第一,这五方不是五选一,而是三条互不相交的赛道加一个评测层:底层平台、设备端应用与框架、以及量化它们的仿真底座,谁也替代不了谁。第二,开放度是「分级」而非「开或不开」:Apple 闭源自用,Qwen 面向厂商定制,OpenGUI 源可见但非开源,OmniBot 与 MobileGym 开源但带红线——把「源可见」当「开源」、把「开源」当「免费可商用」,是选型最常见的两个坑。第三,许可与成本必须一起读:所谓「免费」是软件本身还是含商用权利,直接决定它能不能进生产环境。

常见问题

Q1:这五方里,谁最值得普通用户现在就用上? A1:取决于地区和机型。苹果方案因中国大陆不在首发范围而受限;Qwen Intelligence 是卖给厂商的底座,消费者侧只有荣耀落地机型与千问平台体验专区;今天就能自己动手试的,是 OmniBot 与 OpenGUI,代价是自备设备并接受许可约束。

Q2:为什么 MobileGym 不算手机助手? A2:它的定位是浏览器里的手机仿真环境与评测平台,不是跑在真机上替用户干活的助手。它提供可编程、可回滚、确定性判分的环境,用来训练与评测手机 GUI agent,例如 28 个仿真 App、416 个任务模板、单机 256 个并行实例。它是「用来量化助手的那一层」,与助手本身不同类。

Q3:OpenGUI 说是「开源」,为什么不能直接商用? A3:因为它用的是 BSL 1.1,源码可见但并非 OSI 认可的开源许可。该版本 Additional Use Grant: None,只授予非生产用途;生产与商业使用都需另购商业许可,直到 Change Date 2030-04-29 转为 Apache 2.0。判断依据应是 LICENSE 原文,而不是 GitHub API 的 NOASSERTION 字段。

Q4:开源自建就一定比厂商方案便宜吗? A4:不一定。OmniBot 与 OpenGUI 的软件免费,但要自备模型 API 或算力、设备与后端,商用还可能额外付许可费;Qwen 则按次计价(官方口径每千次任务约 2.41 美元)。一个看基础设施投入、一个看调用量,不该换算成同一数字比较

Q5:Apple Intelligence 和国行可能用的千问底座,是一回事吗? A5:不是。中关村在线 2026-09-10 报道(媒体口径)称,苹果智能初始版本已完成境内大模型备案,底层由阿里千问大模型支撑,这指的是国行系统的底层能力;而 Qwen Intelligence 是阿里向手机厂商提供的 B2B 全栈方案,是另一层的东西。两者名字里都有「千问」,但不是同一件事。


参考来源

  • 各官方页面与仓库 README:Qwen Intelligence 收录页与官方对照表(来源方口径)、Apple Intelligence / Siri AI 公开发布信息、omnimind-ai/OmniBot、Core-Mate/OpenGUI、Purewhiter/mobilegym
  • LICENSE 原文:OmniBot 的 LICENSE(AGPL v3 加商业许可双重许可)、OpenGUI 的 LICENSE(BSL 1.1,Change Date 2030-04-29)、MobileGym 的 LICENSELICENSE-DATA(Apache-2.0 与 CC BY-NC 4.0)
  • GitHub API 快照(2026-09-23):OmniBot 2,007 星;OpenGUI 1,804 星;MobileGym 798 星。三家 license 字段均为 NOASSERTION 或不准,以 LICENSE 原文为准
  • 论文口径:MobileGym,arXiv 2605.26114,EMNLP 2026 主会
  • 公开报道:中关村在线 2026-09-10(媒体口径);Apple 上线信息经 Mac Observer、AI Insiders、ET Now、HandWiki 等转述

本文为代表性对比,采集于 2026-09-23,非本站同一环境独立压测;星标为当日快照,功能、许可与价格以各官方为准。相关阅读:阿里 Qwen Intelligence 发布热点OmniBot 开源端侧 Agent手机装 Agent 上手 SOPAgent Harness 横评Computer Use Agent 横评

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-23

常见问题

这五方里,谁最值得普通用户现在就用上?
取决于地区和机型。苹果方案因中国大陆不在首发范围而受限;Qwen Intelligence 是卖给厂商的底座,消费者侧只有荣耀落地机型与千问平台体验专区;今天就能自己动手试的,是 OmniBot 与 OpenGUI,代价是自备设备并接受许可约束。
为什么 MobileGym 不算手机助手?
它的定位是浏览器里的手机仿真环境与评测平台,不是跑在真机上替用户干活的助手。它提供可编程、可回滚、确定性判分的环境,用来训练与评测手机 GUI agent,例如 28 个仿真 App、416 个任务模板、单机 256 个并行实例。它是「用来量化助手的那一层」,与助手本身不同类。
OpenGUI 说是「开源」,为什么不能直接商用?
因为它用的是 BSL 1.1,源码可见但并非 OSI 认可的开源许可。该版本 `Additional Use Grant: None`,只授予非生产用途;生产与商业使用都需另购商业许可,直到 Change Date 2030-04-29 转为 Apache 2.0。判断依据应是 LICENSE 原文,而不是 GitHub API 的 NOASSERTION 字段。
开源自建就一定比厂商方案便宜吗?
不一定。OmniBot 与 OpenGUI 的软件免费,但要自备模型 API 或算力、设备与后端,商用还可能额外付许可费;Qwen 则按次计价(官方口径每千次任务约 2.41 美元)。一个看基础设施投入、一个看调用量,**不该换算成同一数字比较**。
Apple Intelligence 和国行可能用的千问底座,是一回事吗?
不是。中关村在线 2026-09-10 报道(媒体口径)称,苹果智能初始版本已完成境内大模型备案,底层由阿里千问大模型支撑,这指的是**国行系统的底层能力**;而 Qwen Intelligence 是阿里向手机厂商提供的 B2B 全栈方案,是**另一层的东西**。两者名字里都有「千问」,但不是同一件事。

相关文章

实战 SOP

手机装 Agent:两条路线、十步上手、一条红线

把「手机 AI Agent」落到真机上的实操 SOP,给两条对照路线。第一节先做该不该用的判断:适合想验证手机能否替自己干活的备用机场景;不适合主力机、放着不管的长任务,以及含支付、改密、发消息、改账号设置的动作。路线 A 是 OmniBot 的端侧 App 形态:从 Releases 装 APK,在设置里配 AI 能力、AI 提供商与场景模型,其中 Memory embedding 强制要求嵌入模型而其余场景建议用多模态或视觉模型;Alpine 环境启动时自动初始化;把 skills 仓库链接发给助手即可装技能;定时任务用于执行 subagent 流程而闹钟只做提醒;可选的 Remote Codex bridge 让手机扫码接入电脑的 Codex;可选的 WebUI 通过应用内本地服务取地址与 Token,默认端口 8899 且地址末尾不加路径;开发环境要求 Flutter 3.47.2+、JDK 17+、Node.js 20.19+ 或 22.12+、pnpm 10.28.0。路线 B 是 OpenGUI 的框架形态,经 DeepSeek Harness 接入:硬性前置为 Android 11(API 30)或更新的设备或模拟器,必须开启 USB 调试并授予无障碍权限;最短路径是把官方安装提示词原样发给 Codex,安装器会校验 SHA-256、只装 OpenGUI 插件并保留无关插件与设置;版本纪律为支持 DSH 0.1.0-rc.7 与 0.1.0-rc.8 与 0.1.1-rc.1 与 0.1.1-rc.2(新装默认 0.1.1-rc.2),不支持 0.1.2-alpha.4,且不允许从 0.1.1 RC 降到 0.1.0 RC;连真机后发一句提示即可验证。安全一节给备用机、最小权限、逐次人工确认红线、仅可信局域网、Token 不外传、留日志可回溯、先短任务后长任务等要求,并配上线前自查清单与七条踩坑速查表。许可边界单列:OmniBot 商用须签商业许可(AGPL v3 仅非商业与个人、教育、研究),OpenGUI 是 BSL 1.1 仅非生产用途。文中并点明与站内桌面 computer use 搭建 SOP 分工不重复。官方文档未给出的价格与限额一律不编,写以官方为准。

2026年9月23日9 分钟阅读
硬核横评

谁真能从一句话走到成片?五款视频工作台横评

本篇只比"工作台形态"这一锋面:把脚本、分镜、资产、生成、剪辑、后期装进同一入口的程度,以及该入口对 Agent 与自托管的开放度,外加成本口径,明确不比生成画质。开篇钉死纪律:全部对比均为代表性对比、基于官方页面与来源页口径、非本站独立压测,具体数字以各官方客户端与官网实时界面为准。收五方:剪映 Hub(字节剪映,闭源闭环工作台)、LibTV 1.5(LiblibAI,无限画布加 Skill 双入口,GitHub 有 ltv-labs/libtv-skills)、即梦 AI(字节剪映团队,生成侧全链路)、OpenCreator(krillinai,Apache-2.0 开源、本地优先、Codex CLI 驱动)、TapNow(深圳添科智能,节点式无限画布 Tapflow)。按六段(脚本/分镜资产/生成/拼成片/精修/批量)逐方对位闭环度,单列开放度一节,成本一维立两条红线——货币不可直接横比(LibTV 元/年、即梦 元/月、TapNow 美元充值到 Tapies、剪映 Hub 未公布)、积分不可当钱比(各家换算率不同),只分列口径不做统一排行。文末按场景给选型建议,并与站内已有生成模型横评、开源制作工具横评、API 成本横评、Shotcut 横评划清分工。口径提醒:TapNow 信息为 2025-11 快照、口径偏旧,其 Agent 支持说法二手矛盾,未见官方原文。

2026年9月22日9 分钟阅读
硬核横评

开会不用请翻译?五款实时同传方案硬核横评

本篇只比"实时同传与流式语音翻译"这一锋面,先立三条入选硬门槛:必须流式输入、至少一方有公开可查的工程口径、云 API 与开源自托管都要覆盖,最终收三云加两开源自托管共五款:Qwen3.8-LiveTranslate、OpenAI GPT-4o Realtime API、kyutai-labs/hibiki、ictnlp/StreamSpeech(MIT、1,291 星、Python)与讯飞同传。开篇即钉死纪律:延迟口径不可直接横比,绝不把字均延迟、首包延迟、端到端延迟与未公布指标摆在一起排快慢,无统一基准就不替你下谁快的结论。逐家拆部署形态、语种覆盖、许可边界与同日仓库快照,点出能力半径差异(三家闭源云 API 覆盖广但数据出境且不可改,两家开源自托管可改可本地但覆盖面窄)。文末按场景给选型建议,并与站内云端对本地成本账、语音克隆工具横评、实时语音对话模型发布三篇划清分工,确保几篇横评不混谈。

2026年9月21日8 分钟阅读