把 AI 装进手机,眼下至少是五条互不重叠的路:有人做卖给厂商的底座,有人做系统自带助手,有人做跑在手机本地的开源 App,有人做跨 App 自动化框架,还有人干脆不进手机,只在浏览器里搭一座手机仿真城。这一篇不评谁家模型分数高,只回答一个问题:手机上的 AI Agent 到底有哪几种落地形态,各自的边界、开放度与许可红线在哪。
先把口径钉死:本篇是代表性对比,信息来自各官方页面、仓库 README、LICENSE 原文与公开报道,采集于 2026-09-23,不是本站同一环境下的独立压测;具体数字以各官方实时界面与官方文档为准。
站内已有三篇容易混淆,分工必须说清:Computer Use Agent 横评比的是桌面侧 computer-use agent(Claude、OpenAI、Mariner、cua、Agent-S、fara),操作对象是浏览器与桌面,本篇只聊手机侧;Agent Harness 横评比的是包裹模型的执行脚手架(DSH、Claude Code、OpenCode、Codex),那是另一层,本篇不重复;站内 phone-harness 篇讲的是 iPhone 经 Mac harness 被操控,本篇不重复拆解该仓库,只在 Android 端侧原生的对照里说明区别。
一、五方总览:五种落点,各在各的层
| # | 方案 | 开发方 | 形态 | 跑在哪 | 归属层 |
|---|---|---|---|---|---|
| 1 | Qwen Intelligence | 阿里通义千问 | 面向手机厂商的 AI 全栈方案(模型 + 平台 + 场景) | 手机 + 后端 / 云 | B2B 底座 |
| 2 | Apple Intelligence / Siri AI | 苹果 | 系统级自用助手(端侧模型 + 云侧 AFM) | 端侧 + 云侧 | 系统级自用闭环 |
| 3 | OmniBot | omnimind-ai(开源) | 直接跑在 Android 设备上的端侧 AI Agent | Android 设备本地 | 开源端侧 App |
| 4 | OpenGUI | Core-Mate | Android 手机 GUI agent 框架 | 手机 + 本地后端 | 源可见框架 |
| 5 | MobileGym | Purewhiter(学术) | 浏览器里的手机仿真环境与评测平台 | 浏览器仿真 | 评测 / 仿真底座 |
这张表最容易误读的是第五行。前四家都是「助手」或「准助手」,第五家不是——MobileGym 是另一层:它不下场当助手,而是用来量化上面那几种。把它和前四家并列成「同类助手比大小」,是这一领域最常见的错误归类,本篇不做。
二、逐家拆解
阿里 Qwen Intelligence:卖给厂商的底座,不是给你下载的 App。 B2B 全栈方案,不造硬件,向手机厂商提供「模型 + 平台 + 场景化方案」的一站式 AI 底座,已与荣耀合作落地。三大 Agent 分工明确:Mobile Planner 负责规划与决策,支持长程任务交付(官方示例为规划 100 步以上的复杂任务),配工作记忆与长期用户画像双层记忆;Mobile-Use 负责跨 App 操作,走「API 优先 + GUI 兜底」路线,可查信息、填表单,关键决策需用户确认;Mobile Creative 负责影像创作,口语化需求直出图。
官方口径数字(均为厂商口径,非本站复测):综合任务准确率 91.8%;Planner 每千次任务调用成本约 2.41 美元;Mobile-Use 端到端成功率 90%、完成时间压缩 28.8%、费用降低 20%、单任务耗时 59.5 秒;Creative 首图 3 秒;安全评分高出头部方案 23 个百分点。开放度上,它对厂商可定制、开放四套评测集;但消费者侧只有荣耀落地机型与千问 AI 平台体验专区,普通用户无法像装 App 一样装上它。许可与定价细节官方未公布,以官方为准。发布背景见站内 阿里 Qwen Intelligence 发布热点。
Apple Intelligence / Siri AI:系统自用闭环,但有三条硬约束。 口径必须分层标注。第一层是 Apple 公开发布信息(经多家媒体转述):2026-09-14 随 iOS 27 等系统上线,Beta 阶段仅英文,法、日、韩、葡、西五语 10 月跟进;Apple Intelligence 覆盖 16 种语言,含简繁中文。地区红线最关键:中国大陆不在首发范围,Apple 原话是相关功能「在中国将不可用,直至 Apple 走完监管要求」;欧盟在 iOS、iPadOS、watchOS 上初期不可用,但 macOS 与 visionOS 可用,Apple 称与 DMA 要求相关。依赖服务器端模型的功能受每日用量限制,额度未公布;未来有付费扩容档,价格与时间均未公布。硬件门槛以官方页面为准,如 iPhone 15 Pro 及更新、M 系 iPad 与 Mac。
第二层是来源方口径:Qwen Intelligence 官方对照表把 Apple 描述为「端侧自研模型 + Google Gemini 驱动」,并称 iPhone 15 Pro 以上才可用,这属来源方说法,与上面的 Apple 公开发布信息分开看。第三层是媒体口径:中关村在线 2026-09-10 报道称,苹果智能初始版本已于 2026 年 7 月完成境内大模型备案,底层由阿里巴巴千问大模型支撑。这与 Qwen Intelligence 不是同一件事——一个是国行系统的底层能力,一个是面向手机厂商卖的 B2B 全栈方案,不能混为一谈。
OmniBot:真正跑在 Android 手机本地的开源端侧 Agent。 2026-09-23 GitHub API 快照:2,007 星、144 fork、主语言 Dart、创建于 2026-03-18、最近 push 就在当天(快照数字,每日变动)。形态是直接运行在 Android 设备上的端侧 Agent(Android 原生 Kotlin + Flutter,另有 React + TypeScript 的 WebUI),追求「理解、决策、执行、反馈」闭环。能力面很宽:Skills、在手机上跑 Linux 的 Alpine 环境、浏览器、MCP、安卓系统级工具;定时任务、闹钟、日历、音频控制;短长期记忆;读写文件、工作区、终端。另有 Remote Codex bridge:在已登录 Codex CLI 的电脑上执行 npx @thuocean/codex-bridge,手机扫码连上后即可用电脑的 Codex 干活。本地服务默认端口 8899,以应用实际显示为准。
它和站内 phone-harness 篇完全不是一回事:那篇是 iPhone 经 Mac harness,这篇是 Android 端侧原生,平台、架构、许可都不同。它不是 iOS 方案,也不是云端 SaaS。仓库速览见 OmniBot 开源端侧 Agent,许可红线见第三节。
OpenGUI:Android 真机 GUI agent 框架,源码可见但非开源。 2026-09-23 GitHub API 快照:1,804 星、114 fork、TypeScript、创建于 2026-04-18、最近 push 2026-09-17。它让 agent 在真机上「看见、理解、操作」Android App 界面。最短路径是作为 DeepSeek Harness(DSH)插件,用一句话让 Codex 装上,也提供 WorkBuddy 插件候选,同时支持全栈自建。兼容 DSH 0.1.0-rc.7 到 0.1.1-rc.2(新装默认 0.1.1-rc.2),不支持 DSH 0.1.2-alpha.4;macOS 安装器要求 Node.js 22.19+ 或 24+。
架构上,README 明列主图 mobile-agent.graph.ts、执行子图 executor.graph.ts、待命派发 standby.gateway.ts,Android 侧有 StandbySocketManager.kt 与 GestureService.kt。设计要点是「先规划后动作、执行后给结构化总结」:Plan Supervisor 维持任务状态与续跑,Executor Graph 跑「截屏、视觉、动作、回问」循环,Summarizer 收尾出结构化结果;模型可按角色分配,规划与 VLM 执行能分开选供应商;支持飞书、Telegram、Discord、REST 待命派发。官方自述面向小时级长任务(徽标称最长 12 小时)。限制照 README 原文:需 Android 11(API 30)或更新设备;需 USB 调试与 AccessibilityService 权限;效果取决于模型、App UI、网络与任务长度;尚不是常开式系统级助手;长任务可靠性仍需更多真实测试;缺更多即用示例与基准。
MobileGym:另一层——评测与仿真底座,不是助手本身。 先说明:MobileGym 不是手机上的 AI 助手,而是用来量化上面几种的评测与仿真底座,本篇不把它硬当同类助手比较。它是浏览器里运行、状态完全可编程的手机仿真环境。论文口径(arXiv 2605.26114,已中 EMNLP 2026 主会):28 个仿真 App、416 个参数化任务模板、确定性亚毫秒级判分器;单台服务器可跑 256 个并行实例,每实例约 400 MB 内存、冷启动约 3 秒。Sim-to-Real 验证:在 Qwen3-VL-4B 上跑 GRPO,仿真内提升 42.8 分,迁移到真机后保留 95.1% 增益,即真机提升 40.7 分。以上为论文与 README 口径,不是本站复测。 它的价值是把「判分」从随机性的 VLM 评委换成读状态的确定性判据。想动手装一套端侧 Agent,站内另有 手机装 Agent 上手 SOP。
把五家横向排到同一组维度上,差距更直观:
| 维度 | Qwen Intelligence | Apple Intelligence | OmniBot | OpenGUI | MobileGym |
|---|---|---|---|---|---|
| 跨 App 操作路径 | API 优先 + GUI 兜底 | 系统深度集成 | 系统级工具 + Skills + MCP | AccessibilityService 纯 GUI 视觉 | 不适用(评测底座) |
| 授权与安全 | 三层安全管控,关键决策需用户确认 | 端侧处理 + 服务器功能每日用量限制 | 用途受许可约束 | 需 USB 调试与无障碍权限 | 沙箱、可回滚、确定性判分 |
| 开放度 | 面向厂商可定制,开放四套评测集 | 封闭生态,仅开发者 API | 开源(AGPL v3,限范围) | 源可见(BSL 1.1,非 OSI 开源) | 代码 Apache-2.0,数据 CC BY-NC 4.0 |
| 许可红线 | 未公布,以官方为准 | 不适用 | 商用须签商业许可 | 生产与商用须商业许可 | 数据非商业,仅供学术 |
| 成本口径 | 每千次任务约 2.41 美元(官方口径) | 不单独计费但限高价机型 | 软件免费,自备模型与设备 | 软件免费,自备模型与设备 | 开源,自备服务器与算力 |
三、三道许可红线
这一节是骨架。三家的 GitHub API license 字段都报 NOASSERTION 或不准,下面的结论全部来自 LICENSE 原文,不简写、不臆测。
红线一,OmniBot 是用户分段双重许可(Segmented Dual Licensing)。 仓库 LICENSE 明确写着:开源侧是 GNU AGPL v3,但仅在非商业用途、或个人 / 教育 / 研究目的下免费,且明确「禁止用于任何组织」;即便在 AGPL v3 下也仍需遵守开源义务(例如公开源代码)。商业用途,或想避免 AGPL 开源义务,必须事先与维护者签署商业许可,维护者保留更新许可政策的权利。要点是:它不是「随便用」的开源项目;组织即便做研究也不在免费范围内;不能写成「AGPL 开源软件」了事,更不能说「免费可商用」。
红线二,OpenGUI 是 Business Source License 1.1(BSL 1.1),源码可见但非 OSI 开源。 你可以为非生产用途复制、修改、分发与使用源码;但生产使用、商业使用、托管服务,以及集成进商业产品,均需向 Core-Mate 单独购买商业许可。该版本 Additional Use Grant: None,即仅授予非生产用途;Change Date 为 2030-04-29,届时转为 Apache License 2.0。也就是说,2026 年的它是「公开源码」而非「开源软件」,要等变更日才转为 OSI 认可的开源许可。GitHub API 对此报 NOASSERTION,不能据此判断。
红线三,MobileGym 走代码与数据分离许可。 代码(核心源码与 mobilegym-rl/ 训练代码)是 Apache License 2.0;但数据与内容——mobilegym-data/、各 App 的 data 与 assets、合成与 AI 生成内容、模拟 UGC 与图标——是 CC BY-NC 4.0,仅限非商业学术用途。官方解释说这个拆分是有意的:平台代码要能宽松复用,内容(含第三方品牌的衍生表示)则留在研究范围内。学术评测没问题,做商业产品或商业服务,数据侧就踩线。
四、成本口径:三种计费逻辑,不可横比
这段最容易写坏,所以只分列口径、绝不做同一数字的排行。
- Qwen Intelligence:官方口径是 Planner 每千次任务调用成本约 2.41 美元,称是头部模型的几分之一。这是按次计价,且定价细则官方尚未公布。
- Apple Intelligence:不单独计费,但仅限高价新机型;服务器端功能有每日用量限制,付费扩容档未公布价格与时间。这是绑硬件的口径。
- 开源侧(OmniBot、OpenGUI):软件免费,但要自备模型 API 或算力、自备设备与后端,且商用可能还要再付一笔商业许可费。这是免费软件加自付基础设施的口径。
- MobileGym:开源,但要自备服务器与算力。
四套口径分别对应「按次」「绑硬件」「自付基础设施」「自付算力」,换算成同一个数字再排行,是错的。
五、场景选型与结论
| 你的需求 | 推荐 | 理由 |
|---|---|---|
| 要厂商定制底座 | Qwen Intelligence | 面向厂商的一站式 AI 全栈方案,模块化可定制 |
| 要系统自带助手 | Apple Intelligence | 系统深度集成、端云协同,但受地区与机型约束 |
| 要端侧可控开源 | OmniBot | 直接跑在 Android 本地,能力面最广;商用须先过许可关 |
| 要跨 App 自动化框架 | OpenGUI | 真机 GUI 框架,可作 DSH 插件接入;生产用要商业许可 |
| 要规模化评测 | MobileGym | 另一层:仿真底座,换来可复现的量化结果 |
结论有三条。第一,这五方不是五选一,而是三条互不相交的赛道加一个评测层:底层平台、设备端应用与框架、以及量化它们的仿真底座,谁也替代不了谁。第二,开放度是「分级」而非「开或不开」:Apple 闭源自用,Qwen 面向厂商定制,OpenGUI 源可见但非开源,OmniBot 与 MobileGym 开源但带红线——把「源可见」当「开源」、把「开源」当「免费可商用」,是选型最常见的两个坑。第三,许可与成本必须一起读:所谓「免费」是软件本身还是含商用权利,直接决定它能不能进生产环境。
常见问题
Q1:这五方里,谁最值得普通用户现在就用上? A1:取决于地区和机型。苹果方案因中国大陆不在首发范围而受限;Qwen Intelligence 是卖给厂商的底座,消费者侧只有荣耀落地机型与千问平台体验专区;今天就能自己动手试的,是 OmniBot 与 OpenGUI,代价是自备设备并接受许可约束。
Q2:为什么 MobileGym 不算手机助手? A2:它的定位是浏览器里的手机仿真环境与评测平台,不是跑在真机上替用户干活的助手。它提供可编程、可回滚、确定性判分的环境,用来训练与评测手机 GUI agent,例如 28 个仿真 App、416 个任务模板、单机 256 个并行实例。它是「用来量化助手的那一层」,与助手本身不同类。
Q3:OpenGUI 说是「开源」,为什么不能直接商用?
A3:因为它用的是 BSL 1.1,源码可见但并非 OSI 认可的开源许可。该版本 Additional Use Grant: None,只授予非生产用途;生产与商业使用都需另购商业许可,直到 Change Date 2030-04-29 转为 Apache 2.0。判断依据应是 LICENSE 原文,而不是 GitHub API 的 NOASSERTION 字段。
Q4:开源自建就一定比厂商方案便宜吗? A4:不一定。OmniBot 与 OpenGUI 的软件免费,但要自备模型 API 或算力、设备与后端,商用还可能额外付许可费;Qwen 则按次计价(官方口径每千次任务约 2.41 美元)。一个看基础设施投入、一个看调用量,不该换算成同一数字比较。
Q5:Apple Intelligence 和国行可能用的千问底座,是一回事吗? A5:不是。中关村在线 2026-09-10 报道(媒体口径)称,苹果智能初始版本已完成境内大模型备案,底层由阿里千问大模型支撑,这指的是国行系统的底层能力;而 Qwen Intelligence 是阿里向手机厂商提供的 B2B 全栈方案,是另一层的东西。两者名字里都有「千问」,但不是同一件事。
参考来源
- 各官方页面与仓库 README:Qwen Intelligence 收录页与官方对照表(来源方口径)、Apple Intelligence / Siri AI 公开发布信息、omnimind-ai/OmniBot、Core-Mate/OpenGUI、Purewhiter/mobilegym
- LICENSE 原文:OmniBot 的
LICENSE(AGPL v3 加商业许可双重许可)、OpenGUI 的LICENSE(BSL 1.1,Change Date 2030-04-29)、MobileGym 的LICENSE与LICENSE-DATA(Apache-2.0 与 CC BY-NC 4.0) - GitHub API 快照(2026-09-23):OmniBot 2,007 星;OpenGUI 1,804 星;MobileGym 798 星。三家 license 字段均为 NOASSERTION 或不准,以 LICENSE 原文为准
- 论文口径:MobileGym,arXiv 2605.26114,EMNLP 2026 主会
- 公开报道:中关村在线 2026-09-10(媒体口径);Apple 上线信息经 Mac Observer、AI Insiders、ET Now、HandWiki 等转述
本文为代表性对比,采集于 2026-09-23,非本站同一环境独立压测;星标为当日快照,功能、许可与价格以各官方为准。相关阅读:阿里 Qwen Intelligence 发布热点 | OmniBot 开源端侧 Agent | 手机装 Agent 上手 SOP | Agent Harness 横评 | Computer Use Agent 横评