过去十年,手机上的"智能助手"一直卡在同一个动作上:你得先喊它。喊对唤醒词,它才肯抬头;喊错了,它就当没听见。于是我们对手机 AI 的期待被压得很低,查天气、定闹钟、放首歌,能听懂就算合格。所谓助手,本质上是一个等你开口的搜索框。
Qwen Intelligence 想动的就是这一步。阿里巴巴通义千问团队把它定义为一套 AI 手机全栈解决方案,官方的一句话表述是让手机从"被动响应"走向"主动服务"。这句话听起来像宣传语,但拆开看,它其实是一次职责的重新划分:手机不再只是执行你逐条下达的指令,而是尝试承接一件你还没说完整的事。
真正值得看的,不是"它也能跨 App 点按钮"这件事本身,而是它把这件事拆成了三种不同的角色,并且给每个角色配了不同的成本结构和安全策略。这套拆法的背后,是对"手机操作"的一次重新理解,它认为这不是一个模型能力问题,而是一个工程交付问题。
一、先说清楚它是什么,不是什么
Qwen Intelligence 是阿里巴巴通义千问团队推出的 AI 手机全栈解决方案,定位很明确:不造硬件,向手机厂商提供"模型 + 平台 + 场景化方案"的一站式 AI 底座。也就是说,它是一门 B2B 生意,客户是手机厂商,不是你我。
这一点必须写在最前面,因为它是很多讨论跑偏的根源。它不是消费者能直接下载的 App,你没法打开应用商店搜到它、装上就用。目前可验证的消费者侧落地只有两处:一是与荣耀合作的方案,官方称综合任务准确率达 91.8%;二是千问 AI 平台上的在线体验专区,官网则挂在 qwenintelligence.com。它不打算自己造手机,也不打算绕开厂商直接服务用户。这个选择决定了它的天花板,也决定了它真正的风险不在技术侧,而在商务侧。
关于它目前没有公开的信息,这里需要一次性说清楚:定价与计费细则、开放地区与上线时间表、完整的合作厂商名单、模型版本与参数量,均未见官方披露。网上任何关于"下一步接入哪家""卖多少钱"的说法,都应当以官方为准。本文出现的所有性能数字,也都是官方口径,不是本站实测。
二、Mobile Planner:手机里的那个"项目经理"
三个 Agent 里,Mobile Planner 负责规划与决策,可以理解为手机的"大脑"。它要做四件事:听懂一个复杂需求、把需求拆成可执行的步骤、把可用的工具编排成执行顺序、在执行过程中根据反馈动态调整。
官方举的例子是长程任务交付:规划一个步数超过一百步的复杂任务,比如策划一场活动。一百步这个量级值得停一下。日常指令的难点从来不是"打开某个应用",而是"帮我把这场活动办起来",后者包含时间安排、场地、邀请、物料、预算,任何一环卡住都要回头改前面的计划。任务步数一上百,真正的考验就不再是拆解能力,而是"错了之后能不能回头改"的能力。这也是"动态调整"这四个字分量最重的地方。
支撑长程任务的是一套双层记忆系统:工作记忆随任务演化,记录当前这件事进展到哪一步;长期记忆沉淀用户画像,官方说法是越用越懂用户。这两层分开设计是合理的。工作记忆是短期的、任务级的,用完就该清;长期记忆是跨任务的、关于人的,需要长期积累,也需要谨慎处理。混在一起,要么任务上下文被历史噪声污染,要么用户偏好被单次任务带偏。
成本方面,官方口径是每千次任务调用成本仅约 2.41 美元,并称这一水平是头部模型的几分之一。这个数字单独看没有意义,它的价值在于暴露了产品假设:这是一套假设高频调用的方案。如果一天只调用几次,成本根本不是议题;只有当手机上大量日常操作都要先过一遍 Planner,每千次 2.41 美元才会成为厂商必须算的账。至于对比口径里的"头部模型"具体指哪个、测试条件如何,官方没有展开,外界无法复核。
如果你想先看看端侧 Agent 在开源侧能做到什么程度,可以对照 OmniBot 开源端侧 Agent 的路线,两者在"规划主体放在端上还是云上"这个选择上并不一致。
三、Mobile-Use:API 优先,GUI 兜底
Mobile-Use Agent 负责真正动手,也就是执行跨 App 操作。它采用的路子叫"API 优先 + GUI 兜底":能通过官方接口完成的,走接口;接口不存在或不开放的,退回到模拟图形界面操作。
这六个字是整篇最值得记住的一句。纯图形界面自动化看起来万能,任何应用都能点,但它慢、脆、贵,识别界面元素要耗算力,界面一改就崩,遇到弹窗就发懵。纯接口调用又快又稳,可覆盖范围受制于别人开不开放接口,而现实中大量应用并不提供。两者的取舍不是技术偏好,而是覆盖面与稳定性之间的权衡:先把稳的走完,再用兜底补上长尾。官方称其能力还延伸到浏览器场景与多设备协同。
安全上,官方描述是三层安全隐私管控,关键决策需用户确认后才执行。这个设计放在跨 App 操作上是必要的,因为 Agent 一旦能替你点确认、填表单、提交订单,风险等级和"聊天聊错一句话"完全不是一回事,它可能真的把钱花出去。
指标全部为官方口径:端到端任务成功率 90%;任务完成时间压缩 28.8%;费用降低 20%;单次完成任务耗时 59.5 秒。荣耀方案侧的闭环率同样报为 90%。
这里要泼一点冷水。"成功率 90%"和"耗时 59.5 秒"放在一起看,其实是两类不同性质的信息。耗时是体验指标,59.5 秒对一件需要跨三四个应用的事来说可以接受;成功率是信任指标,而 90% 意味着每十次有一次失败。对一个能替你付钱的 Agent 来说,剩下那 10% 才是产品能不能被长期使用的关键,因为它决定了用户要不要从头到尾盯着它做完。官方没有公布失败时的兜底策略、恢复代价,也没有说明这 90% 覆盖的是哪一类任务,这些空白要靠第三方复测才能填上。
四、Mobile Creative:一句话直出图
Mobile Creative Agent 负责影像创作。机制不复杂:把用户口语化的需求自动拆解成一条工作流,然后一句话直接输出可用图片。官方口径是首图生成仅需 3 秒,并称达到行业第一梯队。
把它和另外两个 Agent 放在一起看,会看出一个有意思的分工差异:Planner 和 Mobile-Use 交付的是"事情办完了",Creative 交付的是"东西你可以直接用了"。前者衡量流程是否闭合,后者衡量产出物能不能拿去发布。这也是为什么它的核心指标是首图时间。创作场景里,用户对"等"的容忍度远低于操作场景,慢了就自己动手了。
三个 Agent 的能力对照如下,其中指标一栏均为官方口径。
| Agent | 角色定位 | 核心机制 | 官方口径指标 |
|---|---|---|---|
| Mobile Planner | 规划与决策,手机的"大脑" | 需求理解、任务拆解、工具编排、动态调整;双层记忆(工作记忆 + 长期用户画像);支持 100 步以上长程任务 | 每千次任务调用成本约 2.41 美元 |
| Mobile-Use | 执行手机操作,跨应用动手 | "API 优先 + GUI 兜底";三层安全隐私管控;关键决策需用户确认 | 端到端任务成功率 90%;完成时间压缩 28.8%;费用降低 20%;单任务耗时 59.5 秒 |
| Mobile Creative | 影像创作,直接产出可用内容 | 把口语化需求自动拆解为工作流,一句话直出图片 | 首图生成 3 秒 |
五、平台、评测与安全:它卖的其实是一整套底座
如果只看到三个 Agent,会低估这套方案的实际形态。官方描述的全栈平台能力包括:模块化可定制、支持模型独立部署、Skill 统一治理、一站式运维、自动化评测。翻译过来就是,厂商可以不整套买,只拿其中几块;可以把模型放在自己那儿跑;可以把技能资产集中管起来;不用自己从零搭评测和运维。
其中"开放四套评测集"这一条最值得留意,覆盖规划、执行、真机、安全四条链路。开放评测集对厂商的意义是降低了选型与验收成本,不用听厂商自己说好不好,可以自己跑。这算是这类 B2B 方案里比较实在的一步。
安全侧,官方称三层安全管控使其安全评分高出头部方案 23 个百分点(官方口径),并提到与复旦白泽团队共建安全评测。与学术安全团队共建评测,是在给"可信"这件事找一个外部锚点,方向上是对的;但"高出 23 个百分点"这个数字,仍然缺少可复核的评测方法与样本说明。
以下是官方口径的竞品对照表。需要强调:该表来自来源方转述,非本站独立复测,请当作厂商视角的能力声明,而不是中立结论。
| 维度 | Qwen Intelligence | Apple Intelligence(Siri AI) |
|---|---|---|
| 产品定位 | 面向手机厂商的 AI 全栈解决方案(B2B 底座) | 苹果自研自用,仅限自家设备生态(B2C 闭环) |
| 架构模式 | 规划 + 操作 + 创意三 Agent 分工,模型与 Harness 协同演进 | 端侧自研模型 + Google Gemini 驱动,系统深度集成 |
| 任务执行 | "API 优先 + GUI 兜底",端到端成功率 90%,完成时间 59.5 秒 | 支持跨应用执行复杂任务,但 Siri AI 功能多次延期,2026 年秋才以 Beta 上线 |
| 记忆能力 | 双层记忆:工作记忆 + 长期用户画像 | 个人情境理解(邮件、照片、信息),依赖 iCloud 同步 |
| 创作能力 | Creative Agent 一句话直出图,首图 3 秒,达行业第一梯队 | Image Playground 生成图片,支持写作工具,能力较基础 |
| 成本 | 每千次任务约 2.41 美元,是头部模型几分之一 | 不单独计费,但仅限高价新机型(iPhone 15 Pro 以上) |
| 开放程度 | 开放四套评测集,模块化可定制,已与荣耀落地(准确率 91.8%) | 封闭生态,仅开发者 API 开放,中国大陆暂无法使用 Siri AI |
在解读这张表时,有一件事必须说清楚:它与 Apple Intelligence 不是同一层的东西。一个是面向手机厂商出售的 AI 底座,一个是苹果自研自用、限自家生态的闭环能力。拿它们直接比高低,等于拿建材供应商和开发商比谁的房子好。详细的对照关系,留给同批的 手机 AI Agent 五方横评 去写,本文只做事实陈述。
六、本站判断:解决了什么,没解决什么
它做对了什么。
第一,它把"手机操作"从模型能力问题重新定义成了工程交付问题。过去两年,端侧 Agent 的讨论几乎都集中在"模型够不够聪明",而 Qwen Intelligence 给出的答案是:聪明不是重点,规划与执行分离、接口优先加界面兜底、记忆分层,这三件事拼起来才是一套能交付给厂商的架构。这比再刷一个榜单分数更接近产品。
第二,它把成本摆上了台面。每千次约 2.41 美元的官方口径,说明设计时按高频调用做过账。一个不谈成本的 Agent 方案,在手机这种日活设备上是没法立项的。
第三,开放评测集、与外部安全团队共建评测、关键决策回到用户确认,这几步都在尝试解决同一个问题:让厂商敢把系统权限交出去。跨 App 操作这件事,技术从来不是第一障碍,信任才是。
它没解决什么。
第一,B2B 决定了它落地的节奏不由阿里掌握。方案再好,也要看厂商的适配意愿和系统权限开放程度。界面兜底这条路依赖无障碍服务、截屏与模拟点击等系统能力,这些权限开多少、开给谁,是厂商和系统方说了算。厂商不配合,兜底就只是纸面能力。
第二,可验证的公开信息太少。91.8% 是"综合任务准确率",这个口径具体怎么算、任务集多大、覆盖哪些场景,官方没有展开;每千次 2.41 美元对应的"头部模型几分之一",也没有给出对比基准。所有数字都是官方口径,没有第三方复测,这决定了今天任何"它比谁强"的结论都只能算厂商声明。
第三,长程任务的可靠性没有被讨论。官方强调能规划一百步以上的任务,但没有公布这类任务的成功率,也没有说明中途失败如何处理、能否回滚。一百步里错一步就要重来的话,体验和成本的账得重算。
第四,商业信息几乎全空白。定价、计费细则、开放地区、上线时间表、完整合作厂商名单,官方都没有公开。荣耀的落地是一个起点,但一个客户不等于一个市场。
结论。Qwen Intelligence 的价值在于它给出了一个形态清晰的答案:手机上的 Agent 不该是一个更聪明的助手,而应该是一套分工明确、成本可算、权限可控的系统组件。它把"手机操作"这件事工程化了,这一点值得认真对待。但它能不能真的长在手机上,取决于两件它自己控制不了的事,厂商愿不愿意开放权限,以及那些官方口径里的数字能不能被第三方复测出来。在那之前,把它当成方向,而不是结论。
想自己动手试试手机上的 Agent 是什么手感,可以参考 手机装 Agent 上手 SOP。
参考来源
- AI工具集收录页(原始信源标注「千问大模型」),采集于 2026-09-23。
- 本文所有性能数字(91.8% / 每千次约 2.41 美元 / 90% / 28.8% / 20% / 59.5 秒 / 首图 3 秒 / 安全评分高出 23 个百分点)均为官方口径,非本站实测或复测;竞品对照表为来源方口径,非本站独立复测。
- 定价与计费细则、开放地区与时间表、完整合作厂商名单、模型版本与参数量均未公开,以官方为准。