前沿热点
前沿热点

手机自己会干活:阿里把三个 Agent 塞进了系统

2026 年 9 月,阿里巴巴通义千问团队推出面向手机厂商的「AI 手机全栈解决方案」Qwen Intelligence:不造硬件,向厂商提供模型、平台与场景化方案。方案含三大 Agent——Mobile Planner 负责任务规划与决策(支持 100+ 步长程任务,双层记忆为工作记忆加长期用户画像),Mobile-Use 以「API 优先 + GUI 兜底」执行跨 App 操作(含三层安全隐私管控、关键决策需用户确认),Mobile Creative 面向影像创作(口语化需求直出图)。官方口径指标:与荣耀合作落地后综合任务准确率 91.8%;Planner 每千次任务调用成本约 2.41 美元;Mobile-Use 端到端成功率 90%、完成时间压缩 28.8%、费用降低 20%、单任务 59.5 秒;Creative 首图生成 3 秒;安全评分高出头部方案 23 个百分点,并与复旦白泽团队共建安全评测。平台侧开放四套评测集(规划、执行、真机、安全),模块化可定制,支持模型独立部署与 Skill 统一治理。本文将口径写死:所有性能数字均为官方口径而非本站复测;官方竞品对照表标明来源方口径;定价与计费细则、开放地区与时间表、完整合作厂商名单、模型版本与参数量均未公开,一律写「以官方为准」;并明确它是 B2B 全栈方案而非消费者可直接下载的 App,消费者侧只有荣耀落地机型与千问 AI 平台体验专区。

发布于 2026年9月23日7 分钟阅读
<!-- qwen-intelligence-hotspot | hotspot | 手机自己会干活:阿里把三个 Agent 塞进了系统 -->

过去十年,手机上的"智能助手"一直卡在同一个动作上:你得先喊它。喊对唤醒词,它才肯抬头;喊错了,它就当没听见。于是我们对手机 AI 的期待被压得很低,查天气、定闹钟、放首歌,能听懂就算合格。所谓助手,本质上是一个等你开口的搜索框。

Qwen Intelligence 想动的就是这一步。阿里巴巴通义千问团队把它定义为一套 AI 手机全栈解决方案,官方的一句话表述是让手机从"被动响应"走向"主动服务"。这句话听起来像宣传语,但拆开看,它其实是一次职责的重新划分:手机不再只是执行你逐条下达的指令,而是尝试承接一件你还没说完整的事。

真正值得看的,不是"它也能跨 App 点按钮"这件事本身,而是它把这件事拆成了三种不同的角色,并且给每个角色配了不同的成本结构和安全策略。这套拆法的背后,是对"手机操作"的一次重新理解,它认为这不是一个模型能力问题,而是一个工程交付问题。

一、先说清楚它是什么,不是什么

Qwen Intelligence 是阿里巴巴通义千问团队推出的 AI 手机全栈解决方案,定位很明确:不造硬件,向手机厂商提供"模型 + 平台 + 场景化方案"的一站式 AI 底座。也就是说,它是一门 B2B 生意,客户是手机厂商,不是你我。

这一点必须写在最前面,因为它是很多讨论跑偏的根源。它不是消费者能直接下载的 App,你没法打开应用商店搜到它、装上就用。目前可验证的消费者侧落地只有两处:一是与荣耀合作的方案,官方称综合任务准确率达 91.8%;二是千问 AI 平台上的在线体验专区,官网则挂在 qwenintelligence.com。它不打算自己造手机,也不打算绕开厂商直接服务用户。这个选择决定了它的天花板,也决定了它真正的风险不在技术侧,而在商务侧。

关于它目前没有公开的信息,这里需要一次性说清楚:定价与计费细则、开放地区与上线时间表、完整的合作厂商名单、模型版本与参数量,均未见官方披露。网上任何关于"下一步接入哪家""卖多少钱"的说法,都应当以官方为准。本文出现的所有性能数字,也都是官方口径,不是本站实测。

二、Mobile Planner:手机里的那个"项目经理"

三个 Agent 里,Mobile Planner 负责规划与决策,可以理解为手机的"大脑"。它要做四件事:听懂一个复杂需求、把需求拆成可执行的步骤、把可用的工具编排成执行顺序、在执行过程中根据反馈动态调整。

官方举的例子是长程任务交付:规划一个步数超过一百步的复杂任务,比如策划一场活动。一百步这个量级值得停一下。日常指令的难点从来不是"打开某个应用",而是"帮我把这场活动办起来",后者包含时间安排、场地、邀请、物料、预算,任何一环卡住都要回头改前面的计划。任务步数一上百,真正的考验就不再是拆解能力,而是"错了之后能不能回头改"的能力。这也是"动态调整"这四个字分量最重的地方。

支撑长程任务的是一套双层记忆系统:工作记忆随任务演化,记录当前这件事进展到哪一步;长期记忆沉淀用户画像,官方说法是越用越懂用户。这两层分开设计是合理的。工作记忆是短期的、任务级的,用完就该清;长期记忆是跨任务的、关于人的,需要长期积累,也需要谨慎处理。混在一起,要么任务上下文被历史噪声污染,要么用户偏好被单次任务带偏。

成本方面,官方口径是每千次任务调用成本仅约 2.41 美元,并称这一水平是头部模型的几分之一。这个数字单独看没有意义,它的价值在于暴露了产品假设:这是一套假设高频调用的方案。如果一天只调用几次,成本根本不是议题;只有当手机上大量日常操作都要先过一遍 Planner,每千次 2.41 美元才会成为厂商必须算的账。至于对比口径里的"头部模型"具体指哪个、测试条件如何,官方没有展开,外界无法复核。

如果你想先看看端侧 Agent 在开源侧能做到什么程度,可以对照 OmniBot 开源端侧 Agent 的路线,两者在"规划主体放在端上还是云上"这个选择上并不一致。

三、Mobile-Use:API 优先,GUI 兜底

Mobile-Use Agent 负责真正动手,也就是执行跨 App 操作。它采用的路子叫"API 优先 + GUI 兜底":能通过官方接口完成的,走接口;接口不存在或不开放的,退回到模拟图形界面操作。

这六个字是整篇最值得记住的一句。纯图形界面自动化看起来万能,任何应用都能点,但它慢、脆、贵,识别界面元素要耗算力,界面一改就崩,遇到弹窗就发懵。纯接口调用又快又稳,可覆盖范围受制于别人开不开放接口,而现实中大量应用并不提供。两者的取舍不是技术偏好,而是覆盖面与稳定性之间的权衡:先把稳的走完,再用兜底补上长尾。官方称其能力还延伸到浏览器场景与多设备协同。

安全上,官方描述是三层安全隐私管控,关键决策需用户确认后才执行。这个设计放在跨 App 操作上是必要的,因为 Agent 一旦能替你点确认、填表单、提交订单,风险等级和"聊天聊错一句话"完全不是一回事,它可能真的把钱花出去。

指标全部为官方口径:端到端任务成功率 90%;任务完成时间压缩 28.8%;费用降低 20%;单次完成任务耗时 59.5 秒。荣耀方案侧的闭环率同样报为 90%。

这里要泼一点冷水。"成功率 90%"和"耗时 59.5 秒"放在一起看,其实是两类不同性质的信息。耗时是体验指标,59.5 秒对一件需要跨三四个应用的事来说可以接受;成功率是信任指标,而 90% 意味着每十次有一次失败。对一个能替你付钱的 Agent 来说,剩下那 10% 才是产品能不能被长期使用的关键,因为它决定了用户要不要从头到尾盯着它做完。官方没有公布失败时的兜底策略、恢复代价,也没有说明这 90% 覆盖的是哪一类任务,这些空白要靠第三方复测才能填上。

四、Mobile Creative:一句话直出图

Mobile Creative Agent 负责影像创作。机制不复杂:把用户口语化的需求自动拆解成一条工作流,然后一句话直接输出可用图片。官方口径是首图生成仅需 3 秒,并称达到行业第一梯队。

把它和另外两个 Agent 放在一起看,会看出一个有意思的分工差异:Planner 和 Mobile-Use 交付的是"事情办完了",Creative 交付的是"东西你可以直接用了"。前者衡量流程是否闭合,后者衡量产出物能不能拿去发布。这也是为什么它的核心指标是首图时间。创作场景里,用户对"等"的容忍度远低于操作场景,慢了就自己动手了。

三个 Agent 的能力对照如下,其中指标一栏均为官方口径。

Agent角色定位核心机制官方口径指标
Mobile Planner规划与决策,手机的"大脑"需求理解、任务拆解、工具编排、动态调整;双层记忆(工作记忆 + 长期用户画像);支持 100 步以上长程任务每千次任务调用成本约 2.41 美元
Mobile-Use执行手机操作,跨应用动手"API 优先 + GUI 兜底";三层安全隐私管控;关键决策需用户确认端到端任务成功率 90%;完成时间压缩 28.8%;费用降低 20%;单任务耗时 59.5 秒
Mobile Creative影像创作,直接产出可用内容把口语化需求自动拆解为工作流,一句话直出图片首图生成 3 秒

五、平台、评测与安全:它卖的其实是一整套底座

如果只看到三个 Agent,会低估这套方案的实际形态。官方描述的全栈平台能力包括:模块化可定制、支持模型独立部署、Skill 统一治理、一站式运维、自动化评测。翻译过来就是,厂商可以不整套买,只拿其中几块;可以把模型放在自己那儿跑;可以把技能资产集中管起来;不用自己从零搭评测和运维。

其中"开放四套评测集"这一条最值得留意,覆盖规划、执行、真机、安全四条链路。开放评测集对厂商的意义是降低了选型与验收成本,不用听厂商自己说好不好,可以自己跑。这算是这类 B2B 方案里比较实在的一步。

安全侧,官方称三层安全管控使其安全评分高出头部方案 23 个百分点(官方口径),并提到与复旦白泽团队共建安全评测。与学术安全团队共建评测,是在给"可信"这件事找一个外部锚点,方向上是对的;但"高出 23 个百分点"这个数字,仍然缺少可复核的评测方法与样本说明。

以下是官方口径的竞品对照表。需要强调:该表来自来源方转述,非本站独立复测,请当作厂商视角的能力声明,而不是中立结论。

维度Qwen IntelligenceApple Intelligence(Siri AI)
产品定位面向手机厂商的 AI 全栈解决方案(B2B 底座)苹果自研自用,仅限自家设备生态(B2C 闭环)
架构模式规划 + 操作 + 创意三 Agent 分工,模型与 Harness 协同演进端侧自研模型 + Google Gemini 驱动,系统深度集成
任务执行"API 优先 + GUI 兜底",端到端成功率 90%,完成时间 59.5 秒支持跨应用执行复杂任务,但 Siri AI 功能多次延期,2026 年秋才以 Beta 上线
记忆能力双层记忆:工作记忆 + 长期用户画像个人情境理解(邮件、照片、信息),依赖 iCloud 同步
创作能力Creative Agent 一句话直出图,首图 3 秒,达行业第一梯队Image Playground 生成图片,支持写作工具,能力较基础
成本每千次任务约 2.41 美元,是头部模型几分之一不单独计费,但仅限高价新机型(iPhone 15 Pro 以上)
开放程度开放四套评测集,模块化可定制,已与荣耀落地(准确率 91.8%)封闭生态,仅开发者 API 开放,中国大陆暂无法使用 Siri AI

在解读这张表时,有一件事必须说清楚:它与 Apple Intelligence 不是同一层的东西。一个是面向手机厂商出售的 AI 底座,一个是苹果自研自用、限自家生态的闭环能力。拿它们直接比高低,等于拿建材供应商和开发商比谁的房子好。详细的对照关系,留给同批的 手机 AI Agent 五方横评 去写,本文只做事实陈述。

六、本站判断:解决了什么,没解决什么

它做对了什么。

第一,它把"手机操作"从模型能力问题重新定义成了工程交付问题。过去两年,端侧 Agent 的讨论几乎都集中在"模型够不够聪明",而 Qwen Intelligence 给出的答案是:聪明不是重点,规划与执行分离、接口优先加界面兜底、记忆分层,这三件事拼起来才是一套能交付给厂商的架构。这比再刷一个榜单分数更接近产品。

第二,它把成本摆上了台面。每千次约 2.41 美元的官方口径,说明设计时按高频调用做过账。一个不谈成本的 Agent 方案,在手机这种日活设备上是没法立项的。

第三,开放评测集、与外部安全团队共建评测、关键决策回到用户确认,这几步都在尝试解决同一个问题:让厂商敢把系统权限交出去。跨 App 操作这件事,技术从来不是第一障碍,信任才是。

它没解决什么。

第一,B2B 决定了它落地的节奏不由阿里掌握。方案再好,也要看厂商的适配意愿和系统权限开放程度。界面兜底这条路依赖无障碍服务、截屏与模拟点击等系统能力,这些权限开多少、开给谁,是厂商和系统方说了算。厂商不配合,兜底就只是纸面能力。

第二,可验证的公开信息太少。91.8% 是"综合任务准确率",这个口径具体怎么算、任务集多大、覆盖哪些场景,官方没有展开;每千次 2.41 美元对应的"头部模型几分之一",也没有给出对比基准。所有数字都是官方口径,没有第三方复测,这决定了今天任何"它比谁强"的结论都只能算厂商声明。

第三,长程任务的可靠性没有被讨论。官方强调能规划一百步以上的任务,但没有公布这类任务的成功率,也没有说明中途失败如何处理、能否回滚。一百步里错一步就要重来的话,体验和成本的账得重算。

第四,商业信息几乎全空白。定价、计费细则、开放地区、上线时间表、完整合作厂商名单,官方都没有公开。荣耀的落地是一个起点,但一个客户不等于一个市场。

结论。Qwen Intelligence 的价值在于它给出了一个形态清晰的答案:手机上的 Agent 不该是一个更聪明的助手,而应该是一套分工明确、成本可算、权限可控的系统组件。它把"手机操作"这件事工程化了,这一点值得认真对待。但它能不能真的长在手机上,取决于两件它自己控制不了的事,厂商愿不愿意开放权限,以及那些官方口径里的数字能不能被第三方复测出来。在那之前,把它当成方向,而不是结论。

想自己动手试试手机上的 Agent 是什么手感,可以参考 手机装 Agent 上手 SOP

参考来源

  • AI工具集收录页(原始信源标注「千问大模型」),采集于 2026-09-23。
  • 本文所有性能数字(91.8% / 每千次约 2.41 美元 / 90% / 28.8% / 20% / 59.5 秒 / 首图 3 秒 / 安全评分高出 23 个百分点)均为官方口径,非本站实测或复测;竞品对照表为来源方口径,非本站独立复测。
  • 定价与计费细则、开放地区与时间表、完整合作厂商名单、模型版本与参数量均未公开,以官方为准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-23

相关文章

前沿热点

2.8 秒压到 2.3 秒:Qwen3.8 同传能替人工译员吗

2026 年 9 月阿里通义千问推出实时同声传译大模型 Qwen3.8-LiveTranslate,已通过千问 AI 平台与阿里云百炼以 WebSocket 实时接口开放,可嵌入会议系统、直播推流与客服坐席。硬指标:字均延迟(LAAL)从 2.8 秒压到 2.3 秒;60 种语言识别输入、29 种语音输出;三大能力为实时说话人分离与音色克隆、原文译文同帧同出、长上下文消歧,另支持视频音频输入辅助消歧。技术上靠 Interleave 单流架构(音频与文本交织,已听音频与已出译文缓存复用,不再每句从头处理)加 Hybrid MoE 的 Thinker–Talker 双模块(Thinker 把视频音频原文译文编进同一条因果序列,Talker 结合译文与源音频合成保留原说话人音色的译文语音)。本文严守口径:2.3 秒是字均延迟不是端到端首包延迟,60 与 29 是两个不同口径,竞品对比表来自官方来源而非本站独立复测,"未公布指标"不等于"做不到",定价限流并发地域均未公开故不编数字,并明确它是 API 服务而非开源模型。

2026年9月21日7 分钟阅读
前沿热点

一句话出片:剪映 Hub 把生成和剪辑焊在一起

据量子位 9-21 报道,字节跳动旗下剪映推出 PC 端一站式 AI 视频创作入口「剪映 Hub」,产品动作不在模型参数而在工作流:把生成与剪辑焊进同一入口。官方定位为 PC 端一站式 AI 视频创作工作台,官方页面给出九项核心功能(AI 生图与素材生成、分镜脚本、模块连线与资产管理、分镜提示词批量生成、多模型视频生成与预览成片、生成后直入剪辑、AI 后编辑、剪映助手 Agent、字节系素材导入),并给出十四步上手路径与一张与即梦 AI 的官方口径对照表(来源方口径,非本站复测)。两个真变化:一是生成结果不导出导入、点「更多剪辑」直接进剪映多轨时间线做 AI 智能延长、超清、补帧、调色、消除、人声分离,本质是"工程内闭环"取代"文件交换";二是剪映助手 Agent 用文字调用剪口播、解说、字幕改误、批量成片等 Skill,把重复劳动压成一句指令。本站判断:工作台解决的是素材到成片的最后一公里,不是画质上限,Hub 是编排层不是生成引擎;闭环代价有三笔账——生态绑定、素材与账号强耦合、定价不透明。定价、免费额度、并发、积分规则、可用地域、单条时长与分辨率上限官方均未公布,一律以官方与客户端实际界面为准,不编数字;上线时间只有二手报道口径。

2026年9月22日7 分钟阅读
前沿热点

花 1/8 的钱硬刚 Opus 5:Step 5 Preview 值得等吗

据 ai-bot.cn 2026-09-20 收录,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview:稀疏 MoE 架构,总参 600B、每次推理仅激活 27B,原生 100 万 Token 上下文加文本与视觉多模态,面向真实世界 Agentic 任务设计。Artificial Analysis Intelligence Index 拿到 44 分、位居开源模型前三,单任务成本据称仅为 Claude Opus 5 的 1/8,GPU Kernel 优化 508 TFLOPS 略高于 Opus 5 的 493,并展示 22 小时级连续自主 Agent 任务。口径如实标注:数字来自厂商竞品表,每 token 单价与稳定性仍是 Preview 阶段两大未知,权重预告 2026-10-15 才释放,本文不吹不黑只给五个判断。

2026年9月20日7 分钟阅读