开源项目
开源项目

Open-AutoGLM 拆解:智谱把手机 Agent 开源了,一句「打开小红书搜美食」它自己动手

zai-org/Open-AutoGLM(26,104 星 / 4,019 fork,Apache-2.0,Python)是智谱开源的手机端 GUI Agent 框架:ADB 控制真机 + VLM 屏幕感知,截图、看懂界面、规划、点击循环执行,10 个固定操作原语,不依赖无障碍接口和控件树。配 AutoGLM-Phone-9B 专用模型(第三方 API / vLLM 本地部署 24GB+ 显存 / Claude Code+GLM Coding Plan 三种取用),内置敏感操作确认与人工接管两道安全门,官方覆盖 Android 50+、鸿蒙 60+ 主流应用。README 专设「给 AI 看的部署指南」,用 agent 装 agent。注意口径:仓库最近 push 停在 2026-03-06,星数是历史积累。

发布于 2026年8月27日8 分钟阅读
<!-- open-autoglm-resource | open-source | Open-AutoGLM 拆解:智谱把手机 Agent 开源了,一句「打开小红书搜美食」它自己动手 -->

过去两年 agent 的主战场都在浏览器和终端里:读写文件、调 API、跑测试。但普通人一天花五六个小时的地方是手机屏幕,而手机上的「智能」至今还停留在语音助手帮你开个 App。智谱(zai-org)开源的 Open-AutoGLM 就是冲着这块最难啃的 GUI 来的:一个基于 AutoGLM 的手机端智能助理框架,你用自然语言说「打开小红书搜索美食」,它自己截图、自己看懂界面、自己规划下一步、自己伸手指点击,直到任务完成。

GitHub API 实测(2026-08-27):26,104 星 / 4,019 fork,Apache-2.0,Python,创建于 2025-12-08。要注意一个口径:仓库最近一次 push 停在 2026-03-06,按快照口径已近半年未更新,星数是历史积累而非当下热度的直接证据。

先说边界:星数与仓库状态为 API 快照(2026-08-27);本文基于官方 README(中/英)与仓库元数据梳理,属代表性拆解非长期实测;「跑通」以官方文档描述为准,未做逐机型验证。

一、它解决什么:把「动嘴」变成「动手」

Open-AutoGLM 的定位一句话可以讲清:手机 GUI 操作的自动化。系统通过 ADB(Android Debug Bridge)控制设备,以视觉语言模型(VLM)做屏幕感知,再结合智能规划能力生成并执行操作流程。用户只需自然语言描述需求,Agent 自动解析意图、理解当前界面、规划下一步动作并完成整个流程。

它的运行循环在 README 里被压缩成一行(原话):截图 -> 视觉模型理解界面 -> 输出点击坐标 -> ADB 执行操作 -> 循环。这个「视觉路线」是理解项目价值的关键:它不依赖 App 的无障碍接口,不依赖控件树,不依赖任何 App 配合,只靠「看屏幕」和「点坐标」就能操作任意应用。代价是每一步都要过一遍 VLM 推理,速度和 token 成本都比控件树方案高,但通用性没有对手。

和本站 8 月拆过的 phone-harness 一句话划清界限:phone-harness 是「借 Mac 镜像控 iPhone」,用 Mac 的鼠标键盘隔着屏幕戳 iOS;Open-AutoGLM 走的是「Android 原生 ADB + VLM 屏幕感知」的正路,直接拿到底层操作权。和 Agent Runtime 五强横评 里那批框架的区别更本质:那些 runtime 跑在服务器和沙盒里,操作的是文件和进程;Open-AutoGLM 操作的是一台物理手机,是 agent 世界里少见的「有手指」的项目。

二、核心设计:感知-规划-执行循环,加两道安全门

Agent 每一步能做的动作是一组固定的原语,共 10 个:

操作描述
Launch启动应用
Tap点击指定坐标
Type输入文本
Swipe滑动屏幕
Back / Home返回上一页 / 返回桌面
Long Press / Double Tap长按 / 双击
Wait等待页面加载
Take_over请求人工接管(登录/验证码等)

模型在每一步输出思考过程加一个动作 JSON,verbose=True 时全程可见--你能看到它写「当前在系统桌面,需要先启动小红书应用」,然后吐出 {"action": "Tap", "element": [500, 100]},再进入下一步。每任务默认最多 100 步(PHONE_AGENT_MAX_STEPS 可调),防止失控循环。

这个循环往上还可以包一层 Python API,把「一句话」变成程序里的一个函数调用:

python
from phone_agent import PhoneAgent
from phone_agent.model import ModelConfig

model_config = ModelConfig(
    base_url="http://localhost:8000/v1",
    model_name="autoglm-phone-9b",
)
agent = PhoneAgent(model_config=model_config)
result = agent.run("打开淘宝搜索无线耳机")

也就是说它不只是个命令行玩具:你可以把「订今晚的外卖」「把收藏夹里的文章转发到文件传输助手」这类流程接进自己的调度系统。框架(跑在你电脑上,负责调模型、解析动作、控制手机)和模型服务(远程 API 或本地部署)是解耦的两半,中间走 OpenAI 兼容接口。模型侧参数官方也有讲究:temperature 0.1、max_tokens 3000,低温度是刻意为之--GUI 操作要的是确定性,不是发散。

这套「裸操作原语」里最值得单独讲的是两道安全门,这是它和一众只会演示的 GUI agent demo 的分水岭:

  • 敏感操作确认:内置确认机制,提供 confirmation_callback 回调,敏感动作先问你再动。
  • 人工接管:登录、验证码这类机器不该碰的场景,Take_over 原语直接把控制权交还给人,配 takeover_callback 自定义流程。更细的是截图黑屏检测--支付、密码、银行类应用会主动屏蔽截图,Agent 拿到黑屏会识别出「这是敏感页面」并自动请求人工接管,而不是瞎点一通。

另外两个工程细节说明这不是玩具:一是支持远程调试,手机和电脑同 WiFi 下 adb connect 192.168.1.100:5555 就能无线控制,多设备用 --device-id 区分;二是系统 prompt 中英两套(prompts_zh.py / prompts_en.py)直接可改,官方文档明说可以通过注入 app 名称禁用某些 app--给 agent 划禁区这件事,被做成了配置项。

三、模型怎么来:一个 9B 手机专用模型,三种取用方式

框架本身不含模型,模型是外部服务。开源的是 AutoGLM-Phone-9B,两个版本:

模型适用场景下载
AutoGLM-Phone-9B针对中文手机应用优化HuggingFace / ModelScope(zai-org/AutoGLM-Phone-9B)
AutoGLM-Phone-9B-Multilingual支持英语场景,适用英文等其他语言内容的应用HuggingFace / ModelScope(zai-org/AutoGLM-Phone-9B-Multilingual)

模型结构与 GLM-4.1V-9B-Thinking 相同,部署可参照 GLM-V 仓库。取用分三层:

方式门槛说明
第三方 API一个 API Key智谱 BigModel(autoglm-phone)、ModelScope;英文版还有 z.ai、Novita AI、Parasail
本地部署NVIDIA GPU,建议 24GB+ 显存vLLM / SGLang 起 OpenAI 兼容服务,模型文件约 20GB
懒人版Claude Code + GLM Coding Plan见下一节

本地部署的启动参数官方给得很具体:--max-model-len 25480、单条 prompt 最多 10 张图片、图像 max_pixels 500 万--这些不是随便拍的数字,改了大概率部署失败,README 甚至专门提供 check_deployment_cn.py 检查脚本,并提醒「如果思维链长度很短或出现乱码,很可能是模型部署失败」。

四、怎么装:README 里专门写了一章「给 AI 看的部署指南」

安装路线有两条。

懒人版:用 Claude Code 配置 GLM Coding Plan 后,输入一句 prompt 即可:

text
访问文档,为我安装 AutoGLM
https://raw.githubusercontent.com/zai-org/Open-AutoGLM/refs/heads/main/README.md

这个设计比看上去更有意思:README 末尾有一整章「自动化部署指南(面向 AI)」,明确写着「本章节专为 AI 助手(如 Claude Code)设计,如果你是人类读者可以跳过」。也就是说这份 README 同时是给人看的文档和给 agent 看的安装程序--里面预置了部署前置检查清单(数据线是否支持数据传输、是否开了 USB 调试安全设置)、异常处理对照表、验收标准(「打开微信,对文件传输助手发送消息:部署成功」)。用 agent 装 agent,这个 meta 程度本身就是 2026 年项目 README 的新范式,和 OpenAI 开源 Codex Harness 时「文档即工具链」的思路殊途同归。

手动版:Python 3.10+,pip install -r requirements.txt && pip install -e .,然后是 Android 侧的准备工作--开启开发者模式和 USB 调试(设置-关于手机-连点版本号约 10 次启用开发者模式,再到开发者选项勾 USB 调试),装 ADB Keyboard(文本输入必需,没有它中文输入会失败;鸿蒙设备用原生输入法不需要),adb devices 确认连接。设备要求 Android 7.0+ 或 HarmonyOS NEXT 及以上(鸿蒙走 HDC 工具链,--device-type hdc 切换),iPhone 有单独的 iOS 配置文档(WebDriverAgent 方案)。

连接跑通之后,官方给的验收标准是「打开微信,对文件传输助手发送消息:部署成功」--手机自动打开微信、自动搜到联系人、自动把消息发出去,三步都对才算部署完成。这个验收设计得很聪明:它覆盖了 Launch、Tap、Type 三个最核心的动作原语,又不碰任何敏感权限,一分钟就能确认整条链路(模型服务、ADB 连接、动作执行)都活着。

常见坑官方都列了,挑最劝退的三个:数据线只有充电功能(adb devices 空列表,换线);部分机型要同时开「USB 调试(安全设置)」才能点击(症状是能打开应用但点不动);Windows 下 GBK 编码报错(UnicodeEncodeError: gbk code,运行前加环境变量 PYTHONIOENCODING=utf-8)。另外非 TTY 环境跑不了交互模式(报 EOF when reading a line),直接在命令行带上任务描述即可。

五、能干什么、不能干什么

支持广度是官方给的硬数据:Android 端 50+ 款主流中文应用,鸿蒙端 60+ 款原生及系统应用

平台覆盖
Android(50+)微信、淘宝、京东、拼多多、美团、携程、12306、滴滴、bilibili、抖音、小红书、知乎、豆瓣等,--list-apps 查全表
鸿蒙(60+)上述主流 App 的鸿蒙版,加系统应用(日历、相机、短信、设置等)和华为服务(应用市场、主题、天气等)

能干的:跨 App 的复合任务(README 演示里就有「比较同一商品在京东和淘宝的价格再下单」级别的任务,模型思考链会自己拆解成启动京东-搜索-记价格-切淘宝-比价-下单);日常口径的批量杂活,比如「打开美团搜索附近的火锅店」「打开抖音刷视频」这类官方示例任务,或者定时把某几条资讯转发给同事;测试口径的回归遍历--把同一个任务描述扔给不同版本的模型或 prompt,看它点得对不对。环境变量也给了无人值守的口子:PHONE_AGENT_BASE_URLPHONE_AGENT_MODELPHONE_AGENT_DEVICE_IDPHONE_AGENT_MAX_STEPS 等都能预先写进环境,脚本化调用。

不能干或要打折扣的,如实列出:

  • 登录和验证码必须人来:这是设计而非缺陷,但意味着它不是全自动无人值守方案。
  • 支付/银行页面是黑盒:截图被系统屏蔽,Agent 只能请求接管。
  • 仅供研究和学习使用:README 使用条款原文「严禁用于非法获取信息、干扰系统或任何违法活动」--拿去做灰产批量操作的念头可以直接打消,这条款也意味着不适合直接上生产环境。
  • 活跃度要自己掂量:快照口径下最近 push 停在 2026-03-06,新机型的适配、新 App 的改版是否跟得上,没有承诺。

六、生态位:不止一个仓库,是一条产品线

单看仓库会低估它,Open-AutoGLM 周围咬合着好几个齿轮:

  • Midscene.js 双向适配:这个视觉模型驱动的开源 UI 自动化 SDK(支持 JavaScript/YAML 流程语法)已完成对 AutoGLM 模型的适配,官方文档明说可在 iOS 和 Android 设备上体验--等于一条 JS/YAML 生态的管道接了进来,会写前端的也能用。
  • GLM Coding Plan 联动:安装入口直接接在智谱自家的 Claude Code 订阅计划上,用自家 agent 框架装自家 agent 框架。
  • 配套产品 Autotyper:智谱 AI 输入法,「用嘴发指令」的落地形态(autoglm.zhipuai.cn/autotyper),开源框架是研究入口,输入法是商业出口。
  • 「AutoGLM 实战派」激励活动:跑通、二创即可瓜分数万元现金奖池--官方在主动给二创导流。
  • 两篇论文背书:AutoGLM(arXiv:2411.00820)和 MobileRL(arXiv:2509.18119,在线强化学习训练手机 GUI Agent),技术路线有公开可查的来路。

放在更大的图景里看,这正好接上智谱本周刚开源的 GLM-5.3-Flash--GLM-5 系列首个原生多模态模型,Visual Coding 能力让模型在代码、浏览器与图形界面之间协同并做视觉验证。GUI/视觉 Agent 是智谱明确下注的赛道:GLM-5.3-Flash 管代码和浏览器侧的视觉验证,Open-AutoGLM 管手机侧的实际操作,一个模型的「眼睛」加一个框架的「手指」。想看 agent 编码侧配套工具的,还可以回看本站的 Cline 拆解

七、许可证与适合谁

Apache-2.0,四个字:随便用。没有 OpenViking 那种 AGPL 传染性问题,商用二次开发的许可证门槛为零(当然使用条款里「仅供研究学习」的约束仍在,那是产品边界不是许可证边界)。

适合谁:想研究手机 GUI Agent 的开发者(这是目前星数最高、文档最完整的中文手机 agent 开源实现,2.6 万星里相当一部分来自「实战派」活动的导流)、做安卓自动化测试想换掉死板脚本号的团队(Python 走原生 API,YAML/JS 走 Midscene.js,两条路都通)、以及奔着奖池去搞二创的独立开发者。不适合谁:想要开箱即用、SLA 保障、无人值守的企业级 RPA 客户--登录要人接管、支付是黑屏、活跃度停在三月,这三条就够了。

一句话收尾:当多数 agent 还在服务器里读写文件时,Open-AutoGLM 把「手指」开源了--它未必是最强的 agent,但它是少数几个真的会替你点开小红书的。


参考来源

本文基于官方 README 与仓库元数据梳理(截至 2026-08-27),星数为 API 快照,未做长期实测,支持应用与操作能力以官方文档为准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-27

相关文章

开源项目

GLM-5.3 深度解析:智谱开源编程第一,还会找漏洞,「开源的盾」启动

智谱 GLM-5.3(2026-08-14):基座未变,靠后训练 Scaling 大幅提升智能上界,成当前编程能力最强开源模型(Terminal Bench 3.0 等多项开源第一),并涌现网络安全能力(代码审查/漏洞发现),联合安全团队发现 2436 个漏洞,启动「开源的盾」计划。深度解析+5 避坑。仓库/星数以官方为准,非实测。

2026年8月14日8 分钟阅读
开源项目

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

2026年9月9日10 分钟阅读
开源项目

OpenMAIC周增八千星登顶,把文档变多智能体课堂

THU-MAIC/OpenMAIC 以周增 8,095 星登顶 GitHub 周榜(2026-09-08 快照 33,053 星 / 5,369 fork / TypeScript / MIT)。它把任意主题或文档变成多智能体互动课堂:AI 老师与 AI 同学实时讲课、讨论、白板板书、TTS 朗读,生成幻灯片、测验、交互式模拟与 PBL 项目制学习,可导出 .pptx 与交互 HTML。v1.0.0(2026-08-27)新增 Agent workbench 聊天式构建、持久化会话、20 个内置技能;技术栈 Next.js 16 / React 19 / LangGraph 1.1;v0.3.0 起由 AGPL-3.0 转 MIT,并内置 SKILL.md 标准技能包,可从 OpenClaw、Codex、WorkBuddy 等工作台直接生成课堂。

2026年9月8日10 分钟阅读