过去两年 agent 的主战场都在浏览器和终端里:读写文件、调 API、跑测试。但普通人一天花五六个小时的地方是手机屏幕,而手机上的「智能」至今还停留在语音助手帮你开个 App。智谱(zai-org)开源的 Open-AutoGLM 就是冲着这块最难啃的 GUI 来的:一个基于 AutoGLM 的手机端智能助理框架,你用自然语言说「打开小红书搜索美食」,它自己截图、自己看懂界面、自己规划下一步、自己伸手指点击,直到任务完成。
GitHub API 实测(2026-08-27):26,104 星 / 4,019 fork,Apache-2.0,Python,创建于 2025-12-08。要注意一个口径:仓库最近一次 push 停在 2026-03-06,按快照口径已近半年未更新,星数是历史积累而非当下热度的直接证据。
先说边界:星数与仓库状态为 API 快照(2026-08-27);本文基于官方 README(中/英)与仓库元数据梳理,属代表性拆解非长期实测;「跑通」以官方文档描述为准,未做逐机型验证。
一、它解决什么:把「动嘴」变成「动手」
Open-AutoGLM 的定位一句话可以讲清:手机 GUI 操作的自动化。系统通过 ADB(Android Debug Bridge)控制设备,以视觉语言模型(VLM)做屏幕感知,再结合智能规划能力生成并执行操作流程。用户只需自然语言描述需求,Agent 自动解析意图、理解当前界面、规划下一步动作并完成整个流程。
它的运行循环在 README 里被压缩成一行(原话):截图 -> 视觉模型理解界面 -> 输出点击坐标 -> ADB 执行操作 -> 循环。这个「视觉路线」是理解项目价值的关键:它不依赖 App 的无障碍接口,不依赖控件树,不依赖任何 App 配合,只靠「看屏幕」和「点坐标」就能操作任意应用。代价是每一步都要过一遍 VLM 推理,速度和 token 成本都比控件树方案高,但通用性没有对手。
和本站 8 月拆过的 phone-harness 一句话划清界限:phone-harness 是「借 Mac 镜像控 iPhone」,用 Mac 的鼠标键盘隔着屏幕戳 iOS;Open-AutoGLM 走的是「Android 原生 ADB + VLM 屏幕感知」的正路,直接拿到底层操作权。和 Agent Runtime 五强横评 里那批框架的区别更本质:那些 runtime 跑在服务器和沙盒里,操作的是文件和进程;Open-AutoGLM 操作的是一台物理手机,是 agent 世界里少见的「有手指」的项目。
二、核心设计:感知-规划-执行循环,加两道安全门
Agent 每一步能做的动作是一组固定的原语,共 10 个:
| 操作 | 描述 |
|---|---|
Launch | 启动应用 |
Tap | 点击指定坐标 |
Type | 输入文本 |
Swipe | 滑动屏幕 |
Back / Home | 返回上一页 / 返回桌面 |
Long Press / Double Tap | 长按 / 双击 |
Wait | 等待页面加载 |
Take_over | 请求人工接管(登录/验证码等) |
模型在每一步输出思考过程加一个动作 JSON,verbose=True 时全程可见--你能看到它写「当前在系统桌面,需要先启动小红书应用」,然后吐出 {"action": "Tap", "element": [500, 100]},再进入下一步。每任务默认最多 100 步(PHONE_AGENT_MAX_STEPS 可调),防止失控循环。
这个循环往上还可以包一层 Python API,把「一句话」变成程序里的一个函数调用:
from phone_agent import PhoneAgent
from phone_agent.model import ModelConfig
model_config = ModelConfig(
base_url="http://localhost:8000/v1",
model_name="autoglm-phone-9b",
)
agent = PhoneAgent(model_config=model_config)
result = agent.run("打开淘宝搜索无线耳机")也就是说它不只是个命令行玩具:你可以把「订今晚的外卖」「把收藏夹里的文章转发到文件传输助手」这类流程接进自己的调度系统。框架(跑在你电脑上,负责调模型、解析动作、控制手机)和模型服务(远程 API 或本地部署)是解耦的两半,中间走 OpenAI 兼容接口。模型侧参数官方也有讲究:temperature 0.1、max_tokens 3000,低温度是刻意为之--GUI 操作要的是确定性,不是发散。
这套「裸操作原语」里最值得单独讲的是两道安全门,这是它和一众只会演示的 GUI agent demo 的分水岭:
- 敏感操作确认:内置确认机制,提供
confirmation_callback回调,敏感动作先问你再动。 - 人工接管:登录、验证码这类机器不该碰的场景,
Take_over原语直接把控制权交还给人,配takeover_callback自定义流程。更细的是截图黑屏检测--支付、密码、银行类应用会主动屏蔽截图,Agent 拿到黑屏会识别出「这是敏感页面」并自动请求人工接管,而不是瞎点一通。
另外两个工程细节说明这不是玩具:一是支持远程调试,手机和电脑同 WiFi 下 adb connect 192.168.1.100:5555 就能无线控制,多设备用 --device-id 区分;二是系统 prompt 中英两套(prompts_zh.py / prompts_en.py)直接可改,官方文档明说可以通过注入 app 名称禁用某些 app--给 agent 划禁区这件事,被做成了配置项。
三、模型怎么来:一个 9B 手机专用模型,三种取用方式
框架本身不含模型,模型是外部服务。开源的是 AutoGLM-Phone-9B,两个版本:
| 模型 | 适用场景 | 下载 |
|---|---|---|
| AutoGLM-Phone-9B | 针对中文手机应用优化 | HuggingFace / ModelScope(zai-org/AutoGLM-Phone-9B) |
| AutoGLM-Phone-9B-Multilingual | 支持英语场景,适用英文等其他语言内容的应用 | HuggingFace / ModelScope(zai-org/AutoGLM-Phone-9B-Multilingual) |
模型结构与 GLM-4.1V-9B-Thinking 相同,部署可参照 GLM-V 仓库。取用分三层:
| 方式 | 门槛 | 说明 |
|---|---|---|
| 第三方 API | 一个 API Key | 智谱 BigModel(autoglm-phone)、ModelScope;英文版还有 z.ai、Novita AI、Parasail |
| 本地部署 | NVIDIA GPU,建议 24GB+ 显存 | vLLM / SGLang 起 OpenAI 兼容服务,模型文件约 20GB |
| 懒人版 | Claude Code + GLM Coding Plan | 见下一节 |
本地部署的启动参数官方给得很具体:--max-model-len 25480、单条 prompt 最多 10 张图片、图像 max_pixels 500 万--这些不是随便拍的数字,改了大概率部署失败,README 甚至专门提供 check_deployment_cn.py 检查脚本,并提醒「如果思维链长度很短或出现乱码,很可能是模型部署失败」。
四、怎么装:README 里专门写了一章「给 AI 看的部署指南」
安装路线有两条。
懒人版:用 Claude Code 配置 GLM Coding Plan 后,输入一句 prompt 即可:
访问文档,为我安装 AutoGLM
https://raw.githubusercontent.com/zai-org/Open-AutoGLM/refs/heads/main/README.md这个设计比看上去更有意思:README 末尾有一整章「自动化部署指南(面向 AI)」,明确写着「本章节专为 AI 助手(如 Claude Code)设计,如果你是人类读者可以跳过」。也就是说这份 README 同时是给人看的文档和给 agent 看的安装程序--里面预置了部署前置检查清单(数据线是否支持数据传输、是否开了 USB 调试安全设置)、异常处理对照表、验收标准(「打开微信,对文件传输助手发送消息:部署成功」)。用 agent 装 agent,这个 meta 程度本身就是 2026 年项目 README 的新范式,和 OpenAI 开源 Codex Harness 时「文档即工具链」的思路殊途同归。
手动版:Python 3.10+,pip install -r requirements.txt && pip install -e .,然后是 Android 侧的准备工作--开启开发者模式和 USB 调试(设置-关于手机-连点版本号约 10 次启用开发者模式,再到开发者选项勾 USB 调试),装 ADB Keyboard(文本输入必需,没有它中文输入会失败;鸿蒙设备用原生输入法不需要),adb devices 确认连接。设备要求 Android 7.0+ 或 HarmonyOS NEXT 及以上(鸿蒙走 HDC 工具链,--device-type hdc 切换),iPhone 有单独的 iOS 配置文档(WebDriverAgent 方案)。
连接跑通之后,官方给的验收标准是「打开微信,对文件传输助手发送消息:部署成功」--手机自动打开微信、自动搜到联系人、自动把消息发出去,三步都对才算部署完成。这个验收设计得很聪明:它覆盖了 Launch、Tap、Type 三个最核心的动作原语,又不碰任何敏感权限,一分钟就能确认整条链路(模型服务、ADB 连接、动作执行)都活着。
常见坑官方都列了,挑最劝退的三个:数据线只有充电功能(adb devices 空列表,换线);部分机型要同时开「USB 调试(安全设置)」才能点击(症状是能打开应用但点不动);Windows 下 GBK 编码报错(UnicodeEncodeError: gbk code,运行前加环境变量 PYTHONIOENCODING=utf-8)。另外非 TTY 环境跑不了交互模式(报 EOF when reading a line),直接在命令行带上任务描述即可。
五、能干什么、不能干什么
支持广度是官方给的硬数据:Android 端 50+ 款主流中文应用,鸿蒙端 60+ 款原生及系统应用:
| 平台 | 覆盖 |
|---|---|
| Android(50+) | 微信、淘宝、京东、拼多多、美团、携程、12306、滴滴、bilibili、抖音、小红书、知乎、豆瓣等,--list-apps 查全表 |
| 鸿蒙(60+) | 上述主流 App 的鸿蒙版,加系统应用(日历、相机、短信、设置等)和华为服务(应用市场、主题、天气等) |
能干的:跨 App 的复合任务(README 演示里就有「比较同一商品在京东和淘宝的价格再下单」级别的任务,模型思考链会自己拆解成启动京东-搜索-记价格-切淘宝-比价-下单);日常口径的批量杂活,比如「打开美团搜索附近的火锅店」「打开抖音刷视频」这类官方示例任务,或者定时把某几条资讯转发给同事;测试口径的回归遍历--把同一个任务描述扔给不同版本的模型或 prompt,看它点得对不对。环境变量也给了无人值守的口子:PHONE_AGENT_BASE_URL、PHONE_AGENT_MODEL、PHONE_AGENT_DEVICE_ID、PHONE_AGENT_MAX_STEPS 等都能预先写进环境,脚本化调用。
不能干或要打折扣的,如实列出:
- 登录和验证码必须人来:这是设计而非缺陷,但意味着它不是全自动无人值守方案。
- 支付/银行页面是黑盒:截图被系统屏蔽,Agent 只能请求接管。
- 仅供研究和学习使用:README 使用条款原文「严禁用于非法获取信息、干扰系统或任何违法活动」--拿去做灰产批量操作的念头可以直接打消,这条款也意味着不适合直接上生产环境。
- 活跃度要自己掂量:快照口径下最近 push 停在 2026-03-06,新机型的适配、新 App 的改版是否跟得上,没有承诺。
六、生态位:不止一个仓库,是一条产品线
单看仓库会低估它,Open-AutoGLM 周围咬合着好几个齿轮:
- Midscene.js 双向适配:这个视觉模型驱动的开源 UI 自动化 SDK(支持 JavaScript/YAML 流程语法)已完成对 AutoGLM 模型的适配,官方文档明说可在 iOS 和 Android 设备上体验--等于一条 JS/YAML 生态的管道接了进来,会写前端的也能用。
- GLM Coding Plan 联动:安装入口直接接在智谱自家的 Claude Code 订阅计划上,用自家 agent 框架装自家 agent 框架。
- 配套产品 Autotyper:智谱 AI 输入法,「用嘴发指令」的落地形态(autoglm.zhipuai.cn/autotyper),开源框架是研究入口,输入法是商业出口。
- 「AutoGLM 实战派」激励活动:跑通、二创即可瓜分数万元现金奖池--官方在主动给二创导流。
- 两篇论文背书:AutoGLM(arXiv:2411.00820)和 MobileRL(arXiv:2509.18119,在线强化学习训练手机 GUI Agent),技术路线有公开可查的来路。
放在更大的图景里看,这正好接上智谱本周刚开源的 GLM-5.3-Flash--GLM-5 系列首个原生多模态模型,Visual Coding 能力让模型在代码、浏览器与图形界面之间协同并做视觉验证。GUI/视觉 Agent 是智谱明确下注的赛道:GLM-5.3-Flash 管代码和浏览器侧的视觉验证,Open-AutoGLM 管手机侧的实际操作,一个模型的「眼睛」加一个框架的「手指」。想看 agent 编码侧配套工具的,还可以回看本站的 Cline 拆解。
七、许可证与适合谁
Apache-2.0,四个字:随便用。没有 OpenViking 那种 AGPL 传染性问题,商用二次开发的许可证门槛为零(当然使用条款里「仅供研究学习」的约束仍在,那是产品边界不是许可证边界)。
适合谁:想研究手机 GUI Agent 的开发者(这是目前星数最高、文档最完整的中文手机 agent 开源实现,2.6 万星里相当一部分来自「实战派」活动的导流)、做安卓自动化测试想换掉死板脚本号的团队(Python 走原生 API,YAML/JS 走 Midscene.js,两条路都通)、以及奔着奖池去搞二创的独立开发者。不适合谁:想要开箱即用、SLA 保障、无人值守的企业级 RPA 客户--登录要人接管、支付是黑屏、活跃度停在三月,这三条就够了。
一句话收尾:当多数 agent 还在服务器里读写文件时,Open-AutoGLM 把「手指」开源了--它未必是最强的 agent,但它是少数几个真的会替你点开小红书的。
参考来源
- zai-org/Open-AutoGLM(GitHub API 实测 2026-08-27):26,104 星 / 4,019 fork,Apache-2.0,Python,创建于 2025-12-08,最近 push 2026-03-06,官方描述「An Open Phone Agent Model & Framework. Unlocking the AI Phone for Everyone」
- Open-AutoGLM 官方 README(中/英),含模型下载、部署参数、支持应用列表与面向 AI 的部署指南:https://github.com/zai-org/Open-AutoGLM
- 模型页:AutoGLM-Phone-9B / AutoGLM-Phone-9B-Multilingual,https://huggingface.co/zai-org/AutoGLM-Phone-9B
- 配套产品:智谱 AI 输入法 Autotyper,https://autoglm.zhipuai.cn/autotyper/
- 论文:AutoGLM(arXiv:2411.00820)、MobileRL(arXiv:2509.18119)
- Midscene.js 接入指南(AutoGLM 适配):https://midscenejs.com/zh/model-common-config.html#auto-glm
- 关联阅读:本站 GLM-5.3-Flash 开源热点(姊妹篇)、phone-harness 拆解(iPhone 镜像路线)、Agent Runtime 五强横评、OpenAI 开源 Codex Harness、Cline 编码 Agent 拆解
本文基于官方 README 与仓库元数据梳理(截至 2026-08-27),星数为 API 快照,未做长期实测,支持应用与操作能力以官方文档为准。