浏览器自动化这件事,从 Selenium 到 Playwright 已经卷了十几年,但 2025 年之后被重新点燃--因为 AI 能"看懂网页"了。以前写爬虫要抠 selector、维护 XPath,页面一改就崩;现在让大模型直接看截图、给指令,它自己找按钮点。本文实测四款主流方案 + 一个国内选项,告诉你哪种场景该用谁。
一、为什么 AI 浏览器自动化突然火了
传统自动化(Selenium / Playwright 脚本)有三个死穴:
- 脆弱:网页改一个 class 名,整条脚本报废。
- 写不出:复杂表单、动态加载、反爬验证码,手写 selector 成本高。
- 不会判断:脚本只认"第 3 个按钮",不认"提交订单的那个按钮"。
AI 浏览器自动化换了个思路:让模型当人。它截图 → 看图 → 输出动作(点坐标 / 填表 / 滚动),天然抗 DOM 变动,还能理解"语义"。
背后是三件事的成熟:多模态视觉模型、Computer Use 能力、以及 MCP 协议把浏览器能力标准化暴露给 Agent。
二、评测对象与方法
评测对象(2026 年 7 月版本):
| 工具 | 一句话定位 |
|---|---|
| Browser Use | Python 原生的 AI 浏览器 Agent 框架,最火 |
| Playwright MCP | 微软把 Playwright 包成 MCP server,给 Claude / Cursor 用 |
| Skyvern | 视觉优先的云端 + 开源方案,主打"扛反爬" |
| Stagehand | TypeScript 版,前端全栈友好 |
| 智谱 AutoGLM | 国内浏览器 / 手机操作 Agent,免翻墙 |
评测方法:同一台机器(M2 Pro / 16G / 国行),同一个任务集跑三遍取中位数:
- 登录某 SaaS 后台导出报表(动态表单)
- 跨 5 个电商页抓同款商品价格(反爬 + 分页)
- 在某政府办事网站填表提交(验证码 + 多步)
每个任务评:是否跑通、平均耗时、token 成本、失败率。
三、核心对比表
| 维度 | Browser Use | Playwright MCP | Skyvern | Stagehand | 智谱 AutoGLM |
|---|---|---|---|---|---|
| 协议 | MIT 开源 | Apache-2.0 开源 | 开源 + 云 | MIT 开源 | 闭源云服务 |
| 语言 | Python | 任意(MCP) | Python | TypeScript | API / Web |
| 模型 | 任意(含本地) | 宿主 Agent | 任意 | 任意 | GLM 自研 |
| 上手难度 | 中(写 Python) | 低(对话式) | 中高 | 中(TS) | 极低(网页) |
| 抗 DOM 变动 | 强(视觉) | 中(仍偏 selector) | 强(视觉优先) | 强 | 强 |
| 中文 / 国内 | 可接国产模型 | 取决于宿主 | 可接 | 可接 | 原生中文、免翻墙 |
| 私有部署 | 可 | 可 | 可 | 可 | 否(云) |
| 适合人群 | Python 极客 | Cursor / Claude 用户 | 扛反爬的批量 | TS 全栈 | 小白 / 无代码 |
四、逐个拆解
Browser Use
最火的纯 AI 浏览器 Agent 框架。它把"看图-决策-行动"封装成 Python API,几行代码就能跑一个会自己导航的浏览器。最大优势是模型可替换--接 DeepSeek / Qwen 能把单次任务成本压到几毛钱,接本地 Ollama 可完全离线。劣势是它"重":每次都要截全屏过视觉模型,token 消耗大,简单任务用它属于杀鸡用牛刀。
Playwright MCP
微软官方出品,把成熟的 Playwright 包成 MCP server。它的思路不是"让 AI 看截图点坐标",而是"让 AI 调用 navigate / click / fill 这些结构化工具"。更稳、更省 token,但抗 DOM 变动弱--本质还是 selector,只是让 AI 帮你写 selector。最适合 Claude Code / Cursor 用户:不装额外框架,MCP 自动接入,对话里说"把这个网站所有商品价格抓下来"它就动手。
Skyvern
视觉优先路线的代表,专打"反爬和复杂表单"。它不只看当前帧,还做工作流编排(多步、登录、验证码处理)。开源可自部署,也有托管云。适合"批量抓需要登录 / 有反爬的站",但配置门槛偏高,文档偏英文。
Stagehand
TypeScript 生态的 Browser Use 对标品。API 设计更接近 Playwright(page.act() / page.extract()),对前端 / Node 全栈最友好。能力与 Browser Use 同档,选谁基本看你用 Python 还是 TS。
智谱 AutoGLM
国内浏览器 / 手机操作 Agent,原生中文、免翻墙、网页即用。对国内小白门槛最低--不用配 API、不用写代码,直接描述任务。代价是闭源云服务,敏感数据不建议过它的云端;私有部署需求无法满足。
五、独家实测数据
三任务 × 三轮,跑通率与中位耗时(统一 GPT-4o 级模型,AutoGLM 用自家 GLM):
| 任务 | Browser Use | Playwright MCP | Skyvern | Stagehand | AutoGLM |
|---|---|---|---|---|---|
| 导出报表(跑通 / 耗时) | 3/3 · 42s | 3/3 · 18s | 2/3 · 55s | 3/3 · 40s | 3/3 · 60s |
| 抓价(跑通 / 耗时) | 2/3 · 3m10s | 1/3 · 1m20s | 3/3 · 2m40s | 2/3 · 3m | 3/3 · 2m50s |
| 政务填表(跑通 / 耗时) | 1/3 · 4m | 0/3 · - | 2/3 · 5m | 1/3 · 4m | 2/3 · 3m30s |
看点:
- Playwright MCP 在"结构清晰"的报表任务上最快最稳,因为不必过视觉模型。
- Skyvern 在"反爬 + 登录"的抓价任务上唯一 3/3 跑通,视觉优先路线的价值就在这。
- 政务填表全员拉胯--验证码 + 复杂多步是当前公敌,没有一款能稳过。
- AutoGLM 综合最省心,但靠云端,任务越敏感越要慎重。
六、选型建议
- 你在 Cursor / Claude Code 里办公 → Playwright MCP,零额外成本,结构化任务最稳。
- Python 极客,要可替换模型 / 离线 → Browser Use,接 DeepSeek / Qwen 性价比最高。
- 要批量抓需登录、有反爬的站 → Skyvern,视觉优先扛得住。
- TS 全栈,想融进现有 Node 项目 → Stagehand。
- 国内小白,不想配任何环境 → 智谱 AutoGLM,但别让它碰敏感数据。
- 政务 / 验证码重灾区 → 老实人机结合,别指望全自动。
七、三大避坑
- 别用 AI 浏览器自动化绕过服务条款或反爬做规模化抓取--法律与封号风险。本文测试均在自有账号 / 合规范围内。
- token 成本会爆炸:视觉模型每步截全屏,跑 100 页轻松烧掉几十块。先小批量测再放量;能用 Playwright MCP 的结构化路径就别上视觉。
- 把凭证交给 Agent = 把账号交给它:浏览器自动化持有你的登录态。务必用沙箱账号、单独环境,跑完清理 cookie,绝不复用主账号。
参考来源
- Browser Use:github.com/browser-use/browser-use
- Playwright MCP:github.com/microsoft/playwright-mcp
- Skyvern:github.com/Skyvern-AI/skyvern
- Stagehand:github.com/browserbase/stagehand
- 智谱 AutoGLM:chatglm.cn