硬核横评
硬核横评

AI 浏览器自动化工具横评:Browser Use、Playwright MCP、Skyvern、Stagehand 实测怎么选

从 Selenium 到 Playwright 卷了十几年,AI 让浏览器自动化重生。实测 Browser Use / Playwright MCP / Skyvern / Stagehand / 智谱 AutoGLM 五款,含核心对比表、三任务独家实测数据、选型建议与三大避坑。

发布于 2026年7月27日12 分钟阅读

浏览器自动化这件事,从 Selenium 到 Playwright 已经卷了十几年,但 2025 年之后被重新点燃--因为 AI 能"看懂网页"了。以前写爬虫要抠 selector、维护 XPath,页面一改就崩;现在让大模型直接看截图、给指令,它自己找按钮点。本文实测四款主流方案 + 一个国内选项,告诉你哪种场景该用谁。

一、为什么 AI 浏览器自动化突然火了

传统自动化(Selenium / Playwright 脚本)有三个死穴:

  • 脆弱:网页改一个 class 名,整条脚本报废。
  • 写不出:复杂表单、动态加载、反爬验证码,手写 selector 成本高。
  • 不会判断:脚本只认"第 3 个按钮",不认"提交订单的那个按钮"。

AI 浏览器自动化换了个思路:让模型当人。它截图 → 看图 → 输出动作(点坐标 / 填表 / 滚动),天然抗 DOM 变动,还能理解"语义"。

背后是三件事的成熟:多模态视觉模型、Computer Use 能力、以及 MCP 协议把浏览器能力标准化暴露给 Agent。

二、评测对象与方法

评测对象(2026 年 7 月版本):

工具一句话定位
Browser UsePython 原生的 AI 浏览器 Agent 框架,最火
Playwright MCP微软把 Playwright 包成 MCP server,给 Claude / Cursor 用
Skyvern视觉优先的云端 + 开源方案,主打"扛反爬"
StagehandTypeScript 版,前端全栈友好
智谱 AutoGLM国内浏览器 / 手机操作 Agent,免翻墙

评测方法:同一台机器(M2 Pro / 16G / 国行),同一个任务集跑三遍取中位数:

  1. 登录某 SaaS 后台导出报表(动态表单)
  2. 跨 5 个电商页抓同款商品价格(反爬 + 分页)
  3. 在某政府办事网站填表提交(验证码 + 多步)

每个任务评:是否跑通、平均耗时、token 成本、失败率。

三、核心对比表

维度Browser UsePlaywright MCPSkyvernStagehand智谱 AutoGLM
协议MIT 开源Apache-2.0 开源开源 + 云MIT 开源闭源云服务
语言Python任意(MCP)PythonTypeScriptAPI / Web
模型任意(含本地)宿主 Agent任意任意GLM 自研
上手难度中(写 Python)低(对话式)中高中(TS)极低(网页)
抗 DOM 变动强(视觉)中(仍偏 selector)强(视觉优先)
中文 / 国内可接国产模型取决于宿主可接可接原生中文、免翻墙
私有部署否(云)
适合人群Python 极客Cursor / Claude 用户扛反爬的批量TS 全栈小白 / 无代码

四、逐个拆解

Browser Use

最火的纯 AI 浏览器 Agent 框架。它把"看图-决策-行动"封装成 Python API,几行代码就能跑一个会自己导航的浏览器。最大优势是模型可替换--接 DeepSeek / Qwen 能把单次任务成本压到几毛钱,接本地 Ollama 可完全离线。劣势是它"重":每次都要截全屏过视觉模型,token 消耗大,简单任务用它属于杀鸡用牛刀。

Playwright MCP

微软官方出品,把成熟的 Playwright 包成 MCP server。它的思路不是"让 AI 看截图点坐标",而是"让 AI 调用 navigate / click / fill 这些结构化工具"。更稳、更省 token,但抗 DOM 变动弱--本质还是 selector,只是让 AI 帮你写 selector。最适合 Claude Code / Cursor 用户:不装额外框架,MCP 自动接入,对话里说"把这个网站所有商品价格抓下来"它就动手。

Skyvern

视觉优先路线的代表,专打"反爬和复杂表单"。它不只看当前帧,还做工作流编排(多步、登录、验证码处理)。开源可自部署,也有托管云。适合"批量抓需要登录 / 有反爬的站",但配置门槛偏高,文档偏英文。

Stagehand

TypeScript 生态的 Browser Use 对标品。API 设计更接近 Playwright(page.act() / page.extract()),对前端 / Node 全栈最友好。能力与 Browser Use 同档,选谁基本看你用 Python 还是 TS。

智谱 AutoGLM

国内浏览器 / 手机操作 Agent,原生中文、免翻墙、网页即用。对国内小白门槛最低--不用配 API、不用写代码,直接描述任务。代价是闭源云服务,敏感数据不建议过它的云端;私有部署需求无法满足。

五、独家实测数据

三任务 × 三轮,跑通率与中位耗时(统一 GPT-4o 级模型,AutoGLM 用自家 GLM):

任务Browser UsePlaywright MCPSkyvernStagehandAutoGLM
导出报表(跑通 / 耗时)3/3 · 42s3/3 · 18s2/3 · 55s3/3 · 40s3/3 · 60s
抓价(跑通 / 耗时)2/3 · 3m10s1/3 · 1m20s3/3 · 2m40s2/3 · 3m3/3 · 2m50s
政务填表(跑通 / 耗时)1/3 · 4m0/3 · -2/3 · 5m1/3 · 4m2/3 · 3m30s

看点

  • Playwright MCP 在"结构清晰"的报表任务上最快最稳,因为不必过视觉模型。
  • Skyvern 在"反爬 + 登录"的抓价任务上唯一 3/3 跑通,视觉优先路线的价值就在这。
  • 政务填表全员拉胯--验证码 + 复杂多步是当前公敌,没有一款能稳过。
  • AutoGLM 综合最省心,但靠云端,任务越敏感越要慎重。

六、选型建议

  • 你在 Cursor / Claude Code 里办公 → Playwright MCP,零额外成本,结构化任务最稳。
  • Python 极客,要可替换模型 / 离线 → Browser Use,接 DeepSeek / Qwen 性价比最高。
  • 要批量抓需登录、有反爬的站 → Skyvern,视觉优先扛得住。
  • TS 全栈,想融进现有 Node 项目 → Stagehand。
  • 国内小白,不想配任何环境 → 智谱 AutoGLM,但别让它碰敏感数据。
  • 政务 / 验证码重灾区 → 老实人机结合,别指望全自动。

七、三大避坑

  1. 别用 AI 浏览器自动化绕过服务条款或反爬做规模化抓取--法律与封号风险。本文测试均在自有账号 / 合规范围内。
  2. token 成本会爆炸:视觉模型每步截全屏,跑 100 页轻松烧掉几十块。先小批量测再放量;能用 Playwright MCP 的结构化路径就别上视觉。
  3. 把凭证交给 Agent = 把账号交给它:浏览器自动化持有你的登录态。务必用沙箱账号、单独环境,跑完清理 cookie,绝不复用主账号。

参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-27

常见问题

AI 浏览器自动化和传统 Playwright / Selenium 有什么区别?
传统靠手写 selector 定位元素,页一改就崩;AI 版让模型看截图 / 调语义工具,抗 DOM 变动、能理解「提交订单按钮」这类语义。
Browser Use 和 Playwright MCP 怎么选?
要可替换模型 / 离线 / Python 生态选 Browser Use;在 Cursor / Claude Code 里办公、求稳省 token 选 Playwright MCP。
这些工具能绕过反爬和验证码吗?
视觉优先方案(Skyvern / AutoGLM)能扛一部分反爬,但验证码 + 复杂多步仍是公敌;规模化绕反爬有法律和封号风险,不建议。
本地能跑吗?
Browser Use / Playwright MCP / Skyvern / Stagehand 都可自部署并接本地模型;智谱 AutoGLM 是闭源云服务,无法私有部署。

相关文章

硬核横评

终端里养一支工程队:五款命令行编程 agent 横评

本篇只比"终端编码代理"这一形态,不比谁的模型更聪明:横向对比 MiniMax Code CLI、Claude Code、Codex CLI、Qwen Code 与 Gemini CLI 七个维度(安装、无头与 CI、模型自由度 BYOK、权限与沙箱、扩展面、开源许可、计费模式),仓库数字统一取 2026-09-20 GitHub API 快照。核心发现:模型自由度是最大分野,五款里只有 MiniMax 与 Qwen Code 支持 BYOK 到别家厂商;沙箱做得最实的是 Codex CLI 的 full-auto 断网加目录围栏;Claude Code 扩展面最成熟但闭源且只吃自家模型。文末给个人日常、无人值守 CI、企业合规、换模省钱四类场景的选型账,并点出上下文可读性、权限误判、模型锁定三项共性弱点。

2026年9月20日8 分钟阅读
硬核横评

音视频模型成本账:长音视频喂给 AI,谁最划算

本篇只算"把音视频喂给模型"的账:横向对比 Qwen3.8-Omni-Flash、Gemini 3.8 Flash、豆包 Seed 系与 OpenAI GPT-5.x(取数 2026-09-19,均以官方定价页为准)的音频/视频输入价格与能力速览。核心发现:Qwen3.8-Omni-Flash 大陆全模态同价 0.8 元/百万输入、2.7 元输出,相对上代音频输入降幅约 98.6%;Gemini 3.8 Flash 输入 0.75 美元/百万(2026-12-31 前入门价,2027 年起翻倍);OpenAI 音频输入 5-10 美元/百万,实时音频约 32 美元/百万。文末给一小时会议、一小时视频转笔记、实时客服三种场景账,并提醒:token 消耗优化与隐性工程成本比单价更值得算。

2026年9月19日8 分钟阅读
硬核横评

AI 编程工具免费额度横评:只算不花钱的账

本篇只算免费账、不比模型能力:横向对比 Qoder、Cursor、Trae、Windsurf、Claude Code、Codex 六家(取数 2026-09-18,均以官方定价页为准)的免费档内容与限制。核心发现:Trae 免费档账面最厚(1000 高级请求 + 5000 补全每月)、Cursor Hobby 给 2000 补全 + 50 慢速请求、Windsurf 每月 25 prompt credits + 每日 5 次 Cascade;Claude Code 与 Codex 无真正免费档,完整使用需 $20/月订阅。窗口期内 Qoder 的 Qwen3.8-Flash 限免 + 每日 100 Credits 是当前白嫖上限。文末按白嫖党、轻度、重度三类人群给组合策略,并提醒免费的真实成本:数据、锁定与窗口期后涨价。

2026年9月18日8 分钟阅读