2025 年 10 月 Anthropic 发布 Computer Use,让 Claude 能"看屏幕、点鼠标、敲键盘"直接操作电脑。不到一年,OpenAI 的 Operator/CUA、Google 的 Project Mariner 跟进,开源侧也冒出三款万星级选手:trycua/cua 2.1 万星、simular-ai/Agent-S 1.2 万星、microsoft/fara 6 千星。AI 从"会聊天"正式跨进"会干活"--但真要选一个替你操作电脑,闭源三巨头和开源三剑客到底谁更靠谱?这篇横评把它们摊开比一遍。
先说清边界:下面基于各工具 GitHub README、官网与公开评测整理,截至 2026-08-11。开源星数经 GitHub API 核实(cua 21,113★、Agent-S 12,147★、fara 6,140★),闭源工具无公开仓库故无星数,定价与可用性一律以官网为准。这是代表性对比,非亲自全量压测。本站还发了 Gemini Robotics ER-2 热点(具身智能另一条线)、cua 开源资源(开源篇专写)、电脑操控 Agent 搭建 SOP(选完工具怎么搭),本文管"选型"这一环。
一、先分清:Computer Use 不是 RPA,也不是个人助手
三个容易混的概念先划清边界。Computer Use / GUI Agent:AI 靠视觉识别屏幕截图 + 模拟鼠标键盘,像人一样操作图形界面--任何你能点的按钮、填的表单,它都能操作,不依赖软件开 API。RPA(机器人流程自动化):靠录制或脚本按固定路径点击,没有"理解"能力,流程一变就废。个人助手(如 OpenClaw):跑在你本地、替你操作邮件/日程/文件/终端这些系统级任务,靠的是 API 调用和脚本而非"看屏幕"--本站 OpenClaw 资源 专写过,它不属于 GUI computer-use,本文不纳入横评。本文只比"看屏幕、动鼠标"这一类。
二、能力矩阵:6 款横评规格表
6 款代表性工具,按定位、开源、支持 OS 或浏览器、核心能力对一遍。
| 工具 | 定位 | 开源 | 支持 OS/浏览器 | 核心能力 |
|---|---|---|---|---|
| Claude Computer Use | 桌面优先 GUI Agent | 否 | 桌面(跨应用)+ Web | 截图识别 + 鼠标键盘模拟,跨应用工作流 |
| OpenAI Operator/CUA | 浏览器优先云端 Agent | 否 | 云端虚拟浏览器 | 网页任务自动化,云端隔离执行 |
| Google Project Mariner | 浏览器内 Agent | 否 | Chrome 浏览器 | 浏览器锚定自动化,Google 生态整合 |
| trycua/cua | 跨 OS 开源 computer-use | 是(MIT) | macOS/Windows | computer-use 2.0,跨 OS 本地操控 |
| simular-ai/Agent-S | 开源 agentic 框架 | 是(Apache-2.0) | macOS/Windows/Linux | 像人一样用电脑的框架,可定制 |
| microsoft/fara | 开源 computer-use 模型 | 是(MIT) | 跨平台(模型级) | Fara1.5 前沿 computer-use agent 模型 |
几个要点。第一,闭源三家走不同架构路线:Anthropic 桌面优先(跨应用最广)、OpenAI 浏览器优先(云端最安全但限网页)、Google 浏览器锚定(夹在中间、胜在生态)。第二,开源三家定位分层:cua 是开箱即用的跨 OS 工具、Agent-S 是可定制的框架、fara 是模型级(你得自己搭截图和操作管道)。第三,"开源"不等于"零成本"--软件免费,但调大模型的 API 费或本地算力你得自己出。
三、逐个拆:6 款各自的最佳射程
Claude Computer Use:跨应用最强,桌面优先。 Anthropic 出品,通过 Claude API 提供 computer-use tool。模型截屏"看"画面、输出鼠标坐标和键盘指令,直接操作本地桌面--不依赖软件开 API,理论上任何你能用的软件它都能用。强项是跨应用通用性:从网页抓数据填 Excel、跨窗口搬运信息、操作没有 API 的老软件,这是它的主场。短板:速度偏慢(每步要截屏 + 思考 + 行动),复杂多步任务出错率尚存,对中文软件兼容性有待验证。最佳射程:跨应用信息搬运、复杂桌面工作流。定价按 Claude API 用量,以官网为准。中国可用性:API 需梯子,受限。
OpenAI Operator/CUA:浏览器任务最稳,云端隔离。 OpenAI 的 Computer-Using Agent,在服务器端虚拟浏览器里完成所有操作--不碰你本地电脑,安全可控但只能操作网页应用。强项是网页任务稳定:订机票、填表单、比价、信息检索,云端跑完把结果给你。短板:浏览器优先架构限制了桌面应用操作能力--它摸不到你本地的 Excel 和微信。最佳射程:网页任务自动化、在线表单、信息检索。定价走 ChatGPT Pro 订阅,以官网为准。中国可用性:ChatGPT 中国不可用。
Google Project Mariner:浏览器内 Agent,胜在生态。 Google 的方案,锚定在浏览器内运行,与 Google 生态(Gmail、Docs、Search)深度整合。强项是 Google 生态内任务顺畅。短板:桌面操作能力薄弱,能力封闭在 Google 体系内。最佳射程:重度 Google 生态用户的浏览器内自动化。定价以官网为准。中国可用性:Google 服务中国受限。
trycua/cua:开源跨 OS,开箱即用。 21,113★,MIT 协议。computer-use 2.0,支持 macOS 和 Windows 跨 OS 操控--这是开源侧星数最高、最受关注的选手,本站有 开源专篇 拆解。强项是跨 OS + 开源 + 可自托管:你能完全在本地跑,数据不出机器。短板:要自己装配置,模型费自付,稳定性参差。最佳射程:想本地跑、跨 OS 自动化的开发者。中国可用性:开源本地跑,不受限。
simular-ai/Agent-S:开源框架,可定制。 12,147★,Apache-2.0。定位是"像人一样用电脑的 agentic 框架"--不只是工具,是让你构建自定义 computer-use agent 的框架,支持 macOS/Windows/Linux。强项是可定制:想改交互逻辑、接自己的模型、加安全边界,框架级方案最灵活。短板:门槛比 cua 高,要写代码。最佳射程:要构建自定义 computer-use agent 的开发者。中国可用性:开源本地跑,不受限。
microsoft/fara:微软官方开源模型。 6,140★,MIT。Fara1.5 是前沿 computer-use agent 模型--注意它是"模型"而非"工具",你得自己搭周边的截图和操作管道。强项是微软官方背书 + 模型级能力:适合研究前沿 computer-use 模型、或在自己管线里替换模型。短板:模型级意味着集成工作量更大,不像 cua 开箱即用。最佳射程:要用前沿 computer-use 模型的研究和工程团队。中国可用性:开源,模型可本地跑。
四、定价与可用性
第二张表看落地:免费档、付费、中国可用性。闭源价格一律"以官网为准",不编具体数字。
| 工具 | 免费档 | 付费 | 中国可用性 |
|---|---|---|---|
| Claude Computer Use | 无 | Claude API 按量付费(以官网为准) | 受限,API 需梯子 |
| OpenAI Operator/CUA | 无 | ChatGPT Pro 订阅(以官网为准) | 不可用 |
| Google Project Mariner | 无 | 以官网为准 | 受限 |
| trycua/cua | 开源免费 | 模型费自付(API 或本地算力) | 可用,本地跑 |
| simular-ai/Agent-S | 开源免费 | 模型费自付 | 可用,本地跑 |
| microsoft/fara | 开源免费 | 模型费自付 | 可用,本地跑 |
结论很直接:闭源三家中国都受限或不可用,开源三家本地跑不受限--这是国内开发者最大的分水岭。闭源胜在开箱即用和模型能力,开源胜在自主可控和零软件费。
五、选型建议:按需求选谁
按你的需求给最直接的结论。
| 你的需求 | 首选工具 | 理由 |
|---|---|---|
| 跨应用桌面工作流自动化 | Claude Computer Use | 桌面优先,跨应用能力最强 |
| 网页任务自动化(订票/填表/比价) | OpenAI Operator/CUA | 浏览器优先,云端隔离最稳 |
| Google 生态内浏览器自动化 | Google Project Mariner | 与 Google 服务深度整合 |
| 本地跨 OS 自动化(macOS/Windows) | trycua/cua | 开源星数最高,开箱即用 |
| 构建自定义 computer-use agent | simular-ai/Agent-S | 框架级,可定制性最强 |
| 研究前沿 computer-use 模型 | microsoft/fara | 微软官方,模型级 |
| 中国可用 + 数据不出本机 | 开源三款任选 | 本地跑不受限 |
多数开发者的实际组合:闭源一家做主力(Claude 或 Operator)+ 开源一款做本地兜底(cua 最容易上手)。不必六款全试,按场景和地域挑。
六、三个避坑
一、别拿 benchmark 当全部,实测成功率还很低。 公开实测报告显示,表现最好的开源 Agent(Agent-S 的 S2 版本)在 50 步操作内成功率仅约 34.5%--近三分之二任务无法完成。所有 Agent 在限 15 步时表现都很差,多步推理和规划仍是瓶颈。允许更多步数会提升成功率,但代价是更高延迟和成本。说白了:现在的电脑操控 Agent 能干活,但别指望它一次到位,做好人工复核。
二、闭源不是"更好",开源不是"更差"。 闭源胜在模型能力和开箱即用,但中国不可用、数据出本机、价格不透明;开源胜在自主可控和本地跑,但要自己装配置、模型费自付、稳定性参差。按地域、隐私要求、技术能力选,别简单按"闭源 vs 开源"站队。
三、敏感操作务必人工确认。 能操作电脑 = 能闯祸。银行、支付、公司内部系统,一律人工操作或至少人工确认后再执行。Computer Use 时代的安全红线是:沙箱优先 + 操作白名单 + 人工确认敏感步骤。本站 电脑操控 Agent 搭建 SOP 有完整的安全搭建流程。
七、常见问题
Q:Computer Use 和 RPA 有什么区别? A:RPA 靠录制或脚本按固定路径点击,没有"理解"能力,流程一变就废。Computer Use 靠视觉模型"看"屏幕 + 推理决定操作,能应对界面变化和非标场景。简单重复且流程固定的选 RPA,需要"看懂画面再动手"的选 Computer Use。
Q:闭源三家中国能用吗? A:都受限或不可用。Claude Computer Use 的 API 需梯子且受限,OpenAI Operator/CUA 随 ChatGPT Pro 在中国不可用,Google Project Mariner 随 Google 服务受限。国内开发者优先看开源三款,本地跑不受限。
Q:开源三款怎么选? A:看你要什么。cua(21,113★)开箱即用、跨 OS,最容易上手;Agent-S(12,147★)是框架,适合要构建自定义 agent 的开发者;fara(6,140★)是模型,适合要研究前沿 computer-use 模型的团队。新手从 cua 起步,进阶选 Agent-S,研究选 fara。
Q:能拿它操作银行或支付吗? A:不建议。能操作电脑 = 能闯祸,银行、支付、公司内部系统一律人工操作或至少人工确认后再执行。Computer Use 适合信息搬运、表单填写、数据整理等"闯不了大祸"的场景,涉及真金白银的务必人盯着。
Q:现在成熟到能替我上班了吗? A:还差一截。最好的开源 Agent 50 步内成功率约 34.5%,复杂多步任务出错率高。现在的定位是"辅助"而非"替身"--它能把重复的、定义清楚的活干掉,但需要你拆解任务、给足试错空间、做好人工复核。当"数字实习生"用,别当"数字替身"用。
参考来源
- Claude Computer Use(Anthropic)官网
- OpenAI Operator / CUA 官网
- Google Project Mariner 官方博客
- trycua/cua GitHub(21,113★,MIT)
- simular-ai/Agent-S GitHub(12,147★,Apache-2.0)
- microsoft/fara GitHub(6,140★,MIT)
- 本站相关:Gemini Robotics ER-2 热点 | cua 开源资源 | 电脑操控 Agent 搭建 SOP | Computer Use 时代热点