硬核横评
硬核横评

AI 电脑操控 Agent 横评:Claude/OpenAI/Mariner 与 3 款开源怎么选

横评 6 款 AI 电脑操控 Agent:闭源 Claude Computer Use / OpenAI Operator / Google Project Mariner + 开源 trycua/cua(21,113★) / simular-ai/Agent-S(12,147★) / microsoft/fara(6,140★)。含能力矩阵与定价可用性 2 张对比表、选型建议、5 FAQ。闭源中国受限,开源本地跑不受限。代表性对比,非亲自全量压测。

发布于 2026年8月11日9 分钟阅读
<!-- ai-computer-use-agents-comparison-review | review | AI 电脑操控 Agent 横评:Claude/OpenAI/Mariner 与 3 款开源怎么选 -->

2025 年 10 月 Anthropic 发布 Computer Use,让 Claude 能"看屏幕、点鼠标、敲键盘"直接操作电脑。不到一年,OpenAI 的 Operator/CUA、Google 的 Project Mariner 跟进,开源侧也冒出三款万星级选手:trycua/cua 2.1 万星、simular-ai/Agent-S 1.2 万星、microsoft/fara 6 千星。AI 从"会聊天"正式跨进"会干活"--但真要选一个替你操作电脑,闭源三巨头和开源三剑客到底谁更靠谱?这篇横评把它们摊开比一遍。

先说清边界:下面基于各工具 GitHub README、官网与公开评测整理,截至 2026-08-11。开源星数经 GitHub API 核实(cua 21,113★、Agent-S 12,147★、fara 6,140★),闭源工具无公开仓库故无星数,定价与可用性一律以官网为准。这是代表性对比,非亲自全量压测。本站还发了 Gemini Robotics ER-2 热点(具身智能另一条线)、cua 开源资源(开源篇专写)、电脑操控 Agent 搭建 SOP(选完工具怎么搭),本文管"选型"这一环。

一、先分清:Computer Use 不是 RPA,也不是个人助手

三个容易混的概念先划清边界。Computer Use / GUI Agent:AI 靠视觉识别屏幕截图 + 模拟鼠标键盘,像人一样操作图形界面--任何你能点的按钮、填的表单,它都能操作,不依赖软件开 API。RPA(机器人流程自动化):靠录制或脚本按固定路径点击,没有"理解"能力,流程一变就废。个人助手(如 OpenClaw):跑在你本地、替你操作邮件/日程/文件/终端这些系统级任务,靠的是 API 调用和脚本而非"看屏幕"--本站 OpenClaw 资源 专写过,它不属于 GUI computer-use,本文不纳入横评。本文只比"看屏幕、动鼠标"这一类。

二、能力矩阵:6 款横评规格表

6 款代表性工具,按定位、开源、支持 OS 或浏览器、核心能力对一遍。

工具定位开源支持 OS/浏览器核心能力
Claude Computer Use桌面优先 GUI Agent桌面(跨应用)+ Web截图识别 + 鼠标键盘模拟,跨应用工作流
OpenAI Operator/CUA浏览器优先云端 Agent云端虚拟浏览器网页任务自动化,云端隔离执行
Google Project Mariner浏览器内 AgentChrome 浏览器浏览器锚定自动化,Google 生态整合
trycua/cua跨 OS 开源 computer-use是(MIT)macOS/Windowscomputer-use 2.0,跨 OS 本地操控
simular-ai/Agent-S开源 agentic 框架是(Apache-2.0)macOS/Windows/Linux像人一样用电脑的框架,可定制
microsoft/fara开源 computer-use 模型是(MIT)跨平台(模型级)Fara1.5 前沿 computer-use agent 模型

几个要点。第一,闭源三家走不同架构路线:Anthropic 桌面优先(跨应用最广)、OpenAI 浏览器优先(云端最安全但限网页)、Google 浏览器锚定(夹在中间、胜在生态)。第二,开源三家定位分层:cua 是开箱即用的跨 OS 工具、Agent-S 是可定制的框架、fara 是模型级(你得自己搭截图和操作管道)。第三,"开源"不等于"零成本"--软件免费,但调大模型的 API 费或本地算力你得自己出。

三、逐个拆:6 款各自的最佳射程

Claude Computer Use:跨应用最强,桌面优先。 Anthropic 出品,通过 Claude API 提供 computer-use tool。模型截屏"看"画面、输出鼠标坐标和键盘指令,直接操作本地桌面--不依赖软件开 API,理论上任何你能用的软件它都能用。强项是跨应用通用性:从网页抓数据填 Excel、跨窗口搬运信息、操作没有 API 的老软件,这是它的主场。短板:速度偏慢(每步要截屏 + 思考 + 行动),复杂多步任务出错率尚存,对中文软件兼容性有待验证。最佳射程:跨应用信息搬运、复杂桌面工作流。定价按 Claude API 用量,以官网为准。中国可用性:API 需梯子,受限。

OpenAI Operator/CUA:浏览器任务最稳,云端隔离。 OpenAI 的 Computer-Using Agent,在服务器端虚拟浏览器里完成所有操作--不碰你本地电脑,安全可控但只能操作网页应用。强项是网页任务稳定:订机票、填表单、比价、信息检索,云端跑完把结果给你。短板:浏览器优先架构限制了桌面应用操作能力--它摸不到你本地的 Excel 和微信。最佳射程:网页任务自动化、在线表单、信息检索。定价走 ChatGPT Pro 订阅,以官网为准。中国可用性:ChatGPT 中国不可用。

Google Project Mariner:浏览器内 Agent,胜在生态。 Google 的方案,锚定在浏览器内运行,与 Google 生态(Gmail、Docs、Search)深度整合。强项是 Google 生态内任务顺畅。短板:桌面操作能力薄弱,能力封闭在 Google 体系内。最佳射程:重度 Google 生态用户的浏览器内自动化。定价以官网为准。中国可用性:Google 服务中国受限。

trycua/cua:开源跨 OS,开箱即用。 21,113★,MIT 协议。computer-use 2.0,支持 macOS 和 Windows 跨 OS 操控--这是开源侧星数最高、最受关注的选手,本站有 开源专篇 拆解。强项是跨 OS + 开源 + 可自托管:你能完全在本地跑,数据不出机器。短板:要自己装配置,模型费自付,稳定性参差。最佳射程:想本地跑、跨 OS 自动化的开发者。中国可用性:开源本地跑,不受限。

simular-ai/Agent-S:开源框架,可定制。 12,147★,Apache-2.0。定位是"像人一样用电脑的 agentic 框架"--不只是工具,是让你构建自定义 computer-use agent 的框架,支持 macOS/Windows/Linux。强项是可定制:想改交互逻辑、接自己的模型、加安全边界,框架级方案最灵活。短板:门槛比 cua 高,要写代码。最佳射程:要构建自定义 computer-use agent 的开发者。中国可用性:开源本地跑,不受限。

microsoft/fara:微软官方开源模型。 6,140★,MIT。Fara1.5 是前沿 computer-use agent 模型--注意它是"模型"而非"工具",你得自己搭周边的截图和操作管道。强项是微软官方背书 + 模型级能力:适合研究前沿 computer-use 模型、或在自己管线里替换模型。短板:模型级意味着集成工作量更大,不像 cua 开箱即用。最佳射程:要用前沿 computer-use 模型的研究和工程团队。中国可用性:开源,模型可本地跑。

四、定价与可用性

第二张表看落地:免费档、付费、中国可用性。闭源价格一律"以官网为准",不编具体数字。

工具免费档付费中国可用性
Claude Computer UseClaude API 按量付费(以官网为准)受限,API 需梯子
OpenAI Operator/CUAChatGPT Pro 订阅(以官网为准)不可用
Google Project Mariner以官网为准受限
trycua/cua开源免费模型费自付(API 或本地算力)可用,本地跑
simular-ai/Agent-S开源免费模型费自付可用,本地跑
microsoft/fara开源免费模型费自付可用,本地跑

结论很直接:闭源三家中国都受限或不可用,开源三家本地跑不受限--这是国内开发者最大的分水岭。闭源胜在开箱即用和模型能力,开源胜在自主可控和零软件费。

五、选型建议:按需求选谁

按你的需求给最直接的结论。

你的需求首选工具理由
跨应用桌面工作流自动化Claude Computer Use桌面优先,跨应用能力最强
网页任务自动化(订票/填表/比价)OpenAI Operator/CUA浏览器优先,云端隔离最稳
Google 生态内浏览器自动化Google Project Mariner与 Google 服务深度整合
本地跨 OS 自动化(macOS/Windows)trycua/cua开源星数最高,开箱即用
构建自定义 computer-use agentsimular-ai/Agent-S框架级,可定制性最强
研究前沿 computer-use 模型microsoft/fara微软官方,模型级
中国可用 + 数据不出本机开源三款任选本地跑不受限

多数开发者的实际组合:闭源一家做主力(Claude 或 Operator)+ 开源一款做本地兜底(cua 最容易上手)。不必六款全试,按场景和地域挑。

六、三个避坑

一、别拿 benchmark 当全部,实测成功率还很低。 公开实测报告显示,表现最好的开源 Agent(Agent-S 的 S2 版本)在 50 步操作内成功率仅约 34.5%--近三分之二任务无法完成。所有 Agent 在限 15 步时表现都很差,多步推理和规划仍是瓶颈。允许更多步数会提升成功率,但代价是更高延迟和成本。说白了:现在的电脑操控 Agent 能干活,但别指望它一次到位,做好人工复核。

二、闭源不是"更好",开源不是"更差"。 闭源胜在模型能力和开箱即用,但中国不可用、数据出本机、价格不透明;开源胜在自主可控和本地跑,但要自己装配置、模型费自付、稳定性参差。按地域、隐私要求、技术能力选,别简单按"闭源 vs 开源"站队。

三、敏感操作务必人工确认。 能操作电脑 = 能闯祸。银行、支付、公司内部系统,一律人工操作或至少人工确认后再执行。Computer Use 时代的安全红线是:沙箱优先 + 操作白名单 + 人工确认敏感步骤。本站 电脑操控 Agent 搭建 SOP 有完整的安全搭建流程。

七、常见问题

Q:Computer Use 和 RPA 有什么区别? A:RPA 靠录制或脚本按固定路径点击,没有"理解"能力,流程一变就废。Computer Use 靠视觉模型"看"屏幕 + 推理决定操作,能应对界面变化和非标场景。简单重复且流程固定的选 RPA,需要"看懂画面再动手"的选 Computer Use。

Q:闭源三家中国能用吗? A:都受限或不可用。Claude Computer Use 的 API 需梯子且受限,OpenAI Operator/CUA 随 ChatGPT Pro 在中国不可用,Google Project Mariner 随 Google 服务受限。国内开发者优先看开源三款,本地跑不受限。

Q:开源三款怎么选? A:看你要什么。cua(21,113★)开箱即用、跨 OS,最容易上手;Agent-S(12,147★)是框架,适合要构建自定义 agent 的开发者;fara(6,140★)是模型,适合要研究前沿 computer-use 模型的团队。新手从 cua 起步,进阶选 Agent-S,研究选 fara。

Q:能拿它操作银行或支付吗? A:不建议。能操作电脑 = 能闯祸,银行、支付、公司内部系统一律人工操作或至少人工确认后再执行。Computer Use 适合信息搬运、表单填写、数据整理等"闯不了大祸"的场景,涉及真金白银的务必人盯着。

Q:现在成熟到能替我上班了吗? A:还差一截。最好的开源 Agent 50 步内成功率约 34.5%,复杂多步任务出错率高。现在的定位是"辅助"而非"替身"--它能把重复的、定义清楚的活干掉,但需要你拆解任务、给足试错空间、做好人工复核。当"数字实习生"用,别当"数字替身"用。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-11

常见问题

Computer Use 和 RPA 有什么区别?
RPA 靠录制或脚本按固定路径点击,没有"理解"能力,流程一变就废。Computer Use 靠视觉模型"看"屏幕 + 推理决定操作,能应对界面变化和非标场景。简单重复且流程固定的选 RPA,需要"看懂画面再动手"的选 Computer Use。
闭源三家中国能用吗?
都受限或不可用。Claude Computer Use 的 API 需梯子且受限,OpenAI Operator/CUA 随 ChatGPT Pro 在中国不可用,Google Project Mariner 随 Google 服务受限。国内开发者优先看开源三款,本地跑不受限。
开源三款怎么选?
看你要什么。cua(21,113★)开箱即用、跨 OS,最容易上手;Agent-S(12,147★)是框架,适合要构建自定义 agent 的开发者;fara(6,140★)是模型,适合要研究前沿 computer-use 模型的团队。新手从 cua 起步,进阶选 Agent-S,研究选 fara。
能拿它操作银行或支付吗?
不建议。能操作电脑 = 能闯祸,银行、支付、公司内部系统一律人工操作或至少人工确认后再执行。Computer Use 适合信息搬运、表单填写、数据整理等"闯不了大祸"的场景,涉及真金白银的务必人盯着。
现在成熟到能替我上班了吗?
还差一截。最好的开源 Agent 50 步内成功率约 34.5%,复杂多步任务出错率高。现在的定位是"辅助"而非"替身"--它能把重复的、定义清楚的活干掉,但需要你拆解任务、给足试错空间、做好人工复核。当"数字实习生"用,别当"数字替身"用。

相关文章

硬核横评

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

2026年9月1日11 分钟阅读
硬核横评

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

2026年8月31日9 分钟阅读