trycua/cua 押的是 AI agent 的下一层:不是让模型更聪明,而是让模型能像人一样操作整台电脑--后台、跨平台、不抢你的鼠标。GitHub 21,114 颗星(实时变动,以 GitHub 为准),1,445 fork,MIT 许可证,2025-01-31 创建,最近一次 push 就在今天(2026-08-11),未归档,Trendshift 榜上有名。官网 cua.ai。主语言标 HTML,实则是多组件 monorepo,底层驱动 Rust 写、UniFFI 绑出 Python 和 TypeScript SDK,团队里有前微软工程师。差异点一句话:browser-use 只管浏览器,openclaw 替你打理邮件日程,cua 管整台 OS--任何桌面应用都能后台操控,外加沙箱、基准、虚拟化一整套 computer-use 2.0 基础设施。
边界先说清:本文基于 trycua/cua 的 GitHub README、libs/cua-driver/README.md 及仓库博客《Inside Windows computer-use》梳理,事实截至 2026-08-11,星数实时变动。与本站 computer-use agent 时代热点、AI computer-use agent 横评 互补但独立。
一、定位:computer-use 2.0 不是"截图点鼠标"
第一代 computer-use(Anthropic 早期 Computer Use API)是"看一眼屏幕,点一下鼠标":每步截图喂模型,输出坐标,前台执行。慢、瞎、还占着前台--AI 操作时你的鼠标被抢走。cua 押的是 2.0:AI 在后台同时操控多台电脑,像真正的员工一样并行干活,不抢你的光标和焦点。README 定位原话:"Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation." 不是又一个"AI 操作电脑"demo,而是让 AI 后台操控电脑这套事的基础设施--驱动、沙箱、基准、虚拟化四件套打包开源。
"后台"是关键词。driver README 开宗明义:"drives native macOS apps without stealing focus"。AI 操作时屏幕上有一个由 driver 自己画的合成光标,和你的物理鼠标分离--你干你的活,AI 操控另一套应用,互不干扰。这是 computer-use 从"演示玩具"走向"并行生产力"的前提。
二、核心组件拆解:四件套各管一摊
Cua Drivers:给 agent 装后台操控能力。 核心。后台 computer-use 驱动,支持 macOS、Windows、Linux(Linux 走 X11 和 compositor-specific Wayland 路由,对原始后台输入有明确限制)。agent 通过它点击、输入、滚动、验证,全程不抢光标。对外两个接口:MCP over stdio(cua-driver mcp,给 Claude Code、Codex、Cursor、OpenClaw 直连)和 CLI(cua-driver call)。底层 Rust runtime,UniFFI 绑出 Python 和 TypeScript SDK。
它怎么"看见"屏幕?仓库博客说 driver 同时给 agent 三样东西:window pixels(窗口像素,实时画面)、UIA/MSAA accessibility trees(无障碍树,直接读应用 UI 结构--按钮叫什么、输入框标签是什么)、action layer(动作层,点击、输入、滚动、设值、验证)。三者结合,agent 不只靠"看"屏幕,还能读界面的逻辑结构再精准操作,比纯视觉方案快且准。Windows 为什么比 macOS 难?博客原话:"one driver has to work across Win32, WPF, WinUI, UWP/WinRT, Electron, Chromium, legacy controls, and custom-rendered canvases。" 解法是 driver 当"路由器"--像素、无障碍树(UIA,老应用 fallback MSAA)、动作各有多条后端路径,按目标动态选。默认 background 模式拒绝静默抢前台,不可后台的场景当显式错误返回而非静默失败,这是工程成熟度的标志。
Cua(Sandbox):给 agent 一个干活的 OS 环境。 pip install cua(Python 3.11+),一套 API 跑任意 VM 或容器镜像,云或本地都行。支持 Linux 容器、Linux VM、macOS、Windows、Android,还能 BYOI(自带 .qcow2/.iso)。云上走 cua.ai,本地走 QEMU。agent 在沙箱里看屏、点按钮、跑命令、自主完成任务,环境用完即弃。
Cua Bench:给 computer-use 能力打分。 基准 + RL 环境,在 OSWorld、ScreenSpot、Windows Arena 和自定义任务上评估 agent,能导出轨迹用于训练。对研究者是客观标尺,对普通用户是选模型依据,registry 在 cuabench.ai。
Lume:macOS 虚拟化。 用 Apple Virtualization.Framework 在 Apple Silicon 上起 macOS/Linux 虚拟机,near-native 性能。一条命令拉 Apple restore image 起 Tahoe 或 Sequoia VM,--unattended 离线装好、配好 SSH。需要让 agent 在隔离 macOS 跑 Xcode、Final Cut 时用它。
三、和 openclaw、browser-use、闭源 Operator 怎么分
先把地盘划清。browser-use 只管浏览器:视觉优先,截图喂模型输出坐标,边界是浏览器标签页。openclaw 是个人助手:跑在你机器上替你打理邮件、日程、文件、终端,强项是"替你干活"的个人自动化。cua 的地盘是"整台 OS 的后台操控"--任何桌面应用(不只是浏览器)都能驱动,外加沙箱、基准、虚拟化。一句话:browser-use 是"眼睛只看网页",openclaw 是"替你管日常杂活",cua 是"给 agent 装上操控整台电脑的手和眼,外加工位和考勤"。三者不是纯竞争:cua-driver README 明确把 OpenClaw 列为支持客户端,browser-use 也能接到 cua 沙箱里跑--cua 更像底下那层基础设施。和闭源 OpenAI Operator 比,cua 开源 MIT、模型可换、能本地离线、能嵌进自家代码,Operator 是黑盒 SaaS。想自己搭流水线参考本站 computer-use agent 搭建 SOP。
| 维度 | trycua/cua | openclaw | browser-use | OpenAI Operator |
|---|---|---|---|---|
| 地盘 | 整台 OS 后台操控 | 个人助手·邮件日程 | 浏览器自动化 | 浏览器为主 |
| 组件 | 驱动+沙箱+基准+虚拟化 | 应用+技能生态 | 单一框架 | 闭源 SaaS |
| 后台运行 | 是(不抢光标) | 是 | 否(占浏览器) | 云端 |
| 跨 OS | macOS/Win/Linux | 跨平台 app | 浏览器内 | 云端 |
| 开源 | MIT | MIT | MIT | 闭源 |
四、上手:三条最短路径
路径 A:给 Claude Code 装后台操控(最快)。 macOS/Linux:/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)";Windows:irm https://cua.ai/driver/install.ps1 | iex。接进 Claude Code:
claude mcp add --transport stdio cua-driver -- cua-driver mcp之后对 Claude Code 说"打开这个应用、提取数据、填进表格",它真去操作桌面应用。其他客户端用 cua-driver mcp-config 打印配置接入,跑 cua-driver doctor 查环境。权限三档:standard(默认无弹窗)、bounded(只放行清单里审过的工具)、unrestricted(--dangerously-bypass-approvals,危险),启动时定死、改要重启 daemon。
路径 B:用 Sandbox 跑自主 agent。 pip install cua,起一个临时沙箱,agent 在里头看屏、点按钮、跑命令。云上走 cua.ai,本地走 QEMU,Android 也支持。
路径 C:跑基准评估。 clone 仓库 cd cua-bench,uv tool install -e .,cb image create linux-docker 建镜像,cb run dataset datasets/cua-bench-basic --agent cua-agent --max-parallel 4 跑分。
五、门槛代价:开源不等于零成本
四个要点。第一,Windows 兼容仍有边角:博客承认 minimized 窗口 WGC 抓不到像素、Chromium 坐标点击/GTK 按钮/WPF 拖拽得显式选 foreground、有些无障碍 provider 会撒谎或挂起。cua 把这些当显式错误返回而非静默吞掉,但你得会处理。第二,Session 0 的坑:agent 从 SSH、服务或错误父进程启动会掉进 Session 0(没有交互式桌面),EnumWindows、UIA、截图全返回空。cua 用跑在用户交互会话里的 daemon、经 named pipe 代理调用解决,但意味着你得把 daemon 跑对地方。第三,模型费自付:基础设施开源免费,但 agent 背后的大模型烧你的 API 额度,computer-use 每步要喂像素和树,token 烧得比纯文本快。第四,成熟度:2.1 万星、今天还在 push,但仍是高速迭代期的基建项目,接口和文档会变,不是开箱即用成品,生产接入前务必自己跑一遍你的场景。
适合:想给 Claude Code/Codex 加"操控整台电脑"能力的开发者;要在 Windows/macOS 桌面应用跑自动化、不想被前台抢占的团队;做 computer-use 研究或训练、需要基准和轨迹的人。别凑这个热闹:只想自动化浏览器--browser-use 更对路,本站有 browser-use 资源盘;想管邮件日程--openclaw 更合适;要开箱即用--闭源 Operator 更省心。
六、常见问题
Q:cua 和 browser-use 有什么区别? A:browser-use 只管浏览器,视觉优先(截图喂模型输出坐标)。cua 管整台 OS--任何桌面应用都能后台操控,靠像素+无障碍树+动作层三路并行,不抢光标。两者也能互补:browser-use 能接到 cua 沙箱里跑。
Q:"后台运行、不抢光标"具体怎么做到的? A:driver 画一个合成光标(synthetic cursor),和物理鼠标分离,每个 agent 有自己的 cursor_id。底层动作可以是 UIA、MSAA、PostMessage 或 SendInput。默认 background 模式拒绝静默抢前台,个别场景才显式选 foreground。来源是仓库博客《Inside Windows computer-use》。
Q:支持 Linux 吗? A:支持但有限制。driver 在 Linux 走 X11 和 compositor-specific Wayland 路由,对原始后台输入有明确限制;macOS 和 Windows 完整支持。Sandbox 层则各 OS 都支持。
Q:怎么装,要付费吗?
A:MIT 开源免费。driver 装 macOS/Linux 用 curl https://cua.ai/driver/install.sh,Windows 用 irm https://cua.ai/driver/install.ps1 | iex。Sandbox 用 pip install cua(Python 3.11+)。云沙箱走 cua.ai 按量付费,本地 QEMU 零云成本,模型费自付。
Q:2.1 万星,项目成熟吗? A:活跃但仍在高速迭代。2025-01-31 创建,今天还在 push,未归档。接口和文档还在变动,Windows 兼容边角问题博客也承认。生产接入前建议自己跑一遍。
参考来源
- trycua/cua GitHub 仓库(21,114 star / 1,445 fork,MIT,多语言 monorepo):https://github.com/trycua/cua
- cua 官网与文档:https://cua.ai | https://cua.ai/docs
- Cua Driver 架构说明(libs/cua-driver/README.md):https://github.com/trycua/cua/blob/main/libs/cua-driver/README.md
- 仓库博客《Inside Windows computer-use》:https://github.com/trycua/cua/blob/main/blog/inside-windows-computer-use.md
- 本站相关:computer-use agent 时代热点 | AI computer-use agent 横评 | computer-use agent 搭建 SOP | browser-use 资源盘