开源项目
开源项目

trycua/cua:开源 computer-use 2.0,AI 后台操控整台电脑

21,114★ trycua/cua(MIT,今日 push)是开源 computer-use 2.0 基础设施:后台驱动(macOS/Windows/Linux,不抢光标)+ 跨 OS 沙箱 + Cua Bench 基准 + Lume 虚拟化四件套。区别于 browser-use 只管浏览器、openclaw 管邮件日程,cua 管的是整台 OS。

发布于 2026年8月11日10 分钟阅读
<!-- cua-computer-use-resource | open-source | trycua/cua:开源 computer-use 2.0,AI 后台操控整台电脑 -->

trycua/cua 押的是 AI agent 的下一层:不是让模型更聪明,而是让模型能像人一样操作整台电脑--后台、跨平台、不抢你的鼠标。GitHub 21,114 颗星(实时变动,以 GitHub 为准),1,445 fork,MIT 许可证,2025-01-31 创建,最近一次 push 就在今天(2026-08-11),未归档,Trendshift 榜上有名。官网 cua.ai。主语言标 HTML,实则是多组件 monorepo,底层驱动 Rust 写、UniFFI 绑出 Python 和 TypeScript SDK,团队里有前微软工程师。差异点一句话:browser-use 只管浏览器,openclaw 替你打理邮件日程,cua 管整台 OS--任何桌面应用都能后台操控,外加沙箱、基准、虚拟化一整套 computer-use 2.0 基础设施。

边界先说清:本文基于 trycua/cua 的 GitHub README、libs/cua-driver/README.md 及仓库博客《Inside Windows computer-use》梳理,事实截至 2026-08-11,星数实时变动。与本站 computer-use agent 时代热点AI computer-use agent 横评 互补但独立。

一、定位:computer-use 2.0 不是"截图点鼠标"

第一代 computer-use(Anthropic 早期 Computer Use API)是"看一眼屏幕,点一下鼠标":每步截图喂模型,输出坐标,前台执行。慢、瞎、还占着前台--AI 操作时你的鼠标被抢走。cua 押的是 2.0:AI 在后台同时操控多台电脑,像真正的员工一样并行干活,不抢你的光标和焦点。README 定位原话:"Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation." 不是又一个"AI 操作电脑"demo,而是让 AI 后台操控电脑这套事的基础设施--驱动、沙箱、基准、虚拟化四件套打包开源。

"后台"是关键词。driver README 开宗明义:"drives native macOS apps without stealing focus"。AI 操作时屏幕上有一个由 driver 自己画的合成光标,和你的物理鼠标分离--你干你的活,AI 操控另一套应用,互不干扰。这是 computer-use 从"演示玩具"走向"并行生产力"的前提。

二、核心组件拆解:四件套各管一摊

Cua Drivers:给 agent 装后台操控能力。 核心。后台 computer-use 驱动,支持 macOS、Windows、Linux(Linux 走 X11 和 compositor-specific Wayland 路由,对原始后台输入有明确限制)。agent 通过它点击、输入、滚动、验证,全程不抢光标。对外两个接口:MCP over stdio(cua-driver mcp,给 Claude Code、Codex、Cursor、OpenClaw 直连)和 CLI(cua-driver call)。底层 Rust runtime,UniFFI 绑出 Python 和 TypeScript SDK。

它怎么"看见"屏幕?仓库博客说 driver 同时给 agent 三样东西:window pixels(窗口像素,实时画面)、UIA/MSAA accessibility trees(无障碍树,直接读应用 UI 结构--按钮叫什么、输入框标签是什么)、action layer(动作层,点击、输入、滚动、设值、验证)。三者结合,agent 不只靠"看"屏幕,还能读界面的逻辑结构再精准操作,比纯视觉方案快且准。Windows 为什么比 macOS 难?博客原话:"one driver has to work across Win32, WPF, WinUI, UWP/WinRT, Electron, Chromium, legacy controls, and custom-rendered canvases。" 解法是 driver 当"路由器"--像素、无障碍树(UIA,老应用 fallback MSAA)、动作各有多条后端路径,按目标动态选。默认 background 模式拒绝静默抢前台,不可后台的场景当显式错误返回而非静默失败,这是工程成熟度的标志。

Cua(Sandbox):给 agent 一个干活的 OS 环境。 pip install cua(Python 3.11+),一套 API 跑任意 VM 或容器镜像,云或本地都行。支持 Linux 容器、Linux VM、macOS、Windows、Android,还能 BYOI(自带 .qcow2/.iso)。云上走 cua.ai,本地走 QEMU。agent 在沙箱里看屏、点按钮、跑命令、自主完成任务,环境用完即弃。

Cua Bench:给 computer-use 能力打分。 基准 + RL 环境,在 OSWorld、ScreenSpot、Windows Arena 和自定义任务上评估 agent,能导出轨迹用于训练。对研究者是客观标尺,对普通用户是选模型依据,registry 在 cuabench.ai。

Lume:macOS 虚拟化。 用 Apple Virtualization.Framework 在 Apple Silicon 上起 macOS/Linux 虚拟机,near-native 性能。一条命令拉 Apple restore image 起 Tahoe 或 Sequoia VM,--unattended 离线装好、配好 SSH。需要让 agent 在隔离 macOS 跑 Xcode、Final Cut 时用它。

三、和 openclaw、browser-use、闭源 Operator 怎么分

先把地盘划清。browser-use 只管浏览器:视觉优先,截图喂模型输出坐标,边界是浏览器标签页。openclaw 是个人助手:跑在你机器上替你打理邮件、日程、文件、终端,强项是"替你干活"的个人自动化。cua 的地盘是"整台 OS 的后台操控"--任何桌面应用(不只是浏览器)都能驱动,外加沙箱、基准、虚拟化。一句话:browser-use 是"眼睛只看网页",openclaw 是"替你管日常杂活",cua 是"给 agent 装上操控整台电脑的手和眼,外加工位和考勤"。三者不是纯竞争:cua-driver README 明确把 OpenClaw 列为支持客户端,browser-use 也能接到 cua 沙箱里跑--cua 更像底下那层基础设施。和闭源 OpenAI Operator 比,cua 开源 MIT、模型可换、能本地离线、能嵌进自家代码,Operator 是黑盒 SaaS。想自己搭流水线参考本站 computer-use agent 搭建 SOP

维度trycua/cuaopenclawbrowser-useOpenAI Operator
地盘整台 OS 后台操控个人助手·邮件日程浏览器自动化浏览器为主
组件驱动+沙箱+基准+虚拟化应用+技能生态单一框架闭源 SaaS
后台运行是(不抢光标)否(占浏览器)云端
跨 OSmacOS/Win/Linux跨平台 app浏览器内云端
开源MITMITMIT闭源

四、上手:三条最短路径

路径 A:给 Claude Code 装后台操控(最快)。 macOS/Linux:/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)";Windows:irm https://cua.ai/driver/install.ps1 | iex。接进 Claude Code:

bash
claude mcp add --transport stdio cua-driver -- cua-driver mcp

之后对 Claude Code 说"打开这个应用、提取数据、填进表格",它真去操作桌面应用。其他客户端用 cua-driver mcp-config 打印配置接入,跑 cua-driver doctor 查环境。权限三档:standard(默认无弹窗)、bounded(只放行清单里审过的工具)、unrestricted(--dangerously-bypass-approvals,危险),启动时定死、改要重启 daemon。

路径 B:用 Sandbox 跑自主 agent。 pip install cua,起一个临时沙箱,agent 在里头看屏、点按钮、跑命令。云上走 cua.ai,本地走 QEMU,Android 也支持。

路径 C:跑基准评估。 clone 仓库 cd cua-benchuv tool install -e .cb image create linux-docker 建镜像,cb run dataset datasets/cua-bench-basic --agent cua-agent --max-parallel 4 跑分。

五、门槛代价:开源不等于零成本

四个要点。第一,Windows 兼容仍有边角:博客承认 minimized 窗口 WGC 抓不到像素、Chromium 坐标点击/GTK 按钮/WPF 拖拽得显式选 foreground、有些无障碍 provider 会撒谎或挂起。cua 把这些当显式错误返回而非静默吞掉,但你得会处理。第二,Session 0 的坑:agent 从 SSH、服务或错误父进程启动会掉进 Session 0(没有交互式桌面),EnumWindows、UIA、截图全返回空。cua 用跑在用户交互会话里的 daemon、经 named pipe 代理调用解决,但意味着你得把 daemon 跑对地方。第三,模型费自付:基础设施开源免费,但 agent 背后的大模型烧你的 API 额度,computer-use 每步要喂像素和树,token 烧得比纯文本快。第四,成熟度:2.1 万星、今天还在 push,但仍是高速迭代期的基建项目,接口和文档会变,不是开箱即用成品,生产接入前务必自己跑一遍你的场景。

适合:想给 Claude Code/Codex 加"操控整台电脑"能力的开发者;要在 Windows/macOS 桌面应用跑自动化、不想被前台抢占的团队;做 computer-use 研究或训练、需要基准和轨迹的人。别凑这个热闹:只想自动化浏览器--browser-use 更对路,本站有 browser-use 资源盘;想管邮件日程--openclaw 更合适;要开箱即用--闭源 Operator 更省心。

六、常见问题

Q:cua 和 browser-use 有什么区别? A:browser-use 只管浏览器,视觉优先(截图喂模型输出坐标)。cua 管整台 OS--任何桌面应用都能后台操控,靠像素+无障碍树+动作层三路并行,不抢光标。两者也能互补:browser-use 能接到 cua 沙箱里跑。

Q:"后台运行、不抢光标"具体怎么做到的? A:driver 画一个合成光标(synthetic cursor),和物理鼠标分离,每个 agent 有自己的 cursor_id。底层动作可以是 UIA、MSAA、PostMessage 或 SendInput。默认 background 模式拒绝静默抢前台,个别场景才显式选 foreground。来源是仓库博客《Inside Windows computer-use》。

Q:支持 Linux 吗? A:支持但有限制。driver 在 Linux 走 X11 和 compositor-specific Wayland 路由,对原始后台输入有明确限制;macOS 和 Windows 完整支持。Sandbox 层则各 OS 都支持。

Q:怎么装,要付费吗? A:MIT 开源免费。driver 装 macOS/Linux 用 curl https://cua.ai/driver/install.sh,Windows 用 irm https://cua.ai/driver/install.ps1 | iex。Sandbox 用 pip install cua(Python 3.11+)。云沙箱走 cua.ai 按量付费,本地 QEMU 零云成本,模型费自付。

Q:2.1 万星,项目成熟吗? A:活跃但仍在高速迭代。2025-01-31 创建,今天还在 push,未归档。接口和文档还在变动,Windows 兼容边角问题博客也承认。生产接入前建议自己跑一遍。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-11

常见问题

cua 和 browser-use 有什么区别?
browser-use 只管浏览器,视觉优先(截图喂模型输出坐标)。cua 管整台 OS--任何桌面应用都能后台操控,靠像素+无障碍树+动作层三路并行,不抢光标。两者也能互补:browser-use 能接到 cua 沙箱里跑。
"后台运行、不抢光标"具体怎么做到的?
driver 画一个合成光标(synthetic cursor),和物理鼠标分离,每个 agent 有自己的 cursor_id。底层动作可以是 UIA、MSAA、PostMessage 或 SendInput。默认 background 模式拒绝静默抢前台,个别场景才显式选 foreground。来源是仓库博客《Inside Windows computer-use》。
支持 Linux 吗?
支持但有限制。driver 在 Linux 走 X11 和 compositor-specific Wayland 路由,对原始后台输入有明确限制;macOS 和 Windows 完整支持。Sandbox 层则各 OS 都支持。
怎么装,要付费吗?
MIT 开源免费。driver 装 macOS/Linux 用 `curl https://cua.ai/driver/install.sh`,Windows 用 `irm https://cua.ai/driver/install.ps1 | iex`。Sandbox 用 `pip install cua`(Python 3.11+)。云沙箱走 cua.ai 按量付费,本地 QEMU 零云成本,模型费自付。
2.1 万星,项目成熟吗?
活跃但仍在高速迭代。2025-01-31 创建,今天还在 push,未归档。接口和文档还在变动,Windows 兼容边角问题博客也承认。生产接入前建议自己跑一遍。

相关文章

开源项目

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

2026年9月9日10 分钟阅读
开源项目

DeepSeek Harness 开源:万物皆插件的 Agent 框架

DeepSeek 官方开源 Agent 编排框架 DeepSeek Harness(命令行 dsh),GitHub MIT、TypeScript,基于 Cordis 运行时,以「万物皆插件」架构模块化拼装 AI 流水线。仓库 2026-08-13 创建,上线约三周 Star 突破 20 万;当前 0.1.3-alpha、开发者预览,官方声明会有破坏性变更、须先读 SAFETY.md。一键 `npx @deepseek-ai/dsh web` 启动 Web UI(http://127.0.0.1:3080)。

2026年9月5日10 分钟阅读