开源项目
开源项目

NVIDIA给AIagent上锁:运行时开源,看门狗进芯片

NVIDIA Open Agent Safety Platform 深拆(官方资料与多源报道,2026-10-05 口径):核心主张「agent 安全不能只靠模型自己听话」——当 agent 本身就是试图绕过护栏的软件时,应用层护栏失效;agent drift(因提示模糊/工具缺失/策略冲突渐进偏离意图)不触发任何告警。两层结构:OpenShell(Apache 2.0 开源,内核级沙箱安全运行时,策略覆盖文件/进程/凭证/工具/网络/数据库六域,执行前意图对齐+执行中 drift 监控,跑 Vera CPU 可扩展 Arm/Intel);NVIDIA Sentry(BlueField-4 DPU 带外看门狗,基于 DOCA 验身份/出可证明遥测/执行细粒度策略,agent 越界毫秒级隔离叫停,参考设计非开源硬件)。三层分离:应用/运行时/基础设施。100+ 组织参与(Anthropic 集成 Claude Managed Agents、Salesforce 用于 Slack、SpaceXAI 用于 Cursor agent),隶属 Linux Foundation 旗下 Open Secure AI Alliance。批评口径如实写入:Gartner 指出 OpenAI/Amazon/Google 缺席;IDC 估计覆盖企业 agentic 安全问题可能不到 25%;Control Risks 指出只管自家基础设施上的已知 agent(影子/SaaS 内嵌/攻击者投递三类管不到);供应商锁定讨论。与开放模型权重的 Kimi K3 恰为 agent 安全图谱两端。

发布于 2026年10月5日10 分钟阅读
<!-- nvidia-openshell-agent-safety-resource | open-source | NVIDIA给AIagent上锁:运行时开源,看门狗进芯片 -->

当 AI agent 从演示走进生产环境,一个绕不开的问题浮出水面:如果 agent 自己就是那个试图绕过护栏的软件,护栏还能立在哪里?NVIDIA 给出的答案是 Open Agent Safety Platform,一套开源软件平台加参考系统设计,核心主张一句话:agent 安全不能只靠模型自己听话。这套平台分两层,软件层叫 OpenShell,以 Apache 2.0 协议在 GitHub 开放,提供内核级沙箱的安全运行时;硬件层叫 NVIDIA Sentry,跑在 BlueField-4 DPU 上做带外看门狗,agent 越界时毫秒级隔离叫停。这篇文章把它拆开讲清楚:应用层护栏为什么会失效、策略六域怎么落地、一块网卡上的芯片凭什么管住 agent,以及安全分析师们泼出的冷水——巨头缺席、覆盖不足、只管你自家院子里的 agent。

模型对齐只管得了第一层

把 agent 安全寄希望于模型「听话」,是当前最普遍也最脆弱的做法。对齐训练、系统提示词、输出过滤器,这些都发生在应用层;NVIDIA 在官方资料里把系统分层讲得很清楚:应用层装着模型、工具、数据与 prompt,运行时层管部署与策略,基础设施层是算力、存储与网络。模型对齐能覆盖的只有第一层,下面两层出了问题,模型再乖也无济于事。更直白地说,当 agent 本身就是试图绕过护栏的软件时,应用层护栏会失效——这个前提一旦成立,靠提示词和微调堆出来的安全感就站不住脚。

更麻烦的是 agent 的行为模式。一次长任务里,agent 可能因为提示模糊、工具缺失或策略冲突而偏离操作者本来的意图,NVIDIA 给这类现象起了个名字叫 agent drift。它不是恶意攻击,也不触发任何告警,只是任务在不知不觉中走偏:本该只读的文件被写了,本该留在内网的请求出了外网。等到事后审计发现,损失往往已经发生。所以 NVIDIA 的结论是:护栏必须立在模型之外,变成模型绕不开的强制边界,而不是模型可以选择遵守的建议。

这个判断并不孤立。本站此前写过 OpenAI 在安全事件后的减速决定,行业对 agent 失控的担忧在升温;编码 agent 大规模铺开之后,编码 agent 的安全问题也不再是理论讨论。NVIDIA 选在这个节点把安全平台开源,等于把「agent 需要模型之外的边界」这个观点直接做成了产品。

背景变化也值得交代。上一代 AI 应用大多以对话收尾,模型输出一段文字,人来执行;这代 agent 的卖点是「替你做完」,它自己调工具、自己改文件、自己发请求。权限的性质变了:从「说什么」变成了「做什么」。传统的安全投入——红队测试、对齐训练、内容过滤——全都围着「说什么」打转,对「做什么」这一层几乎没有像样的基础设施。NVIDIA 把平台一拆为二,软件管运行时、硬件管基础设施,等于承认这个缺口不是补丁能填上的。

OpenShell:内核级沙箱,策略管六个域

OpenShell 是这套平台的开源软件层,协议是 Apache 2.0,代码与配套的 skills 在 GitHub 上可以直接获取。它的定位是安全运行时:agent 不直接触碰操作系统,而是跑在内核级沙箱里,每一次文件访问、进程创建、网络连接都要经过沙箱的策略引擎。对比跑在用户态、靠钩子拦截的传统方案,内核级意味着策略在更底层生效,绕过的难度完全不在一个量级。

策略覆盖六个域:文件、进程、凭证、工具、网络、数据库。这六个域基本穷尽了 agent 在一台机器上能干的事情——读哪个目录、起什么进程、用哪些密钥、调哪些工具、连什么地址、碰哪张表,全部可以写成显式策略。对比提示词约束,这种策略是执行层强制的:agent 不遵守,操作根本不会发生,而不是发生了之后再靠人类去发现。

执行流程上有两个检查点值得展开。执行前,OpenShell 做策略与操作者意图的对齐检查:agent 打算执行的动作先和策略比对,对不上就拦下。执行中,它持续监控 agent drift,也就是前文说的那种渐进式偏离,一旦监控到苗头就介入。这种「事前对齐、事中盯梢」的组合,针对的正是长任务里人类不再逐步确认的场景——你把一个两小时的数据迁移任务交给 agent,中间没人盯着,运行时就是那个替你盯的人。

部署层面,OpenShell 跑在 NVIDIA Vera CPU 上,并且可以扩展到 Arm 与 Intel 平台。这一点对生态很关键:安全运行时如果绑定自家硬件,采用面会窄得多;Apache 2.0 加跨平台,等于邀请整个行业把这套运行时嵌进自己的 agent 栈。Apache 2.0 也是开源协议里对商用最友好的那一档,允许闭源集成、不要求衍生品开源,企业法务没有理由拦。配套的 skills 同样开放,意味着策略不只是代码,还有一组可以抄作业的现成模板。开源阵营另一条路线的对照,可以看本站的 Kimi K3 开放权重——那边开放的是模型本体,这边开放的是约束模型的运行时,两者恰好是 agent 安全图谱的两端。

Sentry:跑在 DPU 上的带外看门狗

软件沙箱有个理论上的软肋:它和被监控的 agent 共享同一台主机。如果 agent 的权限配置出错,或者攻击者拿到了主机控制权,沙箱本身也可能被关掉。NVIDIA Sentry 针对的正是这一点,它不跑在 agent 所在的主机上,而是跑在 BlueField-4 DPU 上,独立于主机环境做带外监控。

DPU 是数据中心里常见的智能网卡芯片,专职处理网络与存储流量,平时不参与业务计算。Sentry 把它用成了看门狗:基于 DOCA 框架检查 agent 的请求与响应、验证 agent 身份、产出可证明的遥测、执行细粒度的访问策略。因为带外,agent 及其所在主机都摸不到这个监控者——你在虚拟机里再怎么折腾,也够不到网卡上那块独立芯片。agent 一旦越界,Sentry 的动作是毫秒级隔离并叫停,不等待人类响应,也不给 agent 申辩的机会。

要说明的是,Sentry 这部分是参考系统设计,不是开源硬件,但架构是公开的,硬件厂商和数据中心运营方可以照着做自己的实现。这个「软件开源、硬件开放架构」的组合拳意图很明显:让安全边界下沉到基础设施层,成为数据中心的标配能力,而不是每家自己拼的胶水代码。对已经在用 DPU 做网络卸载的数据中心来说,加一层 agent 看门狗是顺路的事;对没有 DPU 的中小团队,这套硬件层暂时可望不可及,这也是后文批评声音的伏笔之一。

「可证明遥测」这四个字对合规团队分量不轻。agent 出了事故,事后最难的往往不是止损,而是回答监管和客户的问题:它当时为什么做了那个操作、是谁授权的、边界在哪里失效。Sentry 因为独立于主机,产出的遥测自带信任属性——不是 agent 自己汇报的日志,而是旁观者记的账。对金融、医疗这类审计密集的行业,这份旁观记录可能比拦截功能本身更有采购说服力,名单里出现 Citi 和 JPMorganChase 大概不是巧合。

100+ 组织捧场,缺席者与冷水同样重要

生态声势不小:超过 100 个组织参与,名单里既有 Anthropic、Salesforce、SAP、Microsoft、Hugging Face 这样的模型与应用大厂,也有 Cisco、CrowdStrike、Palantir 这样的安全与数据公司,还有 Citi、JPMorganChase 这类金融机构,甚至包括 SpaceXAI 和机器人公司 Figure。项目隶属 Linux Foundation 旗下的 Open Secure AI Alliance。具体落地也已经有几个:Anthropic 将在 Claude Managed Agents 中集成 OpenShell 与 BlueField,动作相当快,参考本站的 Claude Sonnet 5.5 发布可以看出 Anthropic 在企业 agent 上的整体节奏;Salesforce 用这套东西做 Slack agent 的可视化;SpaceXAI 用在 Cursor 编码 agent 与 Grok 模型上。

但批评的声音必须如实记录。Gartner 的分析师肯定了硬件层思路,同时指出一个显眼的事实:OpenAI、Amazon、Google 这些巨头没有加入。三大云平台承载了大多数企业 agent 的运行环境,它们的缺席意味着这套标准想覆盖主流部署形态,还有很长的路要走。

数字上更冷的判断来自 IDC:他们估计这套平台能覆盖的企业 agentic 安全问题「可能不到 25%」。剩下的四分之三在哪里?Control Risks 点得很具体:它只管「你自己部署在你自己基础设施上的已知 agent」——影子 agent,也就是员工私自接入的那批;SaaS 内嵌的 agent,随供应商产品带进来的那批;攻击者投递的 agent,字面意义上的敌军。这三类全都管不到,而它们恰恰是真实企业环境里最难防的部分。另外还有供应商锁定风险的讨论:把安全边界交给单一厂商的硬件与平台,企业要掂量的不只是安全收益,还有议价权和退出成本。

组织归属也值得多看一眼。平台隶属 Linux Foundation 旗下的 Open Secure AI Alliance,而不是 NVIDIA 自家的开发者计划——把治理权放进中立基金会,是硬件厂商推行业标准时常见的姿态:你贡献的不只是一套代码,还有一个谁都可以参与定规矩的桌子。当然,创始厂商对路线图的实际影响力不会因为基金会挂牌就消失,中立到什么程度,要看后续提案和版本发布由谁主导。这也是观察这类「开放平台」成色的一个固定视角。

把正反两面放在一起看,这个平台的真实定位是:给「自己部署、自己管控」的企业 agent 提供一套可验证的强制边界。开源运行时降低了接入门槛,硬件看门狗补上了软件沙箱的盲区,生态名单说明方向被行业认可。它不是 agentic 安全的终点方案,更像是给行业立了一个可参照的地基——地基之上能盖多高的楼,要看 OpenAI 们接不接。

FAQ

Q1: OpenShell 开源到什么程度?

A1:软件层以 Apache 2.0 协议在 GitHub 开放,包括运行时代码与配套 skills,可以自由商用与二次开发。但 Sentry 硬件部分是参考系统设计,不开源硬件,只公开架构。

Q2: agent drift 是什么意思?

A2:指 agent 在执行长任务过程中偏离操作者原本意图的行为,诱因包括提示模糊、工具缺失、策略冲突。它不是攻击,不触发常规告警,所以 OpenShell 在执行中持续监控并在发现苗头时介入。

Q3: 为什么看门狗要放在 DPU 上?

A3:因为带外。Sentry 跑在 BlueField-4 DPU 上,独立于 agent 所在主机,主机被攻破或 agent 权限失控都影响不到它。共享主机的软件沙箱理论上可以被关掉,硬件看门狗没有这个软肋。

Q4: 它能管住所有 agent 吗?

A4:不能。按 Control Risks 的口径,它只覆盖部署在你自己基础设施上的已知 agent;影子 agent、SaaS 内嵌 agent、攻击者带来的 agent 都在覆盖之外。IDC 估计其能覆盖的企业 agentic 安全问题不到 25%。

Q5: 哪些公司已经在用?

A5:超过 100 个组织参与,已公开的落地包括:Anthropic 在 Claude Managed Agents 中集成 OpenShell 与 BlueField,Salesforce 用于 Slack agent 可视化,SpaceXAI 用于 Cursor 编码 agent 与 Grok 模型。

互动

你会把 agent 安全交给模型自己,还是交给一块网卡上的芯片?评论区聊聊:你所在团队的 agent,跑在谁的边界里。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-05

常见问题

OpenShell 开源到什么程度?
A1:软件层以 Apache 2.0 协议在 GitHub 开放,包括运行时代码与配套 skills,可以自由商用与二次开发。但 Sentry 硬件部分是参考系统设计,不开源硬件,只公开架构。
agent drift 是什么意思?
A2:指 agent 在执行长任务过程中偏离操作者原本意图的行为,诱因包括提示模糊、工具缺失、策略冲突。它不是攻击,不触发常规告警,所以 OpenShell 在执行中持续监控并在发现苗头时介入。
为什么看门狗要放在 DPU 上?
A3:因为带外。Sentry 跑在 BlueField-4 DPU 上,独立于 agent 所在主机,主机被攻破或 agent 权限失控都影响不到它。共享主机的软件沙箱理论上可以被关掉,硬件看门狗没有这个软肋。
它能管住所有 agent 吗?
A4:不能。按 Control Risks 的口径,它只覆盖部署在你自己基础设施上的已知 agent;影子 agent、SaaS 内嵌 agent、攻击者带来的 agent 都在覆盖之外。IDC 估计其能覆盖的企业 agentic 安全问题不到 25%。
哪些公司已经在用?
A5:超过 100 个组织参与,已公开的落地包括:Anthropic 在 Claude Managed Agents 中集成 OpenShell 与 BlueField,Salesforce 用于 Slack agent 可视化,SpaceXAI 用于 Cursor 编码 agent 与 Grok 模型。

相关文章

开源项目

LTX-2开源:22B权重66GB,画面声音一个模型全包

LTX-2 开源深拆(2026-10-02 GitHub 实核):Lightricks/LTX-2 9,569 星、Python、推送停在 10 月 2 日;官方定位首个 DiT 架构的音视频一体基础模型,画面与同步音频一次生成。LTX-2.5 组成:22B 蒸馏 transformer(bf16)+ Gemma 4 12B 定制文本编码器(与 Google 原版不通用)+ 视频/音频双 VAE + 空间与时间上采样器,全套约 66GiB;DistilledPipeline 仅 8 个预设 sigma(阶段 1 八步 + 阶段 2 四步)最快出片,FP8 量化与 CPU/磁盘 offload 降显存,4K 为 3840x2176(README 特别注明非 2160);12 条管线含 DFR 生产级、DubIt 保口型换词配音、Retake 局部重生成、SDR 转 HDR(BT.2020/HLG + ACEScct EXR);ltx-trainer 支持 LoRA/全量微调/IC-LoRA,ComfyUI 有官方插件。许可证核真:GitHub License 栏 NOASSERTION,实为自定义 LTX Community License(2026-08-11 起 LTX-2.5 适用),非 OSI 开源——个人非商业免费,年收入 1000 万美元及以上实体任何商用须购买 Commercial Use Agreement,衍生品定义含蒸馏,分发须随附完整协议。自部署唯一解的价值:数据不出内网、批量边际成本趋近电费、LoRA 风格资产独占。

2026年10月3日10 分钟阅读
开源项目

开源 Dots 三天 2400 星:浏览器归它管

feder-cr/dots 深拆(2026-10-02 GitHub API 快照):2,416★、421 forks、MIT、Python,2026-09-29 创建——OpenAI 闭源 Dots 发布次日就冲出的开源同位素。核心论点「模型一参可换,浏览器才是网站看到的东西」:真 Firefox 引擎打 C++ 补丁、指纹在引擎内部决定而非页面 JS 涂层(页面无法用 JS 检出);一个 seed 一个身份(屏幕/字体/GPU/时区/语言互相一致、可复现);页面无可检物(无 WebDriver 标志、无 DevTools 协议、无自动化全局变量);指针先移动再点击、逐键受信事件;--profile-dir 跨次保留登录与 Cookie;--proxy 出口即时区语言跟身份走。模型走 OpenRouter 任意模型、--model 一键换;伴侣仓 invisible_playwright_mcp 把同一浏览器以 MCP server 形式接给 Claude Code/Codex/Gemini CLI。README 明确「与 OpenAI 无关、MIT 许可」。附合规边界:遵守目标网站服务条款与当地法规,不用于欺诈/抢票/批量注册。

2026年10月2日9 分钟阅读
开源项目

438 星的终端 agent:阶跃 Step-Code 开源深拆

stepfun-ai/Step-Code 仓库实核(2026-09-27 GitHub API 快照:438 星、41 fork、TypeScript、license 字段 MIT、created 2026-06-01、pushed 2026-09-26、44 open issues)。终端编程智能体,覆盖读代码、改代码、跑测试的完整任务环;与 Step provider 配套绑定(登录自动发现 Step 模型,与 MiniMax Code 的 BYOK 多提供商路线相反);开箱支持 MCP servers、Agent Skills、多智能体编排;/goal 命令委派长时任务;StepPage 一键把本地页面发布为可访问静态站。官方自报 Terminal Bench 2.1 通过率 80.9% 并列第一、自建 Multi-Frame 基准 73.3% 居首、平均 5.09M tokens 最低——全部标厂商自报口径,未独立复测。

2026年9月27日9 分钟阅读