当 AI agent 从演示走进生产环境,一个绕不开的问题浮出水面:如果 agent 自己就是那个试图绕过护栏的软件,护栏还能立在哪里?NVIDIA 给出的答案是 Open Agent Safety Platform,一套开源软件平台加参考系统设计,核心主张一句话:agent 安全不能只靠模型自己听话。这套平台分两层,软件层叫 OpenShell,以 Apache 2.0 协议在 GitHub 开放,提供内核级沙箱的安全运行时;硬件层叫 NVIDIA Sentry,跑在 BlueField-4 DPU 上做带外看门狗,agent 越界时毫秒级隔离叫停。这篇文章把它拆开讲清楚:应用层护栏为什么会失效、策略六域怎么落地、一块网卡上的芯片凭什么管住 agent,以及安全分析师们泼出的冷水——巨头缺席、覆盖不足、只管你自家院子里的 agent。
模型对齐只管得了第一层
把 agent 安全寄希望于模型「听话」,是当前最普遍也最脆弱的做法。对齐训练、系统提示词、输出过滤器,这些都发生在应用层;NVIDIA 在官方资料里把系统分层讲得很清楚:应用层装着模型、工具、数据与 prompt,运行时层管部署与策略,基础设施层是算力、存储与网络。模型对齐能覆盖的只有第一层,下面两层出了问题,模型再乖也无济于事。更直白地说,当 agent 本身就是试图绕过护栏的软件时,应用层护栏会失效——这个前提一旦成立,靠提示词和微调堆出来的安全感就站不住脚。
更麻烦的是 agent 的行为模式。一次长任务里,agent 可能因为提示模糊、工具缺失或策略冲突而偏离操作者本来的意图,NVIDIA 给这类现象起了个名字叫 agent drift。它不是恶意攻击,也不触发任何告警,只是任务在不知不觉中走偏:本该只读的文件被写了,本该留在内网的请求出了外网。等到事后审计发现,损失往往已经发生。所以 NVIDIA 的结论是:护栏必须立在模型之外,变成模型绕不开的强制边界,而不是模型可以选择遵守的建议。
这个判断并不孤立。本站此前写过 OpenAI 在安全事件后的减速决定,行业对 agent 失控的担忧在升温;编码 agent 大规模铺开之后,编码 agent 的安全问题也不再是理论讨论。NVIDIA 选在这个节点把安全平台开源,等于把「agent 需要模型之外的边界」这个观点直接做成了产品。
背景变化也值得交代。上一代 AI 应用大多以对话收尾,模型输出一段文字,人来执行;这代 agent 的卖点是「替你做完」,它自己调工具、自己改文件、自己发请求。权限的性质变了:从「说什么」变成了「做什么」。传统的安全投入——红队测试、对齐训练、内容过滤——全都围着「说什么」打转,对「做什么」这一层几乎没有像样的基础设施。NVIDIA 把平台一拆为二,软件管运行时、硬件管基础设施,等于承认这个缺口不是补丁能填上的。
OpenShell:内核级沙箱,策略管六个域
OpenShell 是这套平台的开源软件层,协议是 Apache 2.0,代码与配套的 skills 在 GitHub 上可以直接获取。它的定位是安全运行时:agent 不直接触碰操作系统,而是跑在内核级沙箱里,每一次文件访问、进程创建、网络连接都要经过沙箱的策略引擎。对比跑在用户态、靠钩子拦截的传统方案,内核级意味着策略在更底层生效,绕过的难度完全不在一个量级。
策略覆盖六个域:文件、进程、凭证、工具、网络、数据库。这六个域基本穷尽了 agent 在一台机器上能干的事情——读哪个目录、起什么进程、用哪些密钥、调哪些工具、连什么地址、碰哪张表,全部可以写成显式策略。对比提示词约束,这种策略是执行层强制的:agent 不遵守,操作根本不会发生,而不是发生了之后再靠人类去发现。
执行流程上有两个检查点值得展开。执行前,OpenShell 做策略与操作者意图的对齐检查:agent 打算执行的动作先和策略比对,对不上就拦下。执行中,它持续监控 agent drift,也就是前文说的那种渐进式偏离,一旦监控到苗头就介入。这种「事前对齐、事中盯梢」的组合,针对的正是长任务里人类不再逐步确认的场景——你把一个两小时的数据迁移任务交给 agent,中间没人盯着,运行时就是那个替你盯的人。
部署层面,OpenShell 跑在 NVIDIA Vera CPU 上,并且可以扩展到 Arm 与 Intel 平台。这一点对生态很关键:安全运行时如果绑定自家硬件,采用面会窄得多;Apache 2.0 加跨平台,等于邀请整个行业把这套运行时嵌进自己的 agent 栈。Apache 2.0 也是开源协议里对商用最友好的那一档,允许闭源集成、不要求衍生品开源,企业法务没有理由拦。配套的 skills 同样开放,意味着策略不只是代码,还有一组可以抄作业的现成模板。开源阵营另一条路线的对照,可以看本站的 Kimi K3 开放权重——那边开放的是模型本体,这边开放的是约束模型的运行时,两者恰好是 agent 安全图谱的两端。
Sentry:跑在 DPU 上的带外看门狗
软件沙箱有个理论上的软肋:它和被监控的 agent 共享同一台主机。如果 agent 的权限配置出错,或者攻击者拿到了主机控制权,沙箱本身也可能被关掉。NVIDIA Sentry 针对的正是这一点,它不跑在 agent 所在的主机上,而是跑在 BlueField-4 DPU 上,独立于主机环境做带外监控。
DPU 是数据中心里常见的智能网卡芯片,专职处理网络与存储流量,平时不参与业务计算。Sentry 把它用成了看门狗:基于 DOCA 框架检查 agent 的请求与响应、验证 agent 身份、产出可证明的遥测、执行细粒度的访问策略。因为带外,agent 及其所在主机都摸不到这个监控者——你在虚拟机里再怎么折腾,也够不到网卡上那块独立芯片。agent 一旦越界,Sentry 的动作是毫秒级隔离并叫停,不等待人类响应,也不给 agent 申辩的机会。
要说明的是,Sentry 这部分是参考系统设计,不是开源硬件,但架构是公开的,硬件厂商和数据中心运营方可以照着做自己的实现。这个「软件开源、硬件开放架构」的组合拳意图很明显:让安全边界下沉到基础设施层,成为数据中心的标配能力,而不是每家自己拼的胶水代码。对已经在用 DPU 做网络卸载的数据中心来说,加一层 agent 看门狗是顺路的事;对没有 DPU 的中小团队,这套硬件层暂时可望不可及,这也是后文批评声音的伏笔之一。
「可证明遥测」这四个字对合规团队分量不轻。agent 出了事故,事后最难的往往不是止损,而是回答监管和客户的问题:它当时为什么做了那个操作、是谁授权的、边界在哪里失效。Sentry 因为独立于主机,产出的遥测自带信任属性——不是 agent 自己汇报的日志,而是旁观者记的账。对金融、医疗这类审计密集的行业,这份旁观记录可能比拦截功能本身更有采购说服力,名单里出现 Citi 和 JPMorganChase 大概不是巧合。
100+ 组织捧场,缺席者与冷水同样重要
生态声势不小:超过 100 个组织参与,名单里既有 Anthropic、Salesforce、SAP、Microsoft、Hugging Face 这样的模型与应用大厂,也有 Cisco、CrowdStrike、Palantir 这样的安全与数据公司,还有 Citi、JPMorganChase 这类金融机构,甚至包括 SpaceXAI 和机器人公司 Figure。项目隶属 Linux Foundation 旗下的 Open Secure AI Alliance。具体落地也已经有几个:Anthropic 将在 Claude Managed Agents 中集成 OpenShell 与 BlueField,动作相当快,参考本站的 Claude Sonnet 5.5 发布可以看出 Anthropic 在企业 agent 上的整体节奏;Salesforce 用这套东西做 Slack agent 的可视化;SpaceXAI 用在 Cursor 编码 agent 与 Grok 模型上。
但批评的声音必须如实记录。Gartner 的分析师肯定了硬件层思路,同时指出一个显眼的事实:OpenAI、Amazon、Google 这些巨头没有加入。三大云平台承载了大多数企业 agent 的运行环境,它们的缺席意味着这套标准想覆盖主流部署形态,还有很长的路要走。
数字上更冷的判断来自 IDC:他们估计这套平台能覆盖的企业 agentic 安全问题「可能不到 25%」。剩下的四分之三在哪里?Control Risks 点得很具体:它只管「你自己部署在你自己基础设施上的已知 agent」——影子 agent,也就是员工私自接入的那批;SaaS 内嵌的 agent,随供应商产品带进来的那批;攻击者投递的 agent,字面意义上的敌军。这三类全都管不到,而它们恰恰是真实企业环境里最难防的部分。另外还有供应商锁定风险的讨论:把安全边界交给单一厂商的硬件与平台,企业要掂量的不只是安全收益,还有议价权和退出成本。
组织归属也值得多看一眼。平台隶属 Linux Foundation 旗下的 Open Secure AI Alliance,而不是 NVIDIA 自家的开发者计划——把治理权放进中立基金会,是硬件厂商推行业标准时常见的姿态:你贡献的不只是一套代码,还有一个谁都可以参与定规矩的桌子。当然,创始厂商对路线图的实际影响力不会因为基金会挂牌就消失,中立到什么程度,要看后续提案和版本发布由谁主导。这也是观察这类「开放平台」成色的一个固定视角。
把正反两面放在一起看,这个平台的真实定位是:给「自己部署、自己管控」的企业 agent 提供一套可验证的强制边界。开源运行时降低了接入门槛,硬件看门狗补上了软件沙箱的盲区,生态名单说明方向被行业认可。它不是 agentic 安全的终点方案,更像是给行业立了一个可参照的地基——地基之上能盖多高的楼,要看 OpenAI 们接不接。
FAQ
Q1: OpenShell 开源到什么程度?
A1:软件层以 Apache 2.0 协议在 GitHub 开放,包括运行时代码与配套 skills,可以自由商用与二次开发。但 Sentry 硬件部分是参考系统设计,不开源硬件,只公开架构。
Q2: agent drift 是什么意思?
A2:指 agent 在执行长任务过程中偏离操作者原本意图的行为,诱因包括提示模糊、工具缺失、策略冲突。它不是攻击,不触发常规告警,所以 OpenShell 在执行中持续监控并在发现苗头时介入。
Q3: 为什么看门狗要放在 DPU 上?
A3:因为带外。Sentry 跑在 BlueField-4 DPU 上,独立于 agent 所在主机,主机被攻破或 agent 权限失控都影响不到它。共享主机的软件沙箱理论上可以被关掉,硬件看门狗没有这个软肋。
Q4: 它能管住所有 agent 吗?
A4:不能。按 Control Risks 的口径,它只覆盖部署在你自己基础设施上的已知 agent;影子 agent、SaaS 内嵌 agent、攻击者带来的 agent 都在覆盖之外。IDC 估计其能覆盖的企业 agentic 安全问题不到 25%。
Q5: 哪些公司已经在用?
A5:超过 100 个组织参与,已公开的落地包括:Anthropic 在 Claude Managed Agents 中集成 OpenShell 与 BlueField,Salesforce 用于 Slack agent 可视化,SpaceXAI 用于 Cursor 编码 agent 与 Grok 模型。
互动
你会把 agent 安全交给模型自己,还是交给一块网卡上的芯片?评论区聊聊:你所在团队的 agent,跑在谁的边界里。