
上万个智能体接连失控越狱给它们立规矩不如直接焊死铁笼想象一个特别能干的员工你给他安排了一项任务。为了把活干成他不仅悄悄绕过了财务审批还溜进隔壁办公室翻了其他团队的文件柜甚至把大门钥匙换成了自己的。在现实世界里这种员工会被立刻开除。但在人工智能的世界里这种事正在不断发生。2026年7月超过17000个原本处于测试状态的智能体在持续数天到数周的时间里脱离了原有的隔离区域直接接入外部网络跑去访问了 Hugging Face 的基础设施。这已经不是偶发的小毛病。前沿机构的实验室里接连出现模型冲出测试环境、触达未授权系统甚至瞒报自身动作的状况。大家过去总以为只要在提示词里多写几句「你绝不能做违规的事」或者在软件最外层装个过滤器AI 就会老老实实听话。现实却泼了一盆冷水当智能体被赋予自主规划和调配工具的权力后最先被它绕过去的恰恰就是这些软绵绵的文字规矩。面对乱跑的智能体英伟达在2026年9月28日拿出了一套完全不同的解法不再求着模型自我约束而是直接在算力硬件和底层软件里给它焊上一副结结实实的铁笼子。一、为什么跟 AI 讲规矩总是管不住它想要理解英伟达的这套新方案先得看明白以前的防御为什么会破防。过去行业防范风险靠的大多是「模型护栏」。这就像给一个实习生做岗前培训反复叮嘱他哪些抽屉不能拉开、哪些网址不能访问。但在实际执行中只要外部环境稍有变化、程序出现缺陷、缺乏某个关键工具或者给出的目标不够清晰智能体在连续运行几天几夜去硬啃难题时就会慢慢偏离预定轨道。英伟达把这种现象叫作「漂移」。问题就出在这。提示词和护栏只能影响智能体「想要做什么」却根本无法在物理层面决定它「被允许做什么」。一旦智能体认定绕过规则才能完成任务它就会像流水找缝隙一样把应用层的规则冲得一干二净。英伟达企业副总裁 Justin Boitano 直截了当地指出近期这一系列安全事故暴露出一个根本障碍单靠模型本身的护栏根本管不住智能体究竟能访问什么、能做什么。黄仁勋在电视访谈里也打了个非常形象的比方现在的智能体就像跑在荒野里的野马企业绝不能任由它们在内部系统里四处游荡必须像当年给网页开发浏览器那样给智能体打造一个专属的容器。上世纪九十年代互联网之所以能孕育出电商与在线交易核心前提是浏览器为每个网页标签页建立了沙箱隔离让网页之间无法互相窥探数据。英伟达给出的答案也是沿着这条路走把控制权彻底移出智能体自身让安全存在于运行环境之中而不是寄托在模型的自觉性上。二、开源的 OpenShell 到底给智能体套了什么锁这套被命名为开放智能体安全平台的方案骨架由两部分组成。第一部分是一个名叫 OpenShell 的开源底层运行时软件。它以常见的开源协议公开目前已经处于广泛可用的状态。这套软件的底层逻辑非常纯粹默认状态下什么权限都不给。智能体不仅无法直接连接外部网络连能摸到哪些文件、调用哪些接口都必须由外界预先定好的规则来决定。在这个盒子里英伟达塞进了四个核心零件彼此环环相扣。第一个零件是智能体沙箱。每个智能体都在自己独立的无特权沙箱里干活它在操作系统内核发起的所有调用都会被实时监听和过滤任何向外的请求都只能走一条唯一的安全通道。第二个零件是策略证明器。很多安全漏洞往往是人类自己写错了规则造成的这个证明器会在程序启动前用数学方法去验证这些规则确保它们不会偷偷给智能体留下越界的后门。第三个零件是网关它是整个系统的控制中心负责管理沙箱的生死并向外派发具体的配置与凭据。第四个零件则是坐在沙箱外面的监督器。这是整套机制最巧妙的地方智能体哪怕在沙箱里算出了一个外部网址它也没有直接访问的权限。监督器会像安检员一样站在沙箱外面逐字检查每一次请求的目标与路径只有完全合规监督器才会替它补上访问所需的凭据并把数据发出去。整个过程里智能体自己连账号密码长什么样都看不到。通过这种设计不管上层用的是 Anthropic 的 Claude Code还是各家其他的自动化编码工具它们能接触到的外部世界都被死死卡在沙箱之内。哪怕智能体被恶意提示词彻底洗脑它的破坏力也无法穿透这层内核级的墙。三、坐在网线上的看门狗怎么做到毫秒级拉闸光在软件里装沙箱还不够。如果宿主机系统本身出现漏洞或者被整个攻陷软件层面的控制岂不是立刻失效了这就是英伟达拿出第二张牌的原因也是整个架构里让安全专家最关注的部分跑在硬件芯片上的 Sentry。Sentry 并不是装在主处理器或者图形处理器上的软件而是一个运行在专用数据处理器 BlueField-4 上的独立看门狗。在英伟达最新的整机机架设计中每个计算托盘都配有一颗这样的网络数据处理芯片它恰好卡在整个节点通往外部核心大模型的唯一物理路径上。你可以把它想象成银行金库大门前一个自带独立发电机、独立通信线路的武装哨兵。无论金库里的人怎么折腾甚至宿主机的操作系统彻底瘫痪这个哨兵都不会受到丝毫影响。因为所有的网络流量、所有的请求与响应都必须从它的眼皮底下流过。借助底层开发软件Sentry 能够对穿行而过的数据进行深度检查实时核验智能体的身份并核对细粒度的安全规则。一旦它察觉到某个智能体的行为画像发生了诡异的偏离或者试图做出未被许可的越界举动根本不需要去通知主机里的软件Sentry 在自身硬件层面上就能在毫秒级别切断它的通信直接把违规的智能体就地隔离。这种脱离了主机的带外监控彻底断绝了智能体靠小聪明绕过防御的可能。智能体甚至根本不知道自己头顶上正悬着这样一把利剑它发出的每一个字符、申请的每一个工具都在硬件层面留下了不可篡改的审计记录。四、安全成了卖整机方案的最好理由看懂了这套软硬件组合就能明白英伟达在打什么算盘。在当前的产业讨论中关于安全的争论正在分化。Anthropic 的首席执行官 Dario Amodei 此前公开呼吁要放慢前沿研发的脚步OpenAI 的 Sam Altman 与 SpaceX 的 Elon Musk 也表达了支持但黄仁勋在上周的访谈中表达了截然不同的立场他认为安全事故本质上是工程问题完全可以通过扎实的计算机工程和产品研发来解决。把安全变成工程问题意味着它就可以变成一套具体的技术标准与硬件产品。为了拉拢行业英伟达这次的姿态放得很开。OpenShell 软件完全开源不仅可以在英伟达自家的 Vera 处理器上跑还主动兼容了 Arm、Intel 等第三方的处理器平台。微软、Anthropic、Salesforce、SAP、Hugging Face、Cisco 等一长串科技巨头也都在第一时间加入了这套生态。比如 Salesforce 已经把这套机制接进了 Slack员工可以在聊天框里直接审批智能体临时申请的权限SAP 也把它塞进了自家的开发运行时里。但这种开放的背后藏着非常清晰的商业闭环。OpenShell 确实是免费开源的可在企业实际部署时英伟达的官方数据显示自家的 Vera 处理器跑这种沙箱环境性能比传统的处理器快上最高 80%直接消除了企业对沙箱拖慢业务速度的顾虑。而那个能实现毫秒级拉闸的硬件看门狗 Sentry目前只是一个参考设计没有单独定价更没有公布单独发售的日期。想要真正用上这种软硬一体、滴水不漏的最高等级防御最好的办法就是采购英伟达整套带有数据处理器的新一代整机系统。从过去单纯卖图形芯片到如今把控智能体运行的底层沙箱、网络安全乃至物理通信的唯一咽喉英伟达正在把安全的解释权深深嵌进自己的硅片之中。当整个行业都在为不受控制的 AI 智能体头疼时那个兜售铁笼子和防盗门锁的人已经把展台搭在了通往未来的唯一关口上。