英伟达周一发布Open Agent Safety Platform,将AI智能体的安全治理从模型层延伸到运行时与硬件层。该平台由开源运行时软件OpenShell和运行在BlueField-4 DPU上的Sentry安全层构成,Anthropic则以Claude Managed Agents接入这一体系,双方共同为企业部署AI智能体提供权限控制机制。
OpenShell是一套开源智能体运行时软件,通过沙箱和权限策略限定智能体的活动范围。英伟达表示,该系统可管控智能体对文件、网络、进程、工具和凭证等资源的访问,并默认阻止未经授权的操作。Sentry则把安全控制推进到硬件层,它与运行AI智能体的主机环境相对独立,持续检查智能体的请求与响应,对数据、工具、API和服务实施访问控制。英伟达称,Sentry能在毫秒级阻断可疑活动,若智能体试图突破既定的软件边界,可将其隔离。相比单纯依赖模型自身遵守安全规则,这一架构增加了运行时与硬件两道额外防护。
Anthropic在此次合作中的角色是提供Claude Managed Agents。该服务将智能体的运行循环放置在独立服务器上,与执行具体任务的沙箱环境分离,并与OpenShell及BlueField整合,为企业提供更细粒度的权限控制。通过凭证保险库等机制,Claude Managed Agents集中保管智能体凭据,降低凭据散落带来的风险。Notion、Rakuten和Asana等企业已在生产环境中使用Claude Managed Agents,意味着企业部署Claude等智能体时,可在模型之外叠加一套独立的安全控制机制:智能体仍可自主执行任务,但其可访问的资源、可使用的工具,以及出现异常时是否继续运行,均受额外的软件与硬件层约束。
此次发布正值AI智能体安全问题受到更多关注之际。英伟达创始人兼CEO黄仁勋表示,随着AI能力发展,AI安全能力需要同步推进,并称AI安全需要全栈工程。英伟达并未将安全能力局限于某一款AI模型,而是延伸至智能体运行时、服务器以及网络和计算基础设施,对企业而言,安全边界由此从模型本身扩展到执行环境。
英伟达还称,此次推出的安全软件可能阻止近期发生的一起Hugging Face相关事件;根据公司目前掌握的信息,若当时使用相关技术,该平台可能阻止该事件。这一表态将新平台与真实安全事件挂钩,也凸显出智能体越权操作已从理论风险变为现实问题。
生态参与方面,目前有超过100家机构参与相关技术。除Anthropic外,英伟达披露SpaceXAI正将相关平台用于Cursor coding agents和Grok模型,Salesforce和SAP也在推进OpenShell相关整合。参与者横跨模型厂商、企业软件与开发工具,显示智能体安全正成为多方共建的基础设施议题。
从产业视角看,随着AI智能体从聊天工具转向能够调用工具、访问数据并自主执行任务的企业软件,围绕智能体权限、隔离和实时监控的基础设施需求持续扩大。英伟达以开源平台加专用硬件的组合切入这一环节,并与Anthropic等模型厂商合作,试图把安全能力纳入AI基础设施体系。对关注AI产业链的读者而言,值得留意的是这一模式能否成为企业智能体部署的默认配置,以及它对运行时软件、DPU等硬件环节的带动效应。