輝達週一釋出Open Agent Safety Platform,將AI智慧體的安全治理從模型層延伸到執行時與硬體層。該平台由開源執行時軟體OpenShell和執行在BlueField-4 DPU上的Sentry安全層構成,Anthropic則以Claude Managed Agents接入這一體系,雙方共同為企業部署AI智慧體提供許可權控制機制。
OpenShell是一套開源智慧體執行時軟體,通過沙箱和許可權策略限定智慧體的活動範圍。輝達表示,該系統可管控智慧體對檔案、網路、程序、工具和憑證等資源的訪問,並預設阻止未經授權的操作。Sentry則把安全控制推進到硬體層,它與執行AI智慧體的主機環境相對獨立,持續檢查智慧體的請求與響應,對資料、工具、API和服務實施訪問控制。輝達稱,Sentry能在毫秒級阻斷可疑活動,若智慧體試圖突破既定的軟體邊界,可將其隔離。相比單純依賴模型自身遵守安全規則,這一架構增加了執行時與硬體兩道額外防護。
Anthropic在此次合作中的角色是提供Claude Managed Agents。該服務將智慧體的執行迴圈放置在獨立伺服器上,與執行具體任務的沙箱環境分離,並與OpenShell及BlueField整合,為企業提供更細粒度的許可權控制。通過憑證保險庫等機制,Claude Managed Agents集中保管智慧體憑據,降低憑據散落帶來的風險。Notion、Rakuten和Asana等企業已在生產環境中使用Claude Managed Agents,意味著企業部署Claude等智慧體時,可在模型之外疊加一套獨立的安全控制機制:智慧體仍可自主執行任務,但其可訪問的資源、可使用的工具,以及出現異常時是否繼續執行,均受額外的軟體與硬體層約束。
此次釋出正值AI智慧體安全問題受到更多關注之際。輝達創始人兼CEO黃仁勳表示,隨著AI能力發展,AI安全能力需要同步推進,並稱AI安全需要全棧工程。輝達並未將安全能力侷限於某一款AI模型,而是延伸至智慧體執行時、伺服器以及網路和計算基礎設施,對企業而言,安全邊界由此從模型本身擴充套件到執行環境。
輝達還稱,此次推出的安全軟體可能阻止近期發生的一起Hugging Face相關事件;根據公司目前掌握的資訊,若當時使用相關技術,該平台可能阻止該事件。這一表態將新平台與真實安全事件掛鉤,也凸顯出智慧體越權操作已從理論風險變為現實問題。
生態參與方面,目前有超過100家機構參與相關技術。除Anthropic外,輝達披露SpaceXAI正將相關平台用於Cursor coding agents和Grok模型,Salesforce和SAP也在推進OpenShell相關整合。參與者橫跨模型廠商、企業軟體與開發工具,顯示智慧體安全正成為多方共建的基礎設施議題。
從產業視角看,隨著AI智慧體從聊天工具轉向能夠呼叫工具、訪問資料並自主執行任務的企業軟體,圍繞智慧體許可權、隔離和即時監控的基礎設施需求持續擴大。輝達以開源平台加專用硬體的組合切入這一環節,並與Anthropic等模型廠商合作,試圖把安全能力納入AI基礎設施體系。對關注AI產業鏈的讀者而言,值得留意的是這一模式能否成為企業智慧體部署的預設配置,以及它對執行時軟體、DPU等硬體環節的帶動效應。