Cloudera 與 VAST Data 於 2026 年 7 月 14 日正式宣佈達成戰略合作,雙方將聯手打造一個統一的 AI 工廠。這是一個可擴充套件的生產環境,旨在讓企業能夠持續地將資料攝取、精煉、治理並最終交付給 AI 模型進行訓練和推理,且該環境可在本地資料中心與公有云之間無縫執行。
此次合作的核心在於將 Cloudera 的下一代容器化資料服務與 VAST AI 作業系統進行深度整合。VAST 的作業系統集成了高效能儲存、資料庫及全域性名稱空間能力,專門用於驅動大規模 AI、分析及關鍵任務工作負載。值得注意的是,這一資料平台層基於 輝達 AI 資料平台參考設計構建,能夠將企業沉寂的資料轉化為可供 AI 工廠使用的就緒資料。
當前,許多企業在部署生成式 AI 和智慧體 AI 時,正面臨一個嚴峻挑戰:傳統架構無法支撐從資料準備、訓練到推理、分析的持續 AI 管道。這直接導致了 GPU 飢餓現象——昂貴的加速器叢集因等待資料而大量閒置。Cloudera 與 VAST Data 的聯合解決方案正是針對這一痛點,通過構建高吞吐、低延遲的資料管道,確保 GPU 能夠持續獲得資料供給,從而大幅提升計算效率與投資回報率。
從技術架構看,Cloudera 提供的湖倉一體架構具備可移植的容器化資料服務,涵蓋資料工程、流處理、分析、機器學習等多個層面,能一致地部署在混合雲和多雲環境中。而 VAST 的分離式共享一切架構則作為其 AI 作業系統的基石,可提供 EB 級資料基礎設施,並集成了基於 NVIDIA cuVS 的 GPU 加速向量資料庫服務,以最佳化向量索引與搜尋效能。
雙方結合後,VAST 的 AI 作業系統藉助輝達加速計算將企業資料啟用,Cloudera 則在其上提供資料工程、分析、治理與 AI 服務。最終交付的是一套從原始資料攝取到模型部署的統一 AI 工廠架構。該架構支援在資料中心、私有云和公有云等任何位置的統一運維,通過超高頻寬、低延遲的資料管線消除 GPU 飢餓,確保持續的高利用率,併為結構化、非結構化和多模態資料集提供可擴充套件的卓越儲存效能,同時滿足企業治理與合規要求。
這一合作還進一步推動了私有 AI 工廠解決方案的構建。通過將輝達 AI 基礎設施、NVIDIA AI Enterprise 軟體、VAST AI 作業系統以及 Cloudera 的企業資料與 AI 服務整合,形成一個針對私有和主權 AI 最佳化的方案。其中,由 NVIDIA NIM 微服務加速的 Cloudera AI 推理服務,允許企業在自有資料所在地部署和擴充套件任意模型,包括最新的 NVIDIA Nemotron 開放模型。此外,客戶還能借助 NVIDIA cuDF 加速 Apache Spark 工作負載,讓 Spark 任務通過 GPU 加速處理透明地利用 VAST 的高吞吐資料服務,進一步最佳化 AI 工作負載。
對於大型企業,尤其是受嚴格監管的行業而言,這相當於提供了一個從晶片到應用的完整解決方案,使其能夠在任何地方構建生產級 AI 系統。Cloudera 首席商務官 Abhas Ricky 指出,企業在 GPU 上投入了數十億美元,卻常因資料瓶頸而難以實現充分利用,此次合作正是為了消除這一障礙,構建真正的 AI 工廠。VAST Data 聯合創始人 Jeff Denworth 則強調,多數企業已擁有 AI 所需的資料,挑戰在於如何釋放其價值,以建立持續的推理、微調與分析管道。
據悉,雙方聯合打造的 AI 工廠解決方案目前已通過兩家公司的企業銷售團隊及合作伙伴生態即時可用,相關的參考架構、驗證部署模式及行業特定解決方案將在 2026 年全年持續擴充套件。兩家公司合計管理著 60 EB 的客戶資料,這一龐大的資料基礎為雙方及其客戶開啟了顯著的新增長機會。