OpenAI 的 GPT-6 Astra Ultrafast 已正式上線,可通過 OpenAI API 呼叫,並向符合條件的 ChatGPT Work 與 Codex 使用者開放。該模式執行在輝達 Blackwell GPU 上,依託針對 Blackwell 架構的推理最佳化,token 生成速度最高可達 Astra 標準模式的 8 倍。
對開發者而言,更快的生成速度意味著程式設計智慧體的編輯—測試—除錯迴圈被壓縮,工具呼叫之間等待模型生成響應的時間減少,互動式應用的響應感也隨之提升。這種提速在重複性工作流中價值更明顯:智慧體先寫程式碼、再呼叫工具、檢查結果、決定下一步,每一步都依賴模型快速給出輸出。Ultrafast 把 Astra 的能力帶入這些對時間敏感的迴圈中,而輝達的 AI 基礎設施則幫助 OpenAI 在開發者需要時輸出更多有用的模型結果。
OpenAI 推理負責人 Philippe Tillet 表示,輝達在工具鏈與文件上的深度投入,使 OpenAI 的模型在編寫 Blackwell 與 Rubin GPU 程式方面表現突出;Astra 能把這種知識轉化為高效能核心,讓輝達硬體在延遲、吞吐與成本的前沿區間都具備吸引力,而 Astra Ultrafast 則讓智慧體在寫程式碼、用工具、處理複雜任務時獲得更快的模型響應。
效能提升並不止步於模型部署。OpenAI 正在用自家模型幫助改進執行在輝達 GPU 上的推理軟體,利用平台的可程式設計性測試並落地最佳化。這種持續工作可以讓模型響應隨時間變得更快,也讓已部署的基礎設施產出更高。OpenAI 計算技術長 Uday Ruddarraju 表示,與輝達的合作讓 AI 更快、更有用,OpenAI 用內部模型優化了輝達 GPU 上的推理,而輝達的可程式設計性幫助實現了 Astra Ultrafast 背後的加速。
可程式設計的輝達平台還讓開發者與研究人員在模型演進過程中複用訓練、推理與強化學習的基礎設施。這種靈活性有助於團隊在需求變化時重新調配算力資源,提高利用率,避免為每種工作負載過度配置。開發者即日起可通過 API 使用 GPT-6 Astra Ultrafast,訪問方式、定價與實現細節可參考 Ultrafast 指南。
從產業角度看,這條訊息的核心不只是“更快”,而是前沿模型廠商與 GPU 廠商在推理層的協同正在加深:模型側用自身能力去最佳化底層核心,晶片側則通過可程式設計性承接這種最佳化。對關注 AI 算力與資本敘事的人來說,它提供了一個觀察視窗——推理效率的提升既可能降低單位呼叫成本,也可能因為應用場景擴張而推高總算力需求,兩種力量如何平衡,將影響輝達及其產業鏈上下游的長期需求結構。