推理基礎設施公司 Baseten 宣佈完成 130 億美元 F 輪融資,成為 AI 基礎設施領域新一批“十角獸”公司之一。該公司專注於推理工程,致力於將訓練好的模型轉化為快速、可靠且成本可控的生產級 API。在最新一期播客中,Baseten 的 Philip Kiely 與 Ali Taha 詳細探討了推理工程的核心技術與挑戰,並分享了他們如何應對開源模型釋出後的工程落地問題。
推理工程作為一個獨立學科,其核心問題與模型訓練截然不同:如何將訓練得到的權重轉化為一個在規模上快速、可靠且經濟實惠的產品?這涉及全新的最佳化問題。在近期的一次 GLM-5.2 實驗中,研究人員發現,對模型進行更多量化處理反而能保持基準質量,同時將吞吐量提升 20%,原因是不同層引入的誤差可以相互抵消。這表明推理最佳化仍有巨大潛力,有時能帶來 20%、100% 甚至 200% 的效能提升。
在技術層面,推理系統需要處理諸如 200,000 token 的請求,涉及快取感知路由、KV 快取複用、分離式預填充與解碼、投機解碼、模型並行、GPU 核心最佳化等一系列複雜問題。Baseten 團隊還分享瞭如何在不改變底層語言模型的情況下,將 Kimi 的視覺編碼器嫁接到 GLM-5.2 上,以及如何通過最佳化服務使模型速度提升高達 10 倍。
推理工程不僅限於大語言模型,還擴充套件到 NVIDIA Dynamo、mega kernels、Rubin 晶片、AI 專用晶片、本地推理、影片生成等領域。影片生成面臨巨大的計算障礙,尤其是長影片的連貫性生成。當前開源影片生成模型仍落後於 Veo、Kling 等閉源模型,部分原因在於長影片背後的二次方注意力瓶頸。未來影片系統可能結合自迴歸與擴散架構,以解決即時生成和質量漂移問題。
推理與訓練的界限正在模糊,出現了“為推理而訓練”和“為訓練而推理”的趨勢。通過持續的後訓練、部署、評估和改進迴圈,模型可以不斷最佳化。例如,GLM-5.2 幫助優化了服務於自身的核心,而更快的網路連線有望大幅加速解碼過程。持續學習、KV 快取壓縮和持久模型記憶也成為推理工程的前沿方向。
Baseten 的融資與推理工程的興起,反映了 AI 基礎設施領域正在經歷深刻變革。隨著模型規模擴大和應用場景多樣化,推理效率成為決定 AI 產品競爭力的關鍵因素。Baseten 等公司的實踐表明,推理工程已從輔助環節轉變為獨立且至關重要的工程學科,其最佳化空間巨大,對 AI 產業鏈的算力部署、模型服務模式和成本結構都將產生深遠影響。