美光(Micron)近日發出警告,稱隨著大型語言模型(LLM)持續演進,AI 系統的算力正以前所未有的速度成長,但記憶體卻已成為限制整體效能的關鍵,所謂“記憶體牆”危機正在加劇。該公司指出,在 Meta 的 Llama 3 模型訓練過程中,HBM(高頻寬記憶體)故障導致的中斷佔比接近兩成,凸顯了記憶體可靠性對 AI 訓練的重要性。
HBM 是 AI 加速卡(如 GPU)中用於高速資料傳輸的關鍵記憶體,其頻寬與容量直接影響模型訓練速度。隨著模型引數規模擴大,對 HBM 的需求量激增,但 HBM 的製造難度高,良率與可靠性問題也隨之凸顯。美光此次示警,將 HBM 故障與訓練中斷直接掛鉤,表明記憶體不僅關乎效能,更關乎訓練過程的穩定性。
從產業角度看,這一警告對 AI 基礎設施的投資者具有參考意義。HBM 供應商(如 SK 海力士、三星、美光)的產能與良率,將直接影響 AI 算力供給的效率和成本。若 HBM 故障率持續偏高,可能導致訓練中斷、算力浪費,進而推高 AI 模型的開發成本。同時,這也可能促使業界加大對 HBM 可靠性測試與冗餘設計的投入。
值得注意的是,美光並未提供具體的故障率數字,僅以“近兩成”描述中斷佔比,且未說明該資料的具體統計口徑。因此,投資者在解讀時應保持謹慎,關注後續更多官方披露。總體而言,美光的示警再次提醒市場,AI 產業的瓶頸不僅在於算力,記憶體同樣扮演著舉足輕重的角色。