美光(Micron)近日发出警告,称随着大型语言模型(LLM)持续演进,AI 系统的算力正以前所未有的速度成长,但记忆体却已成为限制整体效能的关键,所谓“记忆体墙”危机正在加剧。该公司指出,在 Meta 的 Llama 3 模型训练过程中,HBM(高带宽记忆体)故障导致的中断占比接近两成,凸显了记忆体可靠性对 AI 训练的重要性。

HBM 是 AI 加速卡(如 GPU)中用于高速数据传输的关键记忆体,其带宽与容量直接影响模型训练速度。随着模型参数规模扩大,对 HBM 的需求量激增,但 HBM 的制造难度高,良率与可靠性问题也随之凸显。美光此次示警,将 HBM 故障与训练中断直接挂钩,表明记忆体不仅关乎性能,更关乎训练过程的稳定性。

从产业角度看,这一警告对 AI 基础设施的投资者具有参考意义。HBM 供应商(如 SK 海力士、三星、美光)的产能与良率,将直接影响 AI 算力供给的效率和成本。若 HBM 故障率持续偏高,可能导致训练中断、算力浪费,进而推高 AI 模型的开发成本。同时,这也可能促使业界加大对 HBM 可靠性测试与冗余设计的投入。

值得注意的是,美光并未提供具体的故障率数字,仅以“近两成”描述中断占比,且未说明该数据的具体统计口径。因此,投资者在解读时应保持谨慎,关注后续更多官方披露。总体而言,美光的示警再次提醒市场,AI 产业的瓶颈不仅在于算力,记忆体同样扮演着举足轻重的角色。