Meta在今年的Hot Chips半导体大会上详细披露了其首款生成式AI加速器MTIA 400的架构细节。这款芯片并非单纯面向大语言模型(LLM)训练,还承担着广告推荐系统的推理任务,展现出“双重性格”。MTIA 400的定位与多数自研AI芯片不同——它主要瞄准LLM训练,而非仅做推理。Meta此前自研的AI加速器主要用于广告推荐,而MTIA 400则首次将训练与推理功能结合,但推理部分并非针对生成式AI,而是运行广告推荐模型(DLRM),后者是Meta收入的主要来源。

MTIA 400采用异构多芯粒架构,包含两个计算芯粒、两个I/O芯粒和一个SoC芯粒,用于主机连接和工作负载编排。计算芯粒基于3nm工艺(推测来自台积电),每个芯粒拥有6x8的处理单元阵列,合计算力达12 petaFLOPS(MXFP4精度,1.7 GHz)。据Meta数据,该芯片在高精度训练场景下比英伟达顶配Blackwell加速器快约20%,功耗相近。然而,与英伟达Rubin和AMD Instinct MI455X相比,MTIA 400分别慢3倍和3.3倍。

内存方面,MTIA 400配备8个36GB的HBM3e堆栈,总容量288GB,带宽约9.2 TB/s,比英伟达和AMD上一代产品快约15%,但不足其新一代GPU带宽的一半。这解释了为何Meta将其定位为训练芯片——在LLM推理上,Meta有更优选择。芯片还通过一对I/O芯粒提供1.2 TB/s的RDMA芯片间带宽,推测采用以太网传输(鉴于博通的参与)。

系统层面,每个计算刀片集成4个MTIA 400,通过PCIe交换机连接x86 CPU和扩展NIC。单个机架配备18个计算刀片和8个交换刀片,共72个加速器组成统一域。Meta尚未透露最大集群规模,仅称支持“数千加速器扩展”,但机架级性能已可与英伟达GB200和GB300系统媲美。

Meta已在开发推理优化版MTIA 450,计划2027年量产,将内存带宽翻倍(可能换用HBM4),适合运行基于LLM的推荐模型。此外,MTIA 500也定于2027年发布,预计增加4个HBM4堆栈,内存带宽再提升50%,并加倍计算芯粒数量。

尽管MTIA系列在Meta生成式AI工作负载中角色日益重要,但其自研芯片短期内不太可能取代AMD或英伟达GPU。后者在LLM推理上更成熟,Meta Superintelligence Labs仍依赖它们训练前沿模型(如Muse Spark)。专用硬件更适合成熟工作负载,Meta的加速器也不例外。