在Hot Chips 2026大会上,谷歌详细介绍了其第八代张量处理单元(TPU)家族,包括用于训练的TPU 8t和用于推理的TPU 8i。这一发布标志着谷歌在自研AI硬件上的持续投入,使其成为少数同时开发训练和推理芯片超大规模云厂商之一。

谷歌的TPU发展历程可追溯至第一代PCIe推理卡,此后在训练和推理优化芯片之间交替迭代。据谷歌介绍,训练过程中的前向传播约有三分之一也属于推理,因此两代芯片的设计经验相互借鉴。多年来,谷歌声称其TPU性能已提升一百万倍

本次发布的TPUv8家族有两个显著特点:一是首次在单一年份推出两款芯片,而非交替发布;二是设计时更多考虑云客户的工作负载,而不仅限于内部任务。谷歌指出,混合专家(MoE)模型带来了新的瓶颈,因为其通信和网络流量远高于早期模型,单纯提升FLOPS已不足以应对。此外,新硬件针对agentic AI长上下文窗口进行了优化。

在推理芯片TPU 8i的设计上,谷歌强调了推理对HBM带宽和SRAM比例的更高需求。与训练芯片相比,8i芯片尺寸更大,配备8个HBM堆栈,而训练芯片8t为6个。谷歌还为其配备了更多SRAM、内存和带宽,以应对低延迟推理场景下的性能挑战。

TPU 8i支持多种网络拓扑,其中BoardFly拓扑由8个托盘、每个托盘4个TPU组成,共36组。与之前用于训练的3D Torus网络相比,Fly网络延迟更低,8i的BoardFly网络最大跳数为7跳,而Torus为16跳。此外,8i设计中的集体加速引擎在靠近网络硬件的ICI I/O die中处理网络内集合操作,避免了数据传输到计算die的时间和HBM访问开销。

在训练芯片TPU 8t方面,谷歌表示训练优化难度大,但公司不愿妥协,因此坚持开发专用训练芯片。8t超级节点包含9600颗芯片,提供2PB共享HBM内存和121 EFLOPS的FP4算力,能效约为上一代TPUv7 Ironwood的两倍。不过,并非所有运算都适合FP4,因此芯片还需高效处理混合精度训练。

值得注意的是,TPU 8i与谷歌自研的Axion CPU搭配使用,比例为2:1,取代了此前使用的x86 CPU,这标志着谷歌在硬件上全面转向自研和Arm架构。这一举措进一步减少了对外部供应商的依赖。

谷歌的TPUv8发布对AI芯片市场具有深远影响。作为少数自研训练硬件的超大规模云厂商,谷歌的持续投入可能加剧与英伟达等主流GPU供应商的竞争,同时为云客户提供更多算力选择。分析人士认为,谷歌在推理芯片上的优化(如高带宽、低延迟网络)反映了AI工作负载从训练向推理转移的趋势,这对整个AI基础设施的构建方式具有启示意义。