推理芯片赛道正在快速升温。过去几年,推理消耗的token呈爆炸式增长,token经济随之成型,专用推理芯片成为兵家必争之地。据硅谷101的一档对话节目梳理,英伟达去年年底以约200亿美元与AI芯片公司Groq达成技术授权协议,并吸纳其创始人Jonathan Ross等核心团队,被外界视为一次变相收购;做晶圆级大芯片的Cerebras今年6月完成IPO,市值达到670亿美元;OpenAI则联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅用了9个月。加上此前已布局的谷歌TPU,推理芯片牌桌上的玩家越来越多。
这场竞争的核心问题在于:各家真正比拼的是什么?为什么会走向不同的技术路径?
参与对话的两位AI芯片创业者——负责推理芯片硬件与系统架构的Mark,以及负责软件和编译器的子扬——从训练与推理的本质差异切入。Mark指出,训练本身没有直接回报,投入训练是在赌一个最强模型,再靠未来推理收回成本;而推理的商业逻辑很直接:用户愿意为每100万个token付多少钱,推理这100万token要花多少成本。因此推理追求的是性价比,而非极致性能。
从技术层面看,推理分为prefill和decode两个阶段。prefill阶段有充足并行度,可以把模型从HBM读入计算单元后同时处理大量token;但decode阶段必须逐个生成token,每生成一个token都要把整个模型权重从存储介质读一遍。这意味着推理对算力和带宽的需求与训练有本质不同。
GPU的应对方式是batching——收集上万个用户的推理任务并行处理。但这导致单个用户感受到延迟:你不仅在等自己的token,还在等同一批里其他用户的token。Mark认为,未来理想的推理系统可能包含多种不同芯片,把decode过程做得足够便宜、足够快,这可能需要打破GPU传统架构,使用不同于HBM的存储介质。
对话中重点讨论了SRAM、DRAM和HBM三种存储介质的取舍。DRAM容量大但离计算单元远、速度慢;HBM把DRAM搬到计算芯片旁边,容量大速度快,但价格昂贵且产能紧张;SRAM可以直接做在计算芯片内部,速度最快,但存储同样数据所需芯片面积是DRAM的几十倍甚至上百倍。
子扬指出,Groq和Cerebras的速度与性价比本质上都来自SRAM,尽管它们并未着重强调这一点。其他美国AI推理芯片公司如d-Matrix、MatX也在往SRAM方向走,谷歌TPU和亚马逊Trainium每一代SRAM也都在变大。从带宽角度看,SRAM无论绝对数量还是每块钱买到的性价比都非常高,行业正在向这个方向收敛。
但SRAM的代价是单芯片容量低,可能比HBM低两个数量级。解决办法是把系统做得更大——用几百甚至几千个芯片来容纳全部模型权重。然而系统变大后,瓶颈就卡在通信上。
在解决大集群通信调度问题上,Groq和Cerebras走向了不同路线。Groq的思路是把调度放在运行之前,由编译器在编译时把未来芯片系统里所有计算和通信都排布好,运行时就没有调度问题。Cerebras则更直接:把一个柜子里几百个芯片的事情塞到一整块晶圆上,物理距离和线的带宽自然更好。
但两位嘉宾指出,这两家公司在做技术决策时,Transformer还没有出现,它们没有足够信息判断未来需要面向什么样的workload优化。Cerebras面临的大挑战是如何控制整个晶圆的良率和成本;Groq则是在选择依靠编译器做完全静态调度时,无法预知如今Transformer推理中如此大的动态性——比如MoE(混合专家模型)的产生。
子扬解释,MoE网络有非常多专家,每个token推理时会激活其中一小部分,这个选择在运行时决定,编译时无法预测。单颗SRAM无法把整个网络放进去,必然出现专家分布在不同芯片上的调度问题。静态调度面对这种动态性时,要么保守地把所有专家都送过去导致部分芯片空转,要么换一种方式切分模型,但后者很难做到高效。
不过,这种trade-off只影响性价比,不影响速度。当前市场对Groq和Cerebras的定位就是快,性价比尚未被充分讨论。如果推理速度能比别人快几倍,就可以为此收取溢价。Mark也提到,从商业角度讲,如果别人愿意为更快买单,你不会主动告诉别人你的成本其实更便宜。
关于Groq创始人Jonathan Ross——他也是谷歌TPU的核心设计者之一——子扬指出,Groq的整个思路是围绕编译器展开的。Ross本人曾是编译器团队的负责人,他出来创业的思路就是把确定性编译做好,然后围绕这个编译去设计硬件,从静态编译和静态调度出发重新设计芯片架构。
这场对话还涉及了英伟达首席科学家Bill Dally的设计哲学。作为现代GPU并行架构最重要的奠基者之一,Dally的思考方式通过其学生Mark的视角被呈现出来,为理解当前推理芯片的技术分歧提供了一个更深层的背景。