AI算力硬件的竞争焦点正从训练转向推理。随着产业重心向推理环节迁移,定制化专用硬件获得更多市场关注:AMD收购推理芯片企业Taalas,Etched完成新一轮大额融资,多家AI实验室也启动自研芯片项目,专用ASIC的需求正在快速升温。
训练阶段需要处理多样化的算法结构与海量数据,GPU凭借并行计算能力和可编程性占据主导。其核心价值在于灵活性——一套硬件架构可同时适配训练与推理,覆盖多种网络模型,配套成熟的软件生态也降低了开发者的迁移成本。但通用性的另一面是电路存在大量冗余,面对固定、大规模的推理任务时,能效表现受限。
推理阶段则具备高度重复性与规模化特征:同一模型架构被反复调用,计算模式相对固定,这为专用集成电路(ASIC)留出空间。定制ASIC针对特定工作负载深度定制,剔除多余计算单元,在目标场景下可实现更高吞吐与更优功耗。代价是硬件能力被限定在特定模型架构,跨场景适配薄弱,一旦算法大幅迭代,芯片价值就会受到冲击。
两条路线并无绝对优劣,而是面向不同业务诉求的技术取舍。头部厂商已开始调整产品定位:英伟达收敛产品方向,聚焦4位至32位不同精度区间的AI工作负载;AMD则保留FP64高精度运算能力,面向高性能计算客户维持完整通用算力,在通用GPU框架下做出差异化侧重。
在推理ASIC赛道上,初创企业已完成从技术原型到实际部署的跨越。被AMD收购的Taalas推出HC1示范芯片,主打高速Token生成能力,在Llama 3.1-8B模型上实现很高的生成速度,但几乎牺牲了通用适配能力。AMD计划将这款ASIC集成至Helios整机机架,与Epyc CPU、Instinct GPU搭配形成异构算力方案,并依托ROCm.ai补齐软件整合能力,把专用加速单元嵌入既有通用算力体系。
Etched同样代表Transformer定向优化ASIC的方向。该公司已完成7亿美元新一轮融资,估值攀升至210亿美元,量化机构Jane Street成为其首位落地客户,首套机架已完成出货并投入部署,同时手握超过10亿美元订单,覆盖云厂商与前沿AI机构。其Sohu芯片专为Transformer系列模型设计,可兼容该架构下多款大模型,却无法运行CNN、LSTM等其他类型网络。Etched宣称在Llama 70B推理任务上实现很高吞吐性能,并推进机架、软件、制造工艺的协同设计,提出低电压推理、集群级内存等技术理念,希望从集群层面改善内存共享与整体运行效率。
AI原生企业与公有云服务商也在加速定制硬件布局,不再单纯依赖外部采购通用GPU。OpenAI披露与博通、Celestica合作开发的Jalapeno推理处理器,后续将释放更多性能细节。Anthropic传出与三星洽谈合作,计划利用其2纳米制程与封装技术开发AI训练芯片;即便推进自研,企业仍会继续采购英伟达、谷歌、亚马逊的算力产品,保持算力供给的多元结构。
各大公有云平台早已完成自研芯片的落地积累:谷歌云的TPU、AWS的Trainium以及微软云的Maia,已形成成熟产品矩阵,服务内部与外部客户。随着AI行业投资逐步回归商业回报,推理环节的成本压力凸显,如何充分释放硬件效能,已成为芯片设计领域新的竞争焦点。
推理算力的竞争并不意味着ASIC将全面取代通用GPU,二者更多是互补共存的关系。通用GPU依靠灵活生态,承接多变的模型迭代与训练任务;定制ASIC在负载稳定的大规模推理场景释放能效优势,却要承担算法迭代带来的技术风险。从芯片初创企业到AI巨头、云服务商,市场参与者正根据自身业务定位选择不同组合策略,异构算力架构预计将成为接下来一段时间行业的主流形态。未来硬件路线的走向,既取决于ASIC产品持续的实际性能验证,也取决于大模型技术演进节奏,整个算力产业将在通用与定制之间持续寻找新的平衡。