大模型进入推理密集期后,算力的衡量方式正从关注训练峰值转向单位Token的性价比。在这一背景下,国产AI芯片厂商中昊芯英在WAIC期间发布了第二代自研TPU芯片“须臾”,并宣布华东地区首个国产TPU智算千卡集群在杭州落成。
须臾是中昊芯英的第二代产品,混合精度浮点算力达到896TFLOPS,8-bit推理算力达到1792TOPS,整体性能约为上一代芯片的三倍,单芯片额定功耗为600W。中昊芯英联合创始人、CTO郑瀚寻将性能提升归因于计算流水线重构、双芯粒同基板封装,以及片上存储容量和带宽的提升。目前,该芯片已完成Qwen、DeepSeek、GLM等主流开源模型的基础适配,并能在新模型发布后较快跑通流程。
TPU(张量处理单元)最初由谷歌在2016年公开,专为深度学习中的张量计算设计,牺牲了一部分通用性以换取在特定任务中的计算密度和能效表现。与GPU最初为图形渲染设计不同,TPU从一开始就瞄准AI负载。当前大模型推理正走向PD分离——将处理输入内容的Prefill阶段与逐Token输出的Decode阶段拆开调度,前者需要快速处理大量上下文,后者更看重持续输出和低延迟。中昊芯英创始人、CEO杨龚轶凡指出,将两种任务放在同一套资源里运行容易出现资源闲置或排队,拆开后集群可以围绕不同负载进行更细致的配置,这正是TPU再次获得关注的原因。
此次落成的杭州国产TPU千卡集群,由杭州电信、中兴通讯和中昊芯英共同建设,面向大模型训练、推理和科学计算等场景提供算力服务,也是中国电信体系内首个大规模国产TPU集群部署项目。运营商正在经历角色变化:过去客户租用服务器、存储和带宽,现在越来越多企业希望直接获得模型调用能力或按Token购买服务。杭州电信并未将TPU视为唯一选择,其现有布局中同时包含GPU算力池,也在探索其他国产芯片路线。未来的智算中心很可能长期保持异构状态,芯片架构各自承担擅长的任务,运营商负责将底层资源组织成面向用户的服务。
这种模式对集群调度提出了更高要求。杭州电信方面透露,经过数月软硬件调优,TPU集群的Token输出效率较年初提升超过10倍。这一数据是系统优化的综合结果,模型版本、算子实现、服务器配置、网络带宽和调度方式都会影响最终能交付的有效Token数量。中兴通讯承担网络和系统集成能力,千卡集群向万卡规模扩展时,芯片之间的连接会迅速成为瓶颈——计算能力提升得越快,通信、存储和散热越容易拖住整体效率。
国产TPU要进入市场,既要解决芯片本身的性能问题,也要回答开发者如何迁移、模型如何适配、客户如何调用的问题。GPU生态长期占据主导,CUDA工具链和开发习惯构成了很高的迁移门槛。中昊芯英方面表示,基础适配和商业化效果之间仍有距离,要把模型的吞吐量、延迟和成本调到可用水平,往往需要围绕算子、编译工具和调度策略持续优化。谷歌TPU的经验说明,专用芯片的价值往往建立在完整的软硬件体系之上,对于国内厂商而言,芯片研发、量产交付和软件生态仍需同步推进。