AI行业正掀起一场“造芯大战”,多家头部公司纷纷投入自研芯片,以应对推理需求爆发带来的算力压力。据The Information 7月20日报道,谷歌正在研发一款内部代号“Frozen v2”的服务器芯片,计划将Gemini模型的部分架构直接固化进硅片,以提升推理效率。而在一个月前的6月24日,OpenAI亮出了与博通联合研发的首款推理芯片Jalapeño,从设计到流片仅耗时九个月。此外,Anthropic、智谱、DeepSeek等公司也被传正在进行相关布局。
然而,并非每家公司都有资金和能力重造芯片,因此一个新兴市场正引发资本和巨头关注:AI Infra(人工智能基础设施层)。其核心逻辑是,已部署的数据中心和GPU仍存在优化空间,通过提升利用率来释放更多算力。这一赛道已涌现出高增长案例:AI推理平台Baseten一年收入增长20倍,估值从21亿美元暴涨至130亿美元;同赛道的Fireworks七个月内估值翻四倍,达到175亿美元,年化营收突破10亿美元。最近,开源推理引擎“双子星”vLLM和SGLang先后宣布商业化,种子轮融资均超过1亿美元,背后聚齐了AI产业几乎所有巨头和顶级风投,预示着强强对决的大幕拉开。
大模型的重心正从训练转向推理,这对算力提出完全不同的要求。训练成本虽高,但任务结束后即告一段落;而推理则不同,无论是Chatbot还是Agent,AI应用越多,GPU需要处理的请求就越频繁且不间断,推理需求随之爆发性增长。RadixArk联合创始人朱邦华指出,随着新应用增多,推理总量将远大于过去,目前市面上几乎每家都缺卡。对于资金雄厚的巨头,最直接的办法是继续建数据中心、采购更多GPU。Meta、Google、Microsoft等科技巨头持续提高资本开支,今年合计预计超过1万亿美元;黄仁勋预测,到2030年全球AI基础设施年投资规模将达到4万亿美元。
但华尔街对此表示担忧。前微软能源战略经理、突破能源科研总监Ethan Xu指出,过去互联网泡沫破裂时,大量资金投入光纤和互联网公司,虽长期实现价值,但短期出现严重问题。因此,在无法短期内大规模增加算力的情况下,提高GPU利用率成为关键,这背后就是AI Infra产业。
GPU利用率问题源于AI系统架构的复杂性。卡内基梅隆大学(CMU)今年4月发布的研究,对一个大型学术AI集群中756块GPU进行了31天细粒度遥测,覆盖A6000、L40S、A100、H100到B200等六种型号,发现GPU常处于“execution-idle”(执行时空转)状态,整体近20%的执行时间和约11%的能耗浪费在等待上。推理场景更为严重,Azure Code负载高达65%的能耗消耗在空转上,OpenAI的Chat类请求也达52%。
AI Infra分为四层:能源基础设施(电)、计算硬件(GPU、HBM、NVLink等)、系统软件(CUDA、编译器、通信库等)和服务编排(推理引擎、调度等)。能源和硬件是“硬”问题,改造周期以年计且优化空间见顶;系统软件和服务编排是“软”问题,本质是工程和算法问题,优化可带来数倍性能提升。行业注意力正快速向这两层“软”问题转移。RadixArk技术成员陈震林表示,尽管成本主要发生在物理层,但大部分工作应放在软件层和服务编排,因为人力投入能带来最大优化可能性。
以一台NVIDIA GB200 NVL72机柜为例,采购成本约400万美元,若软件栈调度优化不足,GPU实际利用率可能仅50%,相当于浪费200万美元。若将利用率从50%提升至90%以上,效果等同凭空多出一台机柜。因此,软件层优化已成为直接商业问题。Anthropic员工中占比最大的已是AI Infra相关工程师,其推理团队约200多人,通过优化成本和性能,直接助力公司营收在二季度实现盈利。OpenAI、Anthropic和谷歌将AI Infra团队放在内部,作为竞争壁垒;而较小模型团队或初创公司则依赖开源框架SGLang与vLLM。
优化工作主要围绕四个问题:哪些计算不用重做、哪些等待可消除、哪些算力未吃满、哪些资源未协同。vLLM因提出PagedAttention受关注,强调通用推理部署;SGLang则从推理执行流程出发,强调计算复用和系统级优化。核心优化技术包括KV Cache复用、缓存感知调度、淘汰机制和分布式缓存感知负载均衡,可显著减少重复计算和等待。此外,连续批处理(Continuous Batching)能让GPU吞吐量提升2到4倍,Prefill/Decode分离则将读入和生成阶段拆分到不同GPU,避免互相拖累,DeepSeek已采用此方案。
随着AI应用深入,GPU利用率优化已成为千亿级市场,吸引资本和巨头竞逐,未来竞争将更加激烈。