推理基础设施公司 Baseten 宣布完成 130 亿美元 F 轮融资,成为 AI 基础设施领域新一批“十角兽”公司之一。该公司专注于推理工程,致力于将训练好的模型转化为快速、可靠且成本可控的生产级 API。在最新一期播客中,Baseten 的 Philip KielyAli Taha 详细探讨了推理工程的核心技术与挑战,并分享了他们如何应对开源模型发布后的工程落地问题。

推理工程作为一个独立学科,其核心问题与模型训练截然不同:如何将训练得到的权重转化为一个在规模上快速、可靠且经济实惠的产品?这涉及全新的优化问题。在近期的一次 GLM-5.2 实验中,研究人员发现,对模型进行更多量化处理反而能保持基准质量,同时将吞吐量提升 20%,原因是不同层引入的误差可以相互抵消。这表明推理优化仍有巨大潜力,有时能带来 20%100% 甚至 200% 的性能提升。

在技术层面,推理系统需要处理诸如 200,000 token 的请求,涉及缓存感知路由、KV 缓存复用、分离式预填充与解码、投机解码、模型并行、GPU 内核优化等一系列复杂问题。Baseten 团队还分享了如何在不改变底层语言模型的情况下,将 Kimi 的视觉编码器嫁接到 GLM-5.2 上,以及如何通过优化服务使模型速度提升高达 10 倍

推理工程不仅限于大语言模型,还扩展到 NVIDIA Dynamo、mega kernels、Rubin 芯片、AI 专用芯片、本地推理、视频生成等领域。视频生成面临巨大的计算障碍,尤其是长视频的连贯性生成。当前开源视频生成模型仍落后于 VeoKling 等闭源模型,部分原因在于长视频背后的二次方注意力瓶颈。未来视频系统可能结合自回归与扩散架构,以解决实时生成和质量漂移问题。

推理与训练的界限正在模糊,出现了“为推理而训练”和“为训练而推理”的趋势。通过持续的后训练、部署、评估和改进循环,模型可以不断优化。例如,GLM-5.2 帮助优化了服务于自身的内核,而更快的网络连接有望大幅加速解码过程。持续学习、KV 缓存压缩和持久模型记忆也成为推理工程的前沿方向。

Baseten 的融资与推理工程的兴起,反映了 AI 基础设施领域正在经历深刻变革。随着模型规模扩大和应用场景多样化,推理效率成为决定 AI 产品竞争力的关键因素。Baseten 等公司的实践表明,推理工程已从辅助环节转变为独立且至关重要的工程学科,其优化空间巨大,对 AI 产业链的算力部署、模型服务模式和成本结构都将产生深远影响。