AI基础设施提供商Crusoe与AI研究机构Thinking Machines Lab于2026年9月23日宣布,双方达成一项价值6500万美元的年度协议,Thinking Machines Lab将把其开源模型的生产推理工作负载迁移至Crusoe Cloud。

根据协议,Thinking Machines Lab将通过Crusoe托管推理服务(Crusoe Managed Inference)运行一系列生产任务,涵盖其Inkling模型GLM 5.2与5.3,以及该实验室自行微调的模型变体。这些工作负载将运行在一套专用的定制部署(Tailored Deployment)上,底层硬件为英伟达HGX B200系统,并通过英伟达Quantum-2 InfiniBand网络互联,整体设计目标是实现高吞吐、高性价比的大规模推理服务。

Crusoe将直接运营并支持该集群。这种定制部署模式提供专用、经过基准测试且带有服务等级协议(SLA)保障的端点,使Thinking Machines Lab无需自行管理推理技术栈,即可获得所需的性价比与扩展空间。双方还计划将合作扩展至批量推理领域,用于大规模合成数据生成,从而把推理环节转化为研究迭代的飞轮。

Thinking Machines Lab的机器学习基础设施负责人Myle Ott表示,Crusoe托管推理服务帮助团队快速从评估阶段进入生产阶段,并达到了该实验室对自有系统的标准,使其能够获得规模与经济性,从而将资源重新投入核心研究。Crusoe Cloud产品管理高级副总裁Erwan Menard则指出,Thinking Machines Lab拥有非常成熟的工程团队,对合作伙伴的要求很高;Crusoe的AI工程师团队打造托管推理服务,正是为了以服务形式提供高性价比、可靠的基础设施、推理能力与模型生命周期工具,让创新企业能够大规模运行其偏好的模型。

从产业视角看,这笔交易反映出两个值得关注的趋势。其一,开源模型实验室正越来越多地将推理环节外包给专业基础设施商,而非全部自建。推理与训练不同,更强调单位成本、吞吐量和稳定性,自建推理栈对工程团队的持续投入要求很高。Thinking Machines Lab选择托管模式,说明在模型能力竞争之外,推理的经济性正成为实验室运营的关键考量。其二,Crusoe披露,Thinking Machines Lab的加入使其托管推理服务的合同年度经常性收入(ARR)在上线不到一年内突破1亿美元。这一数字表明,面向AI推理的托管服务正在形成可观的商业规模,也意味着算力租赁市场的竞争正从单纯的GPU供给,向包含模型生命周期工具在内的服务化能力延伸。

对上游算力供应链而言,协议明确采用英伟达HGX B200与Quantum-2 InfiniBand,显示高端GPU与高速网络仍是生产级推理部署的主流选择。对Crusoe这类垂直整合的基础设施商来说,能否持续吸引头部模型实验室,将取决于其能否在价格、可靠性与扩展性之间保持平衡。而Thinking Machines Lab将推理外包后,能否把节省的工程资源转化为更快的模型迭代,则是这笔交易对其研究节奏的实际影响所在。