8月26日,中国AI大模型企业MiniMax(稀宇科技)发布了其自港股上市以来的首份半年报。财报显示,公司收入同比增长283.1%,半年收入已达到2025年全年收入的1.5倍毛利同比增长464.8%。在随后的财报会上,创始人、董事会主席、CEO、CTO闫俊杰透露,8月公司ARR(年度经常性收入)突破8亿美元B端收入占比达到80%,7月的Token消耗量是1月的20倍。这些数据表明,MiniMax在商业化与规模扩张上均取得显著进展。

闫俊杰在业绩会上提出一个核心观点:“只有最小化单位智能成本,才有可能最大化智能水平。”这背后是过去两年大模型行业面临的普遍困境:遵循Scaling Law堆参数以提升智能,往往导致推理成本高企;而追求低成本普惠,又常以牺牲智能水平为代价。行业一度默认这是“鱼和熊掌不可兼得”的取舍。

当前,大模型行业确实分化出两条路径。一边是谷歌等厂商推出的轻量化小模型,如2026年7至8月发布的Gemini 3.7 FlashGemini 3.6 Flash等,主打速度快、成本低,但智能表现中规中矩,甚至旗舰产品Gemini 3.5 Pro至今未发布。另一边是国产大模型厂商在超大参数路线上狂奔,例如月之暗面Kimi K3(参数约2.8万亿)、阿里Qwen3.8 Max(约2.4万亿)、百度文心5.02.4万亿参数)等,智能水平显著提升,但成本也随之水涨船高——Kimi K3的API定价中,非缓存输入从每百万Token 6.5元涨至20元,输出从27元涨至100元,分别上涨208%270%,且发布两天后便暂停C端新用户订阅以保障算力。

MiniMax的选择是“不做取舍”,而是将降低推理成本提升智能视为同一目标的两面。闫俊杰解释,推理不仅是“用模型”的过程,更是制造下一代智能的“生产资料”——合成数据、强化学习的Rollout、模型评测、Agent与环境交互等核心环节,本质上都依赖推理负载。后训练环节在整体训练算力中的占比越来越高,因此推理效率直接决定下一代模型能训练到什么程度。在算力物理有限的前提下,若推理成本降不下来,最终会反过来制约智能提升。

为实现这一路线,MiniMax自研了MSA(稀疏注意力)架构,将百万字长文本的单位Token计算成本压至传统全注意力机制的约1/20,即M3在1M上下文下每Token计算量仅为上代的1/20。其关键在于将总参数量(决定知识容量)与激活参数量(决定单Token推理成本)解耦,使参数规模扩张不必带来推理成本同比例上涨。因此,M3能在价格不变的前提下提升智能,M3 Pro则能做到约3T参数量级的同时推进强化学习与长程任务训练。

基础设施方面,MiniMax的ETTR(有效训练时间比例)达到97%,是国内最早建立规模化、长期稳定算力体系的独立大模型公司之一。公司通过自主集群、云厂商与TokenFactory合作的组合方式搭建算力供给网络,现有及规划算力已能支撑3T级文本模型和视频模型的持续迭代。

从产业视角看,MiniMax的实践为国产大模型参与全球竞争提供了一条新思路:在算力不占优的背景下,通过降低单位智能成本来推高智能上限。正如闫俊杰所言,推理效率越高,同样算力下能做的实验就越多,智能天花板就越高。这一“降本提智”的技术闭环,能否持续验证并推广,值得AI产业链上下游持续关注。