8月26日,中國AI大模型企業MiniMax(稀宇科技)釋出了其自港股上市以來的首份半年報。財報顯示,公司收入同比增長283.1%,半年收入已達到2025年全年收入的1.5倍;毛利同比增長464.8%。在隨後的財報會上,創始人、董事會主席、CEO、CTO閆俊傑透露,8月公司ARR(年度經常性收入)突破8億美元,B端收入佔比達到80%,7月的Token消耗量是1月的20倍。這些資料表明,MiniMax在商業化與規模擴張上均取得顯著進展。
閆俊傑在業績會上提出一個核心觀點:“只有最小化單位智慧成本,才有可能最大化智慧水平。”這背後是過去兩年大模型行業面臨的普遍困境:遵循Scaling Law堆引數以提升智慧,往往導致推理成本高企;而追求低成本普惠,又常以犧牲智慧水平為代價。行業一度預設這是“魚和熊掌不可兼得”的取捨。
當前,大模型行業確實分化出兩條路徑。一邊是谷歌等廠商推出的輕量化小模型,如2026年7至8月釋出的Gemini 3.7 Flash、Gemini 3.6 Flash等,主打速度快、成本低,但智慧表現中規中矩,甚至旗艦產品Gemini 3.5 Pro至今未釋出。另一邊是國產大模型廠商在超大引數路線上狂奔,例如月之暗面的Kimi K3(引數約2.8萬億)、阿里的Qwen3.8 Max(約2.4萬億)、百度文心5.0(2.4萬億引數)等,智慧水平顯著提升,但成本也隨之水漲船高——Kimi K3的API定價中,非快取輸入從每百萬Token 6.5元漲至20元,輸出從27元漲至100元,分別上漲208%和270%,且釋出兩天後便暫停C端新使用者訂閱以保障算力。
MiniMax的選擇是“不做取捨”,而是將降低推理成本與提升智慧視為同一目標的兩面。閆俊傑解釋,推理不僅是“用模型”的過程,更是製造下一代智慧的“生產資料”——合成數據、強化學習的Rollout、模型評測、Agent與環境互動等核心環節,本質上都依賴推理負載。後訓練環節在整體訓練算力中的佔比越來越高,因此推理效率直接決定下一代模型能訓練到什麼程度。在算力物理有限的前提下,若推理成本降不下來,最終會反過來制約智慧提升。
為實現這一路線,MiniMax自研了MSA(稀疏注意力)架構,將百萬字長文本的單位Token計算成本壓至傳統全注意力機制的約1/20,即M3在1M上下文下每Token計算量僅為上代的1/20。其關鍵在於將總引數量(決定知識容量)與啟用引數量(決定單Token推理成本)解耦,使引數規模擴張不必帶來推理成本同比例上漲。因此,M3能在價格不變的前提下提升智慧,M3 Pro則能做到約3T引數量級的同時推進強化學習與長程任務訓練。
基礎設施方面,MiniMax的ETTR(有效訓練時間比例)達到97%,是國內最早建立規模化、長期穩定算力體系的獨立大模型公司之一。公司通過自主叢集、雲廠商與TokenFactory合作的組合方式搭建算力供給網路,現有及規劃算力已能支撐3T級文本模型和影片模型的持續迭代。
從產業視角看,MiniMax的實踐為國產大模型參與全球競爭提供了一條新思路:在算力不佔優的背景下,通過降低單位智慧成本來推高智慧上限。正如閆俊傑所言,推理效率越高,同樣算力下能做的實驗就越多,智慧天花板就越高。這一“降本提智”的技術閉環,能否持續驗證並推廣,值得AI產業鏈上下游持續關注。