高盛在8月3日的最新研報中,將中國大模型廠商2026年末合計年度經常性收入(ARR)預期從100億美元上調至130億美元,並預測2030年將攀升至1250億美元,五年增長約25倍。同日,Jefferies研報顯示,在OpenRouter平台上,中國模型已連續14周包攬呼叫量前五,其中DeepSeek V4 Flash單週消耗7.22萬億token登頂全球。這兩條線索共同指向一個拐點:中國大模型正從“價效比敘事”邁入“收入兌現敘事”,而驅動這一轉變的核心是Agent與編碼場景對token消費模式的重塑。

高盛預計,中國大模型的API及訂閱收入將從2026年的350億元人民幣增長至2030年的8790億元,對應每日token消耗量從350萬億增至4600萬億。收入結構呈現分化:高盛上調了智譜MiniMax的收入預期,分別上調35%和22%—64%,反映市場對頭部公司商業化能力的重新定價。高盛將中國AI模型市場描述為“雙層結構”:高階市場以智譜GLM5.2和阿里Qwen3.7 Max為代表,定價約每百萬token 1美元;低端市場面向Agent任務,定價低至每百萬token 0.06至0.2美元。兩層市場均在擴張,但驅動因素不同——高階靠智慧溢價,低端靠規模效應。

不過,高盛也指出現實約束:2026年行業訓練總成本40億美元、推理總成本70億美元,合計高於當期ARR,板塊整體仍處於負EBIT狀態。API業務毛利率當前僅20%—30%,盈利拐點預計到2030年才會出現,屆時板塊EBIT利潤率可達18%,對應總利潤230億美元。這是一條“先燒錢、後兌現”的路徑,但終點已被清晰標定。

價效比是硬幣的一面。高盛測算,一名Agent開發者每日約消耗709萬token,在美國頂尖模型上執行,單日成本為52至104美元;切換至中國頭部模型後,成本驟降至13美元,價差達4到8倍。底層是架構紅利:中國模型普遍採用MoE(混合專家)架構,通過低引數啟用比壓低推理成本。以DeepSeek V4 Flash為例,輸入價格每百萬token 0.14美元,輸出0.28美元,而OpenAI GPT-5.5報價5美元,差距超35倍。DeepSeek的快取命中折扣機制按標價2%計費,遠超業內90%折扣水平,進一步降低Agent場景的重複上下文讀取成本。

但價格並非全部。高盛將中國大模型發展劃分為兩個階段:2025年是“DeepSeek時刻”,行業依託MoE架構壓低推理成本;2026年是“智譜時刻”,GLM 5.2在程式碼、智慧體等高價值賽道躋身全球第一梯隊。三個月內,中國大模型在文本賽道全球前50%新增13款,程式碼賽道前30%新增5款,智慧體賽道實現從零到一突破,GLM-5.2穩居全球前7。在Artificial Analysis影片模型榜單中,MiniMax H3影片編輯能力排名全球第一,位元組Seedance在多模態生成領域領先。斯坦福AI Index資料顯示,中美頂尖模型效能差距已縮小至約2.7%,一年前還是兩位數。

能力超越的根源在於,MoE架構的稀疏啟用機制在壓低推理成本的同時,通過更大總引數量實現更高模型容量。MiniMax M3的MSA(混合稀疏注意力)架構將1M超長上下文處理成本降至極低,同時在Coding和Agent基準測試中領先。美團LongCat 2.0基於5萬張國產算力卡完成1.6萬億引數全量訓練,證明國產軟硬體協同棧具備競爭力。能力超越正從通用基準向高價值場景滲透:基礎文本領域智譜和DeepSeek突出,Agent工具呼叫和Coding場景中阿里Qwen3-Max處於全球第一梯隊。

Token消費的結構性轉向是關鍵。OpenRouter最新週報(7月27日—8月2日)顯示,全球大模型呼叫量前五全部由中國模型包攬:DeepSeek V4 Flash(7.22萬億)、小米MiMo-V2.5(6.3萬億)、騰訊混元Hy3(4.82萬億)、DeepSeek V4 Pro(3.28萬億)、智譜GLM5.2(2.89萬億)。中國模型在全球平台的token份額達63.5%,美國為35.5%。同一份編碼任務,AI Agent自動化工作流平均消耗417萬token,普通程式碼問答僅3390token,相差超1000倍。OpenCode平台披露,DeepSeek V4 Flash單日處理量達8萬億token,其中5萬億來自免費試用,3萬億來自付費套餐。以Hermes為代表的Agent應用已超過人類聊天,成為OpenRouter上最大的token消耗App。

這種轉變重塑了模型競爭維度:衡量標準從“單次回答有多聰明”變為“完成長任務要花多少錢、多久、失敗幾次”。企業客戶從“繫結單一模型”轉向“便宜的和高階的搭配著來”。微軟已證實探索將DeepSeek V4部署在Azure上,用作Copilot的低成本模型選項;Airbnb CEO公開表示依賴阿里Qwen模型用於大規模生產場景。

多模態與Agent成為競爭新前沿。7月31日,MiniMax釋出新一代多模態生成模型H3,並宣佈近期開源,支援文本、圖片、音訊和影片輸入,可直出2K解析度,最長生成15秒音畫內容。H3影片生成價格為0.8元/秒(2K解析度),僅為業內同類旗艦模型的三分之一。MiniMax股價當日大漲超14%。字節跳動釋出面向Agent與Coding場景的Seed 2.1 Pro,騰訊WorkBuddy在企業Agent應用市場佔據34%份額,智譜GLM Coding Plan同步開放訂閱。編碼場景成為必爭之地,因為它是Agent能力最直接的商業化出口,也是token消耗最密集的場景之一。

模型層繁榮正向雲收入傳導。阿里雲最新季度收入達398.24億元,同比增長34%,增速創三年新高。AI相關產品收入連續第九個季度三位數增長,佔雲業務對外收入約20%。高盛預計,阿里雲AI收入佔比將從30%向50%邁進。過去四個季度,阿里在AI+雲基礎設施的資本開支約1200億元,CEO吳泳銘表示“三年規劃3800億的投資目前看說少了”。Jefferies前瞻CSP財報季:阿里雲收入預計加速至45% YoY,騰訊雲AI收入佔比提升,百度智慧雲受益於文心繫列迭代。雲廠商正從“賣算力”升級為“賣AI能力”,收入結構轉向MaaS+IaaS混合模式。

中國大模型正經歷雙重轉型:從“價效比”到“收入兌現”,從“Chat”到“Work”。高盛上調ARR預期是對既有趨勢的滯後確認,而token消費的主人正從人變成Agent,這不僅是量的爆發,更是質的轉變。競爭核心不再是引數大小或benchmark分數,而是誰能把推理成本壓到最低、誰能在Agent和編碼場景中捕獲最多token消費、誰能最快將模型能力轉化為雲收入。這是一場關於成本、場景和生態的綜合博弈。