高盛在8月3日的最新研报中,将中国大模型厂商2026年末合计年度经常性收入(ARR)预期从100亿美元上调至130亿美元,并预测2030年将攀升至1250亿美元,五年增长约25倍。同日,Jefferies研报显示,在OpenRouter平台上,中国模型已连续14周包揽调用量前五,其中DeepSeek V4 Flash单周消耗7.22万亿token登顶全球。这两条线索共同指向一个拐点:中国大模型正从“性价比叙事”迈入“收入兑现叙事”,而驱动这一转变的核心是Agent与编码场景对token消费模式的重塑。

高盛预计,中国大模型的API及订阅收入将从2026年的350亿元人民币增长至2030年的8790亿元,对应每日token消耗量从350万亿增至4600万亿。收入结构呈现分化:高盛上调了智谱MiniMax的收入预期,分别上调35%和22%—64%,反映市场对头部公司商业化能力的重新定价。高盛将中国AI模型市场描述为“双层结构”:高端市场以智谱GLM5.2和阿里Qwen3.7 Max为代表,定价约每百万token 1美元;低端市场面向Agent任务,定价低至每百万token 0.06至0.2美元。两层市场均在扩张,但驱动因素不同——高端靠智能溢价,低端靠规模效应。

不过,高盛也指出现实约束:2026年行业训练总成本40亿美元、推理总成本70亿美元,合计高于当期ARR,板块整体仍处于负EBIT状态。API业务毛利率当前仅20%—30%,盈利拐点预计到2030年才会出现,届时板块EBIT利润率可达18%,对应总利润230亿美元。这是一条“先烧钱、后兑现”的路径,但终点已被清晰标定。

性价比是硬币的一面。高盛测算,一名Agent开发者每日约消耗709万token,在美国顶尖模型上运行,单日成本为52至104美元;切换至中国头部模型后,成本骤降至13美元,价差达4到8倍。底层是架构红利:中国模型普遍采用MoE(混合专家)架构,通过低参数激活比压低推理成本。以DeepSeek V4 Flash为例,输入价格每百万token 0.14美元,输出0.28美元,而OpenAI GPT-5.5报价5美元,差距超35倍。DeepSeek的缓存命中折扣机制按标价2%计费,远超业内90%折扣水平,进一步降低Agent场景的重复上下文读取成本。

但价格并非全部。高盛将中国大模型发展划分为两个阶段:2025年是“DeepSeek时刻”,行业依托MoE架构压低推理成本;2026年是“智谱时刻”,GLM 5.2在代码、智能体等高价值赛道跻身全球第一梯队。三个月内,中国大模型在文本赛道全球前50%新增13款,代码赛道前30%新增5款,智能体赛道实现从零到一突破,GLM-5.2稳居全球前7。在Artificial Analysis视频模型榜单中,MiniMax H3视频编辑能力排名全球第一,字节Seedance在多模态生成领域领先。斯坦福AI Index数据显示,中美顶尖模型性能差距已缩小至约2.7%,一年前还是两位数。

能力超越的根源在于,MoE架构的稀疏激活机制在压低推理成本的同时,通过更大总参数量实现更高模型容量。MiniMax M3的MSA(混合稀疏注意力)架构将1M超长上下文处理成本降至极低,同时在Coding和Agent基准测试中领先。美团LongCat 2.0基于5万张国产算力卡完成1.6万亿参数全量训练,证明国产软硬件协同栈具备竞争力。能力超越正从通用基准向高价值场景渗透:基础文本领域智谱和DeepSeek突出,Agent工具调用和Coding场景中阿里Qwen3-Max处于全球第一梯队。

Token消费的结构性转向是关键。OpenRouter最新周报(7月27日—8月2日)显示,全球大模型调用量前五全部由中国模型包揽:DeepSeek V4 Flash(7.22万亿)、小米MiMo-V2.5(6.3万亿)、腾讯混元Hy3(4.82万亿)、DeepSeek V4 Pro(3.28万亿)、智谱GLM5.2(2.89万亿)。中国模型在全球平台的token份额达63.5%,美国为35.5%。同一份编码任务,AI Agent自动化工作流平均消耗417万token,普通代码问答仅3390token,相差超1000倍。OpenCode平台披露,DeepSeek V4 Flash单日处理量达8万亿token,其中5万亿来自免费试用,3万亿来自付费套餐。以Hermes为代表的Agent应用已超过人类聊天,成为OpenRouter上最大的token消耗App。

这种转变重塑了模型竞争维度:衡量标准从“单次回答有多聪明”变为“完成长任务要花多少钱、多久、失败几次”。企业客户从“绑定单一模型”转向“便宜的和高级的搭配着来”。微软已证实探索将DeepSeek V4部署在Azure上,用作Copilot的低成本模型选项;Airbnb CEO公开表示依赖阿里Qwen模型用于大规模生产场景。

多模态与Agent成为竞争新前沿。7月31日,MiniMax发布新一代多模态生成模型H3,并宣布近期开源,支持文本、图片、音频和视频输入,可直出2K分辨率,最长生成15秒音画内容。H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰模型的三分之一。MiniMax股价当日大涨超14%。字节跳动发布面向Agent与Coding场景的Seed 2.1 Pro,腾讯WorkBuddy在企业Agent应用市场占据34%份额,智谱GLM Coding Plan同步开放订阅。编码场景成为必争之地,因为它是Agent能力最直接的商业化出口,也是token消耗最密集的场景之一。

模型层繁荣正向云收入传导。阿里云最新季度收入达398.24亿元,同比增长34%,增速创三年新高。AI相关产品收入连续第九个季度三位数增长,占云业务对外收入约20%。高盛预计,阿里云AI收入占比将从30%向50%迈进。过去四个季度,阿里在AI+云基础设施的资本开支约1200亿元,CEO吴泳铭表示“三年规划3800亿的投资目前看说少了”。Jefferies前瞻CSP财报季:阿里云收入预计加速至45% YoY,腾讯云AI收入占比提升,百度智能云受益于文心系列迭代。云厂商正从“卖算力”升级为“卖AI能力”,收入结构转向MaaS+IaaS混合模式。

中国大模型正经历双重转型:从“性价比”到“收入兑现”,从“Chat”到“Work”。高盛上调ARR预期是对既有趋势的滞后确认,而token消费的主人正从人变成Agent,这不仅是量的爆发,更是质的转变。竞争核心不再是参数大小或benchmark分数,而是谁能把推理成本压到最低、谁能在Agent和编码场景中捕获最多token消费、谁能最快将模型能力转化为云收入。这是一场关于成本、场景和生态的综合博弈。