8月3日,阿里巴巴正式发布Qwen 3.8-Max版,官方信息显示该版本总参数达2.4T、激活参数95B。当日收盘,阿里巴巴港股(89988.HK)股价上涨6.75%。此前,7月31日DeepSeek发布V4 Flash正式版,据Artificial Analysis评估,该版本是目前单任务成本(而非单Token成本)最低的模型,比Anthropic的Fable 5便宜约105倍。
市场对近期模型发布的反应出现明显分化。7月17日,Kimi K3发布后,智谱(02513.HK)和MiniMax(00100.HK)股价同步下跌,智谱在17日(周五)和20日两个交易日累计下跌42.47%,MiniMax两日累计下跌约24.57%。K3发布时在Artificial Analysis(下称“AA”)上的编程评分一度位列第一,有分析指出,智谱此前依靠GLM-5.2建立的“国产最强开源模型”叙事被削弱。然而,就在两周后的7月31日,DeepSeek V4 Flash正式版和MiniMax H3(视频生成模型)同步发布,港股AI板块反弹,当天智谱上涨约14.56%,MiniMax上涨约13.15%,阿里巴巴港股收涨4.73%。
两次竞争对手的发布带来截然不同的市场结果,背后是市场对DeepSeek定位理解的转变。一种分析认为,4月DeepSeek V4预览版发布时,市场将其视为对模型公司估值的冲击,这一叙事延续至Kimi K3发布时;而到7月底,V4 Flash被重新理解为国产开源生态的成本基准和能力下限的重构,进而放大了所有开源模型公司未来的增长机会。8月3日港股收盘后,智谱股价下跌4.73%,而MiniMax则上涨7.2%,或源于H3带来的差异化配置逻辑。
从过去半年中国已上市大模型公司的股价走势看,中国开源模型性能SOTA带来的估值上涨窗口正在缩短,此前的迭代周期以季、月为单位,如今已降低到以双周、周为单位。长期来看,单一模型的性能、评分和排名,已无法为长期公司估值提供支撑。另一方面,对于国内几家开源模型的估值叙事,资本市场似乎已开始从中观层面对标北美,大语言模型市场正在“缩圈”,从“三巨头”走向“双寡头”,参与基础模型竞争的玩家数量将越来越少。在此语境下,一款短期内评分排名靠前的模型,并不是能够留在圈里的充分条件。
回顾智谱和MiniMax的上市表现,可以更清晰地看到叙事变化。智谱是上半年“模型即估值”的代表。2月,GLM-5发布并开源,AA评分达50分,成为开源模型首次突破50分的案例。AlphaEngine数据显示,智谱发布当日上涨28.68%,T+3累计上涨132.07%。6月,GLM-5.2发布后,AA智能指数达到51分,进入全球前三,智谱在官宣后首个交易日上涨32.82%,6月下旬市值一度突破万亿港元。影响估值的不仅是模型性能,还有价格。智谱在GLM-5发布时同步上调Coding Plan价格30%,直接带动了公司API收入。市场当时愿意相信的逻辑是:模型能力提升带来排名跃升,排名跃升支撑涨价,涨价后调用量还能增长,说明公司具备定价权。这是纯模型公司最容易获得估值溢价的方式。
MiniMax在早期也有类似叙事。2月M2.5发布后,MiniMax股价当日上涨14.62%,T+3累计上涨89.08%。但其支撑逻辑与智谱不同,M2.5在AA智能指数上的位置并不突出,报告中约为42分,全球排名在15名以外,但SWE-bench表现和OpenRouter调用量给出另一套证据,市场当时接受的是“榜单弱、调用强”的商业化叙事。到了6月,MiniMax的模型发布开始无法支撑估值,尤其是M3“不及预期”。5月31日晚M3发布,6月1日股价高开低走,收跌15.71%。M3具备1M上下文和自研MSA架构,但在AA智能指数上约为44分,处于跟随位置。同时,M3定价提升,却没有足够强的榜单排名和调用量数据来验证定价权,市场没有把提价看作商业化能力,反而视为估值兑现的窗口。
阿里巴巴Qwen则显示另一种情况。Qwen模型迭代频率高,技术能力处于第一梯队,但阿里股价很少由单一模型发布直接决定,其估值变量包括阿里云收入、MaaS平台、资本开支、AI应用分发、海外云映射和集团基本面。6月17日,Qwen 3.7-Max正式版发布,部分口径下AA分数达56.6分,中国第一、全球第六,但阿里美股当日下跌3.18%,T+5累计下跌14.33%。
Kimi和DeepSeek虽未上市,却成为上市模型公司的外部定价变量。Kimi K3发布后,智谱和MiniMax下跌,说明未上市公司也能通过模型排名改变二级市场对上市模型公司的估值。DeepSeek的影响更复杂:4月V4预览版发布时,模型公司下跌、硬件股上涨,市场理解为DeepSeek压低了模型层估值;7月V4 Flash正式版发布时,智谱、MiniMax、阿里和算力链同步上涨,市场改用生态框架定价。
SOTA窗口期缩短是这一系列变化的共同趋势。模型发布周期不等于SOTA保持时间。BenchLM统计显示,过去12个月有107个显著模型发布,平均约3天一个;进入2026年下半年,frontier模型发布周期已接近1至2周。资本市场甚至不需要等到模型“登顶”才反应,只要新模型足以改变排序预期,或者削弱原SOTA公司的领先假设,股价就会提前调整。Kimi K3发布后智谱和MiniMax下跌,是“排序重排”的反应;DeepSeek V4 Flash发布后板块上涨,则是“生态成本下降”的反应。两者看似相反,实际上都说明市场正在用更高频的方式重估模型公司。
过去,模型公司可以依靠一次SOTA获得较长时间的估值溢价,现在,SOTA更像短期交易信号。智谱GLM-5和GLM-5.2之所以有效,是因为它们同时具备首次突破、排名跃升和涨价验证;MiniMax M3之所以失效,是因为跟随式发布无法支撑提价,也无法抵消解禁压力;阿里Qwen的股价弹性较弱,则说明平台公司要靠云收入、MaaS调用和生态合作来承接模型能力,而不是靠模型榜单本身。
长期看,短期给出一个SOTA模型,并不意味着公司一定能获得更好的商业化潜力。模型排名会变化,API价格会被开源生态压低,客户会在性能、成本和场景之间切换。一个公司如果只有一次登顶,却没有持续迭代能力、调用量增长、客户留存和收入转化,那么SOTA带来的估值溢价很快会被下一次发布稀释。7月之后,市场降低了对单一模型领先的估值权重,并开始在叙事中寻求更多“证据”,包括迭代速度、收入增速和价格弹性、长期的商业模式等。当越来越多公司能够接近前沿模型水平时,单纯依靠模型性能领先已难以形成长期估值溢价,市场开始进一步追问模型能力之外的商业价值。在通往AGI终点的过程中,谁能够更清晰地描绘“路线图”,往往意味着更大可能掌握叙事的话语权。