DeepSeek正式加入超大参数竞赛。据The Information报道,该公司目前正在训练一个约2万亿参数的新模型;梁文锋在近期一场投资者会议上表示,公司下一步计划把模型规模继续推到8万亿参数。这一目标相当于DeepSeek今年4月发布的V4-Pro(1.6万亿总参数、490亿激活参数)的约5倍。
放在一年前,8万亿还是难以想象的数字。但如今,Kimi K3已做到2.8万亿总参数、1040亿激活参数,仍是已正式发布、参数规模最大的开放权重模型;字节被曝正在预训练一个最高可能达到10万亿参数的新模型,由Seed Foundation负责人项亮主导;阿里CEO吴泳铭公开宣布,下一代模型计划做到5万亿到10万亿参数。Anthropic虽不公开参数,但FT此前援引业内估计称,其最新旗舰Mythos 5大约在8万亿参数左右。
这一转向对DeepSeek而言颇为反常。2024年底发布V3时,DeepSeek曾把训练账单摆上台面:6710亿总参数、每Token激活370亿参数,完整训练消耗278.8万H800 GPU小时,按每GPU小时2美元计算,官方给出的训练成本仅557.6万美元。效率而非规模,一度是DeepSeek最鲜明的标签。
条件变化是路线调整的直接原因。DeepSeek今年6月完成成立以来首轮外部融资,募资约74亿美元;第二轮约500亿元人民币(约75亿美元)的融资已进入最后敲定阶段,对应估值约5000亿元人民币。若顺利完成,几个月内累计外部融资将接近150亿美元。公司已聘请中信证券筹备科创板IPO,新增资本明确用于算力基础设施、模型开发和人才投入;9月21日,原高瓴创投合伙人严文韬正式出任CFO,结束了成立三年来CFO空缺的状态。资金与算力条件改善后,DeepSeek开始有能力在参数规模上大胆投入。
参数重新成为焦点,背后是主流架构的变化。过去Dense架构下,参数规模与计算量基本绑定,模型越大、训练和推理成本越高。如今超大模型普遍采用MoE(混合专家)架构,模型可拥有数百甚至数千个专家,但每次任务只激活其中一小部分。例如Kimi K3的2.8万亿总参数中,每Token仅激活约1040亿,占比约3.7%;DeepSeek V4-Pro每Token激活约490亿,占比约3%。总参数与单次激活参数由此成为两个独立数字,模型可以继续扩大容量,而不必让每次计算同比变重。月之暗面称,靠更稀疏的MoE和架构优化,K3整体Scaling效率相比K2提升约2.5倍。
Agent时代的到来进一步放大了这种容量的价值。过去衡量Chatbot能力往往逐项测试,数学、代码、问答各自看峰值;而Agent把能力串进同一条任务链,一次长任务可能涉及搜索、读网页、写代码、调用终端、处理报错、协调子Agent等数十上百步操作。OpenAI今年9月发布Agents API时,就把长时间运行、上下文管理、工具使用和子Agent协调列为核心基础设施,强调Agent需可靠运行数小时甚至数天。任务越长,对能力覆盖面和稳定性的要求越高,前沿竞争因此出现明显的“木桶效应”。METR已直接用“任务时间跨度”衡量Agent能力。
更大的参数容量因此有了新的意义:任务越长,模型越不能偏科;Agent能做的事情越多,底座需要覆盖的能力就越广。MoE打开了容量扩张的空间,Agent则把容量的价值进一步放大。于是,模型厂商一边拼命提高效率,一边重新把参数往5万亿、8万亿、10万亿推。省下来的算力并没有让Scaling消失,反而为新一轮Scaling腾出了空间。