据《金融时报》8月7日报道,字节跳动正在训练一个参数量最高可达10万亿的大模型,目前仍处于早期预训练阶段。这一规模将是中国已发布最大模型、月之暗面 Kimi K3 的三倍以上,并接近 Anthropic 最先进模型 Mythos 5 的体量,业内估计后者约有 8万亿 参数。
报道称,该项目由字节 Seed 基金会负责人牵头,体现 CEO 张一鸣推动原创研究、而非模仿竞争对手模型的思路。预训练阶段通常需要三到六个月,之后若进展顺利将进入微调并最终发布,确切参数规模要到后期阶段才能确定。
此前《晚点 LatePost》曾报道,字节跳动正在讨论训练一个参数规模超 5万亿 的模型,超过阿里 Qwen 3.8-Max(2.4万亿参数)和月之暗面 Kimi K3(2.8万亿参数),为国内已知参数规模最大的训练计划。如今新消息将这一数字翻倍,显示字节跳动在基础模型上的投入力度远超外界预期。
这一动向的背景是,全球AI大模型竞争正从应用层向基础模型层深化。Anthropic 的 Mythos 5 被视为当前行业顶尖水平之一,字节跳动若真能训练出接近其体量的模型,将直接跻身全球第一梯队。不过,超大参数模型的训练对算力、数据和工程能力要求极高,预训练阶段的不确定性也很大,最终能否成功发布仍是未知数。
对AI产业而言,字节跳动的这一布局意味着对高端GPU等算力资源的争夺将进一步加剧。此前有报道称,字节跳动已向英伟达等供应商大量采购芯片,而全球AI基础设施投入正持续推高数据中心需求。若字节的10万亿参数模型顺利落地,其推理和训练所需的算力规模将极为可观,可能带动相关硬件和云服务产业链的进一步扩张。
同时,这也给国内其他大模型厂商带来压力。阿里、月之暗面等已发布模型的参数规模在2万亿至3万亿之间,字节若实现10万亿,将拉开明显差距。不过,参数规模并非衡量模型能力的唯一标准,训练数据质量、算法效率和工程优化同样关键。业界对超大模型的成本和收益也存在争议,部分观点认为,在特定任务上,更大参数未必带来等比例的性能提升。
截至发稿,字节跳动尚未对上述报道作出官方回应。该消息最早由《金融时报》披露,后续进展仍需关注。