據《金融時報》8月7日報道,字節跳動正在訓練一個引數量最高可達10萬億的大模型,目前仍處於早期預訓練階段。這一規模將是中國已釋出最大模型、月之暗面 Kimi K3 的三倍以上,並接近 Anthropic 最先進模型 Mythos 5 的體量,業內估計後者約有 8萬億 引數。

報道稱,該專案由位元組 Seed 基金會負責人牽頭,體現 CEO 張一鳴推動原創研究、而非模仿競爭對手模型的思路。預訓練階段通常需要三到六個月,之後若進展順利將進入微調並最終釋出,確切引數規模要到後期階段才能確定。

此前《晚點 LatePost》曾報道,字節跳動正在討論訓練一個引數規模超 5萬億 的模型,超過阿里 Qwen 3.8-Max(2.4萬億引數)和月之暗面 Kimi K3(2.8萬億引數),為國內已知引數規模最大的訓練計劃。如今新訊息將這一數字翻倍,顯示字節跳動在基礎模型上的投入力度遠超外界預期。

這一動向的背景是,全球AI大模型競爭正從應用層向基礎模型層深化。Anthropic 的 Mythos 5 被視為當前行業頂尖水平之一,字節跳動若真能訓練出接近其體量的模型,將直接躋身全球第一梯隊。不過,超大引數模型的訓練對算力、資料和工程能力要求極高,預訓練階段的不確定性也很大,最終能否成功釋出仍是未知數。

對AI產業而言,字節跳動的這一佈局意味著對高階GPU等算力資源的爭奪將進一步加劇。此前有報道稱,字節跳動已向輝達等供應商大量採購晶片,而全球AI基礎設施投入正持續推高資料中心需求。若位元組的10萬億引數模型順利落地,其推理和訓練所需的算力規模將極為可觀,可能帶動相關硬體和雲服務產業鏈的進一步擴張。

同時,這也給國內其他大模型廠商帶來壓力。阿里、月之暗面等已釋出模型的引數規模在2萬億至3萬億之間,位元組若實現10萬億,將拉開明顯差距。不過,引數規模並非衡量模型能力的唯一標準,訓練資料質量、演算法效率和工程最佳化同樣關鍵。業界對超大模型的成本和收益也存在爭議,部分觀點認為,在特定任務上,更大引數未必帶來等比例的效能提升。

截至發稿,字節跳動尚未對上述報道作出官方回應。該訊息最早由《金融時報》披露,後續進展仍需關注。