字節跳動正在對其大模型核心團隊進行一場深度的組織重構。據晚點LatePost 8月19日報道,Seed基礎模型團隊新設四個一級部門,分別聚焦預訓練資料、強化學習、辦公場景產品後訓練和對話場景產品後訓練。這一調整並非簡單的部門更名,而是將原本按技術方向劃分的團隊打散,重新按資料、強化學習和產品任務組織,標誌著大模型競爭進入組織效率比拼的新階段。
新設立的四個一級部門中,Pretrain Data(預訓練資料)由原先分散在文本、程式設計、視覺理解和語音方向的預訓練資料團隊合併而來,下設文本預訓練(沈科)、程式碼預訓練(Xia Xiao)、視覺預訓練(林毅)和語音預訓練四個分支,統一為Omni全模態模型和超大模型供給資料。負責人李成剛是清華機械系本碩,曾從0到1搭建位元組搜尋系統,先後負責今日頭條網頁搜尋和TikTok影片搜尋的技術工作。其麾下沈科2018年從清華畢業後加入位元組,是超大模型預訓練資料的核心人物;Xia Xiao則是開原始碼模型Seed-Coder和定理證明搜尋方法BFS-prover的核心作者之一。
Horizon RL(強化學習)部門的調整力度更大,它整合了分散在推理、視覺理解等方向的後訓練團隊,下設RL Scaling(嶽宇)、Reasoning(王明軒)和視覺強化學習(吳侑彬)三個分支,負責強化學習、提升模型的基礎智慧上限。王明軒此前在火山翻譯,北航本科、中科院計算所博士,曾在騰訊任高階研究員、多次拿下WMT機器翻譯評測冠軍,2019年加入位元組後一路做到大模型研究團隊負責人;嶽宇則是位元組與清華AIR聯合開源的強化學習系統DAPO的演算法作者之一。Seed此前已公開過DAPO、VAPO等強化學習工作,其中VAPO聚焦於推理模型的強化學習效率與穩定性。
這次調整的核心邏輯在於集中資源。據晚點LatePost報道,Seed在調整公告中稱,此舉旨在“合併相似工作、減少overlap,內聚在一起”。有接近位元組的人士透露,調整後文本、程式碼、視覺等原有方向並未消失,只是管理方式改變。例如,視覺預訓練資料歸Pretrain Data的林毅,視覺強化學習歸Horizon RL的吳侑彬,兩人雖分屬不同部門,但吳侑彬在視覺方向上仍需向林毅彙報。類似的跨部門協作安排還體現在:唐晟宇在執掌Horizon RL的同時管理程式碼預訓練;此前主導多模態互動與世界模型的周暢則同時管理視覺預訓練。
產品側的兩個新部門由原先統一的應用後訓練團隊按使用者任務一分為二。Product Posttrain-Work服務B端,下設GUI(吳志勇)和由原有Agent辦公團隊合併而來的分支,負責Agentic模型的整合與釋出,針對辦公場景最佳化模型的Agentic能力,包括支援豆包和Dola的任務模式。負責人秦禹嘉是四位新部門負責人中的90後,師從清華教授劉知遠,曾是面壁智慧核心成員、開源工具學習引擎BMTools的作者,2024年7月通過Top Seed人才計劃加入位元組,是GUI智慧體UI-TARS的第一作者,兩年內升至一級部門負責人。GUI分支負責人吳志勇曾參與OS-Atlas、SeeClick等GUI智慧體開源工作。
Product Posttrain-Chat由朱文佳負責的Application團隊更名而來,面向C端對話場景,下設豆包和Dola Chat分支,負責人嚴林吸收了吳雙志的原班人馬,主要最佳化搜尋問答、對話體驗、個性化和安全等能力,同時控制推理成本。嚴林是中科院計算所碩士,豆包大語言模型Alignment團隊負責人。知情人士稱,吳雙志則轉往火山引擎,負責火山API支援,向吳迪彙報——吳迪同時掌管位元組機器學習中台和火山引擎的演算法團隊。
這次調整反映出位元組對大模型產品化思路的轉變:過去按模型能力(語言、視覺、程式碼)劃分團隊,現在則按使用者任務劃分——Chat面向搜尋、問答、對話等C端需求,Work面向辦公場景和複雜任務,將AI Coding中積累的工具呼叫、電腦操作和複雜任務執行能力應用到日常辦公。接近位元組的內部人士稱,位元組的定位已清晰:豆包、Dola負責短期做大使用者規模;Work押注新的Agent辦公場景;火山則承擔更長期的企業服務和模型商業化。
Seed的這輪調整並非孤立事件。騰訊上月將混元的大語言模型部與多模態模型部合併為基礎模型部,由姚順雨統一負責;海外Meta的超級智慧實驗室也按模型、研究、產品、Infra四塊重組。行業趨勢顯示,模型向Omni發展後模態邊界模糊,Reasoning和Agent成為競爭重點後,RL不再只是“後訓練環節”,Agent也在拉近模型與產品的距離。位元組此次調整更徹底地改變了組織邏輯——不再按文本、程式碼、視覺各自為戰,而是將能力打散,重新裝進資料、強化學習和產品任務中。框架已搭起,這套組織方式能否真正跑通,將是位元組大模型競爭力的關鍵考驗。