字节跳动正在对其大模型核心团队进行一场深度的组织重构。据晚点LatePost 8月19日报道,Seed基础模型团队新设四个一级部门,分别聚焦预训练数据、强化学习、办公场景产品后训练和对话场景产品后训练。这一调整并非简单的部门更名,而是将原本按技术方向划分的团队打散,重新按数据、强化学习和产品任务组织,标志着大模型竞争进入组织效率比拼的新阶段。

新设立的四个一级部门中,Pretrain Data(预训练数据)由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支,统一为Omni全模态模型和超大模型供给数据。负责人李成刚是清华机械系本硕,曾从0到1搭建字节搜索系统,先后负责今日头条网页搜索和TikTok视频搜索的技术工作。其麾下沈科2018年从清华毕业后加入字节,是超大模型预训练数据的核心人物;Xia Xiao则是开源代码模型Seed-Coder和定理证明搜索方法BFS-prover的核心作者之一。

Horizon RL(强化学习)部门的调整力度更大,它整合了分散在推理、视觉理解等方向的后训练团队,下设RL Scaling(岳宇)、Reasoning(王明轩)和视觉强化学习(吴侑彬)三个分支,负责强化学习、提升模型的基础智能上限。王明轩此前在火山翻译,北航本科、中科院计算所博士,曾在腾讯任高级研究员、多次拿下WMT机器翻译评测冠军,2019年加入字节后一路做到大模型研究团队负责人;岳宇则是字节与清华AIR联合开源的强化学习系统DAPO的算法作者之一。Seed此前已公开过DAPO、VAPO等强化学习工作,其中VAPO聚焦于推理模型的强化学习效率与稳定性。

这次调整的核心逻辑在于集中资源。据晚点LatePost报道,Seed在调整公告中称,此举旨在“合并相似工作、减少overlap,内聚在一起”。有接近字节的人士透露,调整后文本、代码、视觉等原有方向并未消失,只是管理方式改变。例如,视觉预训练数据归Pretrain Data的林毅,视觉强化学习归Horizon RL的吴侑彬,两人虽分属不同部门,但吴侑彬在视觉方向上仍需向林毅汇报。类似的跨部门协作安排还体现在:唐晟宇在执掌Horizon RL的同时管理代码预训练;此前主导多模态交互与世界模型的周畅则同时管理视觉预训练。

产品侧的两个新部门由原先统一的应用后训练团队按用户任务一分为二。Product Posttrain-Work服务B端,下设GUI(吴志勇)和由原有Agent办公团队合并而来的分支,负责Agentic模型的整合与发布,针对办公场景优化模型的Agentic能力,包括支持豆包和Dola的任务模式。负责人秦禹嘉是四位新部门负责人中的90后,师从清华教授刘知远,曾是面壁智能核心成员、开源工具学习引擎BMTools的作者,2024年7月通过Top Seed人才计划加入字节,是GUI智能体UI-TARS的第一作者,两年内升至一级部门负责人。GUI分支负责人吴志勇曾参与OS-Atlas、SeeClick等GUI智能体开源工作。

Product Posttrain-Chat由朱文佳负责的Application团队更名而来,面向C端对话场景,下设豆包和Dola Chat分支,负责人严林吸收了吴双志的原班人马,主要优化搜索问答、对话体验、个性化和安全等能力,同时控制推理成本。严林是中科院计算所硕士,豆包大语言模型Alignment团队负责人。知情人士称,吴双志则转往火山引擎,负责火山API支持,向吴迪汇报——吴迪同时掌管字节机器学习中台和火山引擎的算法团队。

这次调整反映出字节对大模型产品化思路的转变:过去按模型能力(语言、视觉、代码)划分团队,现在则按用户任务划分——Chat面向搜索、问答、对话等C端需求,Work面向办公场景和复杂任务,将AI Coding中积累的工具调用、电脑操作和复杂任务执行能力应用到日常办公。接近字节的内部人士称,字节的定位已清晰:豆包、Dola负责短期做大用户规模;Work押注新的Agent办公场景;火山则承担更长期的企业服务和模型商业化。

Seed的这轮调整并非孤立事件。腾讯上月将混元的大语言模型部与多模态模型部合并为基础模型部,由姚顺雨统一负责;海外Meta的超级智能实验室也按模型、研究、产品、Infra四块重组。行业趋势显示,模型向Omni发展后模态边界模糊,Reasoning和Agent成为竞争重点后,RL不再只是“后训练环节”,Agent也在拉近模型与产品的距离。字节此次调整更彻底地改变了组织逻辑——不再按文本、代码、视觉各自为战,而是将能力打散,重新装进数据、强化学习和产品任务中。框架已搭起,这套组织方式能否真正跑通,将是字节大模型竞争力的关键考验。