字节跳动近期成立了一个新的一级部门——AI数据与安全,与Seed、Flow、抖音等部门平级,负责人为王赢磊(Adam Wang)。这是继2023年底成立Seed和Flow两个AI一级部门后,字节在AI业务上的又一次组织升级,此次直指AI数据。据“智能涌现”从多个独立信源处获悉,该部门整合了此前分散的多个AI数据团队,包括由TikTok创始团队成员傅越(花名Yuyi)于2023年成立的数据团队Global Data、集团数据中台DMC,以及Flow下属的AI数据平台AIDP等。整合从2026年6月初开始,目前仍在梳理架构、优化人员。
新部门的核心职能是为字节所有大模型提供跨模态的数据服务,覆盖数据生产全流程:标准制定、寻源采购、合成清洗、质量评测等。其前身Global Data起初为Dola(豆包海外版)、TikTok等国际业务服务,后转向支持Seed的模型训练数据采购与质量管控,团队规模约百人,设有产品经理、数据工程、采购、质检运营、安全合规等职能。整合后,该部门将是一个横跨基座模型到业务团队的庞大数据组织。
字节在AI数据上的投入在国内大厂中一直较为坚决,一个重要原因是Seed从成立之初就定下“不做蒸馏”的原则。字节在几乎所有模型上的目标都是达到全球第一梯队甚至SOTA,这需要依靠自研数据而非蒸馏。在7月底的Seed全员会上,张一鸣表态字节在大模型攻坚上“坚决不蒸馏”;8月5日的字节全员会上,CEO梁汝波也表示“字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形”。这些表态都指向数据在字节大模型战略中的核心地位。
据“智能涌现”此前报道,字节内部仅为Seedance做模型数据评测的团队就有上千人,每位Seedance算法工程师背后往往配着十余位数据同事支持。相比之下,很多视频领域头部创业公司的评测团队仅数十人。Seedance 2.0的成功被多位从业者称为“一场数据的胜利”。在预算层面,字节2026年初在世界模型和Coding模型训练上的数据预算已超过千万美元级别,且“如果觉得不够,可以随时追加预算”。数据团队内部还采取赛马机制,按世界模型、代码、高难学科等方向划分,每个数据项目需核算ROI。
字节之外,各大厂都在加强数据投入。腾讯近半年来频繁以高达三倍的薪资从字节数据团队挖人;阿里、腾讯在数据采购上的预算都有明显增长,并不断加码投资。大厂普遍采取数据排他策略,如设定数据集独家期限或阶段性买断供应商核心人员。“数据是当下大模型竞争中最具决定性的变量”已成为大语言模型、具身智能、世界模型、AI4S等领域的共识。然而,2026年的数据市场现状是AI公司需求旺盛,但高质量数据供给稀缺,从预训练到后训练都面临瓶颈。对字节而言,挑战在于如何让千人规模的数据组织快速响应模型前沿的变化,因为今天最稀缺的数据半年后可能失去价值。
全球范围内,模型竞争正走向“数据军备赛”。在推理范式收敛、算法架构提升趋缓的背景下,数据成为决定模型能力上限的最重要变量。硅谷头部大模型公司的外部数据预算正以每年数十亿美元的量级膨胀,例如Anthropic仅在2025年就为RL数据拨出超过10亿美元预算。数据也成为硅谷增长最快的赛道之一,明星公司Mercor年化收入从去年的5亿美元涨到今年年中的20亿美元,其中91%来自OpenAI、Anthropic等头部模型公司,估值飞涨至200亿美元,成立仅三年。
数据重要性的根本原因在于互联网公开数据几乎被穷尽。过去三年,模型训练所需数据经历了从公域到私域的转变。公开互联网有大量报告、文档,但缺少人类产出结果的过程数据,如理解模糊意图、寻找上下文、犯错和修正。在Coding之外,医生、律师、科研等高精尖任务仍需大量自然产生的“过程数据”,这些数据藏在企业内部代码库、员工操作痕迹等真实工作流程中。AI所需数据正从公域转向私域,大量私域数据的采集成为大模型公司新的争夺点。字节此次成立AI数据与安全一级部门,正是对这一趋势的回应。