字節跳動近期成立了一個新的一級部門——AI資料與安全,與Seed、Flow、抖音等部門平級,負責人為王贏磊(Adam Wang)。這是繼2023年底成立Seed和Flow兩個AI一級部門後,位元組在AI業務上的又一次組織升級,此次直指AI資料。據“智慧湧現”從多個獨立信源處獲悉,該部門整合了此前分散的多個AI資料團隊,包括由TikTok創始團隊成員傅越(花名Yuyi)於2023年成立的資料團隊Global Data、集團資料中台DMC,以及Flow下屬的AI資料平台AIDP等。整合從2026年6月初開始,目前仍在梳理架構、最佳化人員。
新部門的核心職能是為位元組所有大模型提供跨模態的資料服務,覆蓋資料生產全流程:標準制定、尋源採購、合成清洗、質量評測等。其前身Global Data起初為Dola(豆包海外版)、TikTok等國際業務服務,後轉向支援Seed的模型訓練資料採購與質量管控,團隊規模約百人,設有產品經理、資料工程、採購、質檢運營、安全合規等職能。整合後,該部門將是一個橫跨基座模型到業務團隊的龐大數據組織。
位元組在AI資料上的投入在國內大廠中一直較為堅決,一個重要原因是Seed從成立之初就定下“不做蒸餾”的原則。位元組在幾乎所有模型上的目標都是達到全球第一梯隊甚至SOTA,這需要依靠自研資料而非蒸餾。在7月底的Seed全員會上,張一鳴表態位元組在大模型攻堅上“堅決不蒸餾”;8月5日的位元組全員會上,CEO梁汝波也表示“位元組大語言模型會堅定自研,做好基本功,接受短期落後,堅持最佳化長期,最重要的是動作不要變形”。這些表態都指向資料在位元組大模型戰略中的核心地位。
據“智慧湧現”此前報道,位元組內部僅為Seedance做模型資料評測的團隊就有上千人,每位Seedance演算法工程師背後往往配著十餘位資料同事支援。相比之下,很多影片領域頭部創業公司的評測團隊僅數十人。Seedance 2.0的成功被多位從業者稱為“一場資料的勝利”。在預算層面,位元組2026年初在世界模型和Coding模型訓練上的資料預算已超過千萬美元級別,且“如果覺得不夠,可以隨時追加預算”。資料團隊內部還採取賽馬機制,按世界模型、程式碼、高難學科等方向劃分,每個資料專案需核算ROI。
位元組之外,各大廠都在加強資料投入。騰訊近半年來頻繁以高達三倍的薪資從位元組資料團隊挖人;阿里、騰訊在資料採購上的預算都有明顯增長,並不斷加碼投資。大廠普遍採取資料排他策略,如設定資料集獨家期限或階段性買斷供應商核心人員。“資料是當下大模型競爭中最具決定性的變數”已成為大語言模型、具身智慧、世界模型、AI4S等領域的共識。然而,2026年的資料市場現狀是AI公司需求旺盛,但高質量資料供給稀缺,從預訓練到後訓練都面臨瓶頸。對位元組而言,挑戰在於如何讓千人規模的資料組織快速響應模型前沿的變化,因為今天最稀缺的資料半年後可能失去價值。
全球範圍內,模型競爭正走向“資料軍備賽”。在推理範式收斂、演算法架構提升趨緩的背景下,資料成為決定模型能力上限的最重要變數。矽谷頭部大模型公司的外部資料預算正以每年數十億美元的量級膨脹,例如Anthropic僅在2025年就為RL資料撥出超過10億美元預算。資料也成為矽谷增長最快的賽道之一,明星公司Mercor年化收入從去年的5億美元漲到今年年中的20億美元,其中91%來自OpenAI、Anthropic等頭部模型公司,估值飛漲至200億美元,成立僅三年。
資料重要性的根本原因在於網際網路公開資料幾乎被窮盡。過去三年,模型訓練所需資料經歷了從公域到私域的轉變。公開網際網路有大量報告、文件,但缺少人類產出結果的過程資料,如理解模糊意圖、尋找上下文、犯錯和修正。在Coding之外,醫生、律師、科研等高精尖任務仍需大量自然產生的“過程資料”,這些資料藏在企業內部程式碼庫、員工操作痕跡等真實工作流程中。AI所需資料正從公域轉向私域,大量私域資料的採集成為大模型公司新的爭奪點。位元組此次成立AI資料與安全一級部門,正是對這一趨勢的回應。