德國非營利組織LAION於2026年8月29日釋出了Big Video Dataset(BVD),這是一個面向AI研究的開放影片資料集,規模堪稱空前。該資料集從CommonCrawl中發現的13億個影片URL中,實際下載了8000萬個影片,總時長達到1000萬小時,並從中提取了5500萬個帶自動生成的影片和音訊描述的片段,以及3億張靜態影像。這一規模使其成為目前最大的開源影片資料集之一,為AI影片理解研究提供了海量訓練素材。
據LAION釋出的論文,基於BVD訓練的模型在常見的影片到文本基準測試中,效能優於基於InternVid訓練的模型,最高提升2.1個百分點。BVD的訓練方式將影片、音訊和文本三者結合,讓模型學習視覺內容與對應描述或聲音之間的匹配關係。這種多模態對齊的訓練方法,有望推動影片理解、影片生成和影片檢索等方向的研究進展。
資料集中的大部分影片來自YouTube,且多數為英文內容。LAION明確表示,該資料集僅用於研究目的,並提醒使用者尊重原始內容創作者的權益。在法律層面,LAION可以援引2024年漢堡地區法院的一項裁決,該裁決允許其出於非商業研究目的收集受版權保護的內容。這一法律依據為LAION在資料收集上的合法性提供了支撐,但也可能引發關於版權與AI訓練資料之間平衡的持續討論。
BVD的釋出對AI產業具有多重意義。對研究者而言,它提供了一個大規模、多樣化的影片資料集,有助於訓練更強大的影片理解模型,減少對商業資料集的依賴。對模型開發者來說,BVD可能成為影片多模態模型訓練的重要基準資源,推動影片AI技術的快速迭代。同時,該資料集的開放獲取也降低了研究門檻,可能吸引更多學術機構和初創公司進入影片AI領域。
不過,資料集的版權問題仍是潛在風險。儘管漢堡法院的裁決為LAION提供了法律依據,但不同司法管轄區的法律環境存在差異,未來可能面臨更多法律挑戰。此外,資料集主要來自YouTube,其內容分佈可能存在偏差,影響模型的泛化能力。總體而言,BVD的釋出是AI研究社群的一次重要資源補充,其影響將在後續研究中逐步顯現。