德国非营利组织LAION于2026年8月29日发布了Big Video Dataset(BVD),这是一个面向AI研究的开放视频数据集,规模堪称空前。该数据集从CommonCrawl中发现的13亿个视频URL中,实际下载了8000万个视频,总时长达到1000万小时,并从中提取了5500万个带自动生成的视频和音频描述的片段,以及3亿张静态图像。这一规模使其成为目前最大的开源视频数据集之一,为AI视频理解研究提供了海量训练素材。
据LAION发布的论文,基于BVD训练的模型在常见的视频到文本基准测试中,性能优于基于InternVid训练的模型,最高提升2.1个百分点。BVD的训练方式将视频、音频和文本三者结合,让模型学习视觉内容与对应描述或声音之间的匹配关系。这种多模态对齐的训练方法,有望推动视频理解、视频生成和视频检索等方向的研究进展。
数据集中的大部分视频来自YouTube,且多数为英文内容。LAION明确表示,该数据集仅用于研究目的,并提醒使用者尊重原始内容创作者的权益。在法律层面,LAION可以援引2024年汉堡地区法院的一项裁决,该裁决允许其出于非商业研究目的收集受版权保护的内容。这一法律依据为LAION在数据收集上的合法性提供了支撑,但也可能引发关于版权与AI训练数据之间平衡的持续讨论。
BVD的发布对AI产业具有多重意义。对研究者而言,它提供了一个大规模、多样化的视频数据集,有助于训练更强大的视频理解模型,减少对商业数据集的依赖。对模型开发者来说,BVD可能成为视频多模态模型训练的重要基准资源,推动视频AI技术的快速迭代。同时,该数据集的开放获取也降低了研究门槛,可能吸引更多学术机构和初创公司进入视频AI领域。
不过,数据集的版权问题仍是潜在风险。尽管汉堡法院的裁决为LAION提供了法律依据,但不同司法管辖区的法律环境存在差异,未来可能面临更多法律挑战。此外,数据集主要来自YouTube,其内容分布可能存在偏差,影响模型的泛化能力。总体而言,BVD的发布是AI研究社区的一次重要资源补充,其影响将在后续研究中逐步显现。