几名曾在阿里通义、月之暗面等头部模型大厂实习的年轻人创立了一家AI训练数据公司,不到一年拿下千万美元级订单、完成约三轮融资。外媒最新消息显示,该公司即将完成一轮3亿美元融资,投资方包括红杉、阿里和腾讯,估值达到25亿美元

数据服务公司长期不在VC视野中。原因在于,这类模式主要做现金流生意,创业门槛在AI领域内并不高。更早时候,三四线小城市有一批数据公司利用廉价劳动力为模型训练提供语料。随着大模型智力水平提升,数据质量要求同步提高,越来越多名校背景的高学历从业者加入,法律、医生、记者、编剧等各行各业的资深人士开始入驻数据服务平台。作为兼职,数据标注收入在每小时500至1000元

但只做专家网络,在国内很难撑到百亿估值。一位接触过该项目的投资人表示,在2亿美元轮次以前,投资人更多是从对创始人的判断层面下注;到以25亿美元估值对外融资,公司必须讲出新故事。据了解,该公司今年上半年已涉足金融领域,在预测市场做了一套可对比、可验证的系统,据称要以卖API盈利。

国内数据训练公司大约有二十多家,跨界金融只是它们试图描述的未来方向之一。人工标注、专家外包、数据交付这些传统模式很难讲出足够性感的增长故事,但在越来越多95后、00后年轻创业者那里有了新说法。他们凭借模型训练经验和对模型能力的了解,让原本相对枯燥的现金流生意有了新的想象空间。

理解这门生意,要从去年媒体热议的「985、211硕博生去当AI训练师」说起,比如DeepSeek北大中文系毕业生和Kimi的医学博士。他们中有人自嘲为「数据包工头」,带领以BPO形式存在的标注员,配合研发团队为模型生产训练数据。卖数据的商业逻辑并不复杂,只要拿到订单,自身就能跑成一家现金流不错的公司,不一定需要融资。Surge AI就是典型案例,这家公司成立于2020年,创始人Edwin Chen此前在GoogleMeta从事机器学习工作,很长一段时间没有拿外部融资,靠自身滚动发展。直到2025年,市场传出它寻求最多10亿美元融资的消息,当时公司过去一年收入已超过10亿美元,市场讨论的估值超过150亿美元

随着模型能力提升,医疗、法律、金融等专业领域以及需要主观判断的复杂任务,对资深人才标注的需求快速增长。高质量人类标注者稀缺,大型AI公司愿意支付高额溢价。Mercor早期只是为大型数据标注公司提供合同制人才的AI招聘平台,后来直接把专业人士组织成训练数据供应网络。2025年,Mercor以100亿美元估值融资,2026年又传出按200亿美元估值筹集约5亿美元的计划。

海外诞生了许多独角兽,但国内AI训练数据服务商很少获得VC支持。一位调研过模型厂的投资人表示,当时模型厂内部对数据采购标准、新增供应商标准都不太清晰;尽管已和几家互联网厂商甚至海外供应商合作,整体供应量还不大。另一方面,国内有段时间以蒸馏为主,很大程度上削弱了寻找专家数据的必要性。

今年Agent全面爆发,所需数据类型已不是简单的专家数据,而是更接近环境的数据。一位模型厂研究员表示,现在需要的不只是「问题和答案」,而是能让模型反复行动、获得反馈的可闭环、可验证的训练环境:模型执行任务,环境记录每一步行动,再通过验证器判断结果,最后把反馈交还给模型。比如训练模型写更好的前端代码,光靠人工判断不够,还需要能执行代码的环境、能理解页面效果的模型做裁判,再通过几百轮甚至更长时间运行不断反馈。

一些美国创业公司开始专门做强化学习环境。AfterQuery希望让模型和智能体学会像专业人士一样完成任务,为前沿大模型输出专家推理数据集、强化学习仿真环境和模型评测服务。需求方这边,Anthropic管理层讨论过在未来一年内拿出10亿美元投入强化学习环境;OpenAI方面,2025年全年数据开销约10亿美元,内部预测到2030年将涨到80亿美元。美国已有十几家这样的种子轮团队,人数不超过20人,服务1到3家大客户。国内也开始出现类似机会,越来越多研究员从模型厂外溢,今年5、6月份趋势变得清晰。

和AI其他领域一样,训练数据公司创始人通常很年轻。Scale AI创始人Alexandr Wang24岁成为亿万富翁,Mercor三位创始人在22岁凭借百亿美元估值跻身亿万富翁行列。最近的是AfterQuery两位联合创始人斯宾塞·马蒂加(Spencer Mateega)23岁卡洛斯·乔治斯库(Carlos Georgescu)22岁,创立公司时两人还在大学在读。该公司刚宣布正筹集新一轮融资,估值达32亿美元,成立仅18个月,主要业务是AI训练数据服务。

国内数据初创公司创始人同样年轻。一位接触过国内一家独角兽数据训练公司的投资人表示,早期判断更多集中在「人」身上,兼具商业嗅觉和研究属性的人到今天都比较少见。这家公司创始人曾在月之暗面等一线模型大厂实习,参与过模型训练并发表论文。模型训练一线工作主要由名校PhD承担,他们从实习开始就承担具体执行工作,跟着外包团队完成后很容易想到:既然这件事可以在大厂外包部门完成,为什么不能自己出来做?于是部分人从模型厂或外包团队走出来成立数据创业公司。这也是当下这批数据创业者的共同特征:离模型厂实际需求更近,对外部市场变化更敏感。

工程能力同样关键。如何搭建团队、把研究员认可的数据质量要求落到实际生产中,都需要很强的工程能力。从数据pipeline搭建,到Query设计、数据初步构成,再到后续清洗和质量控制,背后都有复杂工程链路,并非简单人工标注。数据表面上是一门生意,但做得足够好时,也可能成为模型厂之外的一个候选人团队,甚至一个小型预训练、后训练组织。

但单纯的数据生意很难支撑创业公司持续走下去。2025年市场曾披露,和垂直领域专家数据起家的Mercor年化收入达1亿美元,但其中60%到70%的总收入需支付给承包商,留给公司的空间有限。Scale AI也有超过一半营收用于直接业务成本,包括承包商薪资。国内一些数据标注平台公布的价格中,标注员时薪通常在200至500元,资历更高、专业性更强的人甚至可达上千元。随着模型能力提升,后训练公司对顶尖专家需求越来越复杂:依赖大量人工意味着成本不断上涨,提高专家收费会压缩毛利,不提高又难获足够高质量数据。

数据业务订单也并非完全确定。一位投资人表示,第一批数据供应商进入市场时,很多公司先在每个垂直领域做出一批高质量样本,再拿去给阿里、腾讯等客户展示,客户认可后才下订单。但一个订单并不等于一笔可立即确认的收入,每批数据都需研究员验收和质量控制,若连续几次交付数量或质量不达标,客户可能缩减甚至取消订单。

从VC角度看,投资最终要回到两个问题:能否形成足够高的价值倍数,以及未来有没有清晰的退出路径。海外大厂分工相对成熟,每家大厂给外部数据公司的年度预算到2027年、2028年仍在增长,体量很大,因此海外数据公司有不错市场空间,也已出现被并购的退出机会。但中国市场逻辑不同,如果最终只是一家数据外包公司,无论被并购还是上市,空间都相对有限。

在前述投资人看来,未来的数据生意可能不再是「一条数据卖多少钱」的模式,一些数据创业公司开始试图站到SaaS的位置上。传统企业本身没有训练AI模型的能力,但内部拥有大量独特业务流程和高价值数据,数据公司可进入这些企业的工作流,帮助其完成AI化改造。企业会开放一些独特业务场景,公司不仅获得数据,也能积累真实任务轨迹和交互反馈,再沉淀到自己的模型和训练体系中。这样一来,数据不再是一次性交付的商品,而变成连接客户工作流、模型训练和长期服务的一层基础设施,定价方式也会从按数据条数付费,转向为一套能持续产生高质量数据、完成任务执行和模型反馈的系统付费。海外一些数据公司已往更深服务能力走,Turing、Scale、Invisible等都在发展咨询或更深度的企业服务业务。当然,数据越深入客户核心业务,风险也越高。Mercor今年遭遇数据泄露事件后,Meta暂停了与其合作,OpenAI也对此展开调查。

除了追求更高智能,模型发版速度加快也是今年数据订单增长的另一个原因。2026年以来,头部模型厂商发版节奏已压缩到月度级。技术方面,背后可能有一个关键变量在发挥作用:RSI。RSI(Recursive Self-Improvement,递归式自我改进)指AI参与甚至改进自身研发流程,从而持续缩短模型迭代周期,被视为本轮模型发版加速的重要推手,也成为中美AI创投圈热词。这并非全新概念,学术界很早就开始讨论。5月,由Meta前FAIR研究总监田渊栋8位顶级AI研究员联合创办的新AI实验室Recursive Superintelligence(RSI)完成6.5亿美元融资,投后估值约46.5亿美元,这一技术概念正式被推到资本市场面前。一些数据初创公司也开始把RSI作为自身融资叙事的一部分。

有投资人关注到,最近一些数据团队已在新领域搭建「半RSI」系统。它们尚未实现完全自动化迭代,但在某些环节可能已做到接近一半甚至70%到80%。比如团队可在新垂直领域快速生产高质量分析、标注和合成数据,同时把专家经验和人的判断高效嵌入系统。未来若能进一步减少人工介入,让系统自己完成任务生成、执行、评估和迭代,就有机会从数据生产走向更完整的模型改进闭环。然而RSI创业门槛极高,同时需要前沿模型、巨额算力、顶尖研究人才、训练基础设施、大规模实验能力以及足够强的模型评估系统。当前真正有能力尝试闭合完整循环的,仍主要是OpenAI、Anthropic、Google DeepMind以及极少数资本和人才配置超常规的新Lab。

今天市场上很多公司都在讲RSI,但做的并不是同一件事:有的对标大模型公司,目标是做下一代模型研发;有的RSI只发生在某个产品的自动化层面;还有的团队所说的RSI,是自己的数据管线可实现自净化、自迭代。这些工作的层次、方向和范围都不一样,短中期内可能存在明显差距。从投资角度看,首先要拆解RSI的具体含义:它究竟在解决哪个层面的问题?这个层面未来能占据什么生态位?能力边界在哪里,有没有继续向上延展的可能?

当然,数据创业者也不必都以RSI做下一代模型为目标。有些人想得很清楚:出来创业不是为了融资,而是找三五个人、十个人,做一门能赚钱的生意。只要第一笔订单跑通,客户能正常回款,现金流就不会有太大压力。作为年轻人的第一桶金,数据似乎是个不错的生意。在前述投资人看来,一个团队也不会因为选择「做数据」而减分,相反,过程中积累的能力可能成为未来做出更大事情的重要前提。