校园招聘平台Handshake的联合创始人兼CEO Garrett Lord在8月31日的播客中透露,公司过去一年多建立的新AI业务已从零增长至约10亿美元收入,并预期可达20亿美元。相比之下,其运营十多年的校园招聘业务年经常性收入(ARR)刚超过2亿美元。Handshake的主业是帮助大学生找到第一份工作,但现在其增长最快的业务变成了教AI如何工作,这一激进的转型使其成为硅谷关注的创业案例。

Lord在访谈中解释,模型公司如今更需要让AI进入接近真实工作的环境:它可以看到电脑里的文件、云端资料,调用行业软件和工具,像真正的员工一样完成连续任务。他形容这是专家在“电子游戏里工作”。这背后反映了大模型训练数据的结构变化:互联网上的文字、图片和代码是预训练阶段的主要养料,但到了Agent阶段,AI还需要知道真实的人如何完成一份工作。

软件工程Agent进展迅速,因为代码有天然的验证机制,模型容易知道自己做对与否。但绝大多数职业没有对应的“GitHub”。例如,石油工程师如何结合井下数据、历史文件和专业软件做判断,这些知识很少被完整记录在公开互联网上。Lord提到,零售、制造、油气等行业缺乏可直接用于训练模型的真实工作环境,因此自动化水平远低于软件工程。Handshake的做法是:找到真正做过这份工作的人,弄清楚他们每天打开哪些文件、用哪些软件、在哪些步骤需要关键判断,然后重新实现这些工具和环境,设计模型可通过训练学会的任务,并给出成功与失败的评分标准。这与过去简单的数据标注完全不同,后者主要判断对错,而Agent时代需要的是“任务发生在哪里、模型可以做什么、怎样判断完成”。

Handshake成立于2013年,其职业网络已覆盖超过3000万人和约100万家公司。它知道用户的教育背景、专业和职业轨迹,这些信息现在有了新价值:验证一个人是否拥有模型急需的专业经验。Lord透露,上个月参与Handshake AI项目的专家中,89%来自其自有职业网络,这使其相比在社交媒体上寻找专家的竞争者拥有天然优势。Handshake推出AI业务时,强调拥有50万名博士和300万名硕士研究生,可为模型提供物理、化学、法律、金融、医学等领域的专业反馈。Lord总结说:“模型已经强到普通标注员越来越不够用了,它们真正需要的是各个领域的专家。”

Handshake今年初收购了MIT团队创办的Cleanlab,增强在RL environments、evals、AI safety和human data上的能力。5月,它开源了Agent评分器Gandalf。传统LLM-as-a-judge只看模型生成的文字,而Gandalf直接运行在与Agent相同的环境中,可自行决定检查哪些文件和工具结果。Handshake公布的实验中,其最低成本配置约花42美元,F1达到0.633;最强的非Gandalf基线成本约422美元,F1只有0.604。

从专家、任务、环境到verifier,所谓“训练数据”的边界正在扩大。对于Agent训练,一条数据越来越像一个完整的模拟世界:有用户、文件、软件工具、连续动作,以及判断模型是否完成任务的评分器。Lord认为,模型公司已在专业领域投入“数百亿美元”规模的资金,顶尖实验室的数据需求集中在科学、药物发现、材料科学和真实职业任务,而这些领域“不存在一个Reddit或者GitHub等价物”。

Handshake的收入从外部证明了模型公司正在大量采购后训练能力。小米大模型团队负责人罗福莉曾给出量化判断:在Chatbot时代,模型研发用卡比例(研究:正式预训练:正式后训练)约为3:5:1;进入Agent阶段,合理比例变为3:1:1,即正式后训练所需算力与正式预训练相当,顶尖团队可能已是1:1。她直言“Agent范式很吃后训练”,模型进入长程Agent任务后,需要大量实验学习理解Context、调用工具、处理连续反馈,预训练和后训练的资源重要性正在重新平衡。

不过,Handshake的10亿美元收入并非传统SaaS意义上的ARR。The Information今年4月获得的财务数据显示,Handshake AI当时的年化总收入接近10亿美元,但支付专家和承包商后,年化净收入接近3亿美元;旧校招业务贡献接近1.5亿美元。第三方研究机构Sacra估计,Handshake今年4月全公司年化总收入约11亿美元,其中AI训练业务约9.5亿美元;扣除专家及外包人员报酬后,年化净收入约4.5亿美元,其中AI业务净收入约3亿美元。这意味着Handshake的10亿美元中,超过一半甚至接近七成需支付给提供专业知识的人,与高毛利软件公司的收入含义不同。同行Mercor也有类似结构,其超过10亿美元的年化总收入中,约60%—70%需支付给承包商。

Lord不认同“模型学会工作会消耗自身需求”的判断,他认为Coding Agent能力越强,对更困难软件任务的数据需求反而越大。目前数据支持需求仍在快速增长,但全球能每年投入数十亿美元训练前沿模型的实验室数量有限,客户高度集中;同时,synthetic data、self-play和自动verifier也在减少对人工反馈的依赖。Handshake推出Gandalf,本质上也在自动化部分评分工作。这形成了AI数据行业的循环:公司通过组织人类训练AI高速增长,同时又在努力训练AI替代这批人类训练者。最终留下的价值可能是“谁还能拥有模型无法自己生成的东西”。