校園招聘平台Handshake的聯合創始人兼CEO Garrett Lord在8月31日的播客中透露,公司過去一年多建立的新AI業務已從零增長至約10億美元收入,並預期可達20億美元。相比之下,其運營十多年的校園招聘業務年經常性收入(ARR)剛超過2億美元。Handshake的主業是幫助大學生找到第一份工作,但現在其增長最快的業務變成了教AI如何工作,這一激進的轉型使其成為矽谷關注的創業案例。
Lord在訪談中解釋,模型公司如今更需要讓AI進入接近真實工作的環境:它可以看到電腦裡的檔案、雲端資料,呼叫行業軟體和工具,像真正的員工一樣完成連續任務。他形容這是專家在“電子遊戲裡工作”。這背後反映了大模型訓練資料的結構變化:網際網路上的文字、圖片和程式碼是預訓練階段的主要養料,但到了Agent階段,AI還需要知道真實的人如何完成一份工作。
軟體工程Agent進展迅速,因為程式碼有天然的驗證機制,模型容易知道自己做對與否。但絕大多數職業沒有對應的“GitHub”。例如,石油工程師如何結合井下資料、歷史檔案和專業軟體做判斷,這些知識很少被完整記錄在公開網際網路上。Lord提到,零售、製造、油氣等行業缺乏可直接用於訓練模型的真實工作環境,因此自動化水平遠低於軟體工程。Handshake的做法是:找到真正做過這份工作的人,弄清楚他們每天開啟哪些檔案、用哪些軟體、在哪些步驟需要關鍵判斷,然後重新實現這些工具和環境,設計模型可通過訓練學會的任務,並給出成功與失敗的評分標準。這與過去簡單的資料標註完全不同,後者主要判斷對錯,而Agent時代需要的是“任務發生在哪裡、模型可以做什麼、怎樣判斷完成”。
Handshake成立於2013年,其職業網路已覆蓋超過3000萬人和約100萬家公司。它知道使用者的教育背景、專業和職業軌跡,這些資訊現在有了新價值:驗證一個人是否擁有模型急需的專業經驗。Lord透露,上個月參與Handshake AI專案的專家中,89%來自其自有職業網路,這使其相比在社交媒體上尋找專家的競爭者擁有天然優勢。Handshake推出AI業務時,強調擁有50萬名博士和300萬名碩士研究生,可為模型提供物理、化學、法律、金融、醫學等領域的專業反饋。Lord總結說:“模型已經強到普通標註員越來越不夠用了,它們真正需要的是各個領域的專家。”
Handshake今年初收購了MIT團隊創辦的Cleanlab,增強在RL environments、evals、AI safety和human data上的能力。5月,它開源了Agent評分器Gandalf。傳統LLM-as-a-judge只看模型生成的文字,而Gandalf直接執行在與Agent相同的環境中,可自行決定檢查哪些檔案和工具結果。Handshake公佈的實驗中,其最低成本配置約花42美元,F1達到0.633;最強的非Gandalf基線成本約422美元,F1只有0.604。
從專家、任務、環境到verifier,所謂“訓練資料”的邊界正在擴大。對於Agent訓練,一條資料越來越像一個完整的模擬世界:有使用者、檔案、軟體工具、連續動作,以及判斷模型是否完成任務的評分器。Lord認為,模型公司已在專業領域投入“數百億美元”規模的資金,頂尖實驗室的資料需求集中在科學、藥物發現、材料科學和真實職業任務,而這些領域“不存在一個Reddit或者GitHub等價物”。
Handshake的收入從外部證明了模型公司正在大量採購後訓練能力。小米大模型團隊負責人羅福莉曾給出量化判斷:在Chatbot時代,模型研發用卡比例(研究:正式預訓練:正式後訓練)約為3:5:1;進入Agent階段,合理比例變為3:1:1,即正式後訓練所需算力與正式預訓練相當,頂尖團隊可能已是1:1。她直言“Agent範式很吃後訓練”,模型進入長程Agent任務後,需要大量實驗學習理解Context、呼叫工具、處理連續反饋,預訓練和後訓練的資源重要性正在重新平衡。
不過,Handshake的10億美元收入並非傳統SaaS意義上的ARR。The Information今年4月獲得的財務資料顯示,Handshake AI當時的年化總收入接近10億美元,但支付專家和承包商後,年化淨收入接近3億美元;舊校招業務貢獻接近1.5億美元。第三方研究機構Sacra估計,Handshake今年4月全公司年化總收入約11億美元,其中AI訓練業務約9.5億美元;扣除專家及外包人員報酬後,年化淨收入約4.5億美元,其中AI業務淨收入約3億美元。這意味著Handshake的10億美元中,超過一半甚至接近七成需支付給提供專業知識的人,與高毛利軟體公司的收入含義不同。同行Mercor也有類似結構,其超過10億美元的年化總收入中,約60%—70%需支付給承包商。
Lord不認同“模型學會工作會消耗自身需求”的判斷,他認為Coding Agent能力越強,對更困難軟體任務的資料需求反而越大。目前資料支援需求仍在快速增長,但全球能每年投入數十億美元訓練前沿模型的實驗室數量有限,客戶高度集中;同時,synthetic data、self-play和自動verifier也在減少對人工反饋的依賴。Handshake推出Gandalf,本質上也在自動化部分評分工作。這形成了AI資料行業的迴圈:公司通過組織人類訓練AI高速增長,同時又在努力訓練AI替代這批人類訓練者。最終留下的價值可能是“誰還能擁有模型無法自己生成的東西”。