阿里巴巴將領投AI評測公司UniPat AI的一輪3億美元融資,投後估值約25億美元。據鈦媒體經授權釋出的內容,騰訊、紅杉中國等投資方也可能參與,但交易仍在談判,具體條款尚未最終確定。

UniPat在AI圈外知名度不高,但其定位切中了大模型行業的一個關鍵瓶頸。該公司設計用於測試和衡量人工智慧模型的現實場景,並生成詳細的訓練與基準測試資料。其釋出的基準測試已開始被美國實驗室引用到自己的模型報告中。

這家公司成立於2025年末,創始人曾在阿里巴巴月之暗面騰訊工作。在阿里期間,其就職於通義人工智慧實驗室,參與訓練後分析、資料合成和強化學習相關工作。從公開專案看,UniPat並不滿足於給模型排個名次。在軟體開發領域,Monthly-SWEBench每月從真實GitHub專案中篩選任務,測試智慧體能否修復程式碼、完成新功能並通過真實驗證;EvoCode-Bench則讓模型在同一工作空間中連續完成多輪任務,處理需求變化、上下文積累和前後步驟依賴。其Echo系統會從新聞、資料、預測市場和即時網路資訊中提取線索,生成機率判斷,並在未來事件發生後驗證結果。

UniPat在4月釋出的一份公司新聞稿稱,團隊讓5個EchoZ智慧體在Polymarket進行一週實盤測試,其中4個獲得正收益;公司同時公佈了政治與治理問題上的63.2%市場勝率,以及7天以上預測中的59.3%勝率。這讓UniPat的角色從“AI考官”變得更復雜:既測試模型,也訓練模型;既生產資料,也試圖把預測能力變成可出售的服務。

其ExpertEval測試集覆蓋醫療、金融和法律三個高風險領域,包含3213個專家案例207個場景和平均每題21.83條評分標準。這些標準不僅判斷答案是否正確,還會判斷模型有沒有遺漏關鍵條件、是否違反專業規則,以及有沒有犯那些表面合理、現實代價卻很高的錯誤。UniPat把這些錯誤稱為“關鍵負面項”。這套方法背後的判斷是:模型能力的瓶頸,不總是引數和算力,也可能是監督質量。UniPat在公開材料中稱,經過專家Rubric監督訓練的小模型,在多個專業任務上取得了明顯提升。

這一方向與阿里AI戰略的變化相呼應。阿里正把AI從模型研發推向雲、企業軟體和消費業務。2026年3月,阿里推出企業級智慧體平台悟空,希望讓多個智慧體進入企業工作流程;阿里還成立了Alibaba Token Hub事業群,把基礎模型、模型服務和AI應用放在更緊密的組織體系中。2026年6月,阿里把通義大模型團隊和未來生活實驗室合併為Token Foundry,由集團CEO吳泳銘直接負責。阿里需要的因此不只是更強的Qwen,還需要知道Qwen在真實辦公流程裡能否完成任務、模型生成的答案是否值得企業採用、AI能力能否轉化成客戶願意支付的錢。這些問題都需要獨立的測試環境、可重複的任務和明確的驗收標準。

阿里2026年公佈的業績資料顯示,雲智慧集團外部收入增速達到40%,AI相關產品已成為雲業務的重要增長來源;Model Studio客戶數量同比增長8倍。公司隨後披露,AI雲與算力服務收入達到71億美元,同比增長45%。阿里投資UniPat的戰略邏輯可能就在這裡:為Qwen以及未來更多AI產品,提前購買一套“能不能真正工作”的判斷系統。

如果融資最終完成,UniPat約25億美元的估值來自三個未來下注。第一,UniPat能否成為模型公司的測試供應商。第二,它能否掌握足夠多的真實任務、專業規則和反饋資料。第三,它能否讓自己的測試結果進入模型採購、企業部署和模型訓練流程。一旦第三點成立,評測公司就不再是模型產業鏈的附屬角色,而會變成某種“標準制定者”。

但風險也很清楚。評測公司必須保持可信。如果它同時參與某個模型的訓練,又負責評價這個模型,外部客戶就會質疑其獨立性。更大的問題是,評測是否會被模型公司反向最佳化。只要測試集、評分標準和任務結構被充分研究,模型就可能學會針對榜單,而不是學會真正完成工作。模型會越來越多,排行榜也會越來越多,但真正稀缺的,可能是一個可信的答案:這個模型到底能不能完成客戶交給它的事情。誰掌握了這個答案,誰就可能站在AI商業化的驗收環節。