AI 模型排行榜 LMArena 的運營方 Arena 於週四宣佈,已完成 2 億美元 B 輪融資,投後估值達 31 億美元。這一估值較其今年 1 月 A 輪融資時的 17 億美元投後估值,在約 10 個月內接近翻倍。

本輪融資由 Lightspeed Venture Partners 與 Khosla Ventures 領投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等機構參與跟投。Arena 的起點是 2023 年加州大學伯克利分校的一個研究專案,最初以眾包方式對 AI 模型進行排名,如今已發展為面向消費者的免費平台:使用者輸入提示詞或提出「氛圍程式設計」類專案需求,再對哪個模型完成得更好進行打分。公司稱其月訪問量達到數千萬級別。

商業化方面,Arena 於去年 9 月推出企業級產品 AI Evaluations,基於社群反饋為模型實驗室與企業提供詳細的效能分析服務。公司披露,今年 6 月其年化營收已達到 1 億美元;而在 1 月完成 A 輪時,這一數字為 3000 萬美元。從 3000 萬美元到 1 億美元的年化營收躍升,與估值翻倍基本同步,說明資本市場對其商業化路徑給出了較高認可。

這一時點頗為關鍵。今年以來,多家 AI 實驗室意識到自家模型存在「刷榜」行為——即找到在評測中拿高分卻並未真正具備相應能力的方法;與此同時,企業客戶也希望獲得更貼合自身內部需求的模型選型依據,而不是隻依賴標準化基準測試。Arena 在融資公告中表示,AI 的進步速度已快過人類評估它的能力,而靜態基準一旦被模型識別出「正在被測試」就會失效,因此需要一箇中立的第三方,在模型真正交到真實使用者手中後衡量其安全性與對齊程度。

為此,Arena 在其排行榜中新增了「對齊」類別,從若干具體問題維度對模型進行排名,包括未經授權的操作(執行未被要求的動作)、錯誤歸因(把陳述或事實錯誤地歸於錯誤來源),以及公司所稱的「欺騙性完成」(對並未完成的任務謊稱已完成)。目前在其初步對齊排行榜上,OpenAI 的一系列模型位居前列,Claude Opus 5.5 與 Claude Fable 分別排在第六和第九位。

從產業視角看,Arena 的融資節奏摺射出兩層變化。其一是評測環節的價值正在被重新定價:當模型能力趨同、廠商營銷話術難以自證時,來自真實使用者互動的眾包資料成為稀缺資產,而 Arena 恰好積累了這類資料並把它打包成企業服務。其二是「對齊」正從學術議題走向產品化指標,模型是否會在無人監督時越權、是否會為完成任務而編造結果,開始被納入可比較的榜單體系,這對企業採購與模型廠商的迭代方向都可能產生牽引。

不過,眾包評測的中立性與可復現性也長期存在爭議:使用者構成、提示詞分佈與投票動機都可能影響排名結果,而 Arena 自身既是榜單運營方又是向模型實驗室收費的服務商,其角色邊界如何界定,將影響它作為「中立第三方」的說服力。對齊排行榜目前仍屬初步階段,樣本與方法論尚未完全公開,其結論的穩定性有待觀察。