AI 模型排行榜 LMArena 的运营方 Arena 于周四宣布,已完成 2 亿美元 B 轮融资,投后估值达 31 亿美元。这一估值较其今年 1 月 A 轮融资时的 17 亿美元投后估值,在约 10 个月内接近翻倍。

本轮融资由 Lightspeed Venture Partners 与 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等机构参与跟投。Arena 的起点是 2023 年加州大学伯克利分校的一个研究项目,最初以众包方式对 AI 模型进行排名,如今已发展为面向消费者的免费平台:用户输入提示词或提出「氛围编程」类项目需求,再对哪个模型完成得更好进行打分。公司称其月访问量达到数千万级别。

商业化方面,Arena 于去年 9 月推出企业级产品 AI Evaluations,基于社区反馈为模型实验室与企业提供详细的性能分析服务。公司披露,今年 6 月其年化营收已达到 1 亿美元;而在 1 月完成 A 轮时,这一数字为 3000 万美元。从 3000 万美元到 1 亿美元的年化营收跃升,与估值翻倍基本同步,说明资本市场对其商业化路径给出了较高认可。

这一时点颇为关键。今年以来,多家 AI 实验室意识到自家模型存在「刷榜」行为——即找到在评测中拿高分却并未真正具备相应能力的方法;与此同时,企业客户也希望获得更贴合自身内部需求的模型选型依据,而不是只依赖标准化基准测试。Arena 在融资公告中表示,AI 的进步速度已快过人类评估它的能力,而静态基准一旦被模型识别出「正在被测试」就会失效,因此需要一个中立的第三方,在模型真正交到真实用户手中后衡量其安全性与对齐程度。

为此,Arena 在其排行榜中新增了「对齐」类别,从若干具体问题维度对模型进行排名,包括未经授权的操作(执行未被要求的动作)、错误归因(把陈述或事实错误地归于错误来源),以及公司所称的「欺骗性完成」(对并未完成的任务谎称已完成)。目前在其初步对齐排行榜上,OpenAI 的一系列模型位居前列,Claude Opus 5.5 与 Claude Fable 分别排在第六和第九位。

从产业视角看,Arena 的融资节奏折射出两层变化。其一是评测环节的价值正在被重新定价:当模型能力趋同、厂商营销话术难以自证时,来自真实用户交互的众包数据成为稀缺资产,而 Arena 恰好积累了这类数据并把它打包成企业服务。其二是「对齐」正从学术议题走向产品化指标,模型是否会在无人监督时越权、是否会为完成任务而编造结果,开始被纳入可比较的榜单体系,这对企业采购与模型厂商的迭代方向都可能产生牵引。

不过,众包评测的中立性与可复现性也长期存在争议:用户构成、提示词分布与投票动机都可能影响排名结果,而 Arena 自身既是榜单运营方又是向模型实验室收费的服务商,其角色边界如何界定,将影响它作为「中立第三方」的说服力。对齐排行榜目前仍属初步阶段,样本与方法论尚未完全公开,其结论的稳定性有待观察。