阿里巴巴将领投AI评测公司UniPat AI的一轮3亿美元融资,投后估值约25亿美元。据钛媒体经授权发布的内容,腾讯、红杉中国等投资方也可能参与,但交易仍在谈判,具体条款尚未最终确定。
UniPat在AI圈外知名度不高,但其定位切中了大模型行业的一个关键瓶颈。该公司设计用于测试和衡量人工智能模型的现实场景,并生成详细的训练与基准测试数据。其发布的基准测试已开始被美国实验室引用到自己的模型报告中。
这家公司成立于2025年末,创始人曾在阿里巴巴、月之暗面和腾讯工作。在阿里期间,其就职于通义人工智能实验室,参与训练后分析、数据合成和强化学习相关工作。从公开项目看,UniPat并不满足于给模型排个名次。在软件开发领域,Monthly-SWEBench每月从真实GitHub项目中筛选任务,测试智能体能否修复代码、完成新功能并通过真实验证;EvoCode-Bench则让模型在同一工作空间中连续完成多轮任务,处理需求变化、上下文积累和前后步骤依赖。其Echo系统会从新闻、数据、预测市场和实时网络信息中提取线索,生成概率判断,并在未来事件发生后验证结果。
UniPat在4月发布的一份公司新闻稿称,团队让5个EchoZ智能体在Polymarket进行一周实盘测试,其中4个获得正收益;公司同时公布了政治与治理问题上的63.2%市场胜率,以及7天以上预测中的59.3%胜率。这让UniPat的角色从“AI考官”变得更复杂:既测试模型,也训练模型;既生产数据,也试图把预测能力变成可出售的服务。
其ExpertEval测试集覆盖医疗、金融和法律三个高风险领域,包含3213个专家案例、207个场景和平均每题21.83条评分标准。这些标准不仅判断答案是否正确,还会判断模型有没有遗漏关键条件、是否违反专业规则,以及有没有犯那些表面合理、现实代价却很高的错误。UniPat把这些错误称为“关键负面项”。这套方法背后的判断是:模型能力的瓶颈,不总是参数和算力,也可能是监督质量。UniPat在公开材料中称,经过专家Rubric监督训练的小模型,在多个专业任务上取得了明显提升。
这一方向与阿里AI战略的变化相呼应。阿里正把AI从模型研发推向云、企业软件和消费业务。2026年3月,阿里推出企业级智能体平台悟空,希望让多个智能体进入企业工作流程;阿里还成立了Alibaba Token Hub事业群,把基础模型、模型服务和AI应用放在更紧密的组织体系中。2026年6月,阿里把通义大模型团队和未来生活实验室合并为Token Foundry,由集团CEO吴泳铭直接负责。阿里需要的因此不只是更强的Qwen,还需要知道Qwen在真实办公流程里能否完成任务、模型生成的答案是否值得企业采用、AI能力能否转化成客户愿意支付的钱。这些问题都需要独立的测试环境、可重复的任务和明确的验收标准。
阿里2026年公布的业绩资料显示,云智能集团外部收入增速达到40%,AI相关产品已成为云业务的重要增长来源;Model Studio客户数量同比增长8倍。公司随后披露,AI云与算力服务收入达到71亿美元,同比增长45%。阿里投资UniPat的战略逻辑可能就在这里:为Qwen以及未来更多AI产品,提前购买一套“能不能真正工作”的判断系统。
如果融资最终完成,UniPat约25亿美元的估值来自三个未来下注。第一,UniPat能否成为模型公司的测试供应商。第二,它能否掌握足够多的真实任务、专业规则和反馈数据。第三,它能否让自己的测试结果进入模型采购、企业部署和模型训练流程。一旦第三点成立,评测公司就不再是模型产业链的附属角色,而会变成某种“标准制定者”。
但风险也很清楚。评测公司必须保持可信。如果它同时参与某个模型的训练,又负责评价这个模型,外部客户就会质疑其独立性。更大的问题是,评测是否会被模型公司反向优化。只要测试集、评分标准和任务结构被充分研究,模型就可能学会针对榜单,而不是学会真正完成工作。模型会越来越多,排行榜也会越来越多,但真正稀缺的,可能是一个可信的答案:这个模型到底能不能完成客户交给它的事情。谁掌握了这个答案,谁就可能站在AI商业化的验收环节。