蚂蚁集团旗下inclusionAI于Hugging Face发布了UI-Venus-2-9B,这是一个基于Qwen3.5-9B的通用GUI智能体,旨在通过统一的闭环推理-行动框架,在移动应用、网页平台和桌面操作系统上执行任务。该模型权重已公开,代码、项目页面和技术报告也已同步发布。

UI-Venus-2-9B是UI-Venus-2系列的一个版本,其核心设计是让智能体观察当前界面、推理任务状态、执行动作,并根据环境反馈调整下一步决策。为了从“基准导向”走向“真实世界可用”,研发团队在三个维度进行了扩展:环境方面,可执行的移动应用池扩展至170多个多语言应用(100多个中文应用和70多个英文应用),网页池覆盖19个类别的4000多个域名,并原生支持桌面操作系统;任务方面,采用深度研究流程,将生成的指令锚定在应用的实际功能上,以提高任务查询的准确性、有效性和可执行性;验证方面,基于任务相关的视觉关键点和多模型投票构建了轨迹级和样本级评估器,提供可靠的强化学习奖励信号,并对抗奖励黑客攻击。

在安全评估中,UI-Venus-2-9B在OSHarmOSBlind基准上的攻击成功率(ASR,越低越好)分别为11.3%48.8%,而其基础模型Qwen3.5-9B的对应数值为25.3%和79.4%,显示出显著的安全性能提升。此外,该模型在GUI grounding、移动、网页、计算机使用和CAPTCHA等基准上,在相近规模模型中达到了接近最先进的性能。

训练方面,UI-Venus-2采用了五个任务族(Grounding、CAPTCHA、Mobile、Web和Computer)的混合数据,通过三个阶段进行:多模态中期训练——在模拟环境中进行大规模轨迹训练,并用人类判别器协作验证过滤无效交互;离线强化学习——对每个任务族进行独立的步骤级优化,发展领域专用策略;多教师在线策略蒸馏——将领域专用教师合并为统一策略,保留基础模型的广泛多模态推理能力,同时整合空间定位、验证交互和长程导航能力。

在部署上,模型支持通过vLLM进行服务,并提供了针对不同任务族的推理配置建议:通用代理任务使用温度1.0并启用推理;GUI grounding任务禁用推理并使用温度0;CAPTCHA任务则需使用特定提示和解析器。值得注意的是,模型权重许可证尚未最终确认,官方表示将在公开发布前添加,且未沿用Apache-2.0声明,因为上游材料存在冲突的许可声明。

UI-Venus-2-9B的发布反映了GUI智能体领域的一个趋势:从单一基准测试转向更全面的真实环境覆盖和安全性考量。对于AI产业而言,这类模型可能推动自动化操作、智能助手等应用的发展,并可能影响相关软件和硬件生态。不过,其实际效果和广泛应用仍需进一步验证。