腾讯混元团队在 Hugging Face 上发布了开源模型 UI-Mate-democua-27B,这是一个演示引导的 GUI 智能体检查点。该模型基于 Qwen3.6-27B 底座,参数量为 27B,采用 Apache-2.0 许可,支持图像文本到文本的输入输出,能够观察实时屏幕截图、推理可见状态,并输出结构化的键盘和鼠标操作。其核心亮点在于,用户只需展示一次工作流程,模型便能将该流程适配到新任务中,实现一次性程序化学习。

在技术实现上,UI-Mate-democua-27B 从通用强化学习检查点出发,通过监督微调混合了通用计算机使用数据和演示增强数据。这种混合训练方式保留了仅凭指令执行任务的能力,同时赋予了模型在提供演示时使用演示的能力。演示被视为指导而非固定动作脚本,录制的坐标不会被重放,模型会根据实时界面内容、布局或应用状态的变化重新规划。

评估结果显示,在 OSWorkerBench 子集(包含 33 个多应用办公任务)上,严格成功率从仅指令的 17.17% 提升至加入演示后的 35.35%,进步了 18.18 个百分点;进度指标从 67.85% 提升至 81.14%,进步 13.29 个百分点。在 OSWorld 子集上,进度从 40.27% 提升至 65.75%,进步 25.48 个百分点。演示改善了 33 个任务中的 28 个,完美完成任务的数量从 1 个增加到 5 个。平均轨迹长度也从 173.3 步增加到 216.0 步,表明模型在演示引导下更深入地探索任务。

该模型支持与 pyautogui 兼容的结构化动作,并通过 OpenAI 兼容接口提供服务。训练过程中刻意保留部分指导信息,例如省略焦点点击、滚动和弹窗关闭等关键动作,迫使模型从屏幕截图推断缺失步骤,从而增强其适应能力。此外,训练混合了三种指导与屏幕关系:完全对齐、部分错位(模型从屏幕纠正不匹配步骤)和不相关(模型忽略工作流),其中完全对齐占多数,以确保指导的有效性。

UI-Mate-democua-27B 是 UI-Mate 系列的一部分,该系列还包括 UI-Mate-27B 和 UI-Mate-9B 等通用计算机使用检查点。此次发布的演示引导版本专注于通过演示提升任务执行效率,适用于桌面自动化、GUI 操作等场景。该模型的开源发布有助于推动 GUI 智能体在办公自动化、软件测试等领域的应用,为 AI 产业的应用层提供了新的工具选择。