騰訊混元團隊在 Hugging Face 上釋出了開源模型 UI-Mate-democua-27B,這是一個演示引導的 GUI 智慧體檢查點。該模型基於 Qwen3.6-27B 底座,引數量為 27B,採用 Apache-2.0 許可,支援影像文本到文本的輸入輸出,能夠觀察即時螢幕截圖、推理可見狀態,並輸出結構化的鍵盤和滑鼠操作。其核心亮點在於,使用者只需展示一次工作流程,模型便能將該流程適配到新任務中,實現一次性程式化學習。
在技術實現上,UI-Mate-democua-27B 從通用強化學習檢查點出發,通過監督微調混合了通用計算機使用資料和演示增強資料。這種混合訓練方式保留了僅憑指令執行任務的能力,同時賦予了模型在提供演示時使用演示的能力。演示被視為指導而非固定動作指令碼,錄製的座標不會被重放,模型會根據即時介面內容、佈局或應用狀態的變化重新規劃。
評估結果顯示,在 OSWorkerBench 子集(包含 33 個多應用辦公任務)上,嚴格成功率從僅指令的 17.17% 提升至加入演示後的 35.35%,進步了 18.18 個百分點;進度指標從 67.85% 提升至 81.14%,進步 13.29 個百分點。在 OSWorld 子集上,進度從 40.27% 提升至 65.75%,進步 25.48 個百分點。演示改善了 33 個任務中的 28 個,完美完成任務的數量從 1 個增加到 5 個。平均軌跡長度也從 173.3 步增加到 216.0 步,表明模型在演示引導下更深入地探索任務。
該模型支援與 pyautogui 相容的結構化動作,並通過 OpenAI 相容介面提供服務。訓練過程中刻意保留部分指導資訊,例如省略焦點點選、滾動和彈窗關閉等關鍵動作,迫使模型從螢幕截圖推斷缺失步驟,從而增強其適應能力。此外,訓練混合了三種指導與螢幕關係:完全對齊、部分錯位(模型從螢幕糾正不匹配步驟)和不相關(模型忽略工作流),其中完全對齊佔多數,以確保指導的有效性。
UI-Mate-democua-27B 是 UI-Mate 系列的一部分,該系列還包括 UI-Mate-27B 和 UI-Mate-9B 等通用計算機使用檢查點。此次釋出的演示引導版本專注於通過演示提升任務執行效率,適用於桌面自動化、GUI 操作等場景。該模型的開源釋出有助於推動 GUI 智慧體在辦公自動化、軟體測試等領域的應用,為 AI 產業的應用層提供了新的工具選擇。