螞蟻集團旗下inclusionAI於Hugging Face釋出了UI-Venus-2-9B,這是一個基於Qwen3.5-9B的通用GUI智慧體,旨在通過統一的閉環推理-行動框架,在移動應用、網頁平台和桌面作業系統上執行任務。該模型權重已公開,程式碼、專案頁面和技術報告也已同步釋出。

UI-Venus-2-9B是UI-Venus-2系列的一個版本,其核心設計是讓智慧體觀察當前介面、推理任務狀態、執行動作,並根據環境反饋調整下一步決策。為了從“基準導向”走向“真實世界可用”,研發團隊在三個維度進行了擴充套件:環境方面,可執行的移動應用池擴充套件至170多個多語言應用(100多箇中文應用和70多個英文應用),網頁池覆蓋19個類別的4000多個域名,並原生支援桌面作業系統;任務方面,採用深度研究流程,將生成的指令錨定在應用的實際功能上,以提高任務查詢的準確性、有效性和可執行性;驗證方面,基於任務相關的視覺關鍵點和多模型投票構建了軌跡級和樣本級評估器,提供可靠的強化學習獎勵訊號,並對抗獎勵駭客攻擊。

在安全評估中,UI-Venus-2-9B在OSHarmOSBlind基準上的攻擊成功率(ASR,越低越好)分別為11.3%48.8%,而其基礎模型Qwen3.5-9B的對應數值為25.3%和79.4%,顯示出顯著的安全效能提升。此外,該模型在GUI grounding、移動、網頁、計算機使用和CAPTCHA等基準上,在相近規模模型中達到了接近最先進的效能。

訓練方面,UI-Venus-2採用了五個任務族(Grounding、CAPTCHA、Mobile、Web和Computer)的混合資料,通過三個階段進行:多模態中期訓練——在模擬環境中進行大規模軌跡訓練,並用人類判別器協作驗證過濾無效互動;離線強化學習——對每個任務族進行獨立的步驟級最佳化,發展領域專用策略;多教師線上策略蒸餾——將領域專用教師合併為統一策略,保留基礎模型的廣泛多模態推理能力,同時整合空間定位、驗證互動和長程導航能力。

在部署上,模型支援通過vLLM進行服務,並提供了針對不同任務族的推理配置建議:通用代理任務使用溫度1.0並啟用推理;GUI grounding任務停用推理並使用溫度0;CAPTCHA任務則需使用特定提示和解析器。值得注意的是,模型權重許可證尚未最終確認,官方表示將在公開發布前新增,且未沿用Apache-2.0宣告,因為上游材料存在衝突的許可宣告。

UI-Venus-2-9B的釋出反映了GUI智慧體領域的一個趨勢:從單一基準測試轉向更全面的真實環境覆蓋和安全性考量。對於AI產業而言,這類模型可能推動自動化操作、智慧助手等應用的發展,並可能影響相關軟體和硬體生態。不過,其實際效果和廣泛應用仍需進一步驗證。