微軟通過 Hugging Face 平台釋出了一款全新的 GUI 智慧體模型——GELab-Zero-4B-preview-Sico-Evolution。這是一個僅有 4B 引數的影像文本到文本模型,卻在實際任務中展現出驚人的效能飛躍。
該模型是開源平台 Sico 的一部分,該平台旨在構建和進化“數字工作者”,讓 AI 智慧體與人類操作員在實際工作中共同進化。此次釋出的模型是 Sico 平台的首個公開 GUI 智慧體,基於開源的 GELab-Zero-4B-preview 基礎模型,採用 LoRA 技術進行微調,訓練資料來自 微軟 Edge 瀏覽器和 Copilot 的 UI 操作軌跡。
最引人注目的是其效能提升幅度。基礎模型的任務成功率僅為 39.8%,而經過 Sico 進化管線最佳化後,成功率飆升至 82.9%,絕對增幅高達 43.1 個百分點。這一結果意味著該模型在執行 GUI 自動化任務時,可靠性得到了質的提升。
在與其他模型的對比中,這款 4B 小模型的表現同樣令人側目。它超越了多個閉源頂尖模型,包括 GPT-5.4(79.7%)、Claude-Opus-4.6(81.3%)和 Claude-Opus-4.7(82.1%)。在開源陣營中,它更是大幅領先 kimi-k2.6(62.6%)和 UI-Venus-1.5-30B(61.0%)等競爭對手。值得注意的是,UI-Venus-1.5 的引數規模達到 30B,是 GELab-Zero-4B-preview-Sico-Evolution 的 7.5 倍,但成功率卻低了超過 20 個百分點。
這一成果的核心在於微軟提出的通用 GUI 模型進化管線。該管線採用迭代機制,能夠持續提升智慧體在真實任務中的成功率,並且可以遷移到任何 GUI 應用程式中。這意味著開發者可以利用這一流程,針對特定的軟體介面或工作流,不斷最佳化智慧體的表現,而無需從頭訓練大模型。
從產業角度看,這款模型的釋出對 AI 應用層具有多重意義。首先,它證明了小引數模型通過針對性微調和進化最佳化,可以在特定垂直任務上達到甚至超越大模型的表現,這為端側部署和降低推理成本提供了可行路徑。其次,GUI 智慧體是連線 AI 能力與真實軟體操作的關鍵橋樑,在自動化辦公、軟體測試、輔助操作等領域具有廣闊的應用前景。微軟選擇將模型以 Apache-2.0 許可證開源,也有助於推動開發者社群在這一方向的探索和落地。
該模型基於 Qwen3-VL 架構,支援英文和中文,標籤涵蓋 GUI 智慧體、移動智慧體、視覺語言等領域。隨著 Sico 平台後續更多進化模型的釋出,這一技術路線能否在更復雜的多步任務和跨應用場景中保持優勢,將是業界關注的焦點。