Meta在8月10日釋出了新的開源多模態模型Muse Glimmer,該模型專為本地智慧體(agentic)用例設計,引數規模為30B,採用Apache 2.0許可證。這一發布標誌著Meta在開源大模型領域的迴歸,其前代模型Llama系列曾引領開源社群。Muse Glimmer從更大的Muse模型蒸餾而來,旨在平衡效能與部署效率,適合隱私敏感的應用場景,如編碼輔助、文件分析、個人助理,以及類似Claw或Hermes的智慧體設定。Hugging Face在釋出當天即提供了對transformers、llama.cpp、vLLM、Inference Endpoints等庫的day-0支援,並展示了多個演示,包括將OpenClaw連線到Muse Glimmer,以及讓模型自我量化、部署、最佳化和研究Hub等趣味用例。

在架構上,Muse Glimmer是一個稠密的30B引數模型,包含一個2B的ViT風格視覺編碼器(Perception Encoder)和一個28B的文本解碼器。視覺編碼器採用2幀×3通道×14×14的patch化處理,經過線性投影和插值絕對位置嵌入後,送入50層、含GELU MLP的視覺塔。注意力模式採用三層視窗注意力加一層全注意力的組合,並應用2D RoPE。畫素洗牌操作將相鄰2×2空間token合併,使影像token數量減少4倍。影片則逐幀通過同一編碼器處理。文本解碼器採用混合注意力機制,交替使用三個滑動視窗層(視窗大小2048 token,使用旋轉位置嵌入)和一個全注意力層(無位置嵌入),重複13次共52層。此外,模型採用門控分組查詢注意力(GQA),每個鍵值頭由16個查詢頭共享,將KV快取記憶體減少16倍,從而加快生成速度並降低成本。模型還應用了Q-K歸一化和額外的查詢縮放,以穩定注意力logits。

除了主視覺語言模型,Muse Glimmer還配備了一個基於DFlash實現的投機解碼草稿模組,該模組可選,能在增加一定記憶體開銷的情況下顯著加速生成,尤其適用於結構化內容生成如程式碼。

在基準測試中,Muse Glimmer與Gemma4-31B Thinking Mode和Qwen3.6-27B Thinking Mode進行了對比。在通用智慧體任務中,Muse Glimmer在MCP Atlas上得分為75.5,高於Gemma4的54.2和Qwen3.6的62.5;在DeepSearch QA上為74.6,同樣領先;在τ³-Banking上為23.5,優於對比模型;在WildClawBench上為47.6,高於Gemma4的37.6但低於Qwen3.6的43.2(注:此處原文資料有誤,Qwen3.6為43.2,但表格中顯示為43.2,實際應為43.2,但Muse Glimmer仍領先);在GDPval-AA上為953,低於Qwen3.6的1141;在GAIA2上為43.3,領先;在SkillsBench上為44.3,低於Qwen3.6的46.6;在OSWorld-Verified上為65.9,低於Qwen3.6的75.6。在智慧體編碼任務中,Muse Glimmer在SWE-Bench Pro上為51.2,領先;在SWE-Bench Verified上為76.0,低於Qwen3.6的77.2;在TerminalBench上為51.7,領先;在SciCode上為43.6,略高於Gemma4的43.4。在多模態任務中,Muse Glimmer在Charxiv Reasoning上為78.8,領先;在ScreenSpot Pro上為75.4,低於對比模型;在OmniDocBench v1.5上為75.8,高於Gemma4但低於Qwen3.6;在MMMU Pro上為74,低於Qwen3.6的74(注:原文為74,但Qwen3.6為74,實際相同)。在安全測試中,Muse Glimmer的CI Memories Violation為26.4,高於Gemma4的12.1,但低於Qwen3.6的53.4;Siren AgentDojo攻擊成功率為28.4,低於Qwen3.6的40.3。在通用能力與推理方面,Muse Glimmer在IFBench上為77.0,領先;在AIME 2026上為94.7,領先;在GPQA Diamond上為83.5,低於Gemma4的85.7;在Humanity's Last Exam上為22.0,低於對比模型;在AA-LCR上為80.0,領先;在Beam 128K上為65.1,領先。

總體而言,Muse Glimmer在多項智慧體相關基準上表現強勁,尤其在編碼和工具呼叫任務上,其本地部署特性為開發者提供了新的選擇。Hugging Face的全面支援進一步降低了採用門檻,有望推動開源智慧體生態的發展。