Meta在8月10日发布了新的开源多模态模型Muse Glimmer,该模型专为本地智能体(agentic)用例设计,参数规模为30B,采用Apache 2.0许可证。这一发布标志着Meta在开源大模型领域的回归,其前代模型Llama系列曾引领开源社区。Muse Glimmer从更大的Muse模型蒸馏而来,旨在平衡性能与部署效率,适合隐私敏感的应用场景,如编码辅助、文档分析、个人助理,以及类似Claw或Hermes的智能体设置。Hugging Face在发布当天即提供了对transformers、llama.cpp、vLLM、Inference Endpoints等库的day-0支持,并展示了多个演示,包括将OpenClaw连接到Muse Glimmer,以及让模型自我量化、部署、优化和研究Hub等趣味用例。
在架构上,Muse Glimmer是一个稠密的30B参数模型,包含一个2B的ViT风格视觉编码器(Perception Encoder)和一个28B的文本解码器。视觉编码器采用2帧×3通道×14×14的patch化处理,经过线性投影和插值绝对位置嵌入后,送入50层、含GELU MLP的视觉塔。注意力模式采用三层窗口注意力加一层全注意力的组合,并应用2D RoPE。像素洗牌操作将相邻2×2空间token合并,使图像token数量减少4倍。视频则逐帧通过同一编码器处理。文本解码器采用混合注意力机制,交替使用三个滑动窗口层(窗口大小2048 token,使用旋转位置嵌入)和一个全注意力层(无位置嵌入),重复13次共52层。此外,模型采用门控分组查询注意力(GQA),每个键值头由16个查询头共享,将KV缓存内存减少16倍,从而加快生成速度并降低成本。模型还应用了Q-K归一化和额外的查询缩放,以稳定注意力logits。
除了主视觉语言模型,Muse Glimmer还配备了一个基于DFlash实现的投机解码草稿模块,该模块可选,能在增加一定内存开销的情况下显著加速生成,尤其适用于结构化内容生成如代码。
在基准测试中,Muse Glimmer与Gemma4-31B Thinking Mode和Qwen3.6-27B Thinking Mode进行了对比。在通用智能体任务中,Muse Glimmer在MCP Atlas上得分为75.5,高于Gemma4的54.2和Qwen3.6的62.5;在DeepSearch QA上为74.6,同样领先;在τ³-Banking上为23.5,优于对比模型;在WildClawBench上为47.6,高于Gemma4的37.6但低于Qwen3.6的43.2(注:此处原文数据有误,Qwen3.6为43.2,但表格中显示为43.2,实际应为43.2,但Muse Glimmer仍领先);在GDPval-AA上为953,低于Qwen3.6的1141;在GAIA2上为43.3,领先;在SkillsBench上为44.3,低于Qwen3.6的46.6;在OSWorld-Verified上为65.9,低于Qwen3.6的75.6。在智能体编码任务中,Muse Glimmer在SWE-Bench Pro上为51.2,领先;在SWE-Bench Verified上为76.0,低于Qwen3.6的77.2;在TerminalBench上为51.7,领先;在SciCode上为43.6,略高于Gemma4的43.4。在多模态任务中,Muse Glimmer在Charxiv Reasoning上为78.8,领先;在ScreenSpot Pro上为75.4,低于对比模型;在OmniDocBench v1.5上为75.8,高于Gemma4但低于Qwen3.6;在MMMU Pro上为74,低于Qwen3.6的74(注:原文为74,但Qwen3.6为74,实际相同)。在安全测试中,Muse Glimmer的CI Memories Violation为26.4,高于Gemma4的12.1,但低于Qwen3.6的53.4;Siren AgentDojo攻击成功率为28.4,低于Qwen3.6的40.3。在通用能力与推理方面,Muse Glimmer在IFBench上为77.0,领先;在AIME 2026上为94.7,领先;在GPQA Diamond上为83.5,低于Gemma4的85.7;在Humanity's Last Exam上为22.0,低于对比模型;在AA-LCR上为80.0,领先;在Beam 128K上为65.1,领先。
总体而言,Muse Glimmer在多项智能体相关基准上表现强劲,尤其在编码和工具调用任务上,其本地部署特性为开发者提供了新的选择。Hugging Face的全面支持进一步降低了采用门槛,有望推动开源智能体生态的发展。