Meta Superintelligence Labs于8月10日突然开源了Muse系列的首个模型——Muse Glimmer,这是一个30B参数的Agent模型,采用最宽松的Apache 2.0许可证。此举正值美国四个州的总检察长向Meta索赔1.4万亿美元,指控其将Facebook和Instagram设计成对青少年上瘾的产品。Meta在开源与法律压力的双重背景下,展现了其AI战略的攻守姿态。

Muse Glimmer的定位并非聊天机器人,而是常驻本地的Agent。其架构为30B稠密多模态模型,包含27.9B文本解码器1.9B视觉编码器,支持128k以上上下文。模型权重已在Hugging Face开放,并同步提供GGUF和Unsloth变体。发布当天,llama.cpp、Ollama、LM Studio等主流推理框架即实现day-0支持,AMD、Arm、Intel、NVIDIA均参与设备端优化,显示出Meta的充分准备。

为了将30B模型塞进24GB显卡,Meta采用了两项关键技术:量化投机解码。量化将权重压缩至约4-bit,使模型体积降至20GB以内;投机解码则通过一个小模型先预测,主模型一次验证,显著提升生成速度。实测在RTX 5090上,解码速度从74.9 tok/s提升至233 tok/s,提速3.1倍;在MacBook M5 Max上提速1.8倍至50 tok/s。SGLang在RTX 5090上配合NVFP4和DFlash,单用户速度达236 tok/s,批量吞吐达1452 tok/s。这些工程手段有效解决了本地Agent的响应延迟问题。

Glimmer的能力主要来自蒸馏。训练过程分为三阶段:预训练阶段使用Muse Spark的输出进行logit蒸馏,中训阶段扩展上下文并加入密集Agent数据,后训练结合监督微调、on-policy蒸馏和强化学习。这种方式让30B小模型继承了旗舰模型的能力,包括精确的工具调用、多步推理、错误诊断重试、多模态输入以及100多种语言支持。然而,在官方对比中,Glimmer在MCP Atlas上得分75.5,超过Gemma4-31B和Qwen3.6-27B,但在OSWorld-Verified、TerminalBench 2.1和SWE-Bench Verified上,Qwen3.6-27B反而领先,显示其在电脑操作和代码编写上仍有差距。

开源时机颇为微妙。扎克伯格同日发布14页长文《The Future is for Everyone》,明确主张超级智能应普及,反对集中,并点名DeepSeek、Qwen、Kimi为开源领域的领先者,呼吁美国放宽对开源AI的限制。这被视为Meta对开源生态被中国模型占据的公开承认与反击。同时,Muse Spark的API已开始销售,但竞争力尚不及Anthropic和OpenAI旗舰,Meta通过开源Glimmer为API引流,类似DeepSeek、月之暗面、阿里的策略。此外,Alexandr Wang预告Muse Spark 1.2的开源权重版也将推出。

至于那场1.4万亿美元的诉讼,四州按“每个受影响青少年用户乘以法定罚款上限”计算,Meta在法庭文件中称其为“博头条的数字”。8月奥克兰开庭在即,Meta此时高举开源、隐私大旗,叙事收益明显。据《纽约时报》报道,Meta内部还在开发代号Watermelon的更强模型,但未提及开源计划,因此Glimmer的定位是开源蒸馏产物,核心能力仍保留。

Glimmer的发布验证了一条产品路线:云端旗舰推动能力上限,本地小模型通过蒸馏承接,再用量化和投机解码适配消费级硬件。文件、日历、代码等高频私密任务有望在设备端运行。而扎克伯格点名三家中国实验室,也凸显了开源大模型的重心所在。