Meta Superintelligence Labs於8月10日突然開源了Muse系列的首個模型——Muse Glimmer,這是一個30B引數的Agent模型,採用最寬鬆的Apache 2.0許可證。此舉正值美國四個州的總檢察長向Meta索賠1.4萬億美元,指控其將Facebook和Instagram設計成對青少年上癮的產品。Meta在開源與法律壓力的雙重背景下,展現了其AI戰略的攻守姿態。

Muse Glimmer的定位並非聊天機器人,而是常駐本地的Agent。其架構為30B稠密多模態模型,包含27.9B文本解碼器1.9B視覺編碼器,支援128k以上上下文。模型權重已在Hugging Face開放,並同步提供GGUF和Unsloth變體。釋出當天,llama.cpp、Ollama、LM Studio等主流推理框架即實現day-0支援,AMD、Arm、Intel、NVIDIA均參與裝置端最佳化,顯示出Meta的充分準備。

為了將30B模型塞進24GB顯示卡,Meta採用了兩項關鍵技術:量化投機解碼。量化將權重壓縮至約4-bit,使模型體積降至20GB以內;投機解碼則通過一個小模型先預測,主模型一次驗證,顯著提升生成速度。實測在RTX 5090上,解碼速度從74.9 tok/s提升至233 tok/s,提速3.1倍;在MacBook M5 Max上提速1.8倍至50 tok/s。SGLang在RTX 5090上配合NVFP4和DFlash,單使用者速度達236 tok/s,批次吞吐達1452 tok/s。這些工程手段有效解決了本地Agent的響應延遲問題。

Glimmer的能力主要來自蒸餾。訓練過程分為三階段:預訓練階段使用Muse Spark的輸出進行logit蒸餾,中訓階段擴充套件上下文並加入密集Agent資料,後訓練結合監督微調、on-policy蒸餾和強化學習。這種方式讓30B小模型繼承了旗艦模型的能力,包括精確的工具呼叫、多步推理、錯誤診斷重試、多模態輸入以及100多種語言支援。然而,在官方對比中,Glimmer在MCP Atlas上得分75.5,超過Gemma4-31B和Qwen3.6-27B,但在OSWorld-Verified、TerminalBench 2.1和SWE-Bench Verified上,Qwen3.6-27B反而領先,顯示其在電腦操作和程式碼編寫上仍有差距。

開源時機頗為微妙。扎克伯格同日釋出14頁長文《The Future is for Everyone》,明確主張超級智慧應普及,反對集中,並點名DeepSeek、Qwen、Kimi為開源領域的領先者,呼籲美國放寬對開源AI的限制。這被視為Meta對開源生態被中國模型佔據的公開承認與反擊。同時,Muse Spark的API已開始銷售,但競爭力尚不及Anthropic和OpenAI旗艦,Meta通過開源Glimmer為API引流,類似DeepSeek、月之暗面、阿里的策略。此外,Alexandr Wang預告Muse Spark 1.2的開源權重版也將推出。

至於那場1.4萬億美元的訴訟,四州按“每個受影響青少年使用者乘以法定罰款上限”計算,Meta在法庭檔案中稱其為“博頭條的數字”。8月奧克蘭開庭在即,Meta此時高舉開源、隱私大旗,敘事收益明顯。據《紐約時報》報道,Meta內部還在開發代號Watermelon的更強模型,但未提及開源計劃,因此Glimmer的定位是開源蒸餾產物,核心能力仍保留。

Glimmer的釋出驗證了一條產品路線:雲端旗艦推動能力上限,本地小模型通過蒸餾承接,再用量化和投機解碼適配消費級硬體。檔案、日曆、程式碼等高頻私密任務有望在裝置端執行。而扎克伯格點名三家中國實驗室,也凸顯了開源大模型的重心所在。