Meta於9月3日釋出新一代旗艦模型Muse Spark 1.3,在Artificial Analysis的AI分析指數榜上得分62分,僅次於Claude Fable 5.1(66分)和Claude Opus 5(63分),超越了谷歌同日釋出的Gemini 3.8 Flash(59分)。這一排名使Meta在基準測試中暫時領先於谷歌最新推理模型。
Meta聯合創始人兼CEO馬克·扎克伯格在社交平台X上表示,Muse Spark 1.3的效能“超乎想象”。Meta超級智慧實驗室負責人、首席AI官汪滔(Alexander Wang)稱,該模型成本低到“幾乎可以忽略不計”,智慧體、程式設計能力以及易用性大幅提升。他還公開調侃谷歌,在社交平台上發文“gemini who?”,並稱“Gemini現在取消(上線)還不算晚”。
就在Meta釋出新模型前4小時,谷歌推出了其自稱“迄今為止最強”的推理與程式設計模型Gemini 3.8的Flash和Flash Cyber版本,但隨後在Artificial Analysis榜單上被Meta反超。谷歌在該指數上的領先僅維持了幾個小時。
價格與效能
Muse Spark 1.3的API定價與前代1.2保持一致:每百萬token輸入(快取未命中)1.25美元(約合人民幣8.4元),快取命中為0.15美元(約合人民幣1元),輸出為4.25美元(約合人民幣28.55元)。這一價格略高於Gemini 3.8 Flash,但比DeepSeek-V4-Pro的高峰期價格更便宜。有開發者使用該模型製作了《我的世界》遊戲,成本僅10美分(約合人民幣0.67元)。
在基準測試中,Muse Spark 1.3拿下5項第一,在場下文和程式設計方面大部分測試優於GPT-5.6 Sol和Claude Opus 5,僅Terminal-Bench終端操作Agent測試與GPT-5.6 Sol打平。其相對薄弱的是Agent能力,在聯網搜尋類Agent和通用知識任務GDPVal-AA v2中分數較低。
開發者實測反饋
社交平台X上,不少開發者曬出實測案例,普遍評價是速度快、成本低,但生成效果並不驚豔。一位開發者對比了Muse Spark 1.1到1.3對同一建築進行3D模擬的效果,幾何形狀、結構及視覺效果均有明顯提升,總成本保持在0.6美元(約合人民幣4.03元)不變。另一位開發者執行Muse Spark 1.3 Ultra Contributor版本,兩小時內執行了60次以上智慧體任務,成本不到1美元,但有網友質疑這是否說明模型一直未完成任務。
開源的3D空間推理基準測試MineBench結果顯示,Gemini 3.8 Flash總測試成本1.18美元(約合人民幣7.93元),平均推理耗時1分51秒,首測Elo評分為1888分;Muse Spark 1.3總測試成本6.57美元(約合人民幣44.14元),平均推理耗時5分36秒,首測得分1787分,顯示其生成輸出質量與頂尖前沿模型仍有差距。另一位開發者對比了Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT-5.6 Sol,認為Muse Spark在成本與速度上可與Qwen 3.8 Max媲美,而GLM 5.3綜合表現最佳。
技術亮點與迭代節奏
Meta部落格指出,Muse Spark 1.3的優勢在於支撐長週期任務和程式設計。它能與使用者協同,在單條長對話中並行處理多條工作流,面對開放式目標時自主構建上下文、修正方案漏洞。相比前代,Muse Spark 1.3在多步驟任務中能更好保留細節,不遺漏約束條件。Meta工程師測試顯示,其工具呼叫次數減少了20%,token使用量減少了25%。此外,模型的對抗魯棒性增強,對提示注入攻擊的抵禦能力提升,處理複雜智慧體任務時能審慎執行不可逆操作。
過去5個月,Meta接連推出四款Muse Spark模型:4月首發,7月更新1.1,8月上線1.2,加上最新的1.3,迭代節奏愈發密集。Meta表示,已規劃好產品路線圖,包括更大引數規模模型、開源權重版本釋出等。
產業視角
Meta以密集迭代和低價策略衝擊市場,反映出大模型競爭已從單一效能轉向成本、速度與專長領域的綜合比拼。Muse Spark 1.3沒有追求全維度通殺,而是聚焦長上下文和程式設計,在DeepSWE、OSWorld等真實工程基準上反超前沿模型。這種取捨可能預示,未來開發者與企業選型不再追求“一個模型搞定全部”,多模型路由、根據任務型別排程不同專長模型,或將成為企業落地Agent的主流方案。