Meta 最新推出的 Muse Spark 1.1 模型在程式設計能力上實現對智譜 GLM-5.2 的超越,同時以更低的成本提供了更強的可靠性。根據人工智慧評測機構 Artificial Analysis 的資料,該模型在智慧指數上獲得 51 分,與 GLM-5.2、GPT-5.4 和 GPT-5.6 Luna 並列,三個月內提升了整整 8 分。
在更細分的程式設計指數上,Muse Spark 1.1 拿到 71.3 分,壓過 GLM-5.2 的 68.8 分,僅以 0.1 分之差落後於 GPT-5.6 Luna 的 71.4 分。目前程式設計能力榜首仍由 GPT-5.6 Sol(77.4 分)和 Terra(76.7 分)佔據,Claude Fable 5 以 76.5 分緊隨其後。
成本端同樣值得關注。Muse Spark 1.1 的單任務成本估算為 0.26 美元,遠低於 GLM-5.2 的 0.37 美元和 GPT-5.4 的 0.89 美元。在輸出 token 消耗上,Muse Spark 1.1 僅需 9400 萬 token,而 GLM-5.2 需要 1.41 億 token,效率優勢明顯。
可靠性方面,Muse Spark 1.1 的幻覺率從此前的 73% 驟降至 38%。值得注意的是,這一改善並非因為模型變得更“聰明”,而是其策略發生了變化——現在模型更傾向於拒絕回答不確定的問題,而非給出錯誤答案。這種“寧可不說,也不說錯”的機制在實際應用中往往更受企業使用者青睞。
此外,Meta 還將模型的上下文視窗擴大至 100 萬 token,是此前的四倍。這意味著模型可以一次性處理更長的文件、程式碼庫或對話歷史,對於複雜程式設計任務和長文理解場景尤為關鍵。
目前 Muse Spark 1.1 僅通過 Meta 自有 API 提供服務,尚未接入第三方平台。這一發布節點恰逢模型層競爭白熱化階段——各家不僅在基準分數上貼身肉搏,更在單位成本和可靠性上尋找差異化突破口。對於關注 AI 基礎設施和應用的投資者而言,Muse Spark 1.1 的價效比表現可能對 API 定價生態產生示範效應,推動行業從“最強模型”敘事轉向“最適模型”的務實選擇。