Meta于9月3日发布新一代旗舰模型Muse Spark 1.3,在Artificial Analysis的AI分析指数榜上得分62分,仅次于Claude Fable 5.1(66分)和Claude Opus 5(63分),超越了谷歌同日发布的Gemini 3.8 Flash(59分)。这一排名使Meta在基准测试中暂时领先于谷歌最新推理模型。
Meta联合创始人兼CEO马克·扎克伯格在社交平台X上表示,Muse Spark 1.3的性能“超乎想象”。Meta超级智能实验室负责人、首席AI官汪滔(Alexander Wang)称,该模型成本低到“几乎可以忽略不计”,智能体、编程能力以及易用性大幅提升。他还公开调侃谷歌,在社交平台上发文“gemini who?”,并称“Gemini现在取消(上线)还不算晚”。
就在Meta发布新模型前4小时,谷歌推出了其自称“迄今为止最强”的推理与编程模型Gemini 3.8的Flash和Flash Cyber版本,但随后在Artificial Analysis榜单上被Meta反超。谷歌在该指数上的领先仅维持了几个小时。
价格与性能
Muse Spark 1.3的API定价与前代1.2保持一致:每百万token输入(缓存未命中)1.25美元(约合人民币8.4元),缓存命中为0.15美元(约合人民币1元),输出为4.25美元(约合人民币28.55元)。这一价格略高于Gemini 3.8 Flash,但比DeepSeek-V4-Pro的高峰期价格更便宜。有开发者使用该模型制作了《我的世界》游戏,成本仅10美分(约合人民币0.67元)。
在基准测试中,Muse Spark 1.3拿下5项第一,在场下文和编程方面大部分测试优于GPT-5.6 Sol和Claude Opus 5,仅Terminal-Bench终端操作Agent测试与GPT-5.6 Sol打平。其相对薄弱的是Agent能力,在联网搜索类Agent和通用知识任务GDPVal-AA v2中分数较低。
开发者实测反馈
社交平台X上,不少开发者晒出实测案例,普遍评价是速度快、成本低,但生成效果并不惊艳。一位开发者对比了Muse Spark 1.1到1.3对同一建筑进行3D模拟的效果,几何形状、结构及视觉效果均有明显提升,总成本保持在0.6美元(约合人民币4.03元)不变。另一位开发者运行Muse Spark 1.3 Ultra Contributor版本,两小时内执行了60次以上智能体任务,成本不到1美元,但有网友质疑这是否说明模型一直未完成任务。
开源的3D空间推理基准测试MineBench结果显示,Gemini 3.8 Flash总测试成本1.18美元(约合人民币7.93元),平均推理耗时1分51秒,首测Elo评分为1888分;Muse Spark 1.3总测试成本6.57美元(约合人民币44.14元),平均推理耗时5分36秒,首测得分1787分,显示其生成输出质量与顶尖前沿模型仍有差距。另一位开发者对比了Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT-5.6 Sol,认为Muse Spark在成本与速度上可与Qwen 3.8 Max媲美,而GLM 5.3综合表现最佳。
技术亮点与迭代节奏
Meta博客指出,Muse Spark 1.3的优势在于支撑长周期任务和编程。它能与用户协同,在单条长对话中并行处理多条工作流,面对开放式目标时自主构建上下文、修正方案漏洞。相比前代,Muse Spark 1.3在多步骤任务中能更好保留细节,不遗漏约束条件。Meta工程师测试显示,其工具调用次数减少了20%,token使用量减少了25%。此外,模型的对抗鲁棒性增强,对提示注入攻击的抵御能力提升,处理复杂智能体任务时能审慎执行不可逆操作。
过去5个月,Meta接连推出四款Muse Spark模型:4月首发,7月更新1.1,8月上线1.2,加上最新的1.3,迭代节奏愈发密集。Meta表示,已规划好产品路线图,包括更大参数规模模型、开源权重版本发布等。
产业视角
Meta以密集迭代和低价策略冲击市场,反映出大模型竞争已从单一性能转向成本、速度与专长领域的综合比拼。Muse Spark 1.3没有追求全维度通杀,而是聚焦长上下文和编程,在DeepSWE、OSWorld等真实工程基准上反超前沿模型。这种取舍可能预示,未来开发者与企业选型不再追求“一个模型搞定全部”,多模型路由、根据任务类型调度不同专长模型,或将成为企业落地Agent的主流方案。