微软于 8 月 12 日发布了面向 GitHub Copilot 的代码模型 MAI Code 1.1 Flash,宣称其性能优于前代,成本仅为 6 月版本的四分之一,token 效率提升 25%,开发者对其输出的接受率提高了 4%。训练过程涉及“GitHub Copilot 中数十万个强化学习环境”。然而,在公开基准测试中,该模型在性能和价格两方面均被 DeepSeek-V4-Flash-0731 大幅超越。
根据微软公布的基准数据,MAI Code 1.1 Flash 在 SWE-bench Verified 上得分为 72.6%,高于前代 MAI-Code-1-Flash 的 71.6%,也优于 Anthropic 的 Haiku 4.5(69.8%)和 OpenAI 的 GPT-5.4 mini(69.2%),但 DeepSeek-V4-Flash-0731 未公布该项成绩。在 Terminal Bench 2.1 测试中,MAI Code 1.1 Flash 得分为 62.9%,前代为 51.7%,Haiku 4.5 为 49.4%,GPT-5.4 mini 为 60.7%,而 DeepSeek-V4-Flash-0731 高达 82.7%。
价格方面,MAI Code 1.1 Flash 的输入价格为每百万 token 0.20 美元,带缓存输入为 0.02 美元,输出为 1.20 美元;相比之下,DeepSeek-V4-Flash 分别为 0.14 美元、0.0028 美元和 0.28 美元。虽然仅看每 token 成本并不全面,但考虑到使用效率,差距可能依然显著。Anthropic 的 Claude Haiku 4.5 定价更高,输入 1.00 美元、带缓存输入 0.10 美元、输出 5.00 美元。
值得注意的是,微软在官方公告中仅笼统提及“代码存活率提升 4%、回访增加 9%”等改进,而未直接与竞品对比,基准测试结果被隐藏在模型卡中。分析认为,这可能是因为直接对比会暴露其与 DeepSeek 的差距。
这一发布与微软近期宣称的“开源 AI 拥护者”形象并不相符。微软并未采用更强大且免费可用的 DeepSeek-V4-Flash,反而投入资源开发性能较弱、价格更高的专有模型,且很可能不会开放权重。此举背后的原因或许与微软近期调整 Copilot 策略一致——用自家更便宜的 MAI 模型替换 OpenAI 和 Anthropic 的模型,以降低成本,但代价是性能下降,从而改善利润率。
微软生态内的用户仍可根据应用场景选择不同模型,但微软几乎肯定会逐步将自家模型设为默认选项。由于大多数用户不会主动选择特定 AI 模型,这可能会锁定大量市场份额。这一策略在短期内可能有利于微软的财务表现,但从长期看,若用户因性能差距而转向其他工具,微软在 AI 代码生成市场的竞争力或将受到挑战。