微軟於 8 月 12 日釋出了面向 GitHub Copilot 的程式碼模型 MAI Code 1.1 Flash,宣稱其效能優於前代,成本僅為 6 月版本的四分之一,token 效率提升 25%,開發者對其輸出的接受率提高了 4%。訓練過程涉及“GitHub Copilot 中數十萬個強化學習環境”。然而,在公開基準測試中,該模型在效能和價格兩方面均被 DeepSeek-V4-Flash-0731 大幅超越。
根據微軟公佈的基準資料,MAI Code 1.1 Flash 在 SWE-bench Verified 上得分為 72.6%,高於前代 MAI-Code-1-Flash 的 71.6%,也優於 Anthropic 的 Haiku 4.5(69.8%)和 OpenAI 的 GPT-5.4 mini(69.2%),但 DeepSeek-V4-Flash-0731 未公佈該項成績。在 Terminal Bench 2.1 測試中,MAI Code 1.1 Flash 得分為 62.9%,前代為 51.7%,Haiku 4.5 為 49.4%,GPT-5.4 mini 為 60.7%,而 DeepSeek-V4-Flash-0731 高達 82.7%。
價格方面,MAI Code 1.1 Flash 的輸入價格為每百萬 token 0.20 美元,帶快取輸入為 0.02 美元,輸出為 1.20 美元;相比之下,DeepSeek-V4-Flash 分別為 0.14 美元、0.0028 美元和 0.28 美元。雖然僅看每 token 成本並不全面,但考慮到使用效率,差距可能依然顯著。Anthropic 的 Claude Haiku 4.5 定價更高,輸入 1.00 美元、帶快取輸入 0.10 美元、輸出 5.00 美元。
值得注意的是,微軟在官方公告中僅籠統提及“程式碼存活率提升 4%、回訪增加 9%”等改進,而未直接與競品對比,基準測試結果被隱藏在模型卡中。分析認為,這可能是因為直接對比會暴露其與 DeepSeek 的差距。
這一發布與微軟近期宣稱的“開源 AI 擁護者”形象並不相符。微軟並未採用更強大且免費可用的 DeepSeek-V4-Flash,反而投入資源開發效能較弱、價格更高的專有模型,且很可能不會開放權重。此舉背後的原因或許與微軟近期調整 Copilot 策略一致——用自家更便宜的 MAI 模型替換 OpenAI 和 Anthropic 的模型,以降低成本,但代價是效能下降,從而改善利潤率。
微軟生態內的使用者仍可根據應用場景選擇不同模型,但微軟幾乎肯定會逐步將自家模型設為預設選項。由於大多數使用者不會主動選擇特定 AI 模型,這可能會鎖定大量市場份額。這一策略在短期內可能有利於微軟的財務表現,但從長期看,若使用者因效能差距而轉向其他工具,微軟在 AI 程式碼生成市場的競爭力或將受到挑戰。