OpenAI 的 AI 程式設計工具 Codex 正經歷爆發式增長。根據多方追蹤的資料,Codex 的使用者總數在 7 月中旬已突破 700 萬,而今年年初時這一數字僅約為 55 萬至 70 萬,意味著在約六個月內實現了超過 10 倍的使用者增長。
增長在近期尤為迅猛。7 月 9 日,OpenAI 釋出了 GPT-5.6 模型;隨後在 7 月 10 日至 12 日的約 48 小時內,Codex 使用者數從 500 萬躍升至 600 萬,新增了 100 萬用戶。更驚人的是,在接下來的約 24.5 小時內,使用者數再度攀升 100 萬,達到了 700 萬的里程碑。這一增速恰好與 Anthropic 意外延長其 Claude Fable 訂閱服務的時間點重合,儘管兩者是否存在直接關聯尚無定論。
Codex 的這一增長軌跡,讓外界自然將其與主要競爭對手 Claude Code 進行比較。Anthropic 上一次公開披露 Claude Code 的使用者資料是在今年 2 月,當時其周活躍使用者數較 1 月初翻倍,達到約 200 萬,年化經常性收入(ARR)為 25 億美元。此後,Anthropic 未再更新該產品的使用者規模。一種較為善意的解讀是,Anthropic 可能已將程式設計功能的重心轉移至數月前推出的 Claude Tag 上,由於該產品基於 Slackbot 而非命令列工具(CLI),其使用統計口徑與 Codex 難以直接對比。
儘管如此,Codex 在半年內實現 10 倍使用者增長的勢頭依然令人矚目。這一現象背後,是整個 AI 程式設計工具賽道競爭邏輯的演變。行業觀察顯示,模型能力已不再是唯一的差異化因素,編排層(harness/orchestrator) 正日益成為決定產品成敗的關鍵。有觀點直言“編排層就是應用本身”,未來的贏家將是那些針對特定任務深度最佳化工作流的工具,而非提供通用介面的套殼產品。
與此同時,AI 程式設計工具的評估標準也在從單純的 Token 價格轉向單次任務成本。有開發者構建的程式設計智慧體指數顯示,部分模型雖單次呼叫費用更高,但因能做出更精準的決策、減少無效操作,最終完成任務的總成本反而更低。例如,一項實驗發現,在由 Fable 5 模型主導的執行中,81% 的情況下該模型無需親自編輯程式碼,僅通過高效委派和判斷就完成了任務,從而避免了昂貴模型的不必要消耗。
在更廣泛的智慧體基礎設施層面,Prime Intellect 近期釋出了其 Verifiers v1 環境棧,專為智慧體的強化學習與評估設計。該架構將環境拆分為任務集、執行器和執行時,並支援使用者自定義執行器。技術上的一項重要改進是,其 rollout 軌跡現在以訊息有向無環圖(DAG) 形式儲存,每條訊息只存一次,而非在完整歷史中反覆複製,這將軌跡儲存的增長複雜度從 O(n²) 降至 O(n),使得長週期、多模態的智慧體 rollout 變得更加可行。團隊聲稱,使用 6 個 H200 節點,在不到兩天內即可對一個 1000 億引數的推理模型 在 40 輪軟體工程任務上進行 1000 步強化學習訓練。
Codex 使用者數的飆升,疊加編排層重要性上升和成本評估體系演進等趨勢,共同勾勒出 AI 程式設計工具市場正從技術炫技走向工程化落地的關鍵轉折。對於開發者而言,工具的選擇將越來越取決於其在真實工作流中端到端的效率與成本表現,而非單純的模型跑分。