花旗在7月24日釋出的最新AI追蹤報告中指出,AI大模型正變得越來越聰明,但承載它們的物理世界——晶片算力、記憶體頻寬和電力供應——正在被推向極限。報告顯示,月之暗面旗下Kimi K3以57分的智慧得分躋身全球第三,僅落後於閉源榜首Claude Fable 5(60分)和OpenAI GPT-5.6 Sol(59分),差距縮小至3分。Kimi K3是目前公開發布的最大開源模型,幾周前開源陣營最高分還只有51分(智譜AI GLM-5.2),Kimi K3一步躍升6分。整個行業都在加速:前20大模型提供商的中位智慧得分從六週前的34分升至43分。開源陣營中,DeepSeek V4 Pro(44分)每百萬token定價低至0.03美元,接近前沿智慧水平,價格卻低了兩個數量級。閉源陣營也沒有放慢,谷歌剛釋出Gemini 3.6 Flash(7月21日),同時Gemini 3.5 Pro仍在測試,Gemini 4的預訓練已經啟動,三代模型三線並進。花旗認為,Flash先發、Pro延後的釋出節奏釋放出一個訊號:前沿模型的推進正變得更難,這與其他公司在基礎設施建設上遭遇的延誤相一致,也折射出行業希望壓縮交付週期卻難以如願的現狀。
模型越大越強,執行所需的資源也在急劇膨脹。花旗指出,萬億引數模型正在改寫“算力”的含義:這些超大模型實際執行時,越來越多的時間花在跨HBM記憶體和GPU網際網路絡搬運權重及KV-cache資料上,而非矩陣運算本身。瓶頸已經從“算得快不快”(FLOPs)轉向了“搬得動搬不動”——記憶體頻寬、GPU互聯和電力供應成為新的制約。GPU需求依然旺盛,Blackwell架構GPU租金年初至今上漲27%。但單純堆GPU已經不夠,部分實驗室開始直接切入上游發電:SpaceX斥資10億美元購買1GW移動渦輪機組(7月15日),Georgia Power同周簽署服務協議(7月22日)。AI實驗室購買發電裝置——一年前幾乎不可想象的事情,現在正在發生。
模型定價直接反映了產能有多緊。中國前沿模型的混合定價從每百萬token跳漲至0.87美元,周環比和月環比均漲45%,是兩個月來首次大幅波動。全球前沿模型均價周環比漲6.8%,月環比漲11.3%。美歐相對穩定(周環比-0.5%),但月環比也上升了4.1%。花旗判斷,隨著增量基礎設施陸續上線,定價壓力終將緩解,屆時有價值的資料和任務特定效能將比算力獲取構成更持久的護城河。
模型在變強,但跑在模型上的AI agent也在變得更危險。花旗報告用了一個耐人尋味的表述:自主AI agent逃逸沙箱的現實風險,已從4月的“打斷午餐”升級到7月的“滲透Hugging Face基礎設施”。開源模型越強越普及,安全風險的擴散面就越大。AI監管辯論仍在進行——輝達(7月24日)和美國財長貝森特(7月22日)近日均有表態——但短期內難有定論。即便監管框架尚未落地,維護自有模型執行架構的企業已面臨更高的合規門檻。更棘手的是,訓練這些模型的提供商自己仍然無法完全檢視模型為何如此行動,可解釋性問題至今沒有解決。
但安全隱憂並沒有減慢agent的商業化程序。METR(7月21日)的資料顯示,AI agent與人工之間的經濟性差距正在收窄。當agent更自主、更接近經濟可行性,token消耗會持續加速,這又反過來推高基礎設施需求。花旗分析稱,AI行業的投資回報正加速向基礎設施層轉移,而下一階段的模型競爭護城河,將從單純的“算力獲取”徹底轉向“高效產出與專有資料”。能力越強,約束越緊;約束越緊,基礎設施需求越大——這個迴圈沒有減速的跡象。