AI的“機器智慧”價格在持續下降,但生產它的物理系統的賬單卻在不斷攀升。對供應商定價和能力基準的分析顯示,自2022年底以來,達到GPT-3.5或早期GPT-4水平效能的成本已下降數十至數百倍,在某些追蹤序列中,固定能力門檻的降幅甚至超過280倍。如今,提供類似結果的通用模型,每百萬token的成本往往低於1美元,中端產品的降價幅度在20%至80%之間已成為常態。

與此同時,最大的雲和科技公司卻一再上調資本開支預測。頭部供應商2026年的合計支出預計在7000億至8000億美元以上,且還有進一步上調的可能。這些資金正湧入資料中心建設、先進處理器、高頻寬記憶體、網路裝置、電力基礎設施和冷卻系統。

這兩大趨勢其實相互關聯。當某能力的單位成本下降,經濟上可行的使用量就會擴大。這正是19世紀經濟學家威廉·斯坦利·傑文斯在更高效蒸汽機與煤炭總消耗上升案例中首次指出的模式。如今,更低的推理成本使得持續、多步驟的系統變得切實可行。這些智慧體架構不再止步於單一回答,而是會規劃、呼叫外部工具、檢查中間結果、糾正錯誤並迭代。

來自聚合平台的使用資料顯示,智慧體驅動的token消耗量增長速度遠超人類發起的流量,且在最近的測量中已超過後者。完成一項任務,智慧體方式所需的token量可能是簡單聊天的5到30倍,某些配置下倍數更高。研究估計,到本十年末,智慧體活動可能使整體token吞吐量成倍增長。因此,單位價格的下降並未減少對智慧生成資源的總需求,反而增加了需求。

瓶頸已沿供應鏈移動。早期短缺集中在高階處理器,隨後轉向高頻寬記憶體和將邏輯晶片與記憶體堆疊整合的先進封裝技術。封裝產能已擴大數倍,但仍被大量預訂;高頻寬記憶體的產出已基本鎖定至2026年及以後。在多個地區,電力供應和電網接入成為限制因素,冷卻系統也隨著機架密度上升而轉向液冷方案。

價值往往沉澱在供給擴張最慢的地方。通用模型智慧本身已變得更具競爭性和價格敏感,而那些難以快速複製的回報,出現在無法僅靠軟體加速生產的物理資產中,或出現在將廉價認知轉化為可靠商業成果的運營系統中——包括隨每次行動改進的反饋迴圈、持續的客戶關係,以及維持長流程準確性的流程。無差異化的模型接入或簡單的中間層則處於兩極之間。

隨著基礎能力變得更便宜、更普及,僅靠連線性收取長期溢價的能力在萎縮。買家越來越以具體的成本削減或產出增益來衡量系統。此前的技術轉型也遵循類似路徑:一旦稀缺的人類能力變得充裕且廉價,稀缺性並未消失,而是轉移了。機器認知正朝這個方向演進,無法以同樣速度擴充套件的環節,正是經濟回報集中的地方。這些點的永續性將取決於供給響應的速度,以及擴充套件的認知能力在多大程度上轉化為能證明物理投資合理性的成果。