過去兩年,大語言模型 API 市場的主要競爭手段是不斷降低每百萬 token 的價格,以此吸引開發者、擴大使用份額,並讓自家模型成為應用內的預設選擇。然而,這一階段正逐漸讓位於更多樣化的定價工具:分時段費率、快取感知折扣、模型分層,以及少數與業務成果掛鉤的收費嘗試。
8 月 17 日,DeepSeek 的新價格方案正式生效,引入了高峰和低谷時段:在北京時間 9:00-12:00 和 14:00-18:00 的白天高峰時段,費率較高;其他時間則減半。以 V4 Pro 模型為例,高峰時段快取未命中時輸入價格為每百萬 token 9 元,輸出價格為 27 元,快取命中時輸入價格為 0.3 元;低谷時段價格均為高峰的一半。而就在幾天前,該模型公佈的早期價格還是快取未命中輸入 3 元、輸出 6 元、快取命中輸入低至 0.025 元。因此,漲幅最大的是高峰時段的快取命中輸入價格。類似的調整也適用於更輕量的 V4 Flash 模型,其高峰價格分別為 3 元、9 元和 0.1 元。
這些具體數字本身並不重要,重要的是它們所引入的定價結構。分時段定價將非緊急工作負載引導至空閒時段,從而提高固定服務容量的利用率。快取感知定價獎勵那些複用上下文而非重新處理的系統。旗艦模型與輕量模型分開定價,讓高容量、簡單任務以較低成本執行,而複雜推理仍可收取溢價。
中國和海外的其他供應商也在測試類似的方法,包括預付費套餐、基礎費加使用費組合,以及少數將費用與可衡量結果掛鉤的商業協議。
推動這一變化的力量來自多個方面。一旦模型嵌入智慧體工作流,token 使用量會急劇上升。單個使用者請求可能觸發長鏈的中間步驟、工具呼叫和修訂。服務這些鏈條需要持續的算力、記憶體頻寬和能源投入,單個 token 的邊際成本不再微不足道。
與此同時,領先開源模型與專有模型之間的效能差距已經縮小。全球使用量追蹤顯示,中國模型在公開 API 流量中佔據更大份額。當相似質量的替代品以不同價格出現時,標價和總擁有成本對許多買家來說就變得至關重要。海外高價供應商則通過選擇性降低某些模型和層級的費率來應對。
因此,整個市場的價格呈現雙向變動:曾經主要靠成本競爭的供應商在提價,而試圖保住市場份額的現有廠商在降價。此前全面超低價的階段正在結束,取而代之的是更精準地將價格與實際需求和成本模式相匹配。
企業客戶也面臨內部變化。傳統軟體預算往往偏好固定許可或席位數量,即資本支出或可預測的運營支出,以適應年度規劃週期。而 token 計費引入了難以預測、難以跨團隊分配的可變成本。一些組織因此傾向於私有化或混合部署,以恢復一定程度的成本控制;另一些則接受按使用量計費,但要求更清晰的監控、警報和成本分攤工具。少數企業正在嘗試與結果掛鉤的協議,如按節省的小時數、解決的案例數或避免的損失收費,但這些仍難以標準化,因為結果高度依賴於模型的提示方式、整合方式和監督方式,同一系統在不同使用者手中可能產生截然不同的經濟價值。
供應商也在相應調整產品線。輕量或 flash 模型處理常規、高容量的任務,旗艦模型則保留給更難的推理問題。緩存摺扣和高峰定價改善了服務的經濟性。少數公司正在探索收入分成或商業許可結構,將對話從純 token 數量轉向客戶實際提取的經濟價值。
共同的主線是試圖超越每百萬 token 的純商品化競爭。核心商業問題因此改變:不再是誰標價最低,而是某個模型在給定價格、延遲和可靠性水平下,能否產生足夠的可衡量價值,以證明其在客戶 AI 預算中的位置。DeepSeek 轉向高峰定價和更高的絕對價格,正是該供應商試圖更精確回答這一問題的舉措。
整個行業都面臨同樣的壓力。隨著智慧體使用增長,持續推理的真實成本越來越難以忽視,定價不再是為了贏得規模,而是為了將成本結構與真實的需求和支付意願對齊。這一轉變不會整齊劃一。一些工作負載仍將高度價格敏感,繼續追逐最低費率;另一些,尤其是嵌入關鍵業務流程的,將接受更高價格以換取可靠性、支援和可預測的效能。正在形成的市場是多種價格點和多種商業模式共存,這看起來更像其他基礎設施市場中早已熟悉的差異化定價,而非過去兩年的純粹折扣。