丹麥知名程式設計師DHH(David Heinemeier Hansson)近日公佈了一項橫向對比測試結果:針對同一程式設計任務——將Python庫轉換為Rust,他測試了多款主流AI模型,結果顯示效能差距縮小,但成本差異懸殊。
在測試中,Fable 以45分鐘完成,但成本高達550美元;Soul/Grok 耗時約1.5小時,成本約為Fable的十分之一;而DeepSeek Pro 用時2小時45分鐘,成本僅為23美元。值得注意的是,三者生成的輸出完全相同。
DHH的測試表明,頂尖AI模型在特定任務上的效能差距正在縮小,但定價策略卻天差地別。這一現象引發了對AI定價邏輯的重新思考:當模型能力趨於同質化,成本將成為競爭的關鍵維度。
對AI產業而言,這一測試結果可能意味著:在應用層,開發者將更傾向於選擇價效比高的模型;在模型層,價格戰或成為常態;在基礎設施層,算力效率的重要性進一步凸顯。不過,該測試僅基於單一任務,結論的普適性仍有待更多驗證。