丹麦知名程序员DHH(David Heinemeier Hansson)近日公布了一项横向对比测试结果:针对同一编程任务——将Python库转换为Rust,他测试了多款主流AI模型,结果显示性能差距缩小,但成本差异悬殊。

在测试中,Fable45分钟完成,但成本高达550美元Soul/Grok 耗时约1.5小时,成本约为Fable的十分之一;而DeepSeek Pro 用时2小时45分钟,成本仅为23美元。值得注意的是,三者生成的输出完全相同

DHH的测试表明,顶尖AI模型在特定任务上的性能差距正在缩小,但定价策略却天差地别。这一现象引发了对AI定价逻辑的重新思考:当模型能力趋于同质化,成本将成为竞争的关键维度。

对AI产业而言,这一测试结果可能意味着:在应用层,开发者将更倾向于选择性价比高的模型;在模型层,价格战或成为常态;在基础设施层,算力效率的重要性进一步凸显。不过,该测试仅基于单一任务,结论的普适性仍有待更多验证。