8月13日,DeepSeek正式发布DeepSeek-V4-Pro正式版API,大幅增强Agent能力,部分性能逼近甚至超越Claude Fable 5。这是继7月31日推出V4-Flash正式版后,DeepSeek在智能体赛道上的又一关键动作。
据官方基准测试,正式版相比预览版性能全面提升,在AI安全智能体基准测试套件Cybergym和工作流智能体AutomationBench中,DeepSeek-V4-Pro正式版的表现均超越Fable 5。尤其值得注意的是,在针对长周期、高复杂度真实软件工程的编程智能体测试DeepSWE中,正式版得分从预览版的12.8直接跃升至62.7,增幅近五倍,显示出其在复杂任务处理上的显著进步。
DeepSeek官方API文档显示,模型版本已更新为DeepSeek-V4-Pro-0813,调用方法不变,开发者仍使用`deepseek-v4-pro`即可调用最新版本。新版增强了Agent能力,支持JSON结构化输出、工具调用、Responses API及Anthropic API,为开发者构建智能体应用提供了更灵活的接口。不过,正式版的并发限制为500,低于DeepSeek-V4-Flash的2500,这可能影响高并发场景下的使用体验。
在社交平台X上,有网友反馈,目前网页端与API接口调用的DeepSeek-V4-Pro思维链(CoT)表现存在明显差异,API输出的话术读起来生硬、语序别扭。这一反馈提示,尽管基准测试成绩亮眼,但在实际API调用中,模型输出的自然度仍有待优化。
目前DeepSeek尚未公布V4-Pro的API价格,但8月6日官方预告,计划近期整体上调DeepSeek API服务的定价,预计涨幅较大。这一动向与DeepSeek此前在预览版发布时提到的“下半年昇腾950超节点批量上市后会大幅下调Pro价格”形成对比,显示出成本策略的调整。
从产业视角看,大模型比拼已进入智能体决赛圈。DeepSeek-V4-Pro正式版在智能体基准上的突破,进一步强化了其在Agent赛道的竞争力。然而,随着各家模型在各大Agent基准的跑分差距不断收窄,调用成本成为独立开发者、初创团队落地Agent项目的关键瓶颈。DeepSeek的涨价预告,可能促使部分开发者重新评估模型选型,或转向成本更低的替代方案。
对于AI产业链而言,模型层的竞争加剧将传导至下游应用生态,开发者对性价比的敏感度提升,或推动更多开源模型和轻量级方案的采用。同时,DeepSeek在智能体能力上的投入,也反映出行业对复杂任务自动化需求的增长,这将带动相关工具链和基础设施的演进。