AI 模型市场再度迎来密集发布潮。xAI 推出 Grok 4.6,Google 带来 Gemini 3.7 FlashDeepSeek 则发布 V4 Pro 0813。三家公司的模型几乎同时登场,围绕智慧、速度与价格展开激烈竞争。独立评测网站 Artificial Analysis(AA)的测试结果显示,三款模型各具特色:Grok 4.6 在智慧与代理型任务上表现突出,Gemini 3.7 Flash 以极致速度见长,而 DeepSeek 则因涨价策略引发热议。

Grok 4.6:智力跃升,长程代理任务效率优选

作为本轮更新中最受关注的产品,Grok 4.6 的表现令人瞩目。据 xAI 介绍,该模型通过更长时间的预训练,并结合 AI 生成数据与高质量工程数据来强化推理能力;后训练阶段则以 Grok 4.5 为基础,进行监督式微调与强化学习。AA 评测显示,Grok 4.6 的智慧指数达到 61 分,与 GPT-5.6 Sol 并列,正式跻身 60 分以上的顶尖模型行列。

价格方面,Grok 4.6 维持了极具竞争力的收费标准:每百万输入 token 2 美元、输出 6 美元。此外,它执行实际任务平均仅需 53 回合、约 5 亿个输入 token,资源消耗显著低于部分竞品,这对于处理长流程代理工作极为有利。

DeepSeek V4 Pro 0813:表现保守,峰谷定价策略惹议

向来以低价高量著称的 DeepSeek,本次更新却伴随涨价声浪。AA 给予其 53 分的智慧指数,虽优于先前的预览版,但在同级竞品中仍显保守。尽管在 GPQA Diamond 与 Terminal-Bench v2.1 等测试中表现尚可,且单次任务费用约 6 美分(在 104 个模型中名列第二便宜),但新实施的计费机制却引发疑虑。

DeepSeek 同步宣布 API 采用峰谷定价,将北京时间上午 9 点至中午、下午 2 点至 6 点列为高峰时段。在部分情境下,价格最高恐飙升至原先的 12 倍,这让市场质疑其“平价 AI”的定位是否受到冲击。

Gemini 3.7 Flash:极致神速,主打开发实用性与均衡配置

Google 推出的 Gemini 3.7 Flash 则将重心放在速度与实用性上。其智慧指数达 56 分(较前代提升 4 分),AA 认为这归功于代理型任务与程式开发能力的显著进步。该模型在 DeepSWE v1.1、FrontierCode、WebDev Arena 与 AutomationBench 等多项专业测试中皆有大幅提升。

最引人注目的是其输出速度飙升至每秒 340 个 token,成为这波新模型中速度最突出的产品。配合 Google 推出的半价策略(至 2026 年底前,维持每百万输入 0.75 美元、输出 3.75 美元),展现了极高的吸引力。

整体而言,这一轮新模型发布凸显了 AI 领域竞争形态的转变:市场不再单纯比拼单一分数,而是展开“智慧、代理能力、速度与成本”的综合考验。Grok 4.6 专注长程任务的高效能,Gemini 3.7 Flash 以神速与均衡配置取胜,而 DeepSeek 则需在低价优势与涨价压力之间寻找新的立足点。