谷歌于 9 月 2 日发布 Gemini 3.8 Flash,官方定价维持输入每百万 token 0.75 美元、输出 3.75 美元,但第三方机构 Artificial Analysis 当天实测发现,完成同一任务的总成本上升约 40%,原因是模型单任务输出 token 消耗增加约 30%。价格表未动,账单却悄然变厚,这背后折射出大模型竞争正从“每 token 价格”切换到“每任务成本”的新阶段。
Gemini 3.8 Flash 是谷歌在 43 天内推出的第三款 Flash 模型:3.6 于七月下旬发布,3.7 于八月十三日,3.8 于九月二日。谷歌 CEO 皮查伊曾在财报电话会上表示,Flash 的目标是尽量接近月更节奏。该模型在多项基准测试中表现亮眼:DeepSWE v1.1 长周期软件工程得分 73.7%,距离 Claude Opus 5 的 74.0% 仅差 0.3 分;HLE-Verified 综合推理得分 54.9%,高于 Opus 5 的 54.4% 和 GPT-5.6 Sol 的 54.5%;Vals 金融智能体得分 61.4% 排名第一;生成速度约 305 token/秒,是独立机构测过最快的商用模型。定价方面,当前优惠价输入 0.75 美元、输出 3.75 美元每百万 token,有效期至 12 月 31 日,作为参照,Opus 5 为 5 美元/25 美元,GPT-5.6 Sol 为 4 美元/20 美元。模型现已进入 Gemini App、AI Studio 和 Antigravity 编程平台,Cursor、Vercel 等开发工具在发布当天完成接入。
技术机制上,谷歌称模型会“更努力地完成任务”,即提升 agentic 推理深度,面对复杂任务执行更多推理步骤、更频繁地迭代调用工具。每一步都跑测试、查输出,最终答案的错误率被压下去,但每一轮“推理-工具-验证”循环都消耗输出 token,步骤翻倍,token 消耗自然上升。Artificial Analysis 测出的数字链条完整:单任务输出 token 增加约 30%,折算成单任务总成本上升约 40%。即便涨完,单任务约 0.58 美元的成本仍落在“智能-成本”性价比前沿上,高推理档综合智能指数 59 分,比上代提高 3 分。另一层价格变化在明年:优惠价到期后,单价将翻倍至输入 1.50 美元、输出 7.50 美元。用量涨一轮、单价再涨一轮,两波叠加才是完整的价格路径。谷歌同时保留 3.7 Flash 作为低成本选项,承诺继续支持。
Flash 系列的升级节奏指向开发者入口的争夺。编程 Agent 和自动化工作流是当前 token 消耗增长最快的场景,也是各家 API 收入的主战场。这个场景的采购逻辑很现实:单位智能成本谁低用谁,迁移成本极低。DeepSWE 追到离 Opus 5 只差 0.3 分、价格不到六分之一,等于直接把“旗舰级编程能力”的商品价格打穿了一个量级。同天发布的 Gemini 3.8 Flash Cyber 则补了另一条战线:CWE-Bench 漏洞修复得分 47.2%,与领跑的 Fable 5 基本持平;Chrome 安全团队实测其有效补丁产出是更大商业模型的 2.6 倍;Wiz 内部渗透测试召回率高出 7.5 到 9.7 个百分点,同等成绩花费仅为竞对的 1/2.3 到 1/5.2。这个版本不公开售卖,只通过 Fairwind 计划向约 650 家受信机构开放,与 Anthropic 把 Mythos 5.1 锁进可信访问计划的门控逻辑一致。前沿网安能力正在变成需要资质审核的战略资源。
合理推演是,谷歌的账算在规模上:Flash 承担开发者生态的走量任务,把使用习惯和工具链锁定在自家平台上,Pro 级别的利润款可以等能力差距真正拉开再发。这也解释了为什么六月预告的 Gemini 3.5 Pro 至今没有发布——Flash 太强,Pro 的价格锚点立不住。
基准口径的边界需要先讲清。官方主打的四个基准全部领先,但第三方核对了完整榜单后,画面并不均匀。开放式 Agent 任务是明显短板:Terminal-Bench 4.0 上 Opus 5 拿到 51.8%,3.8 Flash 只有 19.1%;OSWorld 电脑操作 75.4% 对 59.0%。Harvey 法律基准上 10.0% 的“领先”,实际是全榜模型集体不及格下的相对值。规律大致是:边界清晰、终点明确的专业任务,它能贴着旗舰打;需要自主规划下一步的开放任务,差距会被拉开。沃顿教授 Ethan Mollick 的初步评价是“一个很好的 Flash 模型,但并不等于前沿模型”。另外,所有对比数据均为厂商自测口径,发布日基准与生产环境表现历来存在差距。成本侧的实际影响也取决于任务结构:短问答场景几乎不受 token 放大影响,长链路 Agent 任务才是成本上升的重灾区。社区传闻称部分团队已在评估回迁 3.7 Flash 控制预算,尚无官方数据印证。
这次发布可以确认的产品事实是:Flash 系列的迭代周期压缩到三周级,能力触及旗舰边缘,网安版本进入资质门控。更值得注意的是成本竞争口径的迁移。当各家每 token 单价逐渐咬平,“完成一个任务烧多少 token”就成了新的定价杠杆——推理更深、步骤更多的模型天然更贵,即便价目表一动不动。Anthropic 两天前把缓存读取价砍了 75%,打的也是同一本账。对开发者的实际建议只剩一条:选型时盯住单任务成本,而不是单价。价格战的第二阶段,比的是谁的账单更会“藏”。