据《华尔街日报》独家爆料,谷歌将于明日(当地时间)发布新一代轻量级模型Gemini 3.8 Flash(代号Skimaki),同时放弃此前预告的Gemini 3.5 Pro。这一消息在AI圈引发热议,因为就在几天前,Anthropic刚推出Claude 5.1,而OpenAI的Astra也即将亮相,谷歌此举被视为对竞争压力的直接回应。

Gemini 3.5 Pro被取消是本次爆料的重磅信息。该模型曾在今年5月的I/O大会上预告,但近4个月过去,其进展甚至不如Flash版本,谷歌被迫“弃子”。据内部人士透露,谷歌已投入更多人力和算力提升Gemini的编程能力,尤其是加大强化学习投入,让AI通过试错学习。同时,谷歌DeepMind并行推进多个项目,以分散风险。

尽管3.5 Pro夭折,但Gemini 4.0在预训练中评估优秀,后训练仍在进行中。爆料还称,Gemini 3.8 Flash在谷歌内部编码工具Jetski的对比测试中“碾压”Opus模型,编程实力强劲。该模型已研发数月,早于谷歌领导层变动——Demis Hassabis让位、首席科学家Jeff Dean离职——之前就已启动,目前内部进展顺利。

谷歌选择先推Flash版本,是因为其参数小、所需计算少,更容易出成果。这一策略与OpenAI和Anthropic形成对比:OpenAI的下一代Astra采用“循环深度”新型推理方法,减少思考token并提升性能,预计本周揭晓;Anthropic的Claude 5.1则主攻编程和科研领域。此外,马斯克预告Grok 4.7将在十天后发布,四家科技巨头几乎同时发力,AI模型竞争进入白热化阶段。

在发布Gemini 3.8 Flash之前,谷歌今日已为Gemini系列引入智能体视频理解(Agentic Video Understanding)功能。该功能允许模型自主决定观看视频的片段、速度和模态(画面、音频或转录文字),而非被动接收固定帧率。官方博客显示,在标准视频分析基准上,开启该功能后token消耗最多降低88%,分析成本最多降66%,准确率最高提升7%,且不额外收费,仍按标准API token定价。

这一功能解决了视频处理的高成本痛点——视频是模态中最贵的,一分钟视频可能消耗相当于一本书的token。通过“拖进度条”式的高效采样,模型能处理亚秒级片段检索、长视频问答、异常检测和计数等任务,使自动剪辑、安防监控、产线质检等场景真正可行。谷歌此前已在图像理解上应用类似思路,此次将工具扩展至原生视频。

谷歌此举意在让Agent“看得起”视频,突破以往依赖文字转述的局限。随着成本曲线下移,Agent能直接处理监控、课程、素材等视频内容,而无需等待人工转写。这被视为谷歌在AI Agent竞争中的关键布局,尤其在OpenAI和Anthropic已在前沿模型和编程Agent上占据优势的背景下。

目前,谷歌计划先推出Gemini 3.8 Flash,以快速回应市场。但分析师指出,谷歌能否在Gemini 4.0上兑现潜力,才是决定其能否与OpenAI、Anthropic抗衡的关键。随着四家公司发布节奏撞车,AI大战的下一个回合已悄然开启。