7月,大模型行业迎来罕见的发布高峰:一个月内,9款旗舰模型扎堆亮相,从月初腾讯混元Hy3发布正式版并开源,到月末Anthropic发布Claude Opus 5,其间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等陆续登场。这被行业视为近一年少见的密集发布潮,也标志着“最强模型”的保质期正在缩短,竞争进入“月抛”时代。
这一轮发布反映出两个显著变化。第一,模型之间的能力差距正在缩小。据Artificial Analysis最新综合智能指数,头部模型分差明显收窄,单一维度的绝对领先越来越难维持,各家开始围绕不同任务寻找优势。第二,开源模型正在进入第一梯队。7月发布的腾讯混元Hy3、Kimi K3等选择开放权重,其中Kimi K3在Code Arena前端编程榜单中排名第一,超过GPT-5.6 Sol和Claude Fable 5。过去两年,开源模型多被视为闭源模型的追赶者,如今已在部分开发场景中与闭源模型直接竞争。
竞争维度已从“谁更聪明”扩展到多个方向。代码能力成为最明显的争夺焦点:OpenAI强化编程和复杂推理,扩展Codex生态;Anthropic押注代码理解和安全审计;Grok 4.5强调速度和低成本,并与AI编程工具Cursor绑定。大模型研究者姚宇航对「定焦One」表示,各家公司都在重点投入编程能力,差距快速缩小,Kimi K3的代码能力已接近头部闭源模型。Agent是另一争夺方向,GPT-5.6 Sol配合Codex探索自动化编程,Opus 5强调长程任务执行,Kimi K3展示连续运行能力,腾讯混元Hy3则结合微信生态探索智能体应用。但Agent在实际工作中仍不成熟,独立开发者北城指出,部分智能体的短板在任务调度能力,如Codex的Ultra模式开启多个子代理重复读取文件,导致Token消耗增加但有效工作未增。姚宇航认为,智能体是值得关注的方向,但离成熟还有距离,垂直领域如医疗、金融仍有较大机会,下一阶段差距取决于场景实用性和客户付费意愿。
参数规模与推理效率的竞争成为另一主线。7月多款模型进入万亿甚至数万亿参数区间,但参数规模已不能简单等同于能力。MoE架构让模型拥有更大参数容量,同时只激活一小部分完成推理,降低成本。行业形成两条路线:一是继续扩大规模,二是强调效率。价格成为最直接的变量:海外厂商差异化定价,OpenAI拆分GPT-5.6版本,Anthropic维持高性能旗舰路线,Grok 4.5输出价格仅为Opus系列的四分之一;国内厂商则持续下调API价格,以低成本扩大用户规模。
具体来看,7月模型表现可分为三类。超出预期的一类包括Kimi K3、Grok 4.5和混元Hy3。Kimi K3采用MoE架构,总参数达万亿级别,发布当天以1679分登顶Code Arena前端编程榜,较前代Kimi K2.6的第18名提升17个位次,一周后进入Arena综合榜全球Top 10。但其幻觉率从K2.6的39%升至51%,输出速度约33 Token/s,低于同类。北城认为Kimi K3优势集中在前端开发、UI设计和产品表达,复杂工程任务表现不稳定。Grok 4.5于7月9日发布,进入Artificial Analysis智能指数前列,在工具调用测试中表现突出,被开发者视为性价比之选。北城称其最大优势是速度,同一需求用Grok 4.5可能三五分钟完成,而GPT-5.6有时需二十分钟甚至半小时。姚宇航认为其编程能力经专门优化,搭配Cursor体验良好。背景是SpaceX此前宣布收购Cursor母公司Anysphere,交易预计三季度交割,xAI与Cursor的数据合作被认为帮助优化了Grok 4.5的编程体验。混元Hy3总参数295B、激活参数仅21B,以不到旗舰模型五分之一的参数规模在多个公开基准中接近更大竞品,但在SWE-Bench Pro中57.9分与Claude Opus 4.8的69.2分仍有明显差距。姚宇航认为混元Hy3相比腾讯之前模型有进步,开源加小尺寸设计是中等体量里的不错选择。
稳定在第一梯队但惊喜有限的是GPT-5.6 Sol和Claude Opus 5。GPT-5.6 Sol强化复杂推理和智能体编程,在Terminal-Bench 2.1测试中达88.8%,Ultra模式提升至91.9%;Claude Opus 5保持复杂任务优势,性能接近Fable 5但价格只有后者一半。北城表示GPT-5.6已覆盖大部分日常开发需求,复杂问题会调用Opus 5,后者定位更像“专家”。反馈分化的一类是Gemini 3.6 Flash和Qwen3.8-Max预览版。Gemini 3.6 Flash在Artificial Analysis智能指数得分为50,与前代持平,开发者反馈提升不明显,但多模态理解仍出色。Qwen3.8-Max预览版效果不稳定,北城认为思考深度高但有时陷入长时间推理,卡普迪姆则用前端审美测评发现实际能力与宣传有差距,最终表现待正式版验证。
7月没有出现全维度领先的模型,不同模型围绕具体场景形成分工。开发者会按任务选择工具:GPT-5.6负责日常开发,Grok 4.5用于快速需求,Kimi K3用于产品和前端,Claude Opus 5解决复杂问题。
这轮密集发布背后,模型迭代方式正在变化。过去能力提升依赖重新训练更大模型,周期长、成本高;如今强化学习、后训练技术成熟,模型升级更多依赖训练后优化。姚宇航指出,近两年发布速度加快,重要原因是行业掌握了更成熟的后训练方法,很多提升无需重新训练,而是基于已有模型继续优化。这意味着竞争周期缩短,领先窗口可能只有几周,发布时间本身成为竞争的一部分。7月是多个节点叠加:国内厂商借世界人工智能大会(WAIC)集中发布,海外厂商也选择此时更新以占据主动。
开源与闭源之争在7月升温。当高性能模型可免费获得,模型公司的API和订阅收入可能被分流。支持开源者认为开放权重降低技术门槛,推动生态发展;闭源阵营则担心用户分流,Anthropic等公司认为开放权重可能带来安全风险。这场争论背后对应不同利益:英伟达等基础设施企业受益于更多部署需求,OpenAI、Anthropic等模型公司依赖闭源维持收入。但开源扩大部署的同时,参数效率提升可能摊薄单位任务算力消耗,算力市场增量未必与开放程度同步。对国内厂商,开放权重也是争取开发者生态、云服务和商业化入口的策略。
7月之后,开发者社区普遍预计DeepSeek V4正式版、Fable 5.1、GPT-6等将在8月发布。模型能力差距缩小,单靠发布更强模型难以建立长期优势。值得观察的指标包括:DeepSeek V4正式版能否推高开源模型能力上限,API价格是否继续下探,智能体能否出现稳定付费场景,以及开源模型能否进入更多企业私有化部署。这些答案将比榜单名次更能说明这场混战的实际影响。