8月26日晚间,阿里千问大模型团队与智谱几乎同步开源新一代模型,并双双打出低价牌,将国产大模型的价格竞争推向新高度。千问发布基于下一代Qwen4架构的多模态MoE预览版Qwen3.8-Flash-Next,智谱则开源GLM-5系列首个原生多模态模型GLM-5.3-Flash(320B-A18B),后者正是此前在网络上爆火的匿名模型“Ox-Alpha”(牛来模型)。
千问新模型Qwen3.8-Flash-Next主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数,原生支持262144 token上下文,并可通过YaRN扩展至1百万token。据千问团队介绍,相比Qwen3.7-Plus,新模型的训练开销仅约为前者的1/9,但在编程和办公任务上性能更强,且在千问放出的基准测试中,绝大多数项目都超过DeepSeek-V4-Flash正式版。
价格方面,Qwen3.8-Flash即将上线千问AI平台,对外提供API服务,每百万Tokens输入1元、输出3元,相比空闲时段的DeepSeek-V4-Flash,输入和输出价格均低33.33%。这一价格策略直指DeepSeek,意图以更低成本吸引开发者。
智谱方面,GLM-5.3-Flash总参数320B,激活18B,在智谱自研的Z.ai Code Bench体感评估中,编程表现与Claude Opus 4.8相当。价格上,该模型降至GLM-5.3的1/10,限时折扣内甚至为GLM-5.3的1/20、Opus 4.8的1/40,降价幅度更为激进。
从技术架构看,Qwen3.8-Flash-Next围绕Attention、Residual、Embedding和Optimization四个方面进行了系统升级。其中,采用GDN(Gated DeltaNet)与QSA(通义稀疏注意力)结合的混合架构,每四层中三层使用GDN压缩历史信息,另一层保留全局Attention进行精确检索,QSA则通过压缩式Indexer筛选重要上下文,在1M token下,Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。此外,引入Gated Residual(门控残差)将残差流扩展为4条并行分支,并引入N-gram Embedding,以较低成本增加大规模“局部模式记忆库”,同时使用Muon Optimizer并优化其在大模型训练中的使用方式。
千问团队表示,提前释出结构改动是为了在发布Qwen4完整模型家族之前,先让社区进行检验。目前,Qwen3.8-Flash-Next的模型权重已在Hugging Face与ModelScope发布,默认1百万上下文并内置官方工具的生产版本。在千问的推特评论区,不少海外开发者已迫不及待想要体验,有网友称“这太强了”“我们不需要OpenAI”“Qwen未来有可能超越Opus”。
此次两家厂商的同步动作,反映出国产大模型竞争已从单纯比拼参数规模转向工程化指标与成本效率的较量。随着企业侧长文档处理、私有化部署、Agent智能体等高价值场景规模化落地,行业对大模型的评价标准更看重冷输入成本、推理带宽开销、硬件适配能力、训练可复现性等。千问新模型证明,总参数量已不再是衡量模型能力的第一指标,激活参数量、冷prefill开销、硬件适配能力的权重持续提升。
对于AI产业投资者而言,这一轮开源降价潮意味着模型层竞争加剧,API调用成本快速下降,将直接利好下游AI应用开发者,但也可能压缩模型厂商的利润空间,促使行业加速向垂直场景和增值服务转型。同时,低成本模型普及有望拉动更大规模的推理算力需求,对基础设施层构成长期利好。