阿里通义千问团队今日在 Hugging Face 上发布了 Qwen3.8-Flash-Next,这是其下一代模型架构的首次开源预览,该架构将用于支撑未来的 Qwen4 系列。此次发布正值大模型竞赛从单纯追求参数规模转向注重效率与推理成本的关键节点。
据模型卡信息,Qwen3.8-Flash-Next 总参数量达 125B,但激活参数仅 6B,并额外包含 51B 的 n-gram 嵌入参数。其原生上下文长度达到 262,144 token,并可扩展至 1,000,000 token。这一设计思路延续了混合专家(MoE)模型“总参数大、激活参数小”的趋势,旨在以较低的计算成本实现更强的性能。
架构上的核心创新包括:混合注意力机制(Qwen Sparse Attention, QSA),它在微块(micro-block)级别进行稀疏选择,而非逐 token 处理,从而显著降低长上下文场景下的延迟;门控残差(Gated Residual),通过数据相关的读写门控来调节残差流中的信息,在保持训练稳定性的同时提升跨层表达能力;以及 n-gram 嵌入,利用短 n-gram 作为索引,使参数扩展更高效,且比 MoE 更易于内存受限的加速器进行卸载。训练方面,团队采用 Muon 与 AdamW 优化器分别处理不同权重类别,并基于重标定的缩放定律,省去了传统的 batch size 预热步骤,直接以目标 batch size 开始训练,从而减少优化步数并支持更大的学习率。
在基准测试中,Qwen3.8-Flash-Next 表现亮眼。在 DeepSWE 1.1(智能体编码)上得分 58.7,显著高于 Qwen3.8-27B 的 42.2 和 DeepSeek-V4-Flash 的 54.4;在 SWE-bench Pro 上以 62.5 分领先于对比模型;在 CoWorkBench(长时办公任务)上得分 73.9,同样优于其他开源模型。在 GPQA Diamond(科学推理)上得分 91,体现了较强的推理能力。不过,在 NL2Repo-Bench(仓库级代码生成)上,其 48.1 分略低于 DeepSeek-V4-Flash 的 54.2。
此次发布对 AI 产业具有多重含义。首先,它展示了在参数规模增长的同时,通过架构创新实现效率提升的可能性,这有助于降低推理成本,对依赖大模型 API 的应用层企业构成利好。其次,作为开源模型,Qwen3.8-Flash-Next 为开发者提供了在本地或私有云部署高性能模型的新选择,可能对闭源 API 服务形成竞争压力。此外,其长上下文能力(原生 262K,可扩展至 1M)与智能体任务优化,契合了当前 AI 应用向复杂工作流发展的趋势。
值得注意的是,模型卡中提及,官方推荐的生产版本为 Qwen3.8-Flash,它基于 Flash-Next 并增加了 1M 默认上下文长度、内置工具等生产特性。这意味着 Flash-Next 更偏向于技术预览,供社区探索与反馈,而生产用户可期待后续的稳定版本。
整体来看,Qwen3.8-Flash-Next 的发布标志着通义千问在模型架构上的重要探索,其效果与效率的平衡或将为行业树立新标杆。投资者可关注其后续 Qwen4 系列的正式发布,以及该架构对相关算力需求与模型服务市场的影响。