8月13日,阿里正式开放了Qwen3.8-2.4T的模型权重,这是继Kimi K3开源半个月后,国产超大模型开源领域的又一重磅动作。此次开源不仅是参数规模达到2.4T的大模型,更标志着阿里首次开放其Max规模模型的权重,打破了此前Max系列仅通过API提供的惯例。
长期以来,阿里Qwen形成了两条产品线:开放权重的模型和更大的闭源Max模型。从2024年的Qwen-72B到Qwen2.5-Max,Max系列始终只通过Qwen Chat和DashScope API提供,而此次Qwen3.8的开源,是阿里首次将Max级模型权重完全开放。
从架构上看,Qwen3.8共有92层,总参数2.4T,每个Token激活95B。它采用512个专家,每次选择10个路由专家,并包含1个共享专家。相比Kimi K3的896个专家和103B激活量,Qwen3.8的每个专家更大,但总激活量稍小。在注意力机制上,Qwen3.8继承了Qwen3.5的混合架构,由23组结构组成,每组包含3层Gated DeltaNet和1层Gated Attention,即69层线性注意力加23层传统注意力,比例接近3:1,这与Kimi K3的架构非常相似。K3的93层中也有69层KDA和24层Gated MLA,同样约为3:1。两者甚至属于相近的技术谱系,KDA可视为对Gated DeltaNet遗忘机制的细粒度化版本。不过,K3在层间信息流上引入了AttnRes(注意力残差),而Qwen3.8则沿用了Qwen3.5的实现,仍采用传统的Pre-Norm残差结构。
在推理基础设施方面,Qwen3.8官方提供BF16和FP8 checkpoint,Inferact进一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版本至少需要两台NVIDIA B300或AMD MI355X节点,而FP4之后可压缩到单节点部署。推理阶段采用TP(张量并行)、DP(数据并行)和EP(专家并行)的组合,Attention部分依赖TP,MoE部分依赖EP。此外,Qwen3.8还训练了Multi-Token Prediction(MTP)能力,示例配置一次预测3个候选Token,以减少自回归生成的串行延迟,这与DeepSeek V4的技术报告方向一致。
后训练方面,Qwen3.8明确将Agent Execution列为核心升级方向,强调自主规划、环境反馈处理和端到端任务完成。官方评测显示,从Qwen3.7-Max到3.8-Max,Terminal Bench 2.1从74.5升至86.6,PaperBench从64.8升至93.0,JobBench从31.3升至53.4,Toolathlon Verified从49.7升至72.5,而传统基准GPQA Diamond仅从92.4微升至92.6,HLE从41.4升至43.6。这表明这一代模型的增量主要发生在Coding Agent、General Agent和专业工作场景。此外,Qwen3.8默认开启preserve_thinking,保留推理上下文,与Kimi K3的后训练方向一致,显示“保留推理状态”正成为旗舰Agent模型的标配。
开源规则方面,Qwen3.8采用专门的Qwen3.8-Max License,而非Apache 2.0。该许可允许使用、复制、修改、分发、微调、部署、托管甚至出售衍生产品,但若商业产品超过1亿月活或月收入超过2000万美元,需在界面显著展示模型名称;若企业从事MaaS或AI Work Assistant业务,且连续12个月集团收入超过5000万美元,则需另行取得许可。这与Kimi K3的自定义许可类似,显示在3T级旗舰模型上,两家公司都选择了open-weight加自定义商业许可的模式,而非过去小模型时代更宽松的Apache式开放。
综合来看,Qwen3.8与Kimi K3在架构、后训练和开源策略上呈现出明显的收敛趋势:总参数进入2-3T,激活参数控制在100B左右,注意力机制采用约四分之三的递归/线性状态层配合四分之一的全局Attention,上下文目标稳定在百万Token,后训练重点转向Coding、Research和长程Agent。Kimi K3在架构上更激进,引入了KDA、AttnRes和Stable LatentMoE;而Qwen3.8则更像将Qwen3.5验证过的混合注意力架构直接Scale到Max级别。两者的架构差异已属小优化,而infra方面的并行调度和通信优化可能成为未来竞争的关键。国产旗舰模型的技术配方正在收敛,下一个能打破这一底子的创新者,将更值得期待。