阿里通义千问团队于 Hugging Face 发布了新一代开源模型 Qwen3.8-2.4T-A95B,这是 Qwen 开源家族中首个达到 Qwen-Max 级别的模型,标志着顶尖闭源能力向开源社区开放。该模型总参数量达 2.4 万亿,激活参数为 950 亿,采用混合专家(MoE)架构,原生支持 262,144 token 的上下文长度,并可扩展至 101 万 token。模型权重与配置文件以 Hugging Face Transformers 格式提供,兼容 vLLM、SGLang、TokenSpeed 等主流推理框架,便于开发者直接集成。
Qwen3.8 系列在 Qwen3.5 和 Qwen3.6 广泛采用的基础上,重点提升了编程、专业工作、研究以及长周期智能体任务的能力。官方介绍称,该模型不仅擅长回答复杂问题,更能可靠地完成多步骤任务。其架构设计上,采用 92 层结构,包含 512 个专家,其中每次激活 10 个路由专家和 1 个共享专家,并引入了 Gated DeltaNet 与 Gated Attention 的混合注意力机制,以平衡效率与性能。
在基准测试中,Qwen3.8-Max 在多项任务上展现出竞争力。例如,在 Terminal Bench 2.1 上得分 86.6,在 SWE-bench Pro 上得分 67.7,在 PaperBench 上得分 93.0,均优于或接近对比的闭源模型(如 Claude Opus 4.8、GPT-5.6 Sol 等)。在 GPQA Diamond 上得分 92.6,与顶尖模型持平。不过,在部分基准如 IFBench 上,Qwen3.8-Max 得分 82.8,略低于 GPT-5.6 Sol 的 72.7(注:原文数据如此,可能为笔误,但按原文转述)。整体来看,Qwen3.8-Max 在编程与智能体任务上表现突出,在通用知识上保持高水平。
此次开源对 AI 产业具有多重意义。对开发者而言,Qwen3.8-Max 级模型的开源降低了使用顶尖模型的门槛,尤其适合需要长上下文和复杂推理的应用场景。对模型层竞争而言,开源模型与闭源模型的差距进一步缩小,可能推动行业整体创新。对基础设施层而言,2.4T 参数的模型在推理时对算力要求较高,但 MoE 架构的激活参数仅 95B,兼顾了性能与成本,有望带动高效推理方案的需求。
值得注意的是,官方还提供了基于该模型的 Qwen3.8-Max API 服务,支持视觉输入、默认 1M 上下文、内置工具等更多功能,为需要托管推理的用户提供了便捷选择。整体而言,Qwen3.8-2.4T-A95B 的开源是模型层的一次重要进展,其实际表现与生态适配值得持续关注。