阿里通义千问团队今日在 Hugging Face 平台发布了新一代开源模型 Qwen3.8-27B,这是 Qwen 开源家族截至目前能力最强的一代。该模型为紧凑型稠密架构,拥有 270 亿参数,原生支持图像与视频理解,并具备可灵活控制的思考模式,旨在以更低的部署成本承载复杂、多步骤的智能体任务。
据模型卡信息,Qwen3.8-27B 基于 Qwen3.5 的架构基础构建,在编码、专业工作、研究以及长周期智能体任务上均有显著提升。其原生上下文长度达 262,144 token,并可扩展至 100 万 token,为处理长文档、长视频等场景提供了基础。模型采用因果语言模型加视觉编码器的架构,包含 64 层,隐藏维度 5120,并使用了 Gated DeltaNet 与 Gated Attention 的混合设计。
在文本能力基准测试中,Qwen3.8-27B 相较前代 Qwen3.6-27B 提升明显。例如,在智能体编码基准 SWE-bench Pro 上,其得分从 53.5 升至 61.7;在代码生成基准 NL2Repo-Bench 上,从 36.2 升至 42.3;在长周期办公任务基准 CoWorkBench 上,从 61.0 升至 70.7;在专业任务基准 JobBench 上,从 21.8 升至 33.4。在通用能力方面,指令跟随基准 IFBench 得分 79.5,科学推理基准 GPQA Diamond 得分 89.2,多学科推理基准 HLE 得分 30.8,竞技编程基准 LiveCodeBench v6 得分 90.3。
在多模态与智能体能力上,Qwen3.8-27B 同样表现突出。在计算机使用基准 OSWorld-Verified 上,其得分达 84.3,高于 Qwen3.6-27B 的 63.9;在浏览器使用基准 WebArena-Verified 上得分 64.8;在移动端使用基准 AndroidWorld 上得分 81.9。这些成绩表明,该模型在真实环境中的自主操作能力有显著进步。
模型卡还提到,Qwen3.8-27B 的思考模式默认开启,但可根据请求关闭,并支持通过 reasoning_effort 调节推理深度,以及通过 preserve_thinking 保留历史消息中的推理上下文。这种灵活性让开发者能根据任务需求在性能与成本之间权衡。
在部署兼容性方面,该模型权重与配置文件以 Hugging Face Transformers 格式提供,并兼容 vLLM、SGLang、TokenSpeed 等主流推理框架。官方还预告,Qwen3.8-27B 将作为托管版本在 Qwen Cloud 上线,提供默认 100 万 token 上下文长度及官方内置工具等生产级特性,服务即将推出。
从产业视角看,Qwen3.8-27B 的发布延续了开源模型在智能体与多模态方向上的快速演进。其紧凑的 27B 规模与原生多模态能力,降低了开发者部署复杂 AI 应用的门槛,同时也对推理侧的算力调度与优化提出了更高要求。随着模型上下文窗口的扩展和智能体任务的复杂化,对内存带宽与长序列推理效率的挑战也将成为产业链关注的重点。