8月13日,阿里正式開放了Qwen3.8-2.4T的模型權重,這是繼Kimi K3開源半個月後,國產超大模型開源領域的又一重磅動作。此次開源不僅是引數規模達到2.4T的大模型,更標誌著阿里首次開放其Max規模模型的權重,打破了此前Max系列僅通過API提供的慣例。

長期以來,阿里Qwen形成了兩條產品線:開放權重的模型和更大的閉源Max模型。從2024年的Qwen-72B到Qwen2.5-Max,Max系列始終只通過Qwen Chat和DashScope API提供,而此次Qwen3.8的開源,是阿里首次將Max級模型權重完全開放。

從架構上看,Qwen3.8共有92層,總引數2.4T,每個Token啟用95B。它採用512個專家,每次選擇10個路由專家,幷包含1個共享專家。相比Kimi K3的896個專家和103B啟用量,Qwen3.8的每個專家更大,但總啟用量稍小。在注意力機制上,Qwen3.8繼承了Qwen3.5的混合架構,由23組結構組成,每組包含3層Gated DeltaNet和1層Gated Attention,即69層線性注意力加23層傳統注意力,比例接近3:1,這與Kimi K3的架構非常相似。K3的93層中也有69層KDA和24層Gated MLA,同樣約為3:1。兩者甚至屬於相近的技術譜系,KDA可視為對Gated DeltaNet遺忘機制的細粒度化版本。不過,K3在層間資訊流上引入了AttnRes(注意力殘差),而Qwen3.8則沿用了Qwen3.5的實現,仍採用傳統的Pre-Norm殘差結構。

在推理基礎設施方面,Qwen3.8官方提供BF16和FP8 checkpoint,Inferact進一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版本至少需要兩台NVIDIA B300AMD MI355X節點,而FP4之後可壓縮到單節點部署。推理階段採用TP(張量並行)、DP(資料並行)和EP(專家並行)的組合,Attention部分依賴TP,MoE部分依賴EP。此外,Qwen3.8還訓練了Multi-Token Prediction(MTP)能力,示例配置一次預測3個候選Token,以減少自迴歸生成的序列延遲,這與DeepSeek V4的技術報告方向一致。

後訓練方面,Qwen3.8明確將Agent Execution列為核心升級方向,強調自主規劃、環境反饋處理和端到端任務完成。官方評測顯示,從Qwen3.7-Max到3.8-Max,Terminal Bench 2.1從74.5升至86.6,PaperBench從64.8升至93.0,JobBench從31.3升至53.4,Toolathlon Verified從49.7升至72.5,而傳統基準GPQA Diamond僅從92.4微升至92.6,HLE從41.4升至43.6。這表明這一代模型的增量主要發生在Coding Agent、General Agent和專業工作場景。此外,Qwen3.8預設開啟preserve_thinking,保留推理上下文,與Kimi K3的後訓練方向一致,顯示“保留推理狀態”正成為旗艦Agent模型的標配。

開源規則方面,Qwen3.8採用專門的Qwen3.8-Max License,而非Apache 2.0。該許可允許使用、複製、修改、分發、微調、部署、託管甚至出售衍生產品,但若商業產品超過1億月活或月收入超過2000萬美元,需在介面顯著展示模型名稱;若企業從事MaaS或AI Work Assistant業務,且連續12個月集團收入超過5000萬美元,則需另行取得許可。這與Kimi K3的自定義許可類似,顯示在3T級旗艦模型上,兩家公司都選擇了open-weight加自定義商業許可的模式,而非過去小模型時代更寬鬆的Apache式開放。

綜合來看,Qwen3.8與Kimi K3在架構、後訓練和開源策略上呈現出明顯的收斂趨勢:總引數進入2-3T,啟用引數控制在100B左右,注意力機制採用約四分之三的遞迴/線性狀態層配合四分之一的全域性Attention,上下文目標穩定在百萬Token,後訓練重點轉向Coding、Research和長程Agent。Kimi K3在架構上更激進,引入了KDA、AttnRes和Stable LatentMoE;而Qwen3.8則更像將Qwen3.5驗證過的混合注意力架構直接Scale到Max級別。兩者的架構差異已屬小最佳化,而infra方面的並行排程和通訊最佳化可能成為未來競爭的關鍵。國產旗艦模型的技術配方正在收斂,下一個能打破這一底子的創新者,將更值得期待。