阿里通義千問團隊今日在 Hugging Face 上釋出了 Qwen3.8-Flash-Next,這是其下一代模型架構的首次開源預覽,該架構將用於支撐未來的 Qwen4 系列。此次釋出正值大模型競賽從單純追求引數規模轉向注重效率與推理成本的關鍵節點。

據模型卡資訊,Qwen3.8-Flash-Next 總引數量達 125B,但啟用引數僅 6B,並額外包含 51B 的 n-gram 嵌入引數。其原生上下文長度達到 262,144 token,並可擴充套件至 1,000,000 token。這一設計思路延續了混合專家(MoE)模型“總引數大、啟用引數小”的趨勢,旨在以較低的計算成本實現更強的效能。

架構上的核心創新包括:混合注意力機制(Qwen Sparse Attention, QSA),它在微塊(micro-block)級別進行稀疏選擇,而非逐 token 處理,從而顯著降低長上下文場景下的延遲;門控殘差(Gated Residual),通過資料相關的讀寫門控來調節殘差流中的資訊,在保持訓練穩定性的同時提升跨層表達能力;以及 n-gram 嵌入,利用短 n-gram 作為索引,使引數擴充套件更高效,且比 MoE 更易於記憶體受限的加速器進行解除安裝。訓練方面,團隊採用 Muon 與 AdamW 最佳化器分別處理不同權重類別,並基於重標定的縮放定律,省去了傳統的 batch size 預熱步驟,直接以目標 batch size 開始訓練,從而減少最佳化步數並支援更大的學習率。

在基準測試中,Qwen3.8-Flash-Next 表現亮眼。在 DeepSWE 1.1智慧體編碼)上得分 58.7,顯著高於 Qwen3.8-27B 的 42.2 和 DeepSeek-V4-Flash 的 54.4;在 SWE-bench Pro 上以 62.5 分領先於對比模型;在 CoWorkBench(長時辦公任務)上得分 73.9,同樣優於其他開源模型。在 GPQA Diamond(科學推理)上得分 91,體現了較強的推理能力。不過,在 NL2Repo-Bench(倉庫級程式碼生成)上,其 48.1 分略低於 DeepSeek-V4-Flash 的 54.2。

此次釋出對 AI 產業具有多重含義。首先,它展示了在引數規模增長的同時,通過架構創新實現效率提升的可能性,這有助於降低推理成本,對依賴大模型 API 的應用層企業構成利好。其次,作為開源模型,Qwen3.8-Flash-Next 為開發者提供了在本地或私有云部署高效能模型的新選擇,可能對閉源 API 服務形成競爭壓力。此外,其長上下文能力(原生 262K,可擴充套件至 1M)與智慧體任務最佳化,契合了當前 AI 應用向複雜工作流發展的趨勢。

值得注意的是,模型卡中提及,官方推薦的生產版本為 Qwen3.8-Flash,它基於 Flash-Next 並增加了 1M 預設上下文長度、內建工具等生產特性。這意味著 Flash-Next 更偏向於技術預覽,供社群探索與反饋,而生產使用者可期待後續的穩定版本。

整體來看,Qwen3.8-Flash-Next 的釋出標誌著通義千問在模型架構上的重要探索,其效果與效率的平衡或將為行業樹立新標杆。投資者可關注其後續 Qwen4 系列的正式釋出,以及該架構對相關算力需求與模型服務市場的影響。