8月26日晚間,阿里千問大模型團隊與智譜幾乎同步開源新一代模型,並雙雙打出低價牌,將國產大模型的價格競爭推向新高度。千問釋出基於下一代Qwen4架構的多模態MoE預覽版Qwen3.8-Flash-Next,智譜則開源GLM-5系列首個原生多模態模型GLM-5.3-Flash(320B-A18B),後者正是此前在網路上爆火的匿名模型“Ox-Alpha”(牛來模型)。

千問新模型Qwen3.8-Flash-Next主模型引數量為125B,額外配備51B的N-gram Embedding,每token啟用6B引數,原生支援262144 token上下文,並可通過YaRN擴充套件至1百萬token。據千問團隊介紹,相比Qwen3.7-Plus,新模型的訓練開銷僅約為前者的1/9,但在程式設計和辦公任務上效能更強,且在千問放出的基準測試中,絕大多數專案都超過DeepSeek-V4-Flash正式版。

價格方面,Qwen3.8-Flash即將上線千問AI平台,對外提供API服務,每百萬Tokens輸入1元、輸出3元,相比空閒時段的DeepSeek-V4-Flash,輸入和輸出價格均低33.33%。這一價格策略直指DeepSeek,意圖以更低成本吸引開發者。

智譜方面,GLM-5.3-Flash總引數320B,啟用18B,在智譜自研的Z.ai Code Bench體感評估中,程式設計表現與Claude Opus 4.8相當。價格上,該模型降至GLM-5.3的1/10,限時折扣內甚至為GLM-5.3的1/20、Opus 4.8的1/40,降價幅度更為激進。

從技術架構看,Qwen3.8-Flash-Next圍繞Attention、Residual、Embedding和Optimization四個方面進行了系統升級。其中,採用GDN(Gated DeltaNet)與QSA(通義稀疏注意力)結合的混合架構,每四層中三層使用GDN壓縮歷史資訊,另一層保留全域性Attention進行精確檢索,QSA則通過壓縮式Indexer篩選重要上下文,在1M token下,Prefill和Decode階段分別實現最高7.6倍和4.9倍的加速。此外,引入Gated Residual(門控殘差)將殘差流擴充套件為4條並行分支,並引入N-gram Embedding,以較低成本增加大規模“區域性模式記憶庫”,同時使用Muon Optimizer並最佳化其在大模型訓練中的使用方式。

千問團隊表示,提前釋出結構改動是為了在釋出Qwen4完整模型家族之前,先讓社群進行檢驗。目前,Qwen3.8-Flash-Next的模型權重已在Hugging Face與ModelScope釋出,預設1百萬上下文並內建官方工具的生產版本。在千問的推特評論區,不少海外開發者已迫不及待想要體驗,有網友稱“這太強了”“我們不需要OpenAI”“Qwen未來有可能超越Opus”。

此次兩家廠商的同步動作,反映出國產大模型競爭已從單純比拼引數規模轉向工程化指標與成本效率的較量。隨著企業側長文件處理、私有化部署、Agent智慧體等高價值場景規模化落地,行業對大模型的評價標準更看重冷輸入成本、推理頻寬開銷、硬體適配能力、訓練可復現性等。千問新模型證明,總引數量已不再是衡量模型能力的第一指標,啟用引數量、冷prefill開銷、硬體適配能力的權重持續提升。

對於AI產業投資者而言,這一輪開源降價潮意味著模型層競爭加劇,API呼叫成本快速下降,將直接利好下游AI應用開發者,但也可能壓縮模型廠商的利潤空間,促使行業加速向垂直場景和增值服務轉型。同時,低成本模型普及有望拉動更大規模的推理算力需求,對基礎設施層構成長期利好。