2026年雲棲大會的主論壇議程出現明顯變化:在吳泳銘發言之後,第一個登台的是千問大語言模型負責人劉大一恆,緊隨其後的是ATH技術副總裁鄭波,負責視聽等多模態模型;兩場模型演講之後,才是平頭哥高慧與阿里雲CTO李飛飛。晶片和雲依然是阿里的底牌,但市場聚光燈已經轉向模型——阿里的模型往哪走、做多大、能不能打,成為牽動神經的問題。
下一代Qwen要做多大,是市場最直接的懸念。此前一年多,業內對Scaling的質疑不斷,但到2026年年中風向明顯調轉。Anthropic CEO Dario Amodei在摩根士丹利會上定調稱Scaling沒有撞牆,2026年還會迎來一輪激進加速。行業行動也印證了這一點:Fable 5被估算為約4.5萬億至5萬億引數,Kimi K3總引數達到2.8萬億。回到Qwen,2026年8月釋出的Qwen3.8引數已達2.4T。劉大一恆在演講中給出路線圖:Qwen4系列即將到來,之後的Qwen4.5和Qwen5計劃進一步邁向5T—10T引數。兩年前Qwen2.5旗艦模型引數量還是72B,到Qwen3.8已擴大至2.4T,增長約33倍;若繼續邁向5T—10T,規模還將在現有基礎上再擴大一倍至三倍以上。劉大一恆明確,基礎模型的智慧上限依然離不開算力、資料和模型規模的持續投入,阿里會繼續擴大預訓練計算量,沿著Scaling Law向上走。
但模型越大,訓練和推理賬單越高。阿里的解法是一邊擴大規模,一邊重新設計模型架構。Qwen3.8-Flash已展示這條路線:通過稀疏注意力、線性注意力和外接記憶等新架構,每次推理只啟用6B引數;相比上一代,訓練成本降至九分之一,百萬Token輸入價格降至四分之一,超長上下文的預填充吞吐量提高8.6倍,模型能力反而繼續上漲。這意味著阿里下一階段的Scaling不只是把模型做大,而是用更低成本支撐更大模型繼續向前。
Qwen5還要等多久,是第二個問題。當下模型競爭節奏越來越快,今天登頂的模型幾周或幾個月後就可能被追平,一個版本領先很難形成長期優勢,真正重要的是誰能更快產生下一代模型。一個越來越被認真對待的方向是讓模型參與造模型,即RSI(遞迴自我改進)。Anthropic曾給Claude一段訓練小模型的程式碼讓它自己找辦法提速:去年Claude把程式碼提速到原來的3倍,今年最新模型已能做到52倍,而人類研究員花半天通常只能做到4倍左右。OpenAI則訓練了專門攻擊其他模型的GPT-Red,用攻擊樣本訓練下一代GPT,結果是GPT-5.6面對最難的一類提示注入攻擊時,失敗率比四個月前的模型低了約六倍。
阿里在RSI上的做法更進一步:讓Qwen不只呼叫工具,也開始參與建設自己的技術棧。最典型的實驗發生在晶片設計上——研究團隊只給Qwen3.8-Max一份真實的片上網路(NoC)模組規格,沒有參考程式碼和現成測試樣例,模型在60多個小時裡自己呼叫EDA工具,完成從編寫電路描述、驗證到後端物理實現的全流程,期間沒有逐輪人工介入,最終晶片物理面積減少42%,功耗估算下降59.5%。在推理基礎設施上,面對一款此前從未適配過的平頭哥新GPU,Qwen3.8-Max自己修改和最佳化SGLang推理框架,用56小時完成部署,將日常對話場景的單例項吞吐量提高96%。模型訓練本身,阿里披露Qwen3.8-Max曾連續自主執行一個多月,完成33輪有效實驗。國產晶片的軟體生態過去要靠工程師一點點補,現在模型開始親自參與這項工作——梁文鋒此前也提到,國產硬體首先要解決生態問題,TileLang等更高層程式設計方式正提供新機會,DeepSeek內部已開始探索用AI編寫TileLang。當然,距離模型自主造出下一代模型仍有距離,但方向已經清楚:模型競爭不再只是比誰釋出更強版本,也開始比誰能讓模型更深地進入訓練、推理、晶片這些研發環節。
多模態做到哪一步,是第三個問題。鄭波給出明確時間:下一代影片生成模型將在11月亮相。他把影片生成的下一階段稱為Agent Video——過去的影片模型解決能不能生成逼真畫面,隨後圖片、影片、聲音等參考資訊被加入讓結果更可控,下一步模型要做的不只是生成素材片段,而是理解創作者想講什麼:使用者給出想法,模型自己拆解劇情、設計分鏡、安排人物和場景,最後生成完整影片。新版本將沿更長、更可控、更完整、更智慧四個方向推進。
其他多模態模型也有升級。影像生成模型Qwen-Image-3.1面向電商、創意、設計等真實商用場景最佳化,將原本數小時的視覺設計壓縮至秒級交付,並支援影像精準編輯。語音方面釋出Qwen-Audio-3.1系列,語音轉寫、語音合成和即時語音互動三類模型全面升級,其中Qwen-Audio-3.1-Realtime能夠邊聽、邊想、邊說,並增強多語言互動、角色扮演和共情能力,已應用於千問辦公和Qoder,並接入QwenNote A2隨身助理、QwenNote Eva桌面機器人和千問AI眼鏡等硬體產品。音樂生成模型HappyShrimp1.1在音樂表現、人聲質量、多語種演唱及指令理解四個維度提升,支援百餘種曲風與十餘種主流語言。世界模型HappyOyster公佈2.0 Preview版本,能更準確模擬物體運動和碰撞,通過3D時空記憶保持場景穩定並降低互動延遲;阿里還聯合高校和產業夥伴搭建世界模型Benchmark和Arena,試圖為這一早期方向建立共同評價標準。鄭波給出更遠判斷:三年之內,行業可能出現原生的全模態統一生成模型,可同時生成影像、影片和音樂,也能理解空間和世界。
三個問題拼在一起,勾勒出阿里下一階段更清晰的模型路線:一條追逐AGI邊界,一條抵達AI普惠日常,最終匯於讓更高智慧走出實驗室、落進現實世界。