螞蟻集團旗下百靈團隊於今日釋出新一代原生多模態模型 Ling-3.0-flash-VL,該模型在 Ling-3.0-flash 的基礎上擴充套件了視覺理解能力,將視覺資訊融入從理解、推理到行動、驗證的完整流程。模型總引數達 124B,但每個 token 僅啟用 5.5B 引數,支援影像與影片輸入,上下文視窗最高可達 1M tokens,在保持高效推理的同時提供強大的多模態與智慧體能力。

Ling-3.0-flash-VL 的架構設計旨在將視覺資訊整合進真實世界的推理與智慧體工作流。模型採用 ViT 視覺編碼器提取影像與影片特徵,通過兩層 MLP 投影器將視覺特徵與文本表示對齊,實現統一的多模態理解與推理。VideoRoPE 技術編碼空間位置與時間順序,使模型能夠理解視覺內容隨時間的變化,支援事件定位、長影片問答與影片片段編輯等任務。此外,模型採用 42 層混合骨幹網路,以 5:1 的比例交替使用 KDA 與 Gated MLA 層,支援跨文本、影像、影片及長智慧體任務歷史的高效長上下文處理。稀疏 MoE 架構在保持 124B 總引數的同時,僅啟用 5.5B 引數,兼顧了強大多模態能力與推理效率。

在評測方面,Ling-3.0-flash-VL 在 Artificial Analysis 智慧指數 v4.1.1 上取得 42 分,較 Ling-3.0-flash 的 38 分提升 4 分,表明視覺能力的加入進一步提升了模型的整體智慧水平。在多模態基準測試中,模型展現出三個維度的能力:理解複雜視覺資訊(如物體計數、複雜佈局、圖表與文件內容);基於視覺證據進行推理與驗證(如計算、多步推理與外部資訊核實);理解網頁與軟體介面並將視覺資訊轉化為行動序列(如自動操作介面完成任務)。模型預設開啟思考模式,預設引數為 temperature=0.6、top_p=0.95、top_k=20。

Ling-3.0-flash-VL 已在 Hugging Face 與 ModelScope 平台開源,採用 MIT 許可。官方提供了基於 SGLangvLLM 的部署方案。SGLang 推薦在 2×141GB 級 GPU(如 H20-3e、H200)或 2-GPU Blackwell 節點(B300、GB300)上執行,支援 256K 上下文(通過 YaRN 擴充套件);在 80GB 視訊記憶體卡(如 H100、H800)上則需擴充套件至 8 卡並行。vLLM 部署需使用專門的程式碼倉庫 inclusionAI/vllm-ling-v3。

此次釋出延續了百靈團隊在高效模型架構上的探索。Ling-3.0-flash-VL 的稀疏啟用設計使其在推理成本上具有顯著優勢,而原生多模態能力則拓展了模型在智慧體、自動化操作等場景的應用潛力。對於 AI 產業觀察者而言,該模型展示了在有限算力下實現強大多模態智慧的可行路徑,其開源策略也有助於推動社群生態發展。不過,模型的實際效能與部署效果仍需在真實場景中進一步驗證。