螞蟻集團旗下 inclusionAI 於 Hugging Face 釋出了 Ling-3.0-flash-dspark,這是一個專為 Ling-3.0-flash 設計的 DSpark 投機解碼草稿模型,引數量約 1.36B,採用 BF16 精度。該模型通過 SpecForge 訓練,並支援 SGLang 推理框架,旨在加速目標模型的文本生成過程。
投機解碼是一種通過小模型快速生成草稿 token,再由大模型並行驗證的技術,可顯著降低推理延遲。DSpark 在 DFlash 基礎上引入了目標模型的輔助特徵,並配備了一個置信度頭,能夠動態決定生成的草稿 token 數量,從而在保證生成質量的同時提升解碼效率。
模型規格方面,Ling-3.0-flash-dspark 擁有 5 層全注意力層,隱藏層大小為 2,560,採用多頭注意力機制,包含 32 個查詢頭和 32 個鍵值頭。其最大位置嵌入長度為 262,144,能夠處理長上下文。草稿塊大小為 8 個 token,驗證寬度為 9(包含目標獎勵 token)。
在效能評估中,該模型在多個基準測試上展現了平均接受長度(即每次投機驗證步驟中平均接受的 token 數,含目標獎勵 token)的優異表現:GSM8K 上為 6.40,MATH-500 為 6.29,AIME 2025 為 5.56,HumanEval 為 6.57,MBPP 為 6.34,LiveCodeBench 為 5.33,MT-Bench 為 3.92,Alpaca 為 3.51,Arena-Hard-v2 為 3.72。九個工作負載的平均接受長度為 5.29。
部署方面,使用者需使用支援 DSPARK 的 SGLang 版本,並替換模型路徑及張量並行大小等引數。這一發布反映了 AI 推理最佳化領域的持續創新,通過投機解碼技術,開發者可以在不犧牲輸出質量的前提下,提升模型響應速度,降低計算成本。對於 AI 產業鏈而言,這類技術有助於緩解算力瓶頸,推動大模型在更多即時應用場景中的落地。