螞蟻集團旗下百靈團隊近日在Hugging Face釋出了Ling-3.0-tiny-singprobe,這是一個基於Ling-3.0-tiny的流式安全探針,旨在以極低的額外開銷實現生成過程中的即時安全監控。該模型權重檔案大小僅3.22M,採用MIT許可證,基礎模型為inclusionAI/Ling-3.0-tiny,並附帶技術報告(arXiv:2608.30703)供研究者參考。
與傳統的獨立安全模型不同,SingProbe的設計思路是複用基礎模型在生成過程中的隱藏狀態,在每一個token生成時同步評估查詢意圖、回答安全性和幻覺風險。這種“內在”探針方式避免了額外執行一個完整安全模型的資源消耗,其新增的解碼開銷據稱低於0.5%,對於對延遲敏感的生產環境而言,這一特性頗具吸引力。
在效能評估方面,SingProbe在多個基準測試中表現出色。在查詢意圖分類任務(6個基準)上,其F1分數為0.8561,與參考基線Qwen3Guard-Stream-8B-strict(0.8602)基本持平;在回答安全分類(8個基準)上,F1為0.8508,略高於基線的0.8486;在流式安全(3個基準)上,R-AUC和T-AUC分別達到0.9888和0.9479,明顯優於基線的0.9640和0.8893;在幻覺檢測(6個基準)上,AUC為0.7765,優於對比模型DRIFT的0.7408。此外,在部署特性上,良性回答的誤報率平均為0.07%,線上幻覺檢測在自由生成下的平均AUC為0.6807。
從技術實現看,SingProbe通過SGLang或vLLM的整合分支支援,使用者可在伺服器啟動時通過Hugging Face ID載入探針。目前該探針僅支援Ling-3.0系列基礎模型(如BailingMoeV3ForCausalLM),且要求使用精確的基礎模型與探針配對。這一限制意味著其應用範圍目前侷限於百靈自家的模型生態,但作為開源專案,未來有望擴充套件至更多模型。
對於AI產業而言,SingProbe的意義在於提供了一種低成本、高效率的安全監控方案。隨著大模型在各行各業落地,安全性和可靠性成為關鍵考量,傳統的安全檢測往往需要額外部署模型,增加推理成本和延遲。SingProbe通過複用基礎模型內部狀態,將安全檢測的額外開銷壓縮到極小,這為即時內容稽核、幻覺抑制等應用場景提供了新的可能性。不過,其效能資料主要基於公開基準測試,實際生產環境中的表現仍需進一步驗證。此外,該探針目前僅支援Ling-3.0系列,對於使用其他基礎模型的開發者而言,尚無法直接採用。總體來看,SingProbe展示了模型安全領域的一種創新思路,其開源釋出也為社群提供了可復現的參考實現。