蚂蚁集团旗下百灵团队近日在Hugging Face发布了Ling-3.0-tiny-singprobe,这是一个基于Ling-3.0-tiny的流式安全探针,旨在以极低的额外开销实现生成过程中的实时安全监控。该模型权重文件大小仅3.22M,采用MIT许可证,基础模型为inclusionAI/Ling-3.0-tiny,并附带技术报告(arXiv:2608.30703)供研究者参考。
与传统的独立安全模型不同,SingProbe的设计思路是复用基础模型在生成过程中的隐藏状态,在每一个token生成时同步评估查询意图、回答安全性和幻觉风险。这种“内在”探针方式避免了额外运行一个完整安全模型的资源消耗,其新增的解码开销据称低于0.5%,对于对延迟敏感的生产环境而言,这一特性颇具吸引力。
在性能评估方面,SingProbe在多个基准测试中表现出色。在查询意图分类任务(6个基准)上,其F1分数为0.8561,与参考基线Qwen3Guard-Stream-8B-strict(0.8602)基本持平;在回答安全分类(8个基准)上,F1为0.8508,略高于基线的0.8486;在流式安全(3个基准)上,R-AUC和T-AUC分别达到0.9888和0.9479,明显优于基线的0.9640和0.8893;在幻觉检测(6个基准)上,AUC为0.7765,优于对比模型DRIFT的0.7408。此外,在部署特性上,良性回答的误报率平均为0.07%,在线幻觉检测在自由生成下的平均AUC为0.6807。
从技术实现看,SingProbe通过SGLang或vLLM的集成分支支持,用户可在服务器启动时通过Hugging Face ID加载探针。目前该探针仅支持Ling-3.0系列基础模型(如BailingMoeV3ForCausalLM),且要求使用精确的基础模型与探针配对。这一限制意味着其应用范围目前局限于百灵自家的模型生态,但作为开源项目,未来有望扩展至更多模型。
对于AI产业而言,SingProbe的意义在于提供了一种低成本、高效率的安全监控方案。随着大模型在各行各业落地,安全性和可靠性成为关键考量,传统的安全检测往往需要额外部署模型,增加推理成本和延迟。SingProbe通过复用基础模型内部状态,将安全检测的额外开销压缩到极小,这为实时内容审核、幻觉抑制等应用场景提供了新的可能性。不过,其性能数据主要基于公开基准测试,实际生产环境中的表现仍需进一步验证。此外,该探针目前仅支持Ling-3.0系列,对于使用其他基础模型的开发者而言,尚无法直接采用。总体来看,SingProbe展示了模型安全领域的一种创新思路,其开源发布也为社区提供了可复现的参考实现。