蚂蚁集团旗下百灵团队于今日发布新一代原生多模态模型 Ling-3.0-flash-VL,该模型在 Ling-3.0-flash 的基础上扩展了视觉理解能力,将视觉信息融入从理解、推理到行动、验证的完整流程。模型总参数达 124B,但每个 token 仅激活 5.5B 参数,支持图像与视频输入,上下文窗口最高可达 1M tokens,在保持高效推理的同时提供强大的多模态与智能体能力。
Ling-3.0-flash-VL 的架构设计旨在将视觉信息整合进真实世界的推理与智能体工作流。模型采用 ViT 视觉编码器提取图像与视频特征,通过两层 MLP 投影器将视觉特征与文本表示对齐,实现统一的多模态理解与推理。VideoRoPE 技术编码空间位置与时间顺序,使模型能够理解视觉内容随时间的变化,支持事件定位、长视频问答与视频片段编辑等任务。此外,模型采用 42 层混合骨干网络,以 5:1 的比例交替使用 KDA 与 Gated MLA 层,支持跨文本、图像、视频及长智能体任务历史的高效长上下文处理。稀疏 MoE 架构在保持 124B 总参数的同时,仅激活 5.5B 参数,兼顾了强大多模态能力与推理效率。
在评测方面,Ling-3.0-flash-VL 在 Artificial Analysis 智能指数 v4.1.1 上取得 42 分,较 Ling-3.0-flash 的 38 分提升 4 分,表明视觉能力的加入进一步提升了模型的整体智能水平。在多模态基准测试中,模型展现出三个维度的能力:理解复杂视觉信息(如物体计数、复杂布局、图表与文档内容);基于视觉证据进行推理与验证(如计算、多步推理与外部信息核实);理解网页与软件界面并将视觉信息转化为行动序列(如自动操作界面完成任务)。模型默认开启思考模式,默认参数为 temperature=0.6、top_p=0.95、top_k=20。
Ling-3.0-flash-VL 已在 Hugging Face 与 ModelScope 平台开源,采用 MIT 许可。官方提供了基于 SGLang 与 vLLM 的部署方案。SGLang 推荐在 2×141GB 级 GPU(如 H20-3e、H200)或 2-GPU Blackwell 节点(B300、GB300)上运行,支持 256K 上下文(通过 YaRN 扩展);在 80GB 显存卡(如 H100、H800)上则需扩展至 8 卡并行。vLLM 部署需使用专门的代码仓库 inclusionAI/vllm-ling-v3。
此次发布延续了百灵团队在高效模型架构上的探索。Ling-3.0-flash-VL 的稀疏激活设计使其在推理成本上具有显著优势,而原生多模态能力则拓展了模型在智能体、自动化操作等场景的应用潜力。对于 AI 产业观察者而言,该模型展示了在有限算力下实现强大多模态智能的可行路径,其开源策略也有助于推动社区生态发展。不过,模型的实际性能与部署效果仍需在真实场景中进一步验证。