Om AI联汇近日宣布,其旗下全球首款端侧原生模型VLX-Seek 1.5正式开源。该模型主打“端侧原生”路线,不依赖云端大算力,也不绑定单一硬件平台,而是从模型架构层就将延迟、功耗、算力、部署成本作为设计前提。在公开评测中,其3B参数版本在多项任务上超越了英伟达同规模的LocateAnything-3B,引发业内对“小参数实现物理世界精准感知”可能性的关注。

传统视觉语言模型(VLM)的工作流通常是:摄像头拍照、上传云端、等待推理、返回结果。这种方式延迟高、带宽依赖大、隐私不可控,而且把物理世界的连续感知切割成一帧帧静态快照。VLX-Seek 1.5则接收视频流持续输入,在端侧实时理解并动态输出决策,形成从“拍照识别”到“视频流理解”的范式变化。公司认为,这正是其能在同参数级别赢过巨头的原因——关键不在参数,而在架构。

在VLX-Seek 1.5的评测中,Om AI联汇测试了3B和10B两个版本,覆盖通用目标检测、指代表达理解、无人机视角感知、具身空间推理以及目标幻觉等多个方向。同场比较的模型包括自家上一版VLX-Seek、英伟达的LocateAnything等检测增强型VLM,以及多个更大的开源或闭源模型。结果显示,VLX-Seek 1.5不仅提升了细粒度视觉理解能力,还在无人机定位、具身设备空间推理等场景中展现出竞争力。

最具代表性的是3B参数版本与同规模模型(LocateAnything-3B)的比较。在通用检测任务中,VLX-Seek 1.5-3B在LVIS Mean指标(衡量开放集定位模型对上千种物体、包含大量稀有物体的框选能力)上达到57.5,相比LocateAnything-3B的50.7,提升13.4%。在指代表达理解任务中,VLX-Seek 1.5-3B在RefCOCOg test Mean(语言描述定位目标物体)上达到80.2,相比LocateAnything-3B提升3.4%。

对于无人机这类目标小、距离远、视角高、环境复杂的场景,传统模型容易漏检或误判。在RefDrone测试中,VLX-Seek 1.5-3B的F1指标达到73.2,相比LocateAnything-3B的52.3提升40%;实例准确率Acc达到58,相比LocateAnything-3B的35.6提升62.9%。这些结果说明,在极端视角和小目标场景下,端侧原生架构正展现出不同于传统路线的效率优势。

针对机器人、无人机和安防系统对安全性的高要求,VLX-Seek 1.5引入了目标幻觉指标,用于衡量模型是否会产生不存在目标的误报。该指标定义为Object Hallucination = FP/Number of GT Objects,其中FP代表针对实际不存在请求目标产生的假阳性检测,数值越低说明目标幻觉越少。在RefDrone目标幻觉评测中,VLX-Seek 1.5的FP/GT为18,而LocateAnything-3B为71.3。公司认为,知道什么时候说“不知道”,反而是智能走进真实物理世界的重要标志。

Om AI联汇近期完成数亿元融资,市场解读为资本市场开始为端侧原生范式定价。公司还透露,消费端已携手联想、苹果推出AI PC“OttoBox AI Studio”,其自研可穿戴AI视觉中枢Homer AI已服务全国近10万视障用户,平台月均AI调用达千万次。这些布局表明,Om AI联汇的目标不仅是成为一家模型公司,更希望成为端侧原生智能时代的基础设施提供者。

从行业格局看,全球物理AI模型路线正呈现多元化:Physical Intelligence的π系列探索云端通用机器人策略模型,Google Gemini Robotics沿云端VLA方向推进,Tesla Optimus则强调模型与机器人本体的闭环。Om AI联汇的端侧原生路线另辟蹊径,试图通过更适合物理世界的架构提高单位参数价值。未来真正拥有最大价值的,或许不是参数最多的模型,而是能让机器人、无人机和智能终端规模化运行的基础设施。