Om AI聯匯近日宣佈,其旗下全球首款端側原生模型VLX-Seek 1.5正式開源。該模型主打“端側原生”路線,不依賴雲端大算力,也不繫結單一硬體平台,而是從模型架構層就將延遲、功耗、算力、部署成本作為設計前提。在公開評測中,其3B引數版本在多項任務上超越了輝達同規模的LocateAnything-3B,引發業內對“小引數實現物理世界精準感知”可能性的關注。

傳統視覺語言模型(VLM)的工作流通常是:攝像頭拍照、上傳雲端、等待推理、返回結果。這種方式延遲高、頻寬依賴大、隱私不可控,而且把物理世界的連續感知切割成一幀幀靜態快照。VLX-Seek 1.5則接收影片流持續輸入,在端側即時理解並動態輸出決策,形成從“拍照識別”到“影片流理解”的範式變化。公司認為,這正是其能在同參數級別贏過巨頭的原因——關鍵不在引數,而在架構。

在VLX-Seek 1.5的評測中,Om AI聯匯測試了3B和10B兩個版本,覆蓋通用目標檢測、指代表達理解、無人機視角感知、具身空間推理以及目標幻覺等多個方向。同場比較的模型包括自家上一版VLX-Seek、輝達的LocateAnything等檢測增強型VLM,以及多個更大的開源或閉源模型。結果顯示,VLX-Seek 1.5不僅提升了細粒度視覺理解能力,還在無人機定位、具身裝置空間推理等場景中展現出競爭力。

最具代表性的是3B引數版本與同規模模型(LocateAnything-3B)的比較。在通用檢測任務中,VLX-Seek 1.5-3B在LVIS Mean指標(衡量開放集定位模型對上千種物體、包含大量稀有物體的框選能力)上達到57.5,相比LocateAnything-3B的50.7,提升13.4%。在指代表達理解任務中,VLX-Seek 1.5-3B在RefCOCOg test Mean(語言描述定位目標物體)上達到80.2,相比LocateAnything-3B提升3.4%。

對於無人機這類目標小、距離遠、視角高、環境複雜的場景,傳統模型容易漏檢或誤判。在RefDrone測試中,VLX-Seek 1.5-3B的F1指標達到73.2,相比LocateAnything-3B的52.3提升40%;例項準確率Acc達到58,相比LocateAnything-3B的35.6提升62.9%。這些結果說明,在極端視角和小目標場景下,端側原生架構正展現出不同於傳統路線的效率優勢。

針對機器人、無人機和安防系統對安全性的高要求,VLX-Seek 1.5引入了目標幻覺指標,用於衡量模型是否會產生不存在目標的誤報。該指標定義為Object Hallucination = FP/Number of GT Objects,其中FP代表針對實際不存在請求目標產生的假陽性檢測,數值越低說明目標幻覺越少。在RefDrone目標幻覺評測中,VLX-Seek 1.5的FP/GT為18,而LocateAnything-3B為71.3。公司認為,知道什麼時候說“不知道”,反而是智慧走進真實物理世界的重要標誌。

Om AI聯匯近期完成數億元融資,市場解讀為資本市場開始為端側原生範式定價。公司還透露,消費端已攜手聯想、蘋果推出AI PC“OttoBox AI Studio”,其自研可穿戴AI視覺中樞Homer AI已服務全國近10萬視障使用者,平台月均AI呼叫達千萬次。這些佈局表明,Om AI聯匯的目標不僅是成為一家模型公司,更希望成為端側原生智慧時代的基礎設施提供者。

從行業格局看,全球物理AI模型路線正呈現多元化:Physical Intelligence的π系列探索雲端通用機器人策略模型,Google Gemini Robotics沿雲端VLA方向推進,Tesla Optimus則強調模型與機器人本體的閉環。Om AI聯匯的端側原生路線另闢蹊徑,試圖通過更適合物理世界的架構提高單位引數價值。未來真正擁有最大價值的,或許不是引數最多的模型,而是能讓機器人、無人機和智慧終端規模化執行的基礎設施。