模型开源 🇨🇳 10.08.2026 05:01

继3B模型超越英伟达与谷歌后,Om AI推出端侧原生VLX模型:小参数实现物理世界精准感知

NVIDIANVIDIA Google/DeepMindGoogle/DeepMind TeslaTesla
Om AI联汇完成由前海母基金领投的数亿元融资,并开源全球首个端侧原生模型VLX-Seek 1.5。该模型提供3B和10B版本,采用流式多模态架构,在多项基准测试中超越更大规模模型,强调从云端到端侧原生人工智能的范式转变,以实现对物理世界的理解。
8月6日,Om AI 联辉宣布完成由前海母基金领投的数亿元融资,并同步开源了被称为全球首个端侧原生模型的 VLX-Seek 1.5。该公司将 VLX 定位为“端侧原生”路线,与英伟达、谷歌等依赖云端的策略形成对比。VLX-Seek 1.5 提供 3B 和 10B 参数版本,其特色是流式多模态架构,可在设备端实时处理视频流,不同于传统的视觉语言模型批量处理方式。在基准测试中,3B 版本在 LVIS Mean(57.5 对 50.7)、RefCOCOg test Mean(80.2 对 76.8)和 RefDrone F1(73.2 对 52.3)上均优于英伟达的 LocateAnything-3B,在小物体和无人机视角场景下有显著提升。该模型还引入了目标幻觉指标,误报率更低(假阳性/目标数 18 对 71.3)。公司还重点介绍了其“一脑多形”智能体平台 OmAgent、面向具身场景的 OttoPlex、与联想和苹果合作开发的 OttoBox 人工智能工作室,以及为近 10 万视障用户服务的 Homer 人工智能可穿戴视觉助手。此次开源旨在为物理世界应用中的端侧原生人工智能定义标准。
来源: QbitAI 量子位 — 原文
我们之前关于此话题的帖子 ↓
最新新闻