Tras superar a NVIDIA y Google con su modelo de 3B, Om AI lanza el modelo nativo de extremo VLX: parámetros pequeños logran percepción precisa del mundo físico
NVIDIA
Google/DeepMind
Tesla
Om AI Lianhui (Om AI联汇) completó una ronda de financiación de varios cientos de millones de yuanes liderada por Qianhai Mother Fund y publicó como código abierto VLX-Seek 1.5, el primer modelo nativo de extremo del mundo. El modelo, disponible en versiones de 3B y 10B, utiliza una arquitectura multimodal de transmisión para superar a modelos más grandes en varios puntos de referencia, enfatizando un cambio de paradigma desde la inteligencia artificial basada en la nube hacia la inteligencia artificial nativa de extremo para la comprensión del mundo físico.
El 6 de agosto, Om AI Lianhui anunció una financiación de varios cientos de millones de yuanes liderada por Qianhai Mother Fund, y simultáneamente liberó como código abierto VLX-Seek 1.5, descrito como el primer modelo nativo de extremo a extremo del mundo. La empresa posiciona VLX como un enfoque 'nativo de extremo', en contraste con las estrategias dependientes de la nube de NVIDIA, Google y otros. VLX-Seek 1.5 viene en versiones de 3B y 10B parámetros y presenta una arquitectura multimodal de transmisión que procesa flujos de video en tiempo real en el dispositivo, a diferencia del procesamiento por lotes de los VLM tradicionales. En los benchmarks, la versión de 3B superó a LocateAnything-3B de NVIDIA en LVIS Mean (57.5 frente a 50.7), RefCOCOg test Mean (80.2 frente a 76.8) y RefDrone F1 (73.2 frente a 52.3), con mejoras significativas en escenarios de objetos pequeños y vistas de dron. El modelo también introduce una métrica de alucinación de objetivos, logrando tasas más bajas de falsos positivos (FP/GT 18 frente a 71.3). La empresa también destacó su plataforma de agente 'un cerebro, múltiples formas' OmAgent, OttoPlex para escenarios encarnados, OttoBox AI Studio desarrollado con Lenovo y Apple, y el asistente visual portable Homer AI que sirve a casi 100,000 usuarios con discapacidad visual. La liberación del código abierto tiene como objetivo definir un estándar para la IA nativa de extremo en aplicaciones del mundo físico.
Fuente: QbitAI 量子位 —
original
