ModelosCódigo Aberto 🇨🇳 10.08.2026 05:01

Após modelo de 3B superar NVIDIA e Google, Om AI lança modelo VLX nativo de ponta: parâmetros pequenos alcançam percepção precisa do mundo físico

NVIDIANVIDIA Google/DeepMindGoogle/DeepMind TeslaTesla
A Om AI Lianhui (Om AI联汇) concluiu uma rodada de financiamento de várias centenas de milhões de yuans liderada pelo Qianhai Mother Fund e disponibilizou como código aberto o VLX-Seek 1.5, o primeiro modelo nativo de ponta do mundo. O modelo, disponível nas versões 3B e 10B, usa uma arquitetura multimodal de streaming para superar modelos maiores em vários benchmarks, enfatizando uma mudança de paradigma de IA baseada em nuvem para IA nativa de ponta para a compreensão do mundo físico.
Em 6 de agosto, a Om AI Lianhui anunciou uma rodada de financiamento de centenas de milhões de yuans liderada pelo Fundo Mãe de Qianhai, e simultaneamente abriu o código do VLX-Seek 1.5, descrito como o primeiro modelo nativo de ponta do mundo. A empresa posiciona o VLX como uma abordagem 'nativa de ponta', contrastando com estratégias dependentes de nuvem da NVIDIA, Google e outras. O VLX-Seek 1.5 está disponível em versões com 3B e 10B de parâmetros e apresenta uma arquitetura multimodal de streaming que processa fluxos de vídeo em tempo real no dispositivo, ao contrário do processamento em lote dos VLMs tradicionais. Em benchmarks, a versão 3B superou o LocateAnything-3B da NVIDIA em LVIS Mean (57,5 contra 50,7), RefCOCOg test Mean (80,2 contra 76,8) e RefDrone F1 (73,2 contra 52,3), com melhorias significativas em cenários de objetos pequenos e visão de drone. O modelo também introduz uma métrica de alucinação de alvo, alcançando taxas de falsos positivos mais baixas (FP/GT 18 contra 71,3). A empresa também destacou sua plataforma de agente 'um cérebro, múltiplas formas' OmAgent, o OttoPlex para cenários corporificados, o OttoBox AI Studio desenvolvido em parceria com a Lenovo e a Apple, e o assistente visual vestível Homer AI atendendo a quase 100.000 usuários com deficiência visual. A abertura do código visa definir um padrão para IA nativa de ponta em aplicações do mundo físico.
Fonte: QbitAI 量子位 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas