облачно-зависимым стратегиям NVIDIA, Google и других игроков. VLX-Seek 1.5 выпускается в версиях с 3 и 10 миллиардами параметров и построена на потоковой мультимодальной архитектуре, способной обрабатывать видеопотоки в реальном времени прямо на устройстве, в отличие от традиционной пакетной обработки в VLM (визуально-языковых моделях). В тестах версия с 3 миллиардами параметров превзошла модель NVIDIA LocateAnything-3B по показателю LVIS Mean (57,5 против 50,7), по RefCOCOg test Mean (80,2 против 76,8) и по RefDrone F1 (73,2 против 52,3), продемонстрировав значительный прогресс в сценариях с мелкими объектами и съёмкой с дронов. Модель также вводит новую метрику «галлюцинаций целей», добиваясь более низкого уровня ложных срабатываний (FP/GT — соотношение ложноположительных результатов к истинно положительным — 18 против 71,3). Компания также рассказала о своей платформе агентов «один мозг — множество форм» OmAgent, решении OttoPlex для сценариев воплощённого ИИ, студии OttoBox AI Studio, разработанной совместно с Lenovo и Apple, а также о носимом визуальном ассистенте Homer AI, которым пользуются почти 100 тысяч слабовидящих людей. Цель публикации модели в открытом доступе — задать стандарт для нативного на устройствах ИИ в приложениях, работающих с физическим миром.