3BモデルがNVIDIAとGoogleを凌駕した後、Om AIが端末ネイティブVLXモデルを発表:小規模パラメータで物理世界の精密な認識を実現
NVIDIA
Google/DeepMind
Tesla
Om AI聯匯(Om AI Lianhui)は、前海母基金が主導する数億人民元の資金調達ラウンドを完了し、世界初の端末ネイティブモデルであるVLX-Seek 1.5をオープンソース化しました。このモデルは3Bと10Bのバージョンがあり、ストリーミングマルチモーダルアーキテクチャを採用し、さまざまなベンチマークで大規模モデルを上回る性能を発揮します。クラウドベースから端末ネイティブへのパラダイムシフトを強調し、物理世界の理解を目指しています。
8月6日、Om AI Lianhuiは前海母基金が主導する数億元規模の資金調達を発表し、同時に「世界初のエンドサイドネイティブモデル」とされるVLX-Seek 1.5をオープンソース化しました。同社はVLXを「エンドサイドネイティブ」アプローチと位置づけ、NVIDIAやGoogleなどのクラウド依存戦略とは対照的です。VLX-Seek 1.5は30億パラメータ版と100億パラメータ版があり、従来のVLM(ビジョン言語モデル)のバッチ処理とは異なり、デバイス上でビデオストリームをリアルタイムに処理するストリーミングマルチモーダルアーキテクチャを特徴としています。ベンチマークでは、30億パラメータ版がNVIDIAのLocateAnything-3BをLVIS Mean(57.5対50.7)、RefCOCOg test Mean(80.2対76.8)、RefDrone F1(73.2対52.3)で上回り、小物体やドローン視点のシナリオで大幅な改善を示しました。また、モデルはターゲット幻覚指標を導入し、誤検出率(FP/GT 18対71.3)を低減しました。同社はさらに、「一つの脳、多様な形態」のエージェントプラットフォームであるOmAgent、身体化シナリオ向けのOttoPlex、LenovoおよびAppleと共同開発したOttoBox AI Studio、そして約10万人の視覚障害者ユーザーにサービスを提供するAIウェアラブル視覚アシスタントのHomer AIを紹介しました。オープンソース化は、物理世界アプリケーションにおけるエンドサイドネイティブAIの標準を定義することを目的としています。
出典: QbitAI 量子位 —
原文
