Liquid AI、小型視覚言語モデルLFM2.5-VL-3Bを発表:オンデバイスでの画面読み取り、物体グラウンディング、ツール呼び出しに対応
Liquid AI
Google/DeepMind
Liquid AIは、オンデバイス展開向けの31億パラメータの視覚言語モデルLFM2.5-VL-3Bをリリースしました。このモデルは、デジタル画面の読み取り、物体のグラウンディング、ツールの呼び出しに優れ、28の視覚ベンチマークで平均69.4を達成し、より大規模なモデルに匹敵する性能を示します。メモリ使用量は約3GBで、Apple製ハードウェア上で効率的に動作し、年間売上高1000万ドル未満の企業には無料となる独自のオープンライセンスを備えています。
Liquid AIは、デバイス上での展開を目的とした、3.1Bパラメータの視覚言語モデルLFM2.5-VL-3Bのリリースを発表しました。このモデルは、モバイル、ウェブ、デスクトップにわたるデジタル画面上の情報を読み取り、オブジェクトを座標に接地し、ドキュメントやチャートを解析し、テキストまたは画像入力からツールを呼び出します。28のビジョンベンチマークで平均69.4を達成し、InternVL-3.5-4Bと同等で、どちらも4.7BモデルであるQwen3.5-4Bに0.7ポイント差に位置します。このモデルは、低遅延を維持するために推論を行わず、約3GBのメモリに収まり、Apple M5 Max上で毎秒228トークンをデコードします。チェックポイントは、ネイティブ、GGUF、ONNX、MLX形式で利用可能で、llama.cpp、MLX、vLLM、SGLang、ONNXランタイムを初日からサポートしています。LFMオープンライセンスv1.0はApache-2.0を基にしていますが、企業の年間収益が1000万ドルに達すると無料の商用利用が終了します。以前のバージョンからの主な改善点には、ScreenSpot-v2の平均が80.7に達したこと、RefCOCO-avgのprecision@1が57.1から87.9に向上したこと、そしてToolSandboxスコアが26.4から59.5に改善された新しい関数呼び出し機能が含まれます。
出典: MarkTechPost —
原文
