Liquid AI가 LFM2.5-VL-3B 공개: 온디바이스 화면 읽기, 객체 접지, 도구 호출을 위한 소형 비전-언어 모델
Liquid AI
Google/DeepMind
Liquid AI가 31억 개의 파라미터를 가진 비전-언어 모델 LFM2.5-VL-3B를 출시했습니다. 이 모델은 온디바이스 배포를 위해 설계되었으며, 디지털 화면 읽기, 객체 접지, 도구 호출에 탁월한 성능을 보입니다. 28개의 비전 벤치마크에서 평균 69.4점을 기록하여 더 큰 모델과 견줄 만한 성능을 달성했습니다. 이 모델은 약 3GB의 메모리에 적합하며 Apple 하드웨어에서 효율적으로 실행됩니다. 또한 연간 매출 1천만 달러 미만의 기업에게 무료인 독특한 오픈 라이선스를 제공합니다.
Liquid AI가 온디바이스 배포를 위해 설계된 31억 개 파라미터의 비전-언어 모델인 LFM2.5-VL-3B의 출시를 발표했습니다. 이 모델은 모바일, 웹, 데스크톱의 디지털 화면을 읽고, 객체를 좌표로 그라운딩하며, 문서와 차트를 파싱하고, 텍스트 또는 이미지 입력에서 도구를 호출할 수 있습니다. 28개의 비전 벤치마크에서 평균 69.4점을 기록하여 InternVL-3.5-4B와 일치하고 Qwen3.5-4B보다 0.7점 낮은 성능을 보이며, 두 모델 모두 47억 개 파라미터 모델입니다. 이 모델은 지연 시간을 낮게 유지하기 위해 추론(reasoning)을 수행하지 않으며, 약 3GB의 메모리에 적합하고 Apple M5 Max에서 초당 228개의 토큰을 디코딩합니다. 체크포인트는 네이티브, GGUF, ONNX, MLX 형식으로 제공되며, llama.cpp, MLX, vLLM, SGLang, ONNX 런타임을 첫날부터 지원합니다. LFM 오픈 라이선스 v1.0은 Apache-2.0 기반이지만, 기업의 연간 매출이 1,000만 달러에 도달하면 무료 상업 사용이 종료됩니다. 이전 버전 대비 주요 개선 사항으로는 ScreenSpot-v2 평균 80.7, RefCOCO-평균 precision@1이 57.1에서 87.9로 증가, ToolSandbox 점수가 26.4에서 59.5로 향상된 새로운 함수 호출 기능이 포함됩니다.
출처: MarkTechPost —
원문
