모델하드웨어 및 추론 🇺🇸 12.08.2026 18:02

LFM2.5-VL-3B: Liquid AI의 엣지 디바이스용 새로운 비전-언어 모델

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Liquid AI가 효율적인 온디바이스 추론을 위해 설계된 소형 비전-언어 모델 LFM2.5-VL-3B를 출시했습니다. 이 모델은 화면 이해, 접지, 다중 이미지 추론 및 함수 호출 기능에서 개선된 성능을 제공합니다. 또한 CPU 및 GPU 배포에 최적화되어 있으면서도 비슷한 크기의 경쟁 모델들을 여러 벤치마크에서 능가합니다.
Liquid AI는 엣지 디바이스를 위한 3.1B 파라미터 비전-언어 모델인 LFM2.5-VL-3B의 출시를 발표했습니다. 이 모델은 SigLIP2 400M NaFlex 비전 인코더와 회사의 LFM2.5-2.6B 텍스트 백본을 결합했으며, 약 34T 토큰으로 훈련되었고, 이전 버전보다 4배 많은 비전 데이터를 사용했습니다. 이 모델은 화면 이해, 접지, 다중 이미지 추론 등 많은 비전 벤치마크에서 동급 크기 중 최고 수준의 결과를 달성했습니다. 또한 지시 수행 및 도구 사용과 같은 텍스트 전용 작업에서도 강력한 성능을 보여줍니다. LFM2.5-VL-3B는 온디바이스 추론에 최적화되어 있으며, M5 Max에서 초당 228토큰, Ryzen AI Max+ 395에서 초당 116토큰, Galaxy S26 Ultra에서도 초당 20토큰을 달성합니다. GPU에서는 멀티프레임 입력을 낮은 지연 시간과 높은 처리량으로 지원하며, 높은 동시성에서 초당 약 11K 출력 토큰을 달성합니다. 이 모델은 Hugging Face에서 제공되며, transformers, vLLM, llama.cpp 등 주요 추론 프레임워크와 호환됩니다.
출처: Hugging Face blog — 원문
관련 게시물 ↓
새로운 뉴스