Liquid AI lanza LFM2.5-2.6B: un modelo agéntico en el dispositivo con contexto de 128K, llamada a herramientas y pesos abiertos
Liquid AI
Google/DeepMind
Alibaba/Qwen
Liquid AI ha presentado LFM2.5-2.6B, un modelo agéntico diseñado para ejecutarse íntegramente en el dispositivo, capaz de planificar, usar herramientas y realizar tareas de varios pasos. Con 2.69 mil millones de parámetros, una ventana de contexto de 128K y pesos abiertos, ofrece un rendimiento competitivo con modelos más grandes, garantizando privacidad de datos y bajos costes operativos.
Liquid AI ha lanzado LFM2.5-2.6B, un modelo agéntico que funciona completamente en el dispositivo, planificando, llamando a herramientas y manejando tareas de múltiples pasos en teléfonos, laptops, PC y robots. El modelo tiene 2,69 mil millones de parámetros en total, una ventana de contexto de 131.072 tokens y un vocabulario de 128.000 tokens, preentrenado con aproximadamente 34 billones de tokens. Se enviaron dos checkpoints: LFM2.5-2.6B-Base para fine-tuning y LFM2.5-2.6B post-entrenado para cargas de trabajo agénticas. Debido a que la inferencia permanece local, los datos nunca salen del dispositivo y el costo marginal por ejecución es casi nulo. El modelo reporta puntuaciones de uso de herramientas y seguimiento de instrucciones competitivas con modelos casi cuatro veces su tamaño. Ambos checkpoints son públicos en Hugging Face bajo la licencia lfm1.0, con pesos en formatos nativos, GGUF, MLX y ONNX, y soporte desde el primer día en llama.cpp, vLLM, SGLang y LM Studio. La arquitectura presenta 30 capas (22 bloques de convolución corta de doble puerta más 8 bloques de atención por grupos consultados) y un tamaño de vocabulario de 128.000. El entrenamiento implicó un proceso de post-entrenamiento de cuatro etapas que incluye fine-tuning supervisado, especialización del maestro con aprendizaje por refuerzo, destilación on-policy multi-dominio y aprendizaje por refuerzo agéntico con GRPO. Los benchmarks muestran que el modelo lidera en todos los benchmarks de seguimiento de instrucciones reportados y en casi todos los benchmarks de uso de herramientas, quedando solo por detrás de modelos más grandes como Qwen3.5-9B en BFCLv4 y tareas de codificación. El modelo se recomienda para cargas de trabajo agénticas, uso de herramientas, extracción de datos, RAG y flujos de trabajo de contexto largo, pero no para codificación agéntica ni tareas intensivas en conocimiento.
Fuente: MarkTechPost —
original
