⚡ ÚLTIMA HORA
Thinking Machines lanza Inkling, un modelo multimodal abierto con 1 billón de parámetros
Thinking Machines ha lanzado Inkling, un LLM multimodal abierto con aproximadamente 1 billón (1T) de parámetros totales y 41 mil millones (41B) de parámetros activos, que admite entradas de texto, imagen y audio con una ventana de contexto de 1 millón (1M). El modelo está disponible en Hugging Face en las variantes BF16 y NVFP4, con soporte desde el primer día en transformers, SGLang, vLLM y llama.cpp.
Thinking Machines ha lanzado como código abierto Inkling, un modelo multimodal de gran tamaño basado en mezcla de expertos con aproximadamente 1 billón de parámetros totales y 41 mil millones de parámetros activos. Es el primer modelo abierto de gran tamaño que acepta de forma nativa entradas de texto, imagen y audio con una ventana de contexto de 1M. La arquitectura incluye atención relativa en lugar de RoPE, atención híbrida con una proporción deslizante-global de 5:1, capas cortas de convolución 1D y mezcla de expertos con expertos compartidos. Para la visión, utiliza un parcheador MLP jerárquico; para el audio, emplea un espectrograma de mel discretizado. Inkling está disponible en BF16 completo (que requiere 2 TB de VRAM) y una variante cuantizada NVFP4 (que requiere 600 GB de VRAM). Soporta inferencia a través del pipeline de transformers, AutoModelForMultimodalLM, SGLang, vLLM y llama.cpp, y se puede acceder a través de los proveedores de inferencia de Hugging Face.
Fuente: Hugging Face blog —
original
