Thinking Machines presenta Inkling, un modelo multimodal abierto con billones de parámetros
Thinking Machines ha publicado en Hugging Face el modelo multimodal abierto Inkling, que comprende texto, imágenes, audio y video, admite un contexto de hasta 1 millón de tokens y tiene aproximadamente 975 mil millones de parámetros. El modelo está disponible en versiones BF16 y NVFP4, funciona con frameworks populares (Transformers, SGLang, vLLM) e incluye mecanismos de inferencia rápida.
Thinking Machines ha lanzado Inkling, un modelo multimodal de código abierto disponible en Hugging Face. El modelo cuenta con aproximadamente 975 mil millones de parámetros (41 mil millones activos debido a la arquitectura MoE), admite imágenes, audio, texto y video, así como una ventana de contexto de hasta 1 millón de tokens. Inkling se entrenó con 45 billones de tokens de diversas modalidades. La arquitectura del modelo incluye un decodificador, atención híbrida (alternancia de atención global y de ventana deslizante en una proporción de 5:1), convoluciones 1D cortas (SConv) para representación local y MoE con 256 expertos, de los cuales en cada inferencia se activan 6 seleccionados y 2 expertos comunes. Para el posicionamiento se utiliza atención relativa en lugar de RoPE. Los módulos multimodales incluyen: para imágenes, un tokenizador MLP jerárquico simple; para audio, un espectrograma de mel discretizado, donde cada fragmento de 100 ms de audio se convierte en mel-binarios. Inkling admite capacidades de uso de herramientas (agencia) y viene con soporte desde el primer día en las bibliotecas Transformers, SGLang y vLLM. Para la inferencia, el modelo requiere 2 TB de memoria de video en la versión BF16 y 600 GB en NVFP4, que es adecuado para las tarjetas gráficas Blackwell. Está disponible a través de los enrutadores de servidores de Hugging Face Inference Providers y localmente mediante llama.cpp con cuantizaciones GGML. En el artículo se incluyen ejemplos de código para trabajar con el modelo a través de pipelines, AutoModelForMultimodalLM, SGLang y vLLM.
Fuente: Hugging Face blog —
original
