⚡ EN DIRECT
Thinking Machines publie Inkling, un modèle multimodal ouvert avec 1 000 milliards de paramètres
Thinking Machines a publié Inkling, un LLM multimodal ouvert d'environ 1 000 milliards de paramètres totaux et 41 milliards de paramètres actifs, prenant en charge les entrées texte, image et audio avec une fenêtre de contexte de 1 million de tokens. Le modèle est disponible sur Hugging Face en variantes BF16 et NVFP4, avec un support dès le premier jour dans transformers, SGLang, vLLM et llama.cpp.
Thinking Machines a publié en open source Inkling, un grand modèle multimodal à mélange d'experts comptant environ 1 000 milliards de paramètres au total et 41 milliards de paramètres actifs. C'est le premier grand modèle ouvert à accepter nativement des entrées textuelles, images et audio avec une fenêtre de contexte de 1 million. L'architecture comprend une attention relative au lieu de RoPE, une attention hybride avec un rapport glissant/global de 5:1, de courtes couches de convolution 1D, et un mélange d'experts avec des experts partagés. Pour la vision, elle utilise un patchifier MLP hiérarchique ; pour l'audio, elle emploie un spectrogramme mél discrétisé. Inkling est disponible en BF16 complet (nécessitant 2 To de VRAM) et en variante NVFP4 quantifiée (nécessitant 600 Go de VRAM). Il prend en charge l'inférence via le pipeline transformers, AutoModelForMultimodalLM, SGLang, vLLM et llama.cpp, et peut être consulté via les fournisseurs d'inférence Hugging Face.
Source: Hugging Face blog —
original
