⚡ BREAKING
Thinking Machines brengt open multimodaal model Inkling uit met 1 biljoen parameters
Thinking Machines heeft Inkling uitgebracht, een open multimodaal groot taalmodel met ~1 biljoen totale parameters en 41 miljard actieve parameters, dat tekst-, beeld- en audio-ingangen ondersteunt met een contextvenster van 1 miljoen tokens. Het model is beschikbaar op Hugging Face in BF16- en NVFP4-varianten, met ondersteuning vanaf dag één in Transformers, SGLang, vLLM en llama.cpp.
Thinking Machines heeft Inkling open-sourced, een groot multimodaal mixture-of-experts-model met ongeveer 1 biljoen totale parameters en 41 miljard actieve parameters. Het is het eerste grote open model dat native tekst-, afbeeldings- en audio-ingangen accepteert met een contextvenster van 1M. De architectuur omvat relatieve aandacht in plaats van RoPE, hybride aandacht met een schuif-tot-globale verhouding van 5:1, korte 1D-convolutielagen en Mixture-of-Experts met gedeelde experts. Voor visie gebruikt het een hiërarchische MLP-patchifier; voor audio een gediscretiseerd mel-spectrogram. Inkling is beschikbaar in volledige BF16 (vereist 2 TB VRAM) en een gekwantiseerde NVFP4-variant (vereist 600 GB VRAM). Het ondersteunt inferentie via transformers-pijplijn, AutoModelForMultimodalLM, SGLang, vLLM en llama.cpp, en kan worden benaderd via Hugging Face Inference Providers.
Bron: Hugging Face blog —
origineel
