Thinking Machines Unveils Open Multimodal Model Inkling with Trillion Parameters
Thinking Machines has released on Hugging Face the open multimodal model Inkling, which understands text, images, audio, and video, supports a context of up to 1 million tokens, and has approximately 975 billion parameters. The model is available in BF16 and NVFP4 versions, works with popular frameworks (Transformers, SGLang, vLLM), and includes fast inference mechanisms.
Perusahaan Thinking Machines merilis model multimodal terbuka bernama Inkling, yang tersedia di Hugging Face. Model ini memiliki sekitar 975 miliar parameter (41 miliar aktif karena arsitektur MoE), mendukung gambar, audio, teks, dan video, serta jendela konteks hingga 1 juta token. Inkling dilatih pada 45 triliun token dari berbagai modalitas. Arsitektur model mencakup decoder, attention hybrid (bergantian antara global dan sliding window attention dengan rasio 5:1), konvolusi 1D pendek (SConv) untuk representasi lokal, dan MoE dengan 256 pakar, di mana setiap pemanggilan hanya 6 pakar terpilih dan 2 pakar umum yang aktif. Untuk posisi, digunakan relative attention sebagai pengganti RoPE. Modul multimodal: untuk gambar — patchifier MLP hierarkis sederhana, untuk audio — mel-spektogram yang didiskritisasi, setiap fragmen audio sepanjang 100 md diubah menjadi mel-binari. Inkling mendukung kemampuan alat (agentic) dan dilengkapi dengan dukungan 'hari pertama' di pustaka Transformers, SGLang, dan vLLM. Untuk inferensi, model membutuhkan 2 TB memori video dalam versi BF16 dan 600 GB dalam NVFP4, yang cocok untuk kartu grafis Blackwell. Tersedia melalui perute server Hugging Face Inference Providers dan secara lokal melalui llama.cpp dengan kuantisasi GGML. Artikel ini menyertakan contoh kode untuk bekerja dengan model melalui pipelines, AutoModelForMultimodalLM, SGLang, dan vLLM.
Sumber: Hugging Face blog —
asli
