⚡ EILMELDUNG
Thinking Machines veröffentlicht offenes multimodales Modell Inkling mit 1 Billion Parametern
Thinking Machines hat Inkling veröffentlicht, ein offenes multimodales Large Language Model mit rund 1 Billion Parametern insgesamt und 41 Milliarden aktiven Parametern, das Text-, Bild- und Audioeingaben mit einem Kontextfenster von 1 Million Tokens unterstützt. Das Modell ist auf Hugging Face in den Varianten BF16 und NVFP4 verfügbar, mit Unterstützung ab Tag null in transformers, SGLang, vLLM und llama.cpp.
Thinking Machines hat Inkling als Open-Source-Modell veröffentlicht, ein großes multimodales Mixture-of-Experts-Modell mit insgesamt rund 1 Billion Parametern und 41 Milliarden aktiven Parametern. Es ist das erste große offene Modell, das nativ Texte, Bilder und Audioeingaben mit einem 1M-Kontextfenster akzeptiert. Die Architektur umfasst relative Aufmerksamkeit anstelle von RoPE, hybride Aufmerksamkeit mit einem Gleitfenster-zu-global-Verhältnis von 5:1, kurze 1D-Faltungsschichten und Mixture-of-Experts mit gemeinsamen Experten. Für die Bildverarbeitung verwendet es einen hierarchischen MLP-Patchifier; für Audio ein diskretisiertes Mel-Spektrogramm. Inkling ist in voller BF16 verfügbar (benötigt 2 TB VRAM) und in einer quantisierten NVFP4-Variante (benötigt 600 GB VRAM). Es unterstützt Inferenz über die Transformers-Pipeline, AutoModelForMultimodalLM, SGLang, vLLM und llama.cpp und kann über Hugging Face Inference Providers genutzt werden.
Quelle: Hugging Face blog —
Original
