Mô hìnhMã nguồn mở 🇺🇸 27.07.2026 03:03

Thinking Machines Unveils Open Multimodal Model Inkling with Trillion Parameters

Thinking Machines has released on Hugging Face the open multimodal model Inkling, which understands text, images, audio, and video, supports a context of up to 1 million tokens, and has approximately 975 billion parameters. The model is available in BF16 and NVFP4 versions, works with popular frameworks (Transformers, SGLang, vLLM), and includes fast inference mechanisms.
Компания Thinking Machines выпустила открытую мультимодальную модель Inkling, доступную на Hugging Face. Модель имеет около 975 миллиардов параметров (41 миллиард активных благодаря архитектуре MoE), поддерживает изображения, аудио, текст и видео, а также окно контекста до 1 миллиона токенов. Inkling обучена на 45 триллионах токенов различных модальностей. Архитектура включает декодер, гибридное внимание (чередование глобального и скользящего оконного внимания в соотношении 5:1), короткие 1D-свёртки (SConv) для локального представления и MoE с 256 экспертами, из которых при каждом вызове активны 6 выбранных и 2 общих эксперта. Для позиционирования используется относительное внимание вместо RoPE. Мультимодальные модули: для изображений — простой иерархический MLP-патчификатор, для аудио — дискретизированная мел-спектрограмма, каждый фрагмент аудио длительностью 100 мс преобразуется в мел-бинары. Inkling поддерживает инструментальные возможности (агентность) и поставляется с поддержкой «с первого дня» в библиотеках Transformers, SGLang и vLLM. Для инференса модель требует 2 ТБ видеопамяти в версии BF16 и 600 ГБ — в NVFP4, который подходит для видеокарт Blackwell. Доступна через серверные роутеры Hugging Face Inference Providers и локально через llama.cpp с GGML-квантами. В статье приведены примеры кода для работы с моделью через pipelines, AutoModelForMultimodalLM, SGLang и vLLM.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới