вместо позиционного кодирования с вращательными матрицами (RoPE), гибридное внимание с соотношением скользящего и глобального внимания 5:1, короткие одномерные сверточные слои, а также асимметричный ансамбль моделей (Mixture-of-Experts) с общими экспертами. Для обработки изображений используется иерархический патчификатор на основе многослойного персептрона (MLP); для аудио — дискретизированная мел-спектрограмма. Inkling доступна в полной версии BF16 (требует 2 ТБ видеопамяти) и в квантованной версии NVFP4 (требует 600 ГБ видеопамяти). Поддерживается инференс через пайплайн transformers, AutoModelForMultimodalLM, SGLang, vLLM и llama.cpp, а также доступна через провайдеров инференса Hugging Face.