Модель использует архитектуру Mixture of Experts со 128 экспертами (4 активных на токен), всего 119 млрд параметров, из которых 8 млрд активных (включая слои эмбеддинга и вывода). Контекстное окно составляет 256k токенов. По сравнению с Mistral Small 3, время полного выполнения сокращено на 40%, а пропускная способность увеличена в 3 раза. Mistral Small 4 превосходит GPT-OSS 120B по эффективности, генерируя значительно более короткие ответы при сопоставимом или лучшем качестве. Модель выходит под лицензией Apache 2.0 и доступна через Mistral API, AI Studio, а также на платформе NVIDIA build.nvidia.com в виде NIM. Mistral Small 4 поддерживает текстовые и изображенческие входы, что позволяет использовать её для чата, кодирования, анализа документов и сложных рассуждений. Компания также объявила о вступлении в NVIDIA Nemotron Coalition в качестве сооснователя.