выполнении задач по программированию стоимость снижается до 0,30 доллара за миллион токенов против стандартной цены в 3 доллара за ввод. Эффективность, вероятно, достигается за счёт использования MXFP4 для хранения весов и MXFP8 для активаций — обоих форматов низкой точности, экономящих память. Из 2,8 триллиона её параметров одновременно активны лишь 104,2 миллиарда. Модель спроектирована для работы на ускорителях Nvidia H20, которые не поддерживают собственную плавающую точку MX, но может работать ещё эффективнее на чипах Blackwell. Kimi-K3 заменяет кэш «ключ-значение» обработчиком фиксированного размера под названием Kimi Delta Attention и использует архитектуру «смесь экспертов» (MoE) с активацией только 16 из 896 экспертов. Однако открыты только веса; процесс обучения и набор данных остаются проприетарными.