тренинга. Kimi K3 основана на архитектуре «Смесь экспертов» (MoE), всего 48 экспертов, из которых 2 активны на каждый токен, при этом активируется 37 миллиардов параметров из общего числа в 264 миллиарда. Модель рассчитана на масштабирование и эффективность, имеет контекстную длину 128K и обучается с использованием смешанной точности FP8. Открытие исходного кода Kimi K3 рассматривается как шаг к демократизации доступа к передовым ИИ-технологиям и вызов установленным игрокам, таким как Anthropic и OpenAI.