ядра ggml, что пропускная способность памяти масштабируется в зависимости от количества байт, читаемых за одно ядро: небольшие чтения (несколько мегабайт) достигают лишь 20-50% пиковой пропускной способности. Множество экспертных проекций в модели MoE приводит к множеству мелких ядер (в среднем 4,6 МБ на ядро), что ниже порога полной пропускной способности. Плотная модель читает более крупные матрицы (22,2 МБ на ядро), достигая 86% пиковой производительности. Автор прогнозирует скорость плотной модели с точностью до 3,7% и масштабирование глубины контекста с точностью до 2,4%, что подтверждает их модель. Они также отмечают предварительный закон масштабирования: порог 90% пропускной способности масштабируется с шириной GPU (в 8 раз от RTX 4060 до 5090).