— 20,0, а Qwen 2.5 14B — 11,7. Скорость обработки промпта варьировалась от 531 до 1720 ток/с. Автор заключает, что генерация ограничена пропускной способностью памяти, поэтому скорость примерно равна пропускной способности, деленной на размер модели (например, ~25 ток/с прогнозируется для 8B с Q4, измерено 21). Он отмечает, что M4 Pro и M4 Max должны масштабироваться с пропускной способностью, а не с ядрами. Он рекомендует модели 8B для 16 ГБ как комфортные (20+ ток/с), в то время как 14B ощущается медленной; длинные контексты дешевы в обработке, но дороги в генерации. Ограничения: одна конфигурация, одна квантизация, только текстовая генерация; батчинг не тестировался. Данные открыты под лицензией CC BY.