остались три модели: google/gemma-4-26b-a4b-qat (MLX, 4bit), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) и google/gemma-4-31b (GGUF, Q4_K_M). Тестировали пинг агента (время отклика) и сводку новостей про Selectel. Модель Qwen показала наилучшее сочетание скорости (3 с на пинг) и детальности ответа, хотя допустила ошибку в дате сделки. Gemma-4-31b отвечала дольше всех (12 с на пинг, 300 с на генерацию новостей) и дала краткий ответ. Синтетические бенчмарки Anubis показали, что MoE-модели (Gemma-4-26b и Qwen) значительно быстрее плотной модели: 59 и 50 токенов/с против 10, при загрузке GPU около 99% и CPU менее 10%. Потребление энергии у Gemma-4-31b оказалось в 6-7 раз выше. В целом Mac mini с UMA подходит для локального инференса средних LLM, а MoE-архитектуры обеспечивают лучшую скорость и эффективность.