развертывания таких моделей, как Qwen3.6 35B-A3B (загрузка 22 ГБ, 30–40 ГБ оперативной памяти) или аналогичного по размеру North Mini Code 1.0. Бенчмарк скорости показывает, что Qwen3.6 и North Mini генерируют около 40 токенов/с на Mac Mini и 30 токенов/с на DGX с до 30 ГБ оперативной памяти при контексте 50 тысяч токенов. Он также упоминает облачные варианты для более крупных моделей, таких как GLM 5.2. Локальная настройка прозрачна, проверяема, бесплатна (кроме аппаратного обеспечения) и обеспечивает конфиденциальность. Он предполагает, что скорость выше 20–30 токенов/с является приемлемой для локальной работы агента.