Mac mini и OpenClaw: проверяем локальный инференс LLM

AppleApple OpenAIOpenAI Google/DeepMindGoogle/DeepMind
На Mac mini M4 Pro с 48 ГБ памяти протестировали связку OpenClaw + LM Studio для локального инференса LLM. Оценили скорость работы, качество ответов и энергоэффективность трёх моделей: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b и google/gemma-4-31b. Лучший результат по скорости и детализации показала MoE-модель Qwen.
Локальный инференс LLM традиционно требует мощного ПК с несколькими видеокартами, но Mac mini с унифицированной памятью (UMA) предлагает альтернативу. В тесте использовался Mac mini M4 Pro с 48 ГБ ОЗУ и 2 ТБ диска, на котором развернули OpenClaw — self-hosted шлюз для ИИ-агентов, работающий поверх LLM. Для запуска моделей выбрали LM Studio с OpenAI-совместимым API. Из каталога после отбора
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
UMA = Unified Memory Architecture — унифицированная архитектура памяти
API = Application Programming Interface — программный интерфейс приложения
GUI = Graphical User Interface — графический интерфейс пользователя
MLX = Machine Learning eXecution — исполнение машинного обучения (фреймворк Apple)
GGUF = GPT-Generated Unified Format — единый формат для моделей GPT
MoE = Mixture of Experts — смесь экспертов
TTFT = Time to First Token — время до первого токена
SLI = Scalable Link Interface — масштабируемый интерфейс связи
NVLink = NVIDIA Link — связь NVIDIA
DDR5 = Double Data Rate 5 — DDR5 (оперативная память пятого поколения)
CPU = Central Processing Unit — центральный процессор
GPU = Graphics Processing Unit — графический процессор
DMG = Disk Image (Apple) — образ диска (macOS)
ML = Machine Learning — машинное обучение
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости