하드웨어 및 추론에이전트 🇷🇺 24.07.2026 03:01

Mac Mini M4 Pro와 OpenClaw: 로컬 LLM 추론 테스트

AppleApple OpenAIOpenAI Google/DeepMindGoogle/DeepMind
이 기사는 48GB RAM을 탑재한 Mac mini M4 Pro에서 OpenClaw와 LM Studio를 사용하여 로컬 LLM 추론을 테스트합니다. 세 가지 모델, 즉 google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, google/gemma-4-31b를 비교합니다. 결과는 gemma-4-26b 및 qwen3.6-35b와 같은 MoE 모델이 밀집 모델인 gemma-4-31b에 비해 더 나은 속도와 에너지 효율성을 제공함을 보여줍니다.
저자는 48GB RAM을 탑재한 Mac mini M4 Pro에서 로컬 LLM 추론을 테스트했으며, AI 에이전트로 OpenClaw를, 모델 실행에는 LM Studio를 사용했습니다. OpenClaw는 애플리케이션과 메신저를 연결하는 자체 호스팅 게이트웨이로, AI 에이전트를 통합할 수 있습니다. 테스트용으로 세 가지 모델을 선택했습니다: 구글의 gemma-4-26b-a4b-qat(MLX, 4비트), 큐원의 qwen3.6-35b-a3b(GGUF, Q4_K_M), 그리고 구글의 gemma-4-31b(GGUF, Q4_K_M)입니다. 핑 시간은 각각 4초, 3초, 12초였습니다. Selectel에 대한 뉴스를 질문했을 때, qwen3.6-35b-a3b 모델이 60초 만에 가장 상세한 응답을 제공했고, gemma-4-26b-a4b-qat는 60초 만에 분석적 응답을, gemma-4-31b는 300초 만에 간략한 응답을 제공했습니다. 합성 Anubis 벤치마크 결과, gemma-4-26b-a4b-qat는 초당 59토큰을 생성하며 토큰당 0.38줄의 에너지를 소비했고, qwen3.6-35b-a3b는 초당 50토큰, 토큰당 0.45줄을 소비했으며, gemma-4-31b는 초당 10토큰, 토큰당 2.73줄에 그쳤습니다. GPU 사용률은 99%에 도달했고, CPU 사용률은 10% 미만이었습니다. MoE 모델(gemma-4-26b 및 qwen3.6-35b)이 밀집 모델인 gemma-4-31b보다 훨씬 빠르고 에너지 효율적이었습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스