Железо и инференс 🇷🇺 04.08.2026 11:03

Вывод LLM на кластере старых ноутбуков

Meta Alibaba/Qwen OpenAI
В ходе эксперимента была протестирована распределённая выдача LLM на трёх старых ноутбуках с использованием протокола RPC библиотеки llama.cpp. Результаты показывают, что распределённая выдача даёт значительное ускорение только в случае, когда модель не помещается в память одного узла; для меньших моделей сетевые накладные расходы делают быстрее один быстрый узел. Тест также выявил, что обработка промптов выигрывает от параллелизма, а генерация токенов — нет.
Был проведён эксперимент по тестированию распределённого инференса LLM на кластере из трёх старых ноутбуков с процессорами Intel разных поколений: Core i7-4700MQ (Haswell, 2013), Core i5-8265U (Whiskey Lake, 2018) и Core i3-1115G4 (Tiger Lake, 2020), суммарно 52 ГБ ОЗУ. Использовалось программное обеспечение llama.cpp (сборка b10069) с RPC-сервером на каждом узле, узлы были соединены через
Показать ещё ↓
Источник: Habr — хаб ML — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости