Локальный запуск LLM для SOC: сколько GPU действительно нужно?

Аналитик R-Vision Сергей Иванов описывает эксперименты с запуском Qwen3.5-122B-A10B-GPTQ на одной видеокарте RTX PRO 6000 Blackwell Max-Q (96 ГБ GDDR7) с использованием vLLM. Благодаря архитектуре Mixture of Experts, DeltaNet, PagedAttention и квантизации модель способна обрабатывать до 7 параллельных запросов с контекстом по 120 000 токенов. Подход ориентирован на задачи SOC, где LLM работает с уже подготовленными данными из SOAR.
Сергей Иванов из R-Vision делится результатами экспериментов по запуску больших языковых моделей (LLM) локально в центре мониторинга и реагирования (SOC). В отличие от универсальных чат-сервисов, в SOC модель не обучается с нуля, а получает уже подготовленный контекст из SOAR (события SIEM, активы из CMDB, данные Threat Intelligence и т.д.) и выполняет конкретные задачи: объяснение срабатываний правил, выделение артефактов, поиск похожих инцидентов, формирование вердикта. Ключевой вопрос — не «можно ли запустить LLM локально?», а «какие ресурсы нужны для конкретных SOC-задач?». Для ответа на него команда провела серию стресс-тестов на стенде с GPU RTX PRO 6000 Blackwell Max-Q (96 ГБ GDDR7), используя модель Qwen3.5-122B-A10B-GPTQ и движок vLLM. Модель построена на архитектуре Mixture of Experts (MoE): из 122 млрд общих параметров при генерации каждого токена активируется около 10 млрд, что снижает вычислительную нагрузку, но все веса должны быть загружены в видеопамять. Дополнительная экономия памяти достигается за счёт гибридного механизма внимания (3 слоя Gated DeltaNet на 1 слой Gated Attention — GQA), что уменьшает размер KV-cache. Технология PagedAttention разбивает KV-cache на динамические страницы, устраняя фрагментацию. Квантизация весов (GPTQ-INT4) сжимает модель с ~244 ГБ до ~61 ГБ, а KV-cache использует 8-битный формат (FP8). В результате на одной карте (96 ГБ VRAM) веса заняли 68,36 ГБ, под KV-cache осталось 11,76 ГБ, что позволило обслуживать до 7 параллельных запросов с контекстом по 120 000 токенов. Материал разделён на две части: первая посвящена инженерным аспектам, вторая — практическому встраиванию LLM в конвейер обработки инцидентов R-Vision SOAR.
Сокращения
LLM = Large Language Model — большая языковая модель
SOC = Security Operations Center — центр мониторинга и реагирования
GPU = Graphics Processing Unit — графический процессор
MoE = Mixture of Experts — смесь экспертов
GQA = Grouped Query Attention — групповое внимание по запросам
KV-cache = Key-Value cache — кэш ключей и значений
VRAM = Video Random Access Memory — видеопамять
SOAR = Security Orchestration, Automation and Response — оркестрация, автоматизация и реагирование на инциденты
SIEM = Security Information and Event Management — управление информацией и событиями безопасности
CMDB = Configuration Management Database — база данных управления конфигурациями
Threat Intelligence — разведка угроз
Источник: Habr — хаб ИИ — оригинал

Наши прошлые публикации по теме

Есть свежие новости