Инференс LLM: от кэша KV до продакшен-развертывания
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
MLOps-инженер из hh.ru объясняет основы инференса больших языковых моделей на локальном оборудовании. Статья охватывает KV-кэш, инференс-движки vLLM и SGLang, эволюцию механизмов внимания (MHA, GQA, MLA, DSA), а также практические рекомендации по выбору оборудования и схем параллелизма.
Статья инженера MLOps Александра Рыжова из hh.ru рассматривает проблемы и решения для развертывания больших языковых моделей (Large Language Models, LLM) на собственных серверах. Ключевой вывод заключается в том, что эффективность инференса определяется управлением памятью GPU. KV-кэш переводит этап декодирования из вычислительно-ограниченного в ограниченный пропускной способностью памяти. Автор
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
