Инференс LLM: от KV-кэша до продакшен-деплоя
Опытный MLOps-инженер из hh.ru рассказывает, как эффективно запускать большие языковые модели на собственном железе в 2026 году. В статье разбираются ключевые технические аспекты: KV-кэш, движки инференса vLLM и SGLang, эволюция механизмов внимания, а также практические рекомендации по выбору модели, параллелизма и оборудования для продакшена.
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02
