Инженеры Mistral AI обнаружили истинную причину утечки памяти в vLLM с помощью BPFtrace
Mistral
Инженеры Mistral AI исследовали утечку памяти в vLLM при дезагрегированном обслуживании с Mistral Medium 3.1. После использования инструментов Python, Heaptrack и BPFtrace они выяснили, что утечка была вызвана прямыми вызовами mmap через обёртку системного вызова glibc, а не выделениями кучи.
Команда Mistral AI исследовала подозрение на утечку памяти в vLLM во время предпроизводственного тестирования разобщенного обслуживания с помощью своей флагманской модели Mistral Medium 3.1. Утечка проявлялась в виде устойчивого увеличения системной памяти на 400 МБ в минуту при определенных условиях: с включенной vLLM, Mistral Medium 3.1 и компиляцией графов, только на стороне декодирования в
Показать ещё ↓
Источник: Mistral AI —
оригинал
