RisetPerangkat Keras & Inferensi 🇺🇸 27.07.2026 17:02

Insinyur Mistral AI temukan penyebab sebenarnya kebocoran memori di vLLM menggunakan BPFtrace

MistralMistral
Insinyur Mistral AI menyelidiki kebocoran memori di vLLM selama disaggregated serving dengan Mistral Medium 3.1. Setelah menggunakan alat Python, Heaptrack, dan BPFtrace, mereka menemukan bahwa kebocoran disebabkan oleh panggilan mmap langsung melalui wrapper syscall glibc, bukan alokasi heap.
Tim Mistral AI menyelidiki dugaan kebocoran memori pada vLLM selama pengujian pra-produksi dari disaggregated serving menggunakan model andalan mereka, Mistral Medium 3.1. Kebocoran tersebut bermanifestasi sebagai peningkatan memori sistem yang stabil sebesar 400 MB per menit dalam kondisi tertentu: dengan vLLM, Mistral Medium 3.1, dan kompilasi graf diaktifkan, hanya pada sisi decode dari pengaturan Prefill/Decode yang dipisahkan menggunakan NIXL. Alat Python awal seperti Memray dan Guppy 3 tidak menunjukkan kebocoran, dan Heaptrack hanya mengungkapkan ketidaksesuaian puncak RSS. Dengan menggunakan pmap untuk memantau /proc/<pid>/maps, mereka mengamati pemetaan memori anonim yang terus bertambah dengan alamat yang berubah, yang merupakan karakteristik dari mremap atau siklus mmap/munmap berulang. Untuk memastikan penyebab pastinya, mereka menggunakan BPFtrace untuk melacak panggilan sistem, yang mengungkapkan bahwa alokasi dilakukan melalui panggilan mmap langsung melalui pembungkus panggilan sistem glibc (syscall+29). Ini menunjukkan bahwa kebocoran berada di luar manajemen heap, sehingga memerlukan pelacakan tingkat rendah untuk mengidentifikasinya.
Sumber: Mistral AI — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru