Bilgi Damıtmayı Ölçekte Çalıştıracak Kadar Ucuza Getirmek
Multiverse Computing
NVIDIA
Meta
Multiverse Computing'den yeni bir makale, önbelleğe alınmış top-K logitleri ve birleştirilmiş parçalı KL kaybı ile verimli çevrimdışı bilgi damıtmayı tanıtıyor; bu, VRAM kullanımını 15 katın üzerinde azaltıyor ve tek bir GPU'da uzun bağlamlı damıtmayı mümkün kılıyor. Teknikler, eğitim maliyetlerini önemli ölçüde düşürerek büyük ölçekli damıtma deneylerini pratik hale getiriyor.
Bilgi damıtma, daha küçük bir öğrenci modelinin daha büyük bir öğretmen modelini taklit etmeyi öğrendiği bir teknik olup, büyük dil modellerini sıkıştırmanın standart bir yöntemidir. 2,8 trilyon parametreli Kimi-K3 gibi son açık kaynaklı LLM'ler yaklaşık 3 TB VRAM gerektirdiğinden sıkıştırma zorunlu hale gelmiştir. 'Büyük Dil Modelleri için Verimli Bilgi Damıtma: Çevrimdışı Top-K Logitler ve Birleşik Parçalı KL Kaybı' başlıklı makale, öğretmenin top-K logitlerini çevrimdışı olarak önbelleğe alarak damıtmanın yüksek maliyetlerini ele alıyor ve öğretmeni bellekte tutma ihtiyacını ortadan kaldırıyor. Ayrıca, kaybı parçalar halinde hesaplayan ve tam kelime dağarcığı × dizi matrisini önleyen birleşik bir parçalı KL kaybı sunuyor. Bu, tek bir H200'de tepe VRAM'i 250 GB'tan 128 GB'a düşürerek, dört düğüm yerine tek GPU'da 32K bağlamında damıtmayı mümkün kılıyor ve adım sürelerini 5 kat hızlandırıyor. Llama 3.1 8B Instruct'tan 3,2 milyar parametreye damıtılan öğrenci model, BoolQ ve HellaSwag gibi kıyaslamalarda doğruluğun çoğunu koruyor ve MMLU'da dokuz puan içinde kalıyor.
Kaynak: Hugging Face blog —
orijinal
