Token Cramming: İdeal Metin Sıkıştırma Anlamı Korumuyor – AIRI Çalışması
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
AIRI'deki araştırmacılar, 1568 token'a kadar tek bir embedding'e sıkıştıran token cramming yönteminin anlam korumayı garanti etmediğini gösterdi: greedy kod çözme altında doğruluk %99,96'dan %40'a düşüyor. %100 yeniden yapılandırma sağlamak için progresif cramming adlı yeni bir yöntem önerildi, ancak mükemmel şekilde sıkıştırılmış bir embedding'in bile modelin muhakeme yeteneğini bozduğu ve bunun nedeninin transformer'ın erken katmanlarında yattığı bulundu.
AIRI araştırmacıları, donmuş bir LLM'nin tek bir embedding'ine 1.568 tokena kadar sıkıştırarak >%99 doğrulukla yeniden yapılandırma yapabilen token sıkıştırma yöntemini inceledi. Ancak, öğretmen zorlamasından açgözlü kod çözüme geçildiğinde doğruluk %40'a düşüyor çünkü hatalar ilk tokenlarda yoğunlaşıyor. Yazarlar, tokenları tek tek ekleyerek %100 yeniden yapılandırmayı garanti eden aşamalı sıkıştırmayı önerdi. Bu yöntemi kullanarak çeşitli modellerin sıkıştırma kapasitesini ölçtüler: örneğin, Llama-3.1-8B 1.438 token sıkıştırır ve düşük boyutlu izdüşümle bu sayı 1.697'ye kadar çıkar. Optimizasyon yörüngelerini incelemek, bunların düşük boyutlu bir alt uzayda (30-100 bileşen) bulunduğunu gösterdi. Ana sonuç: mükemmel şekilde sıkıştırılmış bir embedding bile orijinal önekle birlikte beslendiğinde, HellaSwag'de doğruluk (Llama için %61,9'dan %40,8'e) düşer ve MMLU'da sıfıra iner. Bunun nedeni erken dönüştürücü katmanlarındadır: dikkat iptali, ilk katmanlardaki etkileşimlerin yeniden yapılandırma için gerekli olduğunu ancak anlamayı engellediğini ortaya koydu. Sıkıştırma kapasitesi, model derinliği ve genişliğiyle monoton olarak artar. Ayrıca, bir tokeni sıkıştırmanın zorluğunun, onun sürpriz değeri tarafından tahmin edildiği bulundu.
Kaynak: Habr — хаб ИИ —
orijinal
