Ezberleme ve Genelleme: 2160 Parametreli Dil Modeli Gerçekte Ne Yapabiliyor?
2160 parametreli küçük bir dil modeliyle yapılan deney, eğitilmiş desenleri yüksek güvenle ezberlediğini (%99.93 token olasılığı), tanıdık token'ların permütasyonuna sınırlı aktarım yaptığını (%81.69) ve yeni soru yapısında başarısız olduğunu (%10.46) gösterdi. Model, 14 orijinal ilişkiyi felaketle unutma olmadan korudu.
Tiny Language Model projesinin Node.js üzerindeki 1.1.0 sürümünde, ML topluluğundaki tartışmalar ve Hashnode'daki mühendislerden gelen geri bildirimler sonrasında, ezberleme ile genelleştirme arasındaki sınırın incelenmesi eklendi. Sabit seed 42 ile dört kontrolden oluşan frozen evaluation yapıldı: birebir eğitilmiş şablon, yeni sırada tanıdık token'lar, tamamen ertelenmiş şablon ve adaptive SFT sonrası 14 ilişkinin korunması. Sonuçlar, tanıdık şablonda doğru token'ın minimum olasılığının %99.93, token permütasyonunda %81.69 ve bilinmeyen soru yapısında yalnızca %10.46 olduğunu gösterdi; model beklenen 'cat cannot read' yerine 'cat can fly' yanıtını verdi. İlişki koruma görevi tamamen tamamlandı (14/14, doğruluk %100). Deney, modelin yeteneklerinin sınırının, ezberleme ile yerel transfer ve gerçek genelleştirme arasında olduğunu gösteriyor: model öğrendiklerini iyi yeniden üretiyor ve küçük değişikliklerle başa çıkıyor, ancak yeni yapı davranışı bozuyor. Sınırlılığın nedeni yalnızca parametre sayısı değil, aynı zamanda sınırlı sayıda yapı içeren küçük külliyat. Yazar, daha çeşitli veriler olmadan nöron veya blok sayısını artırmanın yalnızca ezberlemeyi iyileştireceğini belirtiyor. Bu, tam teşekküllü bir benchmark değil, tekrarlanabilir bir eğitim teşhisidir.
Kaynak: Habr — хаб ИИ —
orijinal
