AraştırmaAçık Kaynak 🇷🇺 27.07.2026 20:04

Sıfırdan Python ile Yalnızca Kod Çözücüden Oluşan Bir LLM Dönüştürücüsü Yazmak

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
Bir makale serisinin yazarı, PyTorch çerçevesini kullanarak küçük, yalnızca kod çözücüden oluşan bir LLM için dönüştürücü bloğunun uygulanmasını ayrıntılı olarak açıklıyor. Ele alınan bileşenler şunlardır: maskeli Çok Başlı Dikkat, GELU ile İleri Beslemeli Ağ, normalleştirme katmanı ve artık bağlantılar. Makale, orijinal mimariden farkı açıklıyor: eğitim kararlılığı için normalleştirme sonrası (Post-LN) yerine normalleştirme öncesi (Pre-LN) kullanılıyor.
Yazar Vladimir, lisanslı metin için filigran ekleme görevi örneğini kullanarak, yalnızca kod çözücüden oluşan bir LLM için bir transformatör bloğu uyguluyor. Transformatörün, Google'ın "Attention Is All You Need" makalesinden gelen bir mimari olduğunu ve bir dizinin dikkat mekanizması kullanılarak paralel olarak işlendiğini açıklıyor. Çok Başlıklı Dikkat, üç yansıtma matrisine dayanır: S, A, D. İlk adımda, belirteç benzerliği hesaplanır (dikkat matrisi) ve ikinci adımda, belirteç içeriği bulunan ağırlıklara göre karıştırılır. Verimlilik için, tüm dikkat başlıkları tek bir büyük doğrusal yansıtma aracılığıyla uygulanır. Dikkatten sonra, GELU etkinleştirme ve bırakma ile bir İleri Beslemeli Ağ uygulanır. Transformatörün oluşturulması, normalleştirme (Ön-KN) ve artık bağlantıları içerir. Ayrıca, kod çözücü için nedensel bir maske kullanılır. Genel olarak, blok bir LLM'nin birleştirilmesinde, eğitimde ve metin üretiminde kullanılmaya hazırdır.
Kaynak: Habr — хаб NLP — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler