ForschungModelle 🇷🇺 31.07.2026 16:01

Memorisierung versus Generalisierung: Was ein Sprachmodell mit 2160 Parametern tatsächlich kann

Ein Experiment mit einem winzigen Sprachmodell mit 2160 Parametern zeigte eine sichere Speicherung trainierter Muster (99,93 Prozent Token-Wahrscheinlichkeit), eine begrenzte Übertragung auf die Permutation bekannter Token (81,69 Prozent) und ein Scheitern bei einer neuen Fragestruktur (10,46 Prozent). Das Modell behielt alle 14 ursprünglichen Beziehungen ohne katastrophales Vergessen.
In Version 1.1.0 des Projekts Tiny Language Model auf Node.js wurde nach einer Diskussion in der ML-Community und Feedback von Ingenieuren auf Hashnode die Grenze zwischen Auswendiglernen und Generalisierung untersucht. Mit festem Seed 42 wurde eine Frozen Evaluation durchgeführt, bestehend aus vier Prüfungen: exaktes trainiertes Muster, bekannte Token in neuer Reihenfolge, vollständig zurückgestelltes Muster und Erhalt von 14 Beziehungen nach adaptivem SFT (Supervised Fine-Tuning). Die Ergebnisse zeigten, dass die minimale Wahrscheinlichkeit des korrekten Tokens bei bekanntem Muster 99,93 % betrug, bei Permutation der Token 81,69 % und bei unbekannter Fragetextstruktur nur 10,46 %, wobei das Modell 'cat can fly' statt des erwarteten 'cat cannot read' antwortete. Die Aufgabe des Beziehungserhalts wurde vollständig erfüllt (14 von 14, Genauigkeit 100 %). Das Experiment zeigt, dass die Leistungsgrenze des Modells zwischen Auswendiglernen und lokalem Transfer einerseits und echter Generalisierung andererseits verläuft: Das Modell reproduziert Gelerntes gut und kommt mit kleinen Änderungen zurecht, aber eine neue Struktur zerstört das Verhalten. Der Grund für die Begrenztheit liegt nicht nur in der Anzahl der Parameter, sondern auch im kleinen Korpus mit begrenzter Anzahl von Konstruktionen. Der Autor merkt an, dass eine Erhöhung der Neuronen oder Blöcke ohne vielfältigere Daten lediglich das Auswendiglernen verbessern würde. Es handelt sich um eine reproduzierbare Lerndiagnose, nicht um einen vollwertigen Benchmark.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten