研究モデル 🇷🇺 31.07.2026 16:01

記憶化と汎化:2160パラメータの言語モデルが実際にできること

2160パラメータの小さな言語モデルを用いた実験では、学習済みパターンの記憶は堅牢(トークン確率99.93%)でしたが、既知トークンの並べ替えに対する転移は限定的(81.69%)で、新しい質問構造では失敗(10.46%)しました。モデルは14の元の関係をすべて保持し、破滅的忘却は発生しませんでした。
Node.jsのTiny Language Modelプロジェクトのバージョン1.1.0では、MLコミュニティでの議論とHashnodeでのエンジニアからのフィードバックを受けて、記憶と一般化の境界に関する調査が追加されました。シード42を固定し、4つのチェックからなる凍結評価を実施しました。正確な学習済みテンプレート、新しい順序での既知のトークン、完全に保留されたテンプレート、適応的SFT後の14の関係の保持です。結果は、既知のテンプレートでは正しいトークンの最小確率が99.93%、トークンの置換では81.69%、未知の質問構造ではわずか10.46%であり、モデルは期待される「cat cannot read」の代わりに「cat can fly」と回答しました。関係の保持タスクは完全に達成されました(14件中14件、精度100%)。この実験は、モデルの能力の境界が記憶と局所的な転移と真の一般化の間にあることを示しています。モデルは学習した内容をうまく再現し、小さな変更には対応できますが、新しい構造は動作を破壊します。制限の原因はパラメータ数だけでなく、限られた構文を含む小さなコーパスにもあります。著者は、より多様なデータなしにニューロンやブロックを増やしても、記憶の向上にしかつながらないと指摘しています。これは再現可能な教育的診断であり、完全なベンチマークではありません。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース