Se souvenir de tout : le spectre des poids des réseaux de neurones
PyTorch
L'article démontre que l'information relative à l'entraînement est préservée dans le spectre des poids d'un réseau de neurones. Même après filtrage et postérisation, les données ne sont pas complètement effacées, ce qui permet d'utiliser ces coefficients comme conditions initiales lors du réglage fin. De plus, les coefficients spectraux postérisés occupent beaucoup moins d'espace, ce qui est utile pour la conception de réseaux de neurones.
L'article d'un auteur Habr explore les propriétés spectrales des poids des réseaux de neurones. Il crée un réseau de neurones simple dans Colab pour classer des rectangles et des carrés, générant des rectangles aléatoires avec 8 coordonnées de sommets en entrée et des étiquettes binaires. Le modèle comporte deux couches linéaires avec activation ReLU, entraîné sur 10 époques avec une précision supérieure à 99 %. Après l'entraînement, les poids sont analysés à l'aide de la transformée de Fourier discrète (TFD). L'auteur constate qu'après application d'un filtre de lissage et d'une postérisation des coefficients spectraux, l'information essentielle sur l'apprentissage est conservée, ce qui peut être utilisé pour un réglage fin comme conditions initiales. La représentation spectrale postérisée occupe beaucoup moins d'espace que les poids d'origine, offrant une technique de compression potentielle. L'auteur suggère que cet effet est intéressant pour la conception de réseaux de neurones et fournit le code dans md-summaries comme prompts pour agents IA.
Source: Хабр — Data Mining —
original
