모든 것을 기억한다: 신경망의 가중치 스펙트럼
PyTorch
이 기사는 훈련에 관한 정보가 신경망의 가중치 스펙트럼에 보존된다는 것을 보여줍니다. 필터링과 후처리(포스터화) 후에도 데이터가 완전히 지워지지 않아, 미세 조정이 이러한 계수를 초기 조건으로 사용할 수 있습니다. 또한, 후처리된 스펙트럼 계수는 훨씬 적은 공간을 차지하여 신경망 설계에 유용합니다.
Habr의 한 저자가 쓴 기사는 신경망 가중치의 스펙트럼 특성을 탐구합니다. 그들은 Colab에서 사각형과 정사각형을 분류하는 간단한 신경망을 만들어, 8개의 꼭짓점 좌표를 가진 무작위 사각형을 입력으로 하고 이진 레이블을 사용합니다. 모델은 ReLU 활성화 함수를 가진 두 개의 선형 레이어로 구성되며, 10 에포크 동안 훈련되어 99% 이상의 정확도를 달성합니다. 훈련 후, 가중치는 이산 푸리에 변환(DFT, Discrete Fourier Transform)을 사용하여 분석됩니다. 저자는 평활화 필터와 후처리(posterization)를 스펙트럼 계수에 적용한 후에도 훈련에 관한 필수 정보가 남아 있으며, 이를 초기 조건으로 사용하여 미세 조정(fine-tuning)에 활용할 수 있음을 발견합니다. 후처리된 스펙트럼 표현은 원래 가중치보다 훨씬 적은 공간을 차지하여 잠재적인 압축 기법을 제공합니다. 저자는 이 효과가 신경망 설계에 흥미로우며, 코드를 AI 에이전트를 위한 프롬프트로 md-summaries에 제공합니다.
출처: Хабр — Data Mining —
원문
