토큰 크래밍: 이상적인 텍스트 압축이 의미를 보존하지 못한다 – AIRI 연구
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
AIRI 연구진은 최대 1568개의 토큰을 단일 임베딩으로 압축하는 토큰 크래밍 방법이 의미 보존을 보장하지 않음을 입증했다: 탐욕적 디코딩에서 정확도가 99.96%에서 40%로 떨어진다. 100% 재구성을 달성하는 점진적 크래밍이라는 새로운 방법이 제안되었지만, 완벽하게 압축된 임베딩조차 모델의 추론 능력을 저하시키며 그 원인이 트랜스포머의 초기 레이어에 있음을 발견했다.
AIRI 연구진은 토큰 압축 방법을 연구했는데, 이 방법은 최대 1,568개의 토큰을 재구성 정확도 99% 이상으로 고정된 대규모 언어 모델(LLM)의 단일 임베딩에 압축합니다. 그러나 강제 교사 방식(Teacher Forcing)에서 탐욕적 디코딩(Greedy Decoding)으로 전환하면 정확도가 40%로 떨어지며, 오류가 첫 번째 토큰에 집중됩니다. 저자들은 토큰을 하나씩 점진적으로 추가하여 100% 재구성을 보장하는 점진적 압축(Progressive Cramming)을 제안했습니다. 이 방법을 사용하여 다양한 모델의 압축 용량을 측정했습니다. 예를 들어, Llama-3.1-8B는 1,438개의 토큰을 압축하며, 저차원 투영을 사용하면 최대 1,697개까지 압축합니다. 최적화 궤적을 연구한 결과, 이 궤적은 저차원 부분 공간(30~100개 성분)에 존재함을 보였습니다. 주요 결과: 완벽하게 압축된 임베딩도 원래 프리픽스(Prefix)와 함께 제공될 때 HellaSwag에서 정확도가 감소하고(Llama의 경우 61.9%에서 40.8%로), MMLU에서는 0으로 떨어집니다. 그 이유는 초기 트랜스포머 계층에 있습니다. 주의 집중 제거(Attention Knockout) 실험을 통해 첫 번째 계층에서의 상호작용이 재구성에 필수적이지만 이해를 방해한다는 것이 밝혀졌습니다. 압축 용량은 모델의 깊이와 너비에 따라 단조롭게 증가합니다. 또한 토큰의 압축 난이도는 토큰의 서프라이절(Surprisal)에 의해 예측된다는 사실이 발견되었습니다.
출처: Habr — хаб ИИ —
원문
