Mamba: 트랜스포머를 대체하려 했던 아키텍처
Moonshot AI
망바 아키텍처는 선택적 상태 공간(SSM)을 기반으로 트랜스포머의 대안으로 제안되었으며, 이차 복잡도 대신 선형 복잡도를 약속했습니다. 그러나 실제로 망바는 트랜스포머를 대체하지 못했고, 주의 계층과 결합된 하이브리드 모델에 포함되었습니다. 대략 망바 계층 7개당 주의 계층 1개 비율로 사용됩니다.
2023년 12월, 연구자 알버트 구와 트리 다오가 선택적 상태 공간 모델(SSM)을 기반으로 하는 맘바 아키텍처를 발표했습니다. 트랜스포머에서 각 토큰이 다른 모든 토큰과 비교되는 반면(이차 복잡도 O(N²)), 맘바는 순차적으로 업데이트되는 단일 고정 크기 은닉 상태를 사용하며 선형 복잡도를 가집니다. 핵심 혁신은 선택적 메커니즘으로, 상태 업데이트 파라미터(A, B, C)가 각 토큰에 대해 재계산되어 모델이 유지할 정보와 버릴 정보를 결정할 수 있게 하며, 이는 어텐션 메커니즘과 유사하지만 이차 비용이 없습니다. 계산의 결합성 덕분에 맘바 훈련은 병렬화가 가능하여, 기존 RNN에서 내재된 느린 훈련 문제를 해결했습니다. 그러나 맘바에는 단점이 있습니다. 고정된 상태가 정보를 압축하여, 모든 토큰을 명시적으로 저장하는 트랜스포머에 비해 정밀한 세부 정보 추출 및 복사 능력이 저하됩니다. 따라서 맘바가 트랜스포머를 대체하지는 않았으며, 하이브리드 모델에서 사용됩니다. 이러한 하이브리드 모델에서는 대략 맘바 레이어 7개마다 어텐션 레이어 하나가 추가됩니다. 이 조합은 맘바의 저렴한 장기 기억과 트랜스포머의 정밀한 검색을 유지합니다. 결과적으로, 많은 현대 모델이 암묵적으로 맘바를 사용할 수 있습니다.
출처: Habr — хаб NLP —
원문
