연구 🇷🇺 27.07.2026 16:01

마법은 없다: 35건의 통제 실험 결과 '이색 대수'는 적절히 튜닝된 실수값 아키텍처를 능가하지 못한다

한 연구자 그룹이 신경망에서의 초복소 대수(쿼터니언, 옥토니언, 세데니언 및 클리포드 대수)에 대한 대규모 통제 연구를 수행했다. 모든 35개 실험에서 적절히 튜닝된 실수값 기준선을 추가하자 주장된 이점이 사라졌다. 성공의 유일한 일관된 예측 변수는 이색 산술이 아니라 계층 구조화임이 밝혀졌다.
연구자들은 35개의 통제된 실험을 통해 신경망에서 초복소수 대수(쿼터니언, 옥토니언, 세데니언, 클리퍼드 대수)의 효과를 연구했습니다. 그들에 따르면, 문헌에서의 일반적인 비교는 결함이 있습니다. 초복소수 계층이 비구조적 기준선과 비교되는데, 그 이점은 단순히 어떤 구조를 가짐에서 비롯될 수 있기 때문입니다. 저자들은 동일한 파라미터 수를 가진 네 가지 통제 아키텍처(Real-rotation, Shuffled structure tensor, Real HRR, Real-orthogonality)를 도입했습니다. 적어도 하나의 통제를 추가한 후, 주장된 이점은 자신들의 핵심 결과인 옥토니언 상태-공간 모델을 포함한 8개의 모든 원래 작업에서 사라졌습니다. 이 모델은 오직 쿼터니언에 포함될 수 있는 그룹에서만 우수한 성능을 보였습니다. 유일한 예외는 이진 사면체 그룹에 대한 상태 추적 작업으로, 여기서 쿼터니언 순환 신경망이 길이 1024에서 정확도 0.992로 외삽되었습니다. 그러나 이는 대수적 마법보다는 최적화 지형으로 설명됩니다. SO(4)에는 정확한 해가 존재하지만, 확률적 경사 하강법은 오직 쿼터니언 매개변수화 내에서만 신뢰성 있게 이를 찾습니다. 또한, LRU(복소수 대각 순환 신경망)가 동일한 파라미터 수의 쿼터니언 버전을 능가했습니다. 저자들은 또한 일련의 정확한 불가능성 결과를 증명했습니다: 케일리-딕슨 대수에서는 반사가 달성 불가능하며, 영인자는 3방향 배제를 구현할 수 없습니다(최대 0.500, 직교성의 경우 16방향), 비결합성은 긴 시퀀스에 대한 병렬 스캔을 무효화하며, 대수의 텐서곱은 일반 행렬 대수로 붕괴됩니다. 궁극적으로, 가장 좋은 결과는 '지루한' 2차원 복소수 대수에서 나왔습니다. 저자들은 구조화된 계층에 대한 연구에서 잘못된 긍정을 피하기 위해 파라미터 일치 실제 구조화 통제와 셔플 구조 통제의 필수 사용을 주장합니다. 사전 인쇄본과 코드는 공개적으로 이용 가능합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스