연구모델 🇷🇺 28.07.2026 08:03

모델이 매니폴드에 개념을 패킹하는 방법: 이론, 실전, 그리고 원의 탐색

OpenAIOpenAI MistralMistral
이 기사는 AI 모델이 활성화 공간에서 개념을 매니폴드(예: 원, 심플렉스)로 기하학적으로 구조화하는 방법을 탐구합니다. 휘트니 임베딩 정리(Whitney's embedding theorem)를 포함한 이론적 기초를 설명하고, GPT-2 및 Mistral 7B에서 요일과 같은 주기적 개념에 대한 원형 표현의 실증적 탐지를 보여줍니다.
이 기사는 AI 모델이 실제 세계의 개념을 활성화 공간 내의 기하학적 구조로 묶는다는 점을 설명합니다. 이진 대립과 같은 개념은 두 개의 분리된 점(0차원)을 형성하고, 요일은 원(1차원 다양체)을 형성하며, 계층 구조는 차원이 적용되지 않는 심플렉스(simplex)를 형성합니다. 1944년 휘트니(Whitney)의 임베딩 정리는 모든 매끄러운 d차원 다양체가 R^{2d}에 매끄럽게 임베딩될 수 있다는 것을 말하며, 이는 필요한 차원에 대한 이론적 상한을 제공합니다. 그러나 이 정리는 근사 임베딩과 중첩(superposition) 때문에 모델을 직접적으로 제한하지는 않습니다. 다양체는 개념이 연속적으로 정렬되고 모델의 훈련 목표가 해당 구조에 대한 연산을 요구할 때 나타납니다. 실제 사례로는 GPT-2(7번째 레이어)와 Mistral 7B에서 SAE 클러스터링과 PCA를 통해 발견된 요일의 원형 표현이 있으며, 이러한 구조에 대한 개입은 모델의 행동을 변화시킵니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스