⚡ 속보
GPT-2에서 gpt-oss로: 구조적 발전 분석 및 Qwen3와의 비교
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI가 GPT-2 이후 처음으로 오픈 가중치 모델인 gpt-oss-120b와 gpt-oss-20b를 출시했습니다. 이 아키텍처는 Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU 및 로컬 추론을 위한 MXFP4 최적화를 특징으로 합니다. GPT-2 및 Qwen3와의 비교는 너비 대 깊이 트레이드오프 및 어텐션 싱크의 발전을 강조합니다.
OpenAI는 GPT-2(2019) 이후 처음으로 오픈 가중치 LLM인 gpt-oss-120b와 gpt-oss-20b를 공개했습니다. 이 모델들은 GPT-2에 비해 여러 아키텍처 개선 사항을 도입했습니다: 드롭아웃 제거, 절대 위치 임베딩을 회전 위치 임베딩(RoPE)으로 대체, 활성화 함수를 GELU에서 SwiGLU로 전환, 혼합 전문가(MoE) 추가, 그룹 질의 어텐션(GQA) 사용 등입니다. MoE는 총 파라미터 수를 늘리지만 토큰당 일부만 활성화하여 추론 효율성을 유지합니다. GQA는 키-값 헤드를 줄여 메모리 사용량을 낮춥니다. 모델들은 MXFP4 최적화를 통해 단일 GPU(20B는 16GB 소비자 GPU, 120B는 H100 80GB)에서 실행 가능합니다. Qwen3와 비교하여 gpt-oss는 폭과 깊이 간의 트레이드오프를 탐구합니다. 어텐션 바이어스와 싱크에 대해서도 논의됩니다. 기사는 맥락에서 GPT-5도 간략히 언급합니다. 벤치마크는 경쟁력 있는 성능을 보여주지만, 자세한 점수는 제공되지 않습니다.
출처: Sebastian Raschka —
원문
