모델연구 🇺🇸 28.07.2026 00:02

오픈 LLM을 위한 봄: 2026년 1월~2월의 10가지 아키텍처

Arcee AIArcee AI Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MiniMaxMiniMax CohereCohere
2026년 봄에 발표된 10개의 오픈 LLM을 검토하며, 아키텍처적 유사점과 차이점에 초점을 맞춥니다. 주요 모델로는 Trinity Large, Kimi K2.5, Step 3.5 Flash, Qwen3-Coder-Next 등이 있습니다.
저자는 2026년 1~2월에 공개된 10개의 오픈 LLM에 대한 개요를 제시하며, 아키텍처 세부 사항에 중점을 둡니다. Arcee AI는 로컬-글로벌 어텐션(3:1), QK-Norm, NoPE, 게이트 어텐션 및 4개의 RMSNorm 레이어를 갖춘 Trinity Large(400B MoE, 13B 활성)를 출시했습니다. Moonshot AI는 Kimi K2.5(1조 파라미터)를 도입했는데, 이는 15조 개의 시각 및 텍스트 토큰으로 조기 융합을 통해 학습된 K2의 멀티모달 확장 버전입니다. StepFun의 Step 3.5 Flash(196B MoE, 11B 활성)는 MTP-3을 사용하여 128k 컨텍스트 길이에서 초당 100토큰을 달성했습니다. Qwen3-Coder-Next(80B, 3B 활성)는 게이트 델타넷과 게이트 어텐션(3:1)의 하이브리드로 인해 코딩 작업에서 더 큰 모델을 능가했습니다. 또한 z.AI의 GLM-5, MiniMax M2.5, Nanbeige 4.1 3B, Qwen 3.5, Ant Group의 Ling 2.5 및 Ring 2.5, Cohere의 Tiny Aya, Sarvam 30B 및 105B 모델도 언급됩니다.
출처: Sebastian Raschka — 원문
관련 게시물 ↓
새로운 뉴스