연구모델 🇺🇸 27.07.2026 17:03

2025년 LLM 현황: 진보, 도전 과제, 그리고 예측

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
2025년 LLM 개발은 DeepSeek R1에 의해 촉발된 검증 가능한 보상과 함께 강화 학습(RLVR) 및 GRPO 알고리즘을 사용하는 추론 모델이 지배했습니다. 주요 트렌드로는 추론 시간 스케일링, MoE 아키텍처, Gated DeltaNets 같은 효율성 개선에 초점을 맞추었습니다. 학계 연구는 제로 그래디언트 필터링과 토큰 수준 손실 같은 개선 사항이 포함된 GRPO 변종을 강조했습니다.
2025년이 끝나갈 무렵, 올해는 딥시크 R1(DeepSeek R1)의 1월 출시 이후 RLVR(Reinforcement Learning with Verifiable Rewards)과 GRPO(Group Relative Policy Optimization)를 사용하는 추론 모델이 지배적이었습니다. 딥시크 R1은 추론 행동이 강화 학습으로 개발될 수 있음을 보여주었고, 오픈 가중치 모델이 독점 모델에 필적하는 성능을 보였습니다. 이 논문은 또한 훈련 비용에 대한 논쟁을 불러일으켰으며, 연구원 급여를 제외하고 최종 실행에 약 500만 달러가 소요된 것으로 추정되었습니다. RLVR은 검증 가능한 보상(예: 수학, 코드)을 사용하여 사후 훈련을 수행함으로써 값비싼 인간 레이블에 대한 의존도를 줄입니다. 모든 주요 LLM 개발자가 추론 변형 모델을 출시했습니다. 다른 초점 영역은 2022년의 RLHF(Reinforcement Learning from Human Feedback) + PPO(Proximal Policy Optimization), 2023년의 LoRA(Low-Rank Adaptation) SFT(Supervised Fine-Tuning), 2024년의 중간 훈련이었습니다. 2026~2027년에 대한 예측으로는 RLVR 확장, 추론 시간 스케일링(inference-time scaling), 지속적 학습(continual learning) 등이 있습니다. GRPO는 연구 분야의 인기 주제가 되었으며, 제로 그래디언트 필터링(zero gradient filtering), 능동 샘플링(active sampling), 토큰 수준 손실(token-level loss), KL 손실 제거 등 훈련 안정성을 크게 개선하는 많은 수학적 개선이 이루어졌습니다. 아키텍처 측면에서 최첨단 모델은 여전히 MoE(Mixture of Experts) 레이어와 효율성이 개선된 어텐션(그룹 쿼리 어텐션(grouped-query attention), 슬라이딩 윈도우 어텐션(sliding-window attention), 다중 헤드 잠재 어텐션(multi-head latent attention))을 갖춘 디코더 스타일 트랜스포머를 사용합니다. 새로운 효율성 개선 사항으로는 Qwen3-Next와 Kimi Linear의 게이티드 델타넷(Gated DeltaNet), 엔비디아(NVIDIA)의 Nemotron 3의 맘바-2(Mamba-2) 레이어가 있습니다.
출처: Sebastian Raschka — 원문
관련 게시물 ↓
새로운 뉴스