연구하드웨어 및 추론 🇷🇺 10.08.2026 23:02

주요 NLP 인터뷰 질문: LLM 아키텍처, 추론 및 최적화

MistralMistral Google/DeepMindGoogle/DeepMind
이 기사는 최신 대규모 언어 모델(LLM) 아키텍처와 추론 최적화에 관한 기술 인터뷰의 핵심 주제 및 질문 체크리스트를 제공합니다. 기본 Transformer와의 아키텍처 차이(Pre-Norm, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE)를 다루고, LLM 추론이 비용이 많이 드는 이유를 설명하며, 배칭, KV-캐시, 양자화 및 기타 가속 기술을 설명합니다.
현대의 생성형 LLM은 대부분 디코더 전용 트랜스포머로, GPT, LLaMA, Mistral, Qwen, Gemma 같은 패밀리는 개방성, 파라미터 수(수억 개에서 수천억 개), 아키텍처 세부 사항(밀집형 vs MoE), 어텐션 유형, 정규화, 위치 인코딩, MLP 세부 사항, 컨텍스트 길이(예: 4k, 32k, 128k 토큰), 멀티모달 지원, 훈련 및 라이선스에서 차이가 있습니다. 고전적인 트랜스포머와 비교하여 현대 LLM은 Post-Norm 대신 Pre-Norm을 사용하고(훈련이 더 안정적임), LayerNorm 대신 RMSNorm을 사용하며(더 저렴함), SwiGLU 게이티드 FFN을 사용하고(더 표현력이 좋지만 세 번째 선형 레이어가 추가됨), RoPE 위치 임베딩을 사용하며, 전체 멀티헤드 어텐션 대신 MQA/GQA를 사용하고, 때로는 조건부 계산을 위해 MoE(혼합 전문가)를 사용하며, 더 긴 컨텍스트와 추론 최적화를 지원합니다. 추론은 비용이 많이 드는 이유는 자동 회귀 생성이 토큰당 모든 가중치를 읽고, KV-캐시가 컨텍스트와 배치에 따라 커지며, 프리필(계산 집약적)과 디코드(메모리 집약적)의 두 단계가 있기 때문입니다. 지연 시간(첫 토큰까지의 시간, 토큰 간 지연 시간)과 처리량 간의 트레이드오프가 중요하며, 최적화 기법으로는 KV-캐시, 페이지드 어텐션, 연속 배칭, 추측 디코딩, 양자화, 지식 증류가 있습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스