에이전트모델 🇷🇺 24.07.2026 05:03

LLM에서 에이전트로: 모델과 애플리케이션 사이의 계층 이해하기

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
이 글은 토큰화, 샘플링, KV-캐시에서부터 채팅 템플릿과 Jinja, 모델 저장 형식 및 llama.cpp와 같은 런타임에 이르기까지 LLM과 에이전트 애플리케이션 사이의 계층을 탐구합니다. 추론 토큰이 생성 예산을 소비하는 문제와 컨텍스트 길이 문제와 같은 일반적인 함정을 설명합니다.
이 기사는 LLM에서 에이전트로의 완전한 경로를 설명합니다. 핵심적으로, 모델은 자기회귀 루프에서 다음 토큰을 예측하며, 토크나이저를 사용하여 텍스트를 토큰 ID로 변환하고 디토크나이저를 사용하여 다시 변환합니다. KV-캐시는 이전 키-값 쌍을 저장하여 생성을 가속화합니다. 모델이 기대하는 입력 텍스트는 원시 JSON이 아니라 모델의 채팅 템플릿에 따라 형식화된 프롬프트입니다. 이 템플릿은 Jinja 템플릿으로, 메시지 목록을 특수 토큰(예: ChatML, Llama 3)이 포함된 문자열로 변환합니다. 추론 모델의 경우 프롬프트에 <think> 블록이 포함될 수 있습니다. 모델이 추론에 너무 많은 토큰을 사용하면 최종 답변을 생성하기 전에 생성 예산이 소진될 수 있습니다. 또한 이 기사는 요금 부과와 컨텍스트 길이가 API JSON이 아니라 채팅 템플릿 적용 후 토크나이즈된 프롬프트를 기반으로 한다고 설명합니다. 디스크 상의 모델 저장에는 safetensors 가중치, config.json, 토크나이저 파일, 그리고 tokenizer_config.json의 chat_template이 포함됩니다. llama.cpp와 같은 런타임은 이러한 구성 요소를 번들로 제공하는 GGUF 파일을 로드하여 텍스트에서 텍스트로의 고수준 인터페이스를 제공합니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스