모델애플리케이션 🇷🇺 12.08.2026 10:01

스크린샷의 토큰 수: GPT, Claude, Gemini의 이미지 처리 방식 차이

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind
1920x1080 테스트 스크린샷을 사용하여, 개발자 문서를 기반으로 GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro Preview의 이미지 입력에 대한 시각적 토큰 비용을 계산합니다. 각 모델이 이미지를 처리하는 방법을 설명하고, 토큰 수를 비교하며, 분석을 위한 스크린샷 준비에 대한 실용적인 조언을 제공합니다.
이 기사는 1920x1080 스크린샷을 예로 들어 다양한 AI 모델이 이미지 입력에 대한 시각적 토큰을 어떻게 계산하는지 살펴봅니다. GPT-5.5는 32x32 픽셀 그리드를 사용하여 2040개의 시각적 토큰을 생성합니다. Claude Opus 4.8은 28x28 픽셀 그리드를 사용하여 2691개의 토큰을 제공합니다. Gemini 3.1 Pro Preview는 media_resolution을 통해 대략적인 예산을 사용하며, 높음 모드에서는 최대 1120개의 토큰을 할당합니다. 이 기사는 또한 크롭의 효과에 대해 논의합니다: 960x540 조각은 GPT의 경우 토큰 수를 510개로, Claude의 경우 700개로 줄이지만, Gemini의 예산은 동일하게 유지됩니다. 불필요한 요소를 제거하고 선택적으로 전체 보기와 확대된 조각을 모두 보내는 방식으로 스크린샷을 준비하는 것이 좋다고 조언합니다. 이미지 생성의 경우, 이 기사는 GPT Image 2가 1024x1024 이미지를 생성하는 데 4160개의 토큰을 사용하여 187,200 CAPS의 비용이 들었고, Nano Banana 2는 유사한 생성에 대해 67,200 CAPS의 비용이 들었다고 언급합니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스