Một ảnh chụp màn hình tốn bao nhiêu token: GPT, Claude và Gemini đếm ảnh khác nhau
OpenAI
Anthropic
Google/DeepMind
Sử dụng một ảnh chụp màn hình thử nghiệm 1920x1080, bài viết tính toán chi phí token hình ảnh cho đầu vào trong GPT-5.5, Claude Opus 4.8 và Gemini 3.1 Pro Preview dựa trên tài liệu dành cho nhà phát triển. Bài viết giải thích cách mỗi mô hình xử lý hình ảnh, so sánh số lượng token và đưa ra lời khuyên thực tế về việc chuẩn bị ảnh chụp màn hình để phân tích.
Bài viết phân tích cách các mô hình AI khác nhau đếm token thị giác cho đầu vào hình ảnh, sử dụng ảnh chụp màn hình 1920x1080 làm ví dụ. GPT-5.5 sử dụng lưới pixel 32x32, cho ra 2040 token thị giác. Claude Opus 4.8 sử dụng lưới pixel 28x28, cho 2691 token. Gemini 3.1 Pro Preview sử dụng ngân sách xấp xỉ thông qua media_resolution, với chế độ cao phân bổ tối đa 1120 token. Bài viết cũng thảo luận về tác động của việc cắt ảnh: một đoạn 960x540 làm giảm số token xuống còn 510 đối với GPT và 700 đối với Claude, mặc dù ngân sách của Gemini vẫn giữ nguyên. Nó khuyên nên chuẩn bị ảnh chụp màn hình bằng cách loại bỏ các yếu tố không cần thiết và tùy chọn gửi cả chế độ xem toàn cảnh lẫn đoạn phóng to. Về tạo hình ảnh, bài viết lưu ý rằng GPT Image 2 đã tạo ảnh 1024x1024 sử dụng 4160 token, tốn 187.200 CAPS, trong khi Nano Banana 2 tốn 67.200 CAPS cho việc tạo tương tự.
Nguồn: Habr — хаб ML —
bản gốc
