Mô hìnhKinh doanh & Thị trường 🇷🇺 26.07.2026 15:02

Gemini Flash 3.6: Không thông minh hơn, nhưng rẻ hơn đáng kể

Google/DeepMindGoogle/DeepMind
Google đã phát hành ba mô hình: Gemini 3.6 Flash (chính), Gemini 3.5 Flash-Lite (nhanh/rẻ) và Gemini 3.5 Flash Cyber (bảo mật, bị hạn chế). Cải tiến chính là giảm 17% số token đầu ra cho cùng một tác vụ, mang lại khoản tiết kiệm chi phí từ 31% đến 71% trong các kịch bản tác nhân. Tuy nhiên, khả năng phân tích hình ảnh của mô hình đã giảm, đặc biệt là trên biểu đồ. Gemini 3.5 Flash-Lite là một người dẫn đầu giá trị bất ngờ, đôi khi vượt trội hơn các mô hình tầm trung cũ hơn. Google cũng công bố thử nghiệm nội bộ của Gemini 3.5 Pro và bắt đầu tiền huấn luyện Gemini 4.
Ngày 21 tháng 7, Google phát hành ba mô hình: Gemini 3.6 Flash (thay thế 3.5 Flash, giá 1,50 đô la Mỹ/7,50 đô la Mỹ trên một triệu token), Gemini 3.5 Flash-Lite (siêu nhanh và rẻ với giá 0,30 đô la Mỹ/2,50 đô la Mỹ), và Gemini 3.5 Flash Cyber (dành cho săn lỗ hổng, chỉ dành cho chính phủ). Con số đáng chú ý là mức giảm 17% token đầu ra so với 3.5 Flash theo Artificial Analysis, đạt mức tiết kiệm 65% trên chuẩn mã hóa DeepSWE (97k token so với 276k). Chỉ số trí tuệ tổng thể (50 điểm) không thay đổi. Trên các bài kiểm tra chuẩn, 3.6 Flash cải thiện ở DeepSWE (37% lên 49%), MLE-Bench (49,7% lên 63,9%), OSWorld-Verified (78,4% lên 83,0%), và khả năng ghi nhớ ngữ cảnh dài (~27% lên 54%), nhưng thua kém các đối thủ hàng đầu như Grok 4.5 và Claude Sonnet 5 về mã hóa thuần túy (SWE-Bench Pro 58,7% so với 64,7%) và các tác vụ kiến thức (GDPval-AA Elo 1421 so với 1607 của Sonnet 5). Một sự suy giảm đáng chú ý: Giám đốc điều hành của LlamaIndex, Jerry Liu, phát hiện khả năng đọc biểu đồ ParseBench giảm từ 45% xuống 31%, và điểm tài liệu từ 69,9 xuống 66,8, có thể là sự đánh đổi từ việc tập trung vào mã/agent trong quá trình hậu huấn luyện. Mô hình Flash-Lite nổi bật về giá trị: tốc độ đầu ra 350 token/giây, vượt trội so với Gemini 3 Flash cũ hơn ở một số bài kiểm tra (SWE-Bench Pro 54,2% so với 49,6%, OSWorld-Verified 74,0% so với 65,1%) và rẻ hơn Claude Haiku 4.5. Flash Cyber, được xây dựng trên 3.5 Flash, đã tìm thấy 55 vấn đề riêng biệt trên Chrome V8 (so với 47 của mô hình cơ sở, 36 của Claude Opus 4.6) và đạt 83,2% trên chuẩn CyberGym (đứng thứ tư trong số các mô hình chuyên biệt). Google cũng thông báo về việc thử nghiệm nội bộ Gemini 3.5 Pro với các đối tác và bắt đầu tiền huấn luyện Gemini 4.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới