모델비즈니스 및 시장 🇷🇺 26.07.2026 15:02

Gemini Flash 3.6: 더 똑똑하지는 않지만 확실히 저렴해졌습니다

Google/DeepMindGoogle/DeepMind
Google은 Gemini 3.6 Flash(메인), Gemini 3.5 Flash-Lite(빠르고 저렴), Gemini 3.5 Flash Cyber(보안, 제한적) 세 가지 모델을 출시했습니다. 주요 개선점은 동일한 작업에 대해 출력 토큰이 17% 감소하여, 에이전트 시나리오에서 31~71%의 비용 절감 효과를 가져왔습니다. 그러나 모델의 시각적 파싱 능력은 특히 차트에서 퇴보했습니다. Gemini 3.5 Flash-Lite는 예상치 못한 가치 선두 주자로, 때로는 구형 중간급 모델보다 뛰어난 성능을 보입니다. Google은 또한 Gemini 3.5 Pro의 내부 테스트와 Gemini 4 사전 학습 시작을 발표했습니다.
7월 21일, 구글은 세 가지 모델을 출시했습니다: 제미나이 3.6 플래시(3.5 플래시 대체, 가격은 백만 토큰당 1.50달러 및 7.50달러), 제미나이 3.5 플래시-라이트(초고속 및 저렴, 백만 토큰당 0.30달러 및 2.50달러), 그리고 제미나이 3.5 플래시 사이버(취약점 사냥용, 정부 전용). 헤드라인 수치는 인공 분석(Artificial Analysis) 기준 출력 토큰이 3.5 플래시 대비 17% 감소하여, 딥SWE(DeepSWE) 코딩 벤치마크에서 65% 절감(97,000 토큰 대 276,000 토큰)을 달성한 점입니다. 전반적인 지능 지수(50점)는 변동이 없습니다. 벤치마크에서 3.6 플래시는 딥SWE(37%→49%), MLE-벤치(MLE-Bench)(49.7%→63.9%), OS월드-검증(OSWorld-Verified)(78.4%→83.0%), 장기 문맥 회상(약 27%→54%)에서 개선되었으나, 순수 코딩(SWE-벤치 프로(SWE-Bench Pro) 58.7% 대 64.7%) 및 지식 과제(GDPval-AA 엘로(GDPval-AA Elo) 1421 대 손넷(Sonnet) 5의 1607)에서 그록 4.5(Grok 4.5) 및 클로드 손넷 5(Claude Sonnet 5) 같은 최고 경쟁사에 뒤쳐졌습니다. 주목할 만한 퇴보: 라마인덱스(LlamaIndex) CEO 제리 류(Jerry Liu)는 파스리드 차트 읽기(ParseBench chart reading)가 45%에서 31%로, 문서 점수가 69.9에서 66.8로 하락한 것을 발견했는데, 이는 코드/에이전트에 중점을 둔 후훈련 과정의 트레이드오프로 보입니다. 플래시-라이트 모델은 가치가 뛰어납니다: 초당 350토큰 출력 속도로, 일부 테스트에서 구형 제미나이 3 플래시를 능가하고(SWE-벤치 프로 54.2% 대 49.6%, OS월드-검증 74.0% 대 65.1%), 클로드 하이쿠 4.5(Claude Haiku 4.5)보다 저렴합니다. 플래시 사이버는 3.5 플래시를 기반으로 구축되어, 크롬 V8(Chrome V8)에서 55개의 고유 이슈를 발견했으며(기준 모델 47개, 클로드 오퍼스 4.6(Claude Opus 4.6) 36개), 사이버짐(CyberGym) 벤치마크에서 83.2% 점수를 기록했습니다(전문 모델 중 4위). 구글은 또한 파트너와의 제미나이 3.5 프로 내부 테스트와 제미나이 4 사전 훈련 시작을 언급했습니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스