ModellenBedrijf & Markt 🇷🇺 26.07.2026 15:02

Gemini Flash 3.6: niet slimmer, maar wel merkbaar goedkoper

Google/DeepMindGoogle/DeepMind
Google heeft drie modellen uitgebracht: Gemini 3.6 Flash (hoofdmodel), Gemini 3.5 Flash-Lite (snel/goedkoop) en Gemini 3.5 Flash Cyber (beveiliging, beperkt). De belangrijkste verbetering is een verlaging van 17% in outputtokens voor dezelfde taken, wat in agentische scenario's leidt tot kostenbesparingen van 31-71%. De visuele parseercapaciteit van het model is echter achteruitgegaan, vooral bij grafieken. Gemini 3.5 Flash-Lite is een verrassende waardeleider en presteert soms beter dan oudere modellen uit het middensegment. Google heeft ook aangekondigd dat men intern Gemini 3.5 Pro test en dat de pre-training van Gemini 4 is gestart.
Op 21 juli bracht Google drie modellen uit: Gemini 3.6 Flash (vervanger van 3.5 Flash, geprijsd op $1,50/$7,50 per miljoen tokens), Gemini 3.5 Flash-Lite (ultrasnel en goedkoop met $0,30/$2,50) en Gemini 3.5 Flash Cyber (voor kwetsbaarhedenjacht, alleen voor overheden). Het belangrijkste cijfer is een reductie van 17% in uitvoertokens vergeleken met 3.5 Flash, volgens Artificial Analysis, met een besparing van 65% op de DeepSWE-codeerbenchmark (97k tokens versus 276k). De algemene intelligentie-index (50 punten) bleef gelijk. Op benchmarks verbeterde 3.6 Flash op DeepSWE (37%→49%), MLE-Bench (49,7%→63,9%), OSWorld-Verified (78,4%→83,0%) en langere context recall (~27%→54%), maar bleef achter bij topconcurrenten zoals Grok 4.5 en Claude Sonnet 5 op puur programmeren (SWE-Bench Pro 58,7% versus 64,7%) en kennistaken (GDPval-AA Elo 1421 versus 1607 voor Sonnet 5). Een opmerkelijke terugval: Jerry Liu, chief executive officer van LlamaIndex, ontdekte dat het lezen van grafieken op ParseBench daalde van 45% naar 31%, en documentscores van 69,9 naar 66,8, waarschijnlijk een afweging door posttraining gericht op code/agenten. Het Flash-Lite-model is een uitblinker in waarde: 350 tokens per seconde uitvoer, sneller dan oudere Gemini 3 Flash op sommige tests (SWE-Bench Pro 54,2% versus 49,6%, OSWorld-Verified 74,0% versus 65,1%) en goedkoper dan Claude Haiku 4.5. Flash Cyber, gebaseerd op 3.5 Flash, vond 55 unieke problemen in Chrome V8 (versus 47 voor de basis, 36 voor Claude Opus 4.6) en scoorde 83,2% op de CyberGym-benchmark (vierde onder gespecialiseerde modellen). Google meldde ook interne tests van Gemini 3.5 Pro met partners en de start van pre-training voor Gemini 4.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws