ModelleGeschäft & Markt 🇷🇺 26.07.2026 15:02

Gemini Flash 3.6: Nicht intelligenter, aber deutlich günstiger

Google/DeepMindGoogle/DeepMind
Google hat drei Modelle veröffentlicht: Gemini 3.6 Flash (Hauptmodell), Gemini 3.5 Flash-Lite (schnell/günstig) und Gemini 3.5 Flash Cyber (Sicherheit, eingeschränkt). Die wichtigste Verbesserung ist eine 17-prozentige Reduzierung der Ausgabetoken für dieselben Aufgaben, was in agentischen Szenarien zu Kosteneinsparungen von 31 bis 71 Prozent führt. Allerdings hat die visuelle Analyse des Modells nachgelassen, insbesondere bei Diagrammen. Gemini 3.5 Flash-Lite ist ein überraschender Preisführer und übertrifft manchmal ältere Mittelklasse-Modelle. Google kündigte außerdem interne Tests von Gemini 3.5 Pro und den Beginn des Pre-Trainings von Gemini 4 an.
Am 21. Juli veröffentlichte Google drei Modelle: Gemini 3.6 Flash (ersetzt 3.5 Flash, Preis 1,50 $/7,50 $ pro Million Tokens), Gemini 3.5 Flash-Lite (extrem schnell und günstig mit 0,30 $/2,50 $) und Gemini 3.5 Flash Cyber (für Sicherheitslücken-Suche, nur für Behörden). Die Schlagzeile ist eine um 17 % reduzierte Anzahl von Ausgabe-Tokens im Vergleich zu 3.5 Flash laut Artificial Analysis, was bei der DeepSWE-Codierungsbenchmark Einsparungen von 65 % erreicht (97.000 Tokens gegenüber 276.000). Der allgemeine Intelligenzindex (50 Punkte) bleibt unverändert. Bei Benchmarks verbesserte sich 3.6 Flash bei DeepSWE (37 % → 49 %), MLE-Bench (49,7 % → 63,9 %), OSWorld-Verified (78,4 % → 83,0 %) und Long-Context-Recall (~27 % → 54 %), lag aber bei reinem Coding (SWE-Bench Pro 58,7 % gegenüber 64,7 %) und Wissensaufgaben (GDPval-AA Elo 1421 gegenüber 1607 für Sonnet 5) hinter Top-Konkurrenten wie Grok 4.5 und Claude Sonnet 5 zurück. Eine bemerkenswerte Regression: Der LlamaIndex-CEO Jerry Liu stellte fest, dass die Diagramm-Lesefähigkeit bei ParseBench von 45 % auf 31 % sank und die Dokumentenbewertung von 69,9 auf 66,8 fiel – vermutlich ein Trade-off durch den Post-Training-Fokus auf Code/Agenten. Das Flash-Lite-Modell ist ein preislicher Ausreißer: 350 Tokens/s Ausgabe, bei einigen Tests besser als das ältere Gemini 3 Flash (SWE-Bench Pro 54,2 % gegenüber 49,6 %, OSWorld-Verified 74,0 % gegenüber 65,1 %) und günstiger als Claude Haiku 4.5. Flash Cyber, basierend auf 3.5 Flash, fand 55 einzigartige Schwachstellen in Chrome V8 (gegenüber 47 für das Basis-, 36 für Claude Opus 4.6) und erreichte 83,2 % auf dem CyberGym-Benchmark (vierter unter spezialisierten Modellen). Google gab zudem bekannt, dass interne Tests von Gemini 3.5 Pro mit Partnern laufen und das Pre-Training von Gemini 4 begonnen hat.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten