Gemini Flash 3.6: Ei älykkäämpi, mutta huomattavasti halvempi
Google/DeepMind
Google julkaisi kolme mallia: Gemini 3.6 Flash (päämalli), Gemini 3.5 Flash-Lite (nopea/halpa) ja Gemini 3.5 Flash Cyber (turvallisuus, rajoitettu). Keskeinen parannus on 17 prosentin vähennys lähtötokenien määrässä samoissa tehtävissä, mikä tarkoittaa 31–71 prosentin kustannussäästöjä agenttiskenaarioissa. Mallin visuaalinen jäsennys kuitenkin heikkeni, erityisesti kaavioiden osalta. Gemini 3.5 Flash-Lite on yllättävä hinta-laatusuhteen johtaja, joka ylittää joskus vanhemmat keskiluokan mallit. Google ilmoitti myös Gemini 3.5 Pron sisäisestä testauksesta ja Gemini 4:n esikoulutuksen aloittamisesta.
21. heinäkuuta Google julkaisi kolme mallia: Gemini 3.6 Flash (korvaa 3.5 Flash-mallin, hinnoiteltu 1,50/7,50 dollariin miljoonaa tokenia kohden), Gemini 3.5 Flash-Lite (erittäin nopea ja halpa, 0,30/2,50 dollaria) sekä Gemini 3.5 Flash Cyber (haavoittuvuuksien metsästykseen, vain valtion käyttöön). Pääotsikko on 17 prosentin vähennys ulostulotokeneissa verrattuna 3.5 Flash-malliin Artificial Analysis -analyysin mukaan, mikä tarkoittaa 65 prosentin säästöä DeepSWE-koodausvertailussa (97 000 tokenia vs 276 000). Kokonaisälyindeksi (50 pistettä) pysyi muuttumattomana. Vertailutesteissä 3.6 Flash parani DeepSWE:ssä (37 % → 49 %), MLE-Benchissä (49,7 % → 63,9 %), OSWorld-Verifiedissä (78,4 % → 83,0 %) ja pitkän kontekstin muistamisessa (~27 % → 54 %), mutta jäi jälkeen huippukilpailijoista, kuten Grok 4.5 ja Claude Sonnet 5, puhtaassa koodauksessa (SWE-Bench Pro 58,7 % vs 64,7 %) ja tietotehtävissä (GDPval-AA Elo 1421 vs 1607 Sonnet 5:lle). Huomionarvoinen taantuma: LlamaIndexin toimitusjohtaja Jerry Liu havaitsi ParseBench-kaaviolukemisen laskeneen 45 prosentista 31 prosenttiin ja dokumenttipisteiden pudonneen 69,9:stä 66,8:aan, mikä johtuu todennäköisesti koulutuksen jälkeisestä painotuksesta koodiin ja agentteihin. Flash-Lite-malli on arvokas erottuja: 350 tokenia sekunnissa ulostulo, voittaa vanhemman Gemini 3 Flash -mallin joissakin testeissä (SWE-Bench Pro 54,2 % vs 49,6 %, OSWorld-Verified 74,0 % vs 65,1 %) ja on halvempi kuin Claude Haiku 4.5. Flash Cyber, joka on rakennettu 3.5 Flash -mallin päälle, löysi 55 ainutlaatuista ongelmaa Chrome V8:sta (vs 47 perusmallilla, 36 Claude Opus 4.6:lla) ja sai 83,2 prosentin pistemäärän CyberGym-vertailussa (neljäs erikoistuneiden mallien joukossa). Google ilmoitti myös testaavansa sisäisesti Gemini 3.5 Prota kumppaneiden kanssa ja aloittaneensa Gemini 4 -mallin esikoulutuksen.
Lähde: Habr — хаб ИИ —
Alkuperäinen
