Gemini 3.7 Flash, pročitan iz Googleovih brojki
Google ga je objavio 13. avgusta 2026. godine, dvadeset tri dana poslije Gemini 3.6 Flasha, s velikim napretkom na testovima za kod i agente i uvodnom cijenom koju tako i naziva. Sve to stoji. Četiri stvari se vide tek ako otvoriš karticu modela umjesto objave, a jedna od njih je rezultat koji je pao.
Izvor
Gemini 3.7 Flash: our most intelligent workhorse modelGoogle: The Keyword, AI · Original objavljen 13. avgust 2026
| # | Ime | Cijena | Za koga je |
|---|---|---|---|
| 1 | Gemini 3.7 Flash | 0,75 i 3,75 dolara za milion do 31. decembra 2026, potom 1,50 i 7,50 | Po objavljenim brojkama najjači jeftini model za kod, po cijeni koja ističe i uz ritam izdanja koji će ga zamijeniti. Čitaj karticu, ne objavu. |
- 01
Gemini 3.7 Flash
0,75 i 3,75 dolara za milion do 31. decembra 2026, potom 1,50 i 7,50Po objavljenim brojkama najjači jeftini model za kod, po cijeni koja ističe i uz ritam izdanja koji će ga zamijeniti. Čitaj karticu, ne objavu.
Valja
Velik napredak u odnosu na 3.6 Flash na šesnaest od sedamnaest evaluacija koje kartica nabraja, uključujući FrontierCode 1.1 na 43,6 naspram 34,4 odsto, OSWorld 2.0 na 47,9 naspram 33,8 i AutomationBench na 30,4 naspram 17 odsto. Ulazni prozor od milion tokena, tekst, slika, zvuk i video na ulazu, i objavljena cijela tabela poređenja umjesto pet izabranih redova. Bezbjednosna provjera prijavljena kao slična ili bolja u odnosu na prethodnika.
Ne valja
CharXiv bez alata pada sa 85,2 na 84,5 odsto, i baš taj rezultat objava izostavlja. Cijena je uvodna, udvostručuje se 1. januara 2027. i ista je ona koju 3.6 Flash već ima. Uz granicu znanja u martu 2026. ide napomena da su pojedine oblasti ograničene na januar 2025. Izlaz je ograničen na 64.000 tokena. Prethodnik je star dvadeset tri dana, što govori koliko dugo išta od ovoga ostaje aktuelno.
Na ovom modelu nismo pokrenuli nijednu evaluaciju. Ovo je čitanje onoga što je Google objavio — objave, kartice modela, changeloga i cjenovnika — a vrijednost takvog čitanja nije u prepričavanju rezultata. Vrijednost je u razmaku između stranice napisane da model najavi i stranice napisane da ga dokumentuje, jer te dvije stranice ne govore sasvim isto.
Šta se tvrdi, i na osnovu čega
Istaknuti rezultati su veliki i dolaze od Googlea. Na testu FrontierCode 1.1 model postiže 43,6 odsto naspram 34,4 odsto koliko ima Gemini 3.6 Flash. Na DeepSWE v1.1 stiže do 65,3 odsto. Na Terminal-benchu 2.1 ide sa 78 na 85,8 odsto, na AutomationBenchu sa 17 na 30,4, na OSWorldu 2.0 sa 33,8 na 47,9, a na testu pamćenja dugog konteksta GDM-MRCR v2 sa 91,8 na 97 odsto. Kartica nabraja sedamnaest evaluacija i uz svaku stavlja rezultat prethodnika, što je više nego što većina objava iznese.
Kartica daje i oblik same stvari: ulazni prozor od milion tokena, gornju granicu izlaza od 64.000 tokena, tekst, sliku, zvuk i video na ulazu, granicu znanja u martu 2026. i bezbjednosnu provjeru koju Google sažima kao sličnu ili bolju u odnosu na 3.6 Flash, a da nije pređen nijedan prag praćenih kritičnih sposobnosti.
Model je, dakle, ono što o sebi kaže. Ostatak ovog teksta govori o četiri stvari koje ti kaže samo kartica.
Prvo: isti rezultat nije isti na dvije Googleove stranice
U objavi Gemini 3.6 Flash na DeepSWE v1.1 stoji na 49 odsto. Na kartici modela stoji na 48,6. Isti model, ista evaluacija, isti proizvođač, isti dan, dvije brojke. Napredak je zato 16,3 ili 16,7 poena, zavisno od toga koju si Googleovu stranicu čitao dok si ga zapisivao.
Te dvije stranice se ne slažu ni oko imena. Ono što objava zove WebDev Arena, kartica zove Code Arena Web; rezultati, 1588 naspram 1538, poklapaju se. Nijedno od toga nije skandal i nijedno ne mijenja zaključak. Važno je zato što je brojka s evaluacije upotrebljiva samo ako onaj ko je navodi i onaj ko je provjerava dođu do iste vrijednosti, a ovdje neće.
Praktično pravilo glasi: navodi karticu. To je dokument koji nosi cijelu tabelu umjesto pet redova izabranih za najavu, i to je dokument uz koji čitalac može da uporedi i sljedeći model u nizu.
Drugo: jedan rezultat je pao, i njega u objavi nema
Na testu CharXiv bez alata, kojim se mjeri čitanje grafikona, Gemini 3.7 Flash ima 84,5 odsto tamo gdje je 3.6 Flash imao 85,2. To je jedini pad u tabeli, mali je, i potpuno izostaje iz objave, koja ističe pet evaluacija i među njima ne bira nijednu koja se pomjerila u pogrešnom smjeru.
Niko ništa nije sakrio: brojka stoji na Googleovoj kartici, objavljenoj istog dana. Ali ako 3.6 Flash mijenjaš u poslu koji iz dokumenata čita grafikone i brojke, izdanje koje je popravilo šesnaest stvari pogoršalo je baš onu na koju se oslanjaš, a to iz najave koju si dobio ne bi saznao.
Druga brojka koju vrijedi izvaditi iz kartice je Terminal-bench 3.0, gdje rezultat ide sa 5,4 na 14,9 odsto. To je gotovo utrostručenje, i to je i dalje četrnaest zarez devet odsto. Na najtežem terminalskom testu koji Google objavljuje, najbolji jeftini model za kod dovrši otprilike jedan zadatak od sedam. Kad se pročita uz 85,8 odsto na Terminal-benchu 2.1, taj par je najpošteniji opis toga gdje su agenti trenutno, a u objavu je ušla samo jedna njegova polovina.
Treće: cijena nije svojstvo ovog modela
Objava je oko toga izričita: 3.7 Flash je do kraja godine dostupan po uvodnoj cijeni od 0,75 dolara za milion ulaznih i 3,75 dolara za milion izlaznih tokena. To je jasna izjava o vremenski ograničenoj cijeni, a Google na cjenovnik štampa i datum i naredne stope od 1,50 i 7,50 dolara. Niko ovdje nikoga ne obmanjuje.
Ono što se u toj slici gubi jeste da cijena nije nova i nije vezana za ovaj model. Gemini 3.6 Flash danas košta potpuno istih 0,75 i 3,75 dolara, pod potpuno istom napomenom koja ističe 31. decembra 2026. Niža cijena je stigla sa 3.6 Flashom, za koji u changelogu piše da dolazi po nižoj cijeni od 3.5 Flasha. Verzija 3.7 ju je naslijedila. Ako si pročitao da je ovo izdanje prepolovilo trošak, prepolovljavanje se desilo jedno izdanje ranije.
Posljedica za budžet je ona iz tabele cijena: 1. januara 2027. udvostručuju se ulaz, izlaz, čitanje iz keša i čuvanje keša, pa posao koji danas košta šest dolara na hiljadu kratkih poziva tada košta dvanaest. Biranje 3.7 Flasha umjesto 3.6 Flasha je odluka o kvalitetu, jer po cijeni su isti red.
Četvrto: granica znanja ima drugu granicu ispod sebe
Kartica kao granicu znanja daje mart 2026. godine, a onda dodaje da su pojedine oblasti ograničene na januar 2025. Ta druga rečenica je jedan red i zaslužuje više pažnje nego što joj dužina obećava: za te oblasti je znanje modela četrnaest mjeseci starije od brojke koju bi naveo. Google ne kaže koje su to oblasti, pa je jedino bezbjedno čitanje da svježa granica ne opisuje ravnomjerno svaku temu.
Drugo ograničenje koje kartica nosi, a objava ne, jeste granica izlaza. Ulazni prozor je milion tokena; gornja granica izlaza je 64.000. Za sažimanje, razvrstavanje i odgovaranje to je više nego dovoljno. Za stvaranje dugog dokumenta u jednom prolazu to je zid u koji ćeš udariti, a takva ograničenja se pokazuju u proizvodnji, ne na evaluacijama.
Šta nismo provjerili
Nijednu od ovih evaluacija nismo pokrenuli i ne možemo reći da li se brojke ponavljaju. Svaki rezultat ovdje je Google koji svoj model mjeri prema svom prethodniku, što je uobičajen postupak i istovremeno razlog da se veličina napretka uzima opreznije od njegovog smjera.
Nismo provjerili ni odziv, ni propusnost pod opterećenjem, ni pouzdanost pozivanja alata, ni ponašanje na jezicima na kojima je pisan ovaj sajt. To su stvari koje odlučuju da li je jeftin model upotrebljiv, nijedna od njih ne stoji na kartici s evaluacijama, a jedini način da se saznaju jeste da kroz model propustiš sopstveni saobraćaj sedmicu dana.
Izvori
Povezano
GPT-5.6 Sol pao na 4 i 20 dolara i po cijeni pretekao Claude Opus 5
OpenAI je 21. avgusta snizio cijenu Sola na API-ju: ulaz sa 5 na 4 dolara, izlaz sa 30 na 20, a ulaz iz keša sa 0,50 na 0,40. Na standardnom zadatku model je od skupljeg od Claudea Opusa 5 postao jeftiniji od njega. Sniženje je promotivno i traje najmanje do 21. novembra.
OpenAIprovjereno

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa
Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.
Hugging Faceprovjereno
Najbolji jeftini modeli za velike količine poziva, po cijeni hiljadu poziva
Šest modela, jedan zadatak, jedna brojka: koliko košta hiljadu poziva kada svaki šalje 4.000 tokena i dobija 800 nazad. Najjeftiniji red je 1,76 dolara, najskuplji 16, što je razlika od devet puta, a ne od sto puta, koliko se u ovoj rubrici obično podrazumijeva. Dvije stvari pomjeraju poredak jače nego istaknuta cijena, a jedna od njih ima rok.
Anthropic, Google, OpenAIprovjereno