Googleov novi model za prepis čisti govor, a to je i mogućnost i rizik
Gemini 3.5 Transcribe izbacuje poštapalice, razrješava ispravke u toku rečenice i usput oblikuje tekst. Google navodi 4,0 odsto grešaka po riječi u toku govora i 2,6 odsto na snimku — a mjerio je Artificial Analysis, ne sam Google.
Izvor
Intelligent transcription with Gemini 3.5 TranscribeGoogle DeepMind Blog · Original objavljen 26. avgust 2026
Google je 26. avgusta predstavio Gemini 3.5 Transcribe, model za pretvaranje govora u tekst koji ne staje na tome šta je rečeno. Izbacuje „ovaj“ i „aha“, prati govornika koji se ispravi usred rečenice, i vraća oblikovan tekst umjesto sirovog niza riječi.
Šta radi i gdje se pokreće
Model dolazi kroz dva API-ja. Prepis u toku govora ide kroz Live API, pod oznakom `gemini-3.5-transcribe-live`, uz kašnjenje koje Google opisuje kao manje od sekunde i dvosmjerni prenos. Snimljeni zvuk ide kroz Interactions API, pod oznakom `gemini-3.5-transcribe`, i vraća pripisivanje govornika i vremenske oznake po riječi. Oba su dostupna kroz Gemini API u Google AI Studiju i na platformi Gemini Enterprise Agent.
Google navodi više od 85 jezika uz samostalno prepoznavanje, sopstveni rječnik za stručne izraze i neobična pisanja, i pripisivanje govora za najviše tri govornika — preko tri je označeno kao ogledno. Model uz to može da preda posao drugim Gemini modelima kroz pozivanje funkcija, zasad samo u Gemini aplikaciji na macOS-u.
- U toku govora: `gemini-3.5-transcribe-live` kroz Live API.
- Snimci: `gemini-3.5-transcribe` kroz Interactions API, s vremenskim oznakama.
- Tri govornika se pripisuju pouzdano; više od tri je ogledno.
- Već radi u Gboardovom Rambleru, Gemini aplikaciji na macOS-u, Antigravityju i AI Studiju.
Brojke, i ko ih je izmjerio
Google prosječnu stopu grešaka po riječi navodi kao 4,0 odsto za prepis u toku govora i 2,6 odsto za snimljeni zvuk, a vrijeme do konačnog prepisa kao 70 odsto kraće nego kod prethodnog modela, Chirpa 3. Na višejezičnom mjerenju FLEURS navodi 5,50 odsto u toku govora i 5,04 odsto na snimku.
Ono što vrijedi primijetiti je kome se mjerenje pripisuje: Googleova objava navodi Artificial Analysis, a ne sopstvenu laboratoriju. To brojke ne čini nezavisnim od objave — proizvođač i dalje bira koje će objaviti i naspram kog prethodnika — ali znači da je probu pokrenuo neko van Googlea, a to je više nego što uz većinu objava o modelima stoji.
Čišćenje nije nedužno
Prepis koji izbaci poštapalice i nečujno pretvori „nađimo se u utorak — ne, u srijedu“ u srijedu lakše se čita, a teže mu se vjeruje. U intervjuu, u iskazu pred sudom, u ljekarskom prijemu ili u redakcijskom snimku, oklijevanje i ispravka su dio zapisa — a model koji ih pospremi donio je uredničku odluku umjesto tebe.
Za glasovna sučelja — diktiranje, agente, titlove uživo — to je upravo ispravno podrazumijevano ponašanje, i model je očigledno za to i pravljen. Za sve što treba da stoji kao dokaz o tome šta je čovjek zaista rekao, sirovi tok i dalje vrijedi, a Googleova objava ne kaže može li se sačuvati uz očišćeni tekst.
Izvori
Povezano
IBM je izdao model za rasuđivanje u tri veličine, a najmanji staje na laptop
Granite 4.2 dolazi kao 3B, 8B i 30B pod licencom Apache 2.0, a uz težine su odmah objavljena i izdanja u GGUF-u i na četiri bita. Zanimljiv dio nije tabela mjerenja — nego to što su licenca i formati riješeni prvog dana.
IBMprovjereno
GPT-5.6 Sol pao na 4 i 20 dolara i po cijeni pretekao Claude Opus 5
OpenAI je 21. avgusta snizio cijenu Sola na API-ju: ulaz sa 5 na 4 dolara, izlaz sa 30 na 20, a ulaz iz keša sa 0,50 na 0,40. Na standardnom zadatku model je od skupljeg od Claudea Opusa 5 postao jeftiniji od njega. Sniženje je promotivno i traje najmanje do 21. novembra.
OpenAIprovjereno

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa
Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.
Hugging Faceprovjereno

