Preskoči na sadržaj
Modelisrednji signalprovjereno

Googleov novi model za prepis čisti govor, a to je i mogućnost i rizik

Gemini 3.5 Transcribe izbacuje poštapalice, razrješava ispravke u toku rečenice i usput oblikuje tekst. Google navodi 4,0 odsto grešaka po riječi u toku govora i 2,6 odsto na snimku — a mjerio je Artificial Analysis, ne sam Google.

Potpisuje Redakcija WebAiRadarObjavljeno 2 min čitanjanapisao model
Slika: Google DeepMind

Google je 26. avgusta predstavio Gemini 3.5 Transcribe, model za pretvaranje govora u tekst koji ne staje na tome šta je rečeno. Izbacuje „ovaj“ i „aha“, prati govornika koji se ispravi usred rečenice, i vraća oblikovan tekst umjesto sirovog niza riječi.

Šta radi i gdje se pokreće

Model dolazi kroz dva API-ja. Prepis u toku govora ide kroz Live API, pod oznakom `gemini-3.5-transcribe-live`, uz kašnjenje koje Google opisuje kao manje od sekunde i dvosmjerni prenos. Snimljeni zvuk ide kroz Interactions API, pod oznakom `gemini-3.5-transcribe`, i vraća pripisivanje govornika i vremenske oznake po riječi. Oba su dostupna kroz Gemini API u Google AI Studiju i na platformi Gemini Enterprise Agent.

Google navodi više od 85 jezika uz samostalno prepoznavanje, sopstveni rječnik za stručne izraze i neobična pisanja, i pripisivanje govora za najviše tri govornika — preko tri je označeno kao ogledno. Model uz to može da preda posao drugim Gemini modelima kroz pozivanje funkcija, zasad samo u Gemini aplikaciji na macOS-u.

  • U toku govora: `gemini-3.5-transcribe-live` kroz Live API.
  • Snimci: `gemini-3.5-transcribe` kroz Interactions API, s vremenskim oznakama.
  • Tri govornika se pripisuju pouzdano; više od tri je ogledno.
  • Već radi u Gboardovom Rambleru, Gemini aplikaciji na macOS-u, Antigravityju i AI Studiju.

Brojke, i ko ih je izmjerio

Google prosječnu stopu grešaka po riječi navodi kao 4,0 odsto za prepis u toku govora i 2,6 odsto za snimljeni zvuk, a vrijeme do konačnog prepisa kao 70 odsto kraće nego kod prethodnog modela, Chirpa 3. Na višejezičnom mjerenju FLEURS navodi 5,50 odsto u toku govora i 5,04 odsto na snimku.

Ono što vrijedi primijetiti je kome se mjerenje pripisuje: Googleova objava navodi Artificial Analysis, a ne sopstvenu laboratoriju. To brojke ne čini nezavisnim od objave — proizvođač i dalje bira koje će objaviti i naspram kog prethodnika — ali znači da je probu pokrenuo neko van Googlea, a to je više nego što uz većinu objava o modelima stoji.

Čišćenje nije nedužno

Prepis koji izbaci poštapalice i nečujno pretvori „nađimo se u utorak — ne, u srijedu“ u srijedu lakše se čita, a teže mu se vjeruje. U intervjuu, u iskazu pred sudom, u ljekarskom prijemu ili u redakcijskom snimku, oklijevanje i ispravka su dio zapisa — a model koji ih pospremi donio je uredničku odluku umjesto tebe.

Za glasovna sučelja — diktiranje, agente, titlove uživo — to je upravo ispravno podrazumijevano ponašanje, i model je očigledno za to i pravljen. Za sve što treba da stoji kao dokaz o tome šta je čovjek zaista rekao, sirovi tok i dalje vrijedi, a Googleova objava ne kaže može li se sačuvati uz očišćeni tekst.

Izvori

MarkeGemini

Povezano

GPT-5.6 SOL$4/$20po milionu tokena, ulaz i izlaz
Modelijak signal

GPT-5.6 Sol pao na 4 i 20 dolara i po cijeni pretekao Claude Opus 5

OpenAI je 21. avgusta snizio cijenu Sola na API-ju: ulaz sa 5 na 4 dolara, izlaz sa 30 na 20, a ulaz iz keša sa 0,50 na 0,40. Na standardnom zadatku model je od skupljeg od Claudea Opusa 5 postao jeftiniji od njega. Sniženje je promotivno i traje najmanje do 21. novembra.

OpenAIprovjereno

Naslovna kartica s natpisom „Measuring benchmark optimization in speech recognition", a iznad njega znaci Humea i Hugging Facea.
Modelijak signal

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa

Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.

Hugging Faceprovjereno