Preskoči na sadržaj
Modelijak signalprovjereno

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa

Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.

Potpisuje Redakcija WebAiRadarObjavljeno 2 min čitanjanapisao model
Slika: Hugging Face

Stopa greške po riječi je brojka koju svi porede, a ovo je istraživanje koje pokazuje šta ona umije tiho da mjeri umjesto toga. Tim je isprobao 11 otvorenih modela, među njima Whisper Large v3, Nvidia Canary i IBM Granite, na skupu VoxPopuli na engleskom i na obje podjele skupa LibriSpeech, i osmislio tri provjere koje bi stvarno bolji prepisivač prošao, a onaj skrojen po skupu podataka pao.

Referenca je pogrešna, a modeli se s njom slažu

Prva provjera traži mjesta na kojima se prepis iz samog testa ne poklapa sa zvukom. Oko 40 odsto snimaka iz testnog dijela skupa VoxPopuli označeno je kao mjesto s mogućom greškom u referenci, a to je dovoljno velik udio da pomjeri svaki poredak sagrađen nad tim skupom.

Nalaz je u tome šta su modeli s tim uradili. Šest od 11 ponovilo je pogrešan prepis, zapisujući ono što referenca kaže umjesto onoga što se u snimku čuje. Modeli s najnižom stopom greške po riječi to su radili najčešće, a to je cio problem izrečen u jednoj rečenici: ocjena nagrađuje slaganje s referencom, a slaganje s referencom nije isto što i tačno čuti.

Popunjavanje onoga što je zaklonjeno

Druga provjera zakloni dio zvuka — recimo neki broj — i gleda da li ga model ipak ispiše. Na skupu LibriSpeech pojedini najbolji modeli po rezultatu ispisali su zaklonjene brojeve u otprilike 30 do 40 odsto slučajeva.

Do tog odgovora ne vodi nijedan put kroz zvuk. Model koji zapiše broj koji ne može da čuje vadi ga iz nečega što je zapamtio, a na javnom testu to nešto je najvjerovatnije sam test.

Prepoznati koji ispit polažeš

Treća provjera je najdirektnija. Različiti skupovi podataka slijede različite pravopisne konvencije, pa su istraživači gledali da li model mijenja konvenciju zavisno od toga iz kojeg skupa snimak dolazi. Više modela je prešlo granicu od 50 odsto, koliko bi dalo nasumično pogađanje, a neki su stigli do oko 90 odsto tačnosti pri prebacivanju.

Autori to čitaju tako da modeli koriste okolni zvučni kontekst da odluče hoće li slijediti snimak ili primijeniti pravilo prepisivanja svojstveno tom testu. Prostije rečeno: model prepozna ispit i odgovara u stilu tog ispita.

Šta s ovim uraditi pri izboru modela

Praktičan zaključak je onaj koji istraživanje i navodi: kandidate poređaj na potpuno izdvojenom skupu za ocjenjivanje, ne po jednoj objavljenoj brojci. Kod govora je to neobično lako izvesti, jer tvoj sopstveni zvuk i jeste taj izdvojen skup — snimci tvojih sagovornika, u tvojim uslovima, s tvojim rječnikom.

Uz to je i razlog za oprez prema razmaku između dva reda na tabeli. Ako se krojenje po skupu podataka gomila baš na vrhu tabele, onda je razlika od poena ili dva među vodećima najmanje pouzdan dio cijele tabele.

Povezano

GPT-5.6 SOL$4/$20po milionu tokena, ulaz i izlaz
Modelijak signal

GPT-5.6 Sol pao na 4 i 20 dolara i po cijeni pretekao Claude Opus 5

OpenAI je 21. avgusta snizio cijenu Sola na API-ju: ulaz sa 5 na 4 dolara, izlaz sa 30 na 20, a ulaz iz keša sa 0,50 na 0,40. Na standardnom zadatku model je od skupljeg od Claudea Opusa 5 postao jeftiniji od njega. Sniženje je promotivno i traje najmanje do 21. novembra.

OpenAIprovjereno

GEMINI 3.7 FLASH−0,7jedini rezultat koji je pao
Modelijak signal

Gemini 3.7 Flash, pročitan iz Googleovih brojki

Google ga je objavio 13. avgusta 2026. godine, dvadeset tri dana poslije Gemini 3.6 Flasha, s velikim napretkom na testovima za kod i agente i uvodnom cijenom koju tako i naziva. Sve to stoji. Četiri stvari se vide tek ako otvoriš karticu modela umjesto objave, a jedna od njih je rezultat koji je pao.

Googleprovjereno

CIJENA ZADATKA$1,76najjeftinija hiljada poziva od 4.000 tokena
Modelijak signal

Najbolji jeftini modeli za velike količine poziva, po cijeni hiljadu poziva

Šest modela, jedan zadatak, jedna brojka: koliko košta hiljadu poziva kada svaki šalje 4.000 tokena i dobija 800 nazad. Najjeftiniji red je 1,76 dolara, najskuplji 16, što je razlika od devet puta, a ne od sto puta, koliko se u ovoj rubrici obično podrazumijeva. Dvije stvari pomjeraju poredak jače nego istaknuta cijena, a jedna od njih ima rok.

Anthropic, Google, OpenAIprovjereno