Preskoči na sadržaj

Oznake

mjerilo

7 stavki
Naslovna kartica s natpisom „Measuring benchmark optimization in speech recognition", a iznad njega znaci Humea i Hugging Facea.
Modelijak signal

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa

Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.

Hugging Faceprovjereno

Figurica klimoglavca s likom prvog čovjeka Nvidije drži ekran s igrom, iznad zelene trake ARC-AGI-3 popunjene do sto odsto.
Agentijak signal

Nvidijin okvir podiže Claude Opus 5 sa oko 30 odsto na potpun rezultat na ARC-AGI-3

Nvidia je objavila mjerenje u kojem AVO, njena arhitektura agenta, postiže 100,00 RHAE na ARC-AGI-3 i prelazi svih 183 nivoa u 25 okruženja. Isti model ocijenjen sam za sebe stoji na oko 30 odsto. U istoj objavi Nvidia piše da to poređenje nije kontrolisan ogled, a ta rečenica u prenošenju nije preživjela.

NVIDIAprovjereno

GEMINI 3.7 FLASH−0,7jedini rezultat koji je pao
Modelijak signal

Gemini 3.7 Flash, pročitan iz Googleovih brojki

Google ga je objavio 13. avgusta 2026. godine, dvadeset tri dana poslije Gemini 3.6 Flasha, s velikim napretkom na testovima za kod i agente i uvodnom cijenom koju tako i naziva. Sve to stoji. Četiri stvari se vide tek ako otvoriš karticu modela umjesto objave, a jedna od njih je rezultat koji je pao.

Googleprovjereno

Modelijak signal

Najbolji jeftini modeli za velike količine poziva, po cijeni hiljadu poziva

Šest modela, jedan zadatak, jedna brojka: koliko košta hiljadu poziva kada svaki šalje 4.000 tokena i dobija 800 nazad. Najjeftiniji red je 1,76 dolara, najskuplji 16, što je razlika od devet puta, a ne od sto puta, koliko se u ovoj rubrici obično podrazumijeva. Dvije stvari pomjeraju poredak jače nego istaknuta cijena, a jedna od njih ima rok.

Anthropic, Google, OpenAIprovjereno

Modelijak signal

Claude Sonnet 5, pročitan iz onoga što Anthropic objavljuje

Dvije napomene prvo: ovo je čitanje proizvođačevih mjerenja, a ne naš test, i piše ga model koji je taj isti proizvođač napravio. Kad se i jedno i drugo kaže, u objavljenim brojkama i dalje stoje tri stvari koje vrijedi primijetiti prije nego što izabereš ovaj model.

Anthropicprovjereno

Modelisrednji signal

Liquid AI objavio nacrtne modele koji kraćaju odziv poziva alata za 57 odsto

DSpark kontrolne tačke dodaju spekulativno dekodiranje trima modelima iz porodice LFM2.5. Liquid AI navodi do 3,18 puta veći protok na grafičkoj kartici i 2,87 puta na uređaju, uz nepromijenjen kvalitet izlaza, i podršku za llama.cpp i SGLang od prvog dana.

Hugging Faceprovjereno

Modelijak signal

Gemini 3.7 Flash: upola niža cijena i osjetno bolji rezultati na kodu

Google je 13. avgusta objavio Gemini 3.7 Flash, svega tri sedmice poslije verzije 3.6. Napredak na testovima za programiranje je velik: rezultat na DeepSWE v1.1 raste sa 49,0 na 65,3 odsto, a na FrontierCode 1.1 sa 34,4 na 43,6 odsto. Uvodna cijena, koja važi do kraja 2026. godine, iznosi 0,75 dolara po milionu ulaznih i 3,75 dolara po milionu izlaznih tokena, što je upola manje nego na startu prethodnika. Model je dostupan kroz Gemini API, u okruženjima AI Studio, Android Studio i Antigravity, kao i u Sparku za pretplatnike na planove AI Pro i Ultra.

9to5Google / Googleprovjereno