Preskoči na sadržaj
Modelisrednji signalprovjereno

Ai2 je objavio metod koji pokazuje šta pojedinačna pitanja u mjerilima zapravo mjere

BenchMIRT uzima teoriju odgovora na stavku iz psihometrije i primjenjuje je na mjerilo pitanje po pitanje, umjesto da vjeruje prosjeku. Obučen na 100 modela, 16 mjerila i više od 34.000 pitanja, sam je izdvojio dvije dimenzije: bezbjednost i opšte rezonovanje. Nekoliko mjerila je završilo na dimenziji na koju ih niko nije svrstao. Zadržavanje 10 odsto pitanja dalo je gotovo isti poredak kao i cio skup.

Potpisuje Redakcija WebAiRadarObjavljeno 3 min čitanjanapisao model
Slika: Ai2

Ai2 je 1. septembra 2026. objavio BenchMIRT, metod za provjeru mjerila za jezičke modele na nivou pojedinačnog pitanja, a ne konačne ocjene. Polazna pretpostavka je da mjerilo namjerava da izmjeri jednu sposobnost, dok pitanja u njemu često zavise od nekoliko njih. Kad se ti signali usrednje u jedan broj, taj broj prestaje da govori ono što mu ime obećava.

Kako metod radi

Teorija odgovora na stavku dolazi iz psihometrije i počinje od jednostavnog zapažanja: ne govori svako pitanje jednako mnogo o onome ko rješava test. Neka su teža, a neka bolje razdvajaju jače od slabijih. Jednodimenzionalna varijanta je i ranije primjenjivana na pojedinačna mjerila. BenchMIRT koristi višedimenzionalnu, pa umije da razdvoji nekoliko sposobnosti koje ulaze u isto pitanje.

Procjenjuje dvije stvari odjednom. Za model procjenjuje snagu na sposobnostima koje se pojavljuju u izabranim mjerilima. Za pitanje procjenjuje težinu i to koliko dobro razdvaja jače modele od slabijih. Ai2 ga je obučio na rezultatima 100 jezičkih modela na 16 mjerila i više od 34.000 pitanja. Šest mjerila mjeri rezonovanje, među njima MMLU-Pro, GPQA, MATH i BBH, a deset dolazi iz bezbjednosnog skupa projekta Olmo 3. Metodu niko nije rekao koje mjerilo šta mjeri, a on je svejedno izdvojio dvije preovlađujuće dimenzije: bezbjednost i opšte rezonovanje.

Šta je našao u postojećim mjerilima

Za veći dio skupa se namjera mjerila potvrdila. Tri slučaja nisu, a svaki od njih je vrsta greške koja neprimjetno iskrivi poređenje dva modela.

  • BBQ ispituje društvene predrasude i obično se svrstava među bezbjednosna mjerila, a mnogo se jače poklopilo s opštim rezonovanjem. Slaba ocjena zato dijelom može značiti i teškoću u razumijevanju pitanja, a ne samo ponašanje modela prema predrasudama.
  • WMDP ispituje opasno dvonamjensko znanje i takođe je pratilo rezonovanje umjesto bezbjednosti, i to u obrnutom smjeru. Jače rezonovanje je išlo uz slabiju ocjenu, jer se odbijanje da se to znanje pruži računa kao tačan odgovor.
  • HarmBench u sebi miješa signale, pa su njegovi obični i kontekstualni štetni zahtjevi legli na bezbjednost, dok su pitanja o autorskim pravima legla na opšte rezonovanje.

Manje pitanja, gotovo ista slika

Procjene na nivou pitanja omogućavaju da se pitanja poredaju po tome koliko dobro razdvajaju modele. Ai2 je to uradio na istih 16 mjerila i navodi da je zadržavanje samo 10 odsto pitanja uglavnom davalo gotovo istu sliku o tome koji su modeli jači u posmatranoj sposobnosti. Zadržavanje polovine pitanja se često još bliže poklapalo s cijelim skupom.

Metod umije i da predvidi kako bi model prošao na pitanju na kojem nikad nije ocijenjen. Pogodio je u 79 odsto slučajeva, prema 70 odsto koliko daje jednostavnija pretpostavka da model na svakom pitanju prolazi otprilike kao i na mjerilu u cjelini. Ta razlika je praktična dobit, jer za istu ocjenu modela treba manje pokretanja provjere.

Ograničenja koja autori sami navode

Svi modeli na kojima je BenchMIRT obučen i provjeren objavljeni su zaključno s martom 2025, pa ovaj rad ne govori kako se metod ponaša na današnjim modelima. Dimenzije koje pronalazi zavise i od skupa mjerila koji mu se da, a drugačiji izbor bi mogao da izdvoji druge sposobnosti. Ai2 dodaje i da za puko rangiranje modela na nasumično izdvojenim pitanjima obični prosjek mjerila radi nešto bolje.

Autori imenuju i očiglednu opasnost. Iste procjene koje pronalaze najinformativnija bezbjednosna pitanja mogu se upotrijebiti i da se ta pitanja uklone, pa bi ostala slabija provjera kroz koju bi nebezbjedan model prošao. Oni smatraju da je veća prozirnost vrijedna tog rizika i podsjećaju da se slično skraćivanje već može izvesti postojećim alatima, ali rizik navode kao stvaran, a ne kao teorijski.

jedna ocjena mjerila može da sadrži nekoliko različitih signala
Ai2, objava o metodu BenchMIRT

Povezano

Modelisrednji signal

NeoMME sa 260 miliona parametara došao je na 0,002 od modela s 3,75 milijardi na ViDoRe v3

Kompanija H objavila je 3. septembra 2026. dva multimodalna enkodera, od 260 miliona i 800 miliona parametara, pod licencom Apache 2.0 i za učitavanje kroz biblioteku Hugging Face Transformers. Na mjerilu ViDoRe v3, koje ocjenjuje pretragu skeniranih dokumenata, manji model postiže 0,523 po mjeri nDCG@10, a to je 0,002 ispod modela ColQwen2.5 koji ima oko četrnaest puta više parametara. Isti model kodira oko 51 stranicu u sekundi na jednoj grafičkoj kartici NVIDIA L40S. Indeks koji pravi može se sabiti sa oko 1,5 megabajta po stranici na 6 kilobajta, uz zadržanih preko 95 odsto kvaliteta pretrage.

Hugging Faceprovjereno

PREKID 3. SEPTEMBRA4 odjednomChatGPT, Claude, Grok i Gemini
Modelisrednji signal

ChatGPT, Claude, Grok i Gemini imali su smetnje u istom dvočasu, 3. septembra

Anthropic je 3. septembra 2026. zaveo povećan broj grešaka na modelima Claude Mythos 5.1, Claude Fable 5.1 i Claude Opus 5, a OpenAI povećan broj grešaka u ChatGPT-u i Codexu. Grok je korisnicima ispisivao poruku o greškama, a nezavisni nadzor je zabilježio vjerovatan prekid Gemini API-ja. Četiri nezavisna provajdera, jedno prijepodne. Nijedna stranica o stanju usluga ne imenuje zajednički uzrok, a Amazon Web Services, Microsoft Azure i Cloudflare tog jutra nisu prijavili veće smetnje.

Ars Technicaprovjereno

Modelijak signal

OpenAI je objavio GPT-6 Astru po 10 dolara za milion ulaznih tokena, a preduzećima je pristup isključen

Model GPT-6 Astra objavljen je 3. septembra 2026. Prvo ga je dobio ograničen broj organizacija, a narednih dana slijede i korisnici planova ChatGPT Plus, Pro, Business i Enterprise. U API-ju se zove gpt-6-astra i košta 10 dolara po milionu ulaznih i 50 dolara po milionu izlaznih tokena, a isporučuje se i preko Microsoft Azurea i Amazon Bedrocka. Preduzeća ga ne dobijaju sama od sebe, jer je pristup pri objavi podrazumijevano isključen i mora ga uključiti administrator. OpenAI uz to upozorava da dodatne bezbjednosne provjere umiju da pauziraju posao u ChatGPT-u i Codexu, a u API-ju da ga prekinu.

OpenAIprovjereno