Preskoči na sadržaj
Agentijak signalprovjereno

Nvidijin okvir podiže Claude Opus 5 sa oko 30 odsto na potpun rezultat na ARC-AGI-3

Nvidia je objavila mjerenje u kojem AVO, njena arhitektura agenta, postiže 100,00 RHAE na ARC-AGI-3 i prelazi svih 183 nivoa u 25 okruženja. Isti model ocijenjen sam za sebe stoji na oko 30 odsto. U istoj objavi Nvidia piše da to poređenje nije kontrolisan ogled, a ta rečenica u prenošenju nije preživjela.

Potpisuje Redakcija WebAiRadarObjavljeno 3 min čitanjanapisao model
Slika: NVIDIA

Izvor

NVIDIA AVO Reaches 100% on ARC-AGI-3

NVIDIA Technical Blog · Original objavljen 21. avgust 2026

Brojka je od onih koje se ponavljaju bez fusnote, pa idu obje polovine odjednom. Nvidia je 21. avgusta objavila da je AVO, njena arhitektura agenta pokrenuta nad Claudeom Opusom 5, prešao svaki nivo javnog skupa ARC-AGI-3. Osnovna vrijednost koju ARC Prize navodi za taj model, ocijenjen sam za sebe i uz visok uloženi trud, iznosi oko 30 odsto. Nvidia pritom izričito kaže da te dvije brojke ne stoje u istom ogledu.

Šta je izmjereno

Mjera je RHAE, relativna efikasnost radnji u odnosu na čovjeka, koju Nvidia opisuje kao spoj dovršenosti zadatka i efikasnosti po nivou, mjerene prema ljudima koji zadatak rade prvi put. AVO na njoj ima 100,00, pošto je prešao svih 183 nivoa u 25 okruženja uz 6.624 radnje u okruženju.

ARC-AGI-3 nije test pitanja i odgovora. Svako okruženje je svijet u kojem agent mora da istražuje, sam sastavi pretpostavku šta u njemu važi i onda djeluje kroz mnogo koraka. Zbog tog oblika okvir uopšte i igra ulogu: između 30 odsto i potpunog rezultata ne mijenja se znanje modela, nego to kako mu se dodjeljuje kontekst, koliko smije da koristi alate, kako drži stanje i kako se oporavlja poslije greške.

Prema čemu se poredi, i koliko pažljivo

U objavi stoje dva poređenja i nisu ravnopravna. Prema VISTA, drugom okviru nad istim Claudeom Opusom 5, AVO je istih 183 nivoa prešao uz 6.624 radnje naspram 7.542 koliko ih je trošila VISTA — otprilike 12 odsto manje. To jeste poređenje jednakog s jednakim: isti model, isti nivoi, dva okvira.

Drugo poređenje je ono koje je otputovalo dalje. Vrijednost od oko 30 odsto je ocjena koju ARC Prize daje Claudeu Opusu 5 samom za sebe, i Nvidia to i kaže, nazivajući je ocjenom na nivou modela za razliku od sopstvenog rezultata na nivou sistema. Onda dodaje rečenicu koju vrijedi zadržati: ta poređenja se ne smiju čitati kao kontrolisan ogled, jer se sistemi razlikuju po arhitekturi, po tome kako predstavljaju ono što vide i po izvedbi.

Pošteno čitanje, dakle, nije da okvir pretvara 30 odsto u sto. Pošteno čitanje je da su dva različito sagrađena sistema, od kojih je jedan gola ocjena modela, dala vrlo različite brojke, a niko još nije izdvojio koji je dio odradio posao.

Šta rad zapravo pokriva

AVO je opisan u radu iz marta 2026. godine, a razrađeni obrazac u njemu uopšte nije ARC-AGI-3. Rad metod primjenjuje na optimizaciju jezgara za pažnju na grafičkim procesorima Blackwell, gdje pronađena jezgra nadmašuju cuDNN za najviše 3,5 odsto i FlashAttention-4 za najviše 10,5 odsto na višeglavoj pažnji, odnosno za 7 i 9,3 odsto na grupisanoj. Prvo otkriće je trajalo sedam dana; prilagođavanje na grupisanu pažnju trideset minuta.

Umjesto nepromjenjivih operatora mutacije i ukrštanja u evolutivnoj pretrazi, metod uvodi agente koji gledaju dotadašnju lozu rješenja, bazu znanja iz oblasti i povratnu informaciju iz izvršavanja, pa na osnovu toga predlažu, popravljaju, kritikuju i provjeravaju izmjene. Rad nije prošao stručnu recenziju.

Šta iz ovoga slijedi

Ako gradiš agente, praktična pouka je da je skela oko modela površina za projektovanje s dvocifrenim posljedicama, a ne tanak omotač koji se napiše jednom pa zaboravi. Sastavljanje konteksta, pristup alatima, držanje stanja i oporavak od greške su mjesta na kojima razlika nastaje.

Ako čitaš brojke s evaluacija, pouka je uža i starija: rezultat sistema i rezultat modela nisu isto mjerenje, a proizvođač koji to sam napiše u svojoj objavi uradio je više nego većina. Brojka koju vrijedi zapamtiti je ona iza koje stoji kontrolisano poređenje — dvanaest odsto manje radnji od drugog okvira, nad istim modelom.

Izvori

MarkeClaude

Povezano

Agentisrednji signal

Posrednik koji je skidao jedno zaglavlje udvostručavao je račun za Claude Code

Izdanje 2.1.239 popravlja strujanje na Bedrocku iza posrednika koji uklanjaju zaglavlje Content-Type iz odgovora. Claude Code je tiho prelazio na ponovno izvršavanje svakog koraka bez strujanja, pa se svaki korak naplaćivao dvaput. Isto izdanje u procjenu troška uvodi premiju od 1,1 puta, koju plaćaju radni prostori s ograničenom rezidencijom podataka.

Anthropicprovjereno

CHATGPT ZA MACiMessagečita i šalje, tek kad ti odobriš
Agentisrednji signal

ChatGPT sada čita i šalje tvoje poruke u Apple Messages, i to samo na Macu

Dodatak u ChatGPT aplikaciji za računar čita i pretražuje tvoje iMessage, SMS i RCS razgovore i kroz Messages šalje poruke u tvoje ime. Podrazumijevano ništa ne odlazi dok ne odobriš i tekst i primaoce. Postoji prekidač koji taj korak uklanja, a OpenAI-jeva sopstvena dokumentacija odvraća od njega.

OpenAIprovjereno

Snimak ekrana: ploča GitHub Copilota u Slacku, ispod naslova „The new GitHub Copilot experience in Slack".
Agentisrednji signal

GitHub Copilot je istog dana ušao u Slack i Microsoft Teams

Oba su objavljena 21. avgusta, u javnom pregledu. Pomeneš @GitHub u kanalu i agent razvrstava prijave grešaka, istražuje kvarove, piše izmjenu u izolovanom okruženju u oblaku i otvara zahtjev za spajanje, uz vezu na razgovor iz kojeg je nastao. Zanimljiv nije spisak mogućnosti, koji je poznat, nego prostorija u koju se agent preselio: tamo gdje se o poslu razgovara, a ne tamo gdje se piše.

GitHubprovjereno