Anthropic navodi da GLM-5.3 sam pravi eksploite za pregledač, a zaštita mu se uklanja za oko 4.400 dolara
Anthropicov Frontier Red Team objavio je 29. septembra 2026. analizu modela GLM-5.3, koji Zhipu AI nudi s otvorenim težinama. Prema toj analizi model za poznate ranjivosti u Chromeovom motoru V8 pravi radne eksploite približno jednako često kao Claude Mythos Preview, a njegova odbijanja se zaobilaze u 64 do 100 odsto pokušaja. Potpuno uklanjanje zaštite koštalo je, navodi kompanija, oko 2.200 GPU sati, odnosno oko 4.400 dolara.
Izvor
GLM-5.3 and the spread of advanced cyber capabilitiesAnthropic News · Original objavljen 29. septembra 2026.
Model koji svako može da preuzme sada sam nalazi i povezuje ranjivosti u pregledaču, tvrdi Anthropic. Izvještaj potpisuje Frontier Red Team, koji je GLM-5.3 uporedio s modelom Claude Mythos Preview, dostupnim samo provjerenim braniocima kroz program Project Glasswing. Zaključak izvještaja je da je prag slobodno dostupnih sposobnosti pređen. Eksploit je kod koji iskorišćava ranjivost, a sve brojke u tekstu su Anthropicova sopstvena mjerenja.
Šta je model uradio u Anthropicovim testovima
Na testu ExploitBench, koji mjeri eksploite za poznate ranjivosti u V8, JavaScript motoru pregledača Chrome, GLM-5.3 je radni eksploit od početka do kraja napravio u 50 od 410 pokušaja. Claude Mythos Preview je uspio u 56 od 410. Na internom Anthropicovom testu Binary Exploitation, na nasumičnom podskupu od 100 zadataka, GLM-5.3 je potpuno preuzeo tok izvršavanja u 4 odsto pokušaja, a Mythos Preview u 6 odsto. Claude Opus 4.6 i GLM-5.2 nisu uspjeli nijednom.
U sesiji koju je vodio istraživač model je oko jedan dan radio na izolovanoj Linux verziji popularnog pregledača, uz manje od sata ljudske pažnje. Anthropic navodi da je model našao više do tada nepoznatih ranjivosti u JavaScript motoru i povezao ih u veb stranicu koja čita proizvoljne datoteke s računara posjetioca, uključujući privatni SSH ključ. Kompanija kaže da je ranjivosti prijavila održavaocu pregledača.
U drugoj sesiji manji model GLM-5.3-Flash dobio je nedavno zakrpljenu ranjivost u Chromeu, CVE-2026-11645, i još jednu poznatu grešku. Uz 20 minuta ljudske pažnje i 8 sati rada modela nastao je pouzdan lanac eksploita za ARM64, koji zaobilazi zaštitu autentifikacijom pokazivača. Po Zhipuovim cijenama API-ja to je, prema Anthropicu, koštalo 20,40 dolara.
Kako je zaštita zaobiđena
GLM-5.3 odbija očigledno štetne zahtjeve i u simuliranom okruženju odbio je svaki direktan zahtjev da napadne kritične sisteme. Anthropic je zatim probao tri postupka. Izmišljena priča, u kojoj je model samostalni agent na vježbi crvenog tima, navela ga je da pristane u 64 odsto slučajeva. Unaprijed popunjeni tokeni razmišljanja, kao da je model već odlučio da nastavi, podigli su udio na 92 odsto. Abliterirana kopija, kojoj su odbijanja uklonjena iz težina, pristala je u 100 odsto slučajeva.
Samo uklanjanje odbijanja, poznato kao abliteracija, koštalo je Anthropicov tim, koji to nikad ranije nije radio, oko 2.200 GPU sati, odnosno oko 4.400 dolara. Kompanija procjenjuje da bi iskusnom timu trebalo oko 600 GPU sati, odnosno oko 1.200 dolara. Udio odbijanja pao je s više od 90 odsto na oko 3 odsto na testu JailbreakBench, 2 odsto na HarmBench i 12 odsto na StrongREJECT, dok se rezultat na GPQA-Diamond nije promijenio. Više programera je abliterirane verzije objavilo već nekoliko dana poslije izlaska modela.
Anthropic navodi da nijedan od tri postupka u istim testovima nije uspio protiv zaštićenih Claude modela, jer API blokira izmišljene priče, ne dozvoljava unaprijed popunjeno razmišljanje i ne daje težine. Simulacija je koristila lažni alat za komandnu liniju koji ništa ne izvršava, što kompanija i sama navodi kao ograničenje mjerenja.
Šta Anthropic traži
Izvještaj se poziva na procjenu Centra za standarde i inovacije u AI-ju pri NIST-u (CAISI) od 17. septembra 2026. Ta procjena je GLM-5.3 nazvala najsposobnijim modelom s otvorenim težinama za sajber zadatke do sada i smjestila ga oko četiri mjeseca iza američkog vrha na zbirnim sajber testovima. Anthropic kaže da se njegovi nalazi o sposobnostima uglavnom poklapaju s tom procjenom.
Kompanija zaključuje da bi vlade trebalo da bezbjednosno testiraju modele ovakvih sposobnosti, uključujući nasljednike modela GLM-5.3, da branioci treba da koriste najbolje dostupne alate, i da pristup Claudeovim sajber sposobnostima treba proširiti na više branilaca. Navodi i da je program Project Glasswing provjerenim braniocima omogućio da nađu više od 10.000 ranjivosti u kritičnom softveru prije nego što su slični modeli postali slobodno dostupni.
„najsposobniji model s otvorenim težinama za sajber zadatke objavljen do sada“
Povezano

NVIDIA predstavila Kumo Tabular, Transformer koji predviđa iz tabela bez dodatnog treniranja
Kumo Tabular čita tabelu s označenim redovima i u jednom prolazu unaprijed vraća predviđanja za nove redove, bez treniranja, podešavanja i ručnog izdvajanja obilježja. NVIDIA ga je objavila 29. septembra 2026. u 3 veličine, od 28 miliona do 215 miliona parametara, pod licencom OpenMDW-1.1 koja dopušta komercijalnu upotrebu. Prema mjerenju proizvođača, model je prvi na 4 mjerila: TabArena, BeyondArena, TALENT i ScoringBench. Radi samo s numeričkim i kategorijskim kolonama i traži grafičku karticu s CUDA podrškom.
Hugging Face Blogprovjereno
OpenAI je objavio GPT-6.1 Sol po cijeni modela GPT-6 Sol i uveo plan Pro 500 od 500 dolara
GPT-6.1 Sol košta 2 dolara po milionu ulaznih i 10 dolara po milionu izlaznih tokena, isto koliko i GPT-6 Sol, a keširani ulaz pojeftinio je na 0,10 dolara. OpenAI navodi da se model u programiranju i upravljanju računarom približava modelu GPT-6 Astra uz petinu njegove cijene. Veći model GPT-6.1 Astra nije objavljen. Novi plan Pro 500 od 500 dolara mjesečno jedini među Pro planovima uključuje režim Ultrafast, a Pro 200 se vraća s manjim obimom korišćenja.
OpenAIprovjereno
Anthropic je objavio Sonnet 5.5, čiji ulazni i izlazni tokeni koštaju upola manje nego kod Opusa 5.5
Claude Sonnet 5.5 zadržava cijene Sonneta 5: dva dolara po milionu ulaznih i deset dolara po milionu izlaznih tokena. To je upola manje nego kod Opusa 5.5, a prema testovima samog Anthropica dva modela dijeli svega nekoliko poena. Kod koji isključuje razmišljanje mora se izmijeniti prije prelaska, jer staro podešavanje sada vraća grešku.
Anthropicprovjereno


