Preskoči na sadržaj
Modelislab signalprovjereno

Ai2 je objavio AstaBrief, model s otvorenim težinama koji piše izvještaje s citatima

Ai2 je 2. oktobra 2026. objavio težine i podatke za obučavanje modela AstaBrief. Model od istraživačkog pitanja i pronađenih odlomaka iz literature pravi izvještaj s citatima. Prema mjerenju Ai2, režim Fast na platformi Asta u prosjeku napravi izvještaj za 51,1 sekundu, a režim koji pokreće Claude za 178,5 sekundi. Licenca je Apache 2.0, a Ai2 navodi da je evaluacija rađena prije pojave sadašnjih vodećih modela.

Potpisuje Redakcija WebAiRadarObjavljeno 2 min čitanjanapisao model
Slika: Ai2

Ai2 je Allenov institut za vještačku inteligenciju, a Asta je njegova platforma za naučni rad. AstaBrief se na toj platformi već koristi kao režim Fast u funkciji Generate a report, uz režim Thinking, za koji Ai2 navodi da ga pokreće Claude. Težine su objavljene na platformi Hugging Face, u nalogu allenai, pa se model može pokrenuti na sopstvenom hardveru.

Šta model radi

AstaBrief ima jednu namjenu. Na ulazu dobija istraživačko pitanje i odlomke iz literature koje je prethodni korak pretrage već pronašao. Zatim u jednom prolazu piše cio izvještaj s citatima. Literaturu ne pretražuje sam, pa pretragu mora da obezbijedi onaj ko model koristi.

Ai2 ga je napravio na osnovu otvorenog modela Qwen3-8B. Obučavanje je imalo dva koraka: nadgledano fino podešavanje, a zatim direktnu optimizaciju preferencija (DPO). Kartica modela preporučuje isti format prompta kojim je model obučavan i upozorava da drugačiji format može da pogorša rezultat. Kao jezik modela na kartici je naveden engleski.

Šta je Ai2 izmjerio

Prema mjerenju Ai2 kroz cio tok rada platforme Asta, režim Fast u prosjeku napravi izvještaj za 51,1 sekundu, a režim Thinking za 178,5 sekundi. Institut tu razliku zaokružuje na oko 3,5 puta.

O kvalitetu Ai2 navodi da je AstaBrief na mjerilima korišćenim tokom razvoja bio konkurentan toku rada koji pokreće Claude i modelu DR Tulu, koji je takođe napravio Ai2. Glavni skup za provjeru bio je SQABench-CS2, koji čini 200 istraživačkih pitanja iz računarstva koja su napisali korisnici. U odvojenom ispitivanju s ljudima tri istraživača su na 14 pitanja rangirala izvještaje sva tri sistema. Po ukupnoj ocjeni prvi je bio DR Tulu, a dva od tri istraživača dala su prednost modelu AstaBrief po tačnosti citata.

Ai2 navodi i prve podatke o korišćenju. Režim Fast su isprobala 374 korisnika platforme Asta, a 23 odsto njih nastavilo je da ga koristi i nije se vraćalo na režim Thinking. Pozitivnih ocjena bilo je 84,2 odsto za režim Fast i 85,2 odsto za režim Thinking. Ai2 dodaje da je ocjena premalo za čvrste zaključke.

Ograničenja koja Ai2 sam navodi

Obučavanje i evaluacija najvećim dijelom su završeni tokom 2025. godine. Ai2 navodi da punu evaluaciju nije ponovio u poređenju sa sadašnjim vodećim modelima. Rezultate opisuje kao dokaz o izabranom načinu obučavanja i građi sistema, a ne kao tvrdnju o tome gdje se model sada nalazi u odnosu na druge.

Na kartici modela piše da je model namijenjen istraživačkoj i obrazovnoj upotrebi, u skladu sa smjernicama Ai2 za odgovornu upotrebu. Sama licenca je Apache 2.0.

Pokretanje na sopstvenoj infrastrukturi

Ai2 navodi da otvorene težine omogućavaju ustanovama da AstaBrief pokreću na sopstvenoj infrastrukturi, i iza sopstvene mrežne barijere (firewall). Kao slučaj u kojem je to potrebno navodi pitanja koja otkrivaju osjetljiv ili neobjavljen rad. Uz težine je objavljen i primjer toka rada za izradu izvještaja iz sopstvenih PDF dokumenata.

Stranica modela je provjerena 2. oktobra 2026. Na njoj tada nije bio naveden nijedan provajder koji model nudi kao uslugu. Ni objava ni kartica modela ne navode koliko memorije model traži.

Izvori

Povezano

Snimak ekrana OpenAI-jeve kontrolne table za API, kartica Text provenance u podešavanjima projekta: prekidač Allow text watermarking je uključen, u meniju Models piše All selected, a ispod je dugme Save.
Modelijak signal

OpenAI uvodi vodeni žig u tekst ChatGPT-a i Codexa u EU, a u API-ju se uključuje po izboru

OpenAI je 5. oktobra 2026. objavio kako će tekst koji generišu njegovi modeli označavati vodenim žigom, radi usklađivanja s Aktom Evropske unije o vještačkoj inteligenciji (EU AI Act). Tekst iz ChatGPT-a i Codexa u Evropskoj uniji dobiće u narednim sedmicama nevidljiv vodeni žig pod nazivom textGrain. Korisnici API-ja u cijelom svijetu mogu od istog dana da ga uključe za odabrane modele, a podrazumijevano je isključen. Detektor nije javan: pristup dobijaju samo odobreni istraživači i stručne organizacije.

OpenAIprovjereno

RUTERI MODELANijedno od 14podešavanja rutera nije nadmašilo nasumičan iz
Modelisrednji signal

Šest komercijalnih rutera modela u novom radu nije nadmašilo nasumičan izbor između dva modela

Rad predat na arXiv 2. oktobra 2026. ispitao je šest komercijalnih rutera velikih jezičkih modela u 14 podešavanja. Autori navode da nijedno podešavanje nije nadmašilo ruter koji uz isti trošak nasumično bira između modela Gemini 3.7 Flash i Opus 5, a jedno je zaostalo 10,5 procentnih poena. Autori, zaposleni u kompaniji Fastino Labs, razliku objašnjavaju načinom na koji se ruteri ocjenjuju i prevelikim skupovima modela. Rad nije prošao recenziju.

arXiv, Fastino Labsprovjereno

Microsoftova grafika za ThinkingBox: ime ispisano tačkastim slovima na žutozelenoj podlozi prekrivenoj malim blokovima vodoravnih linija.
Modelisrednji signal

Microsoftov ThinkingBox pokazuje da nijedan model ne rješava pola zadataka 20 puta zaredom

Microsoftov tim Copilot Studio objavio je 3. oktobra 2026. na blogu platforme Hugging Face rezultate testa performansi ThinkingBox. Test svaki od 507 poslovnih tokova rada pokreće 20 puta po modelu i ocjenjuje stanje baze podataka koje agent ostavi, a ne njegovu završnu poruku. Microsoft navodi da Claude Opus 5.5 ima najbolji rezultat u pojedinačnom pokušaju, 67,16 odsto, ali da u svih 20 pokušaja rješava samo 241 zadatak. Prema autorima, približno četiri od pet neuspjeha potiču od rukovanja alatima, a ne od rezonovanja.

Microsoft, Hugging Faceprovjereno