Amazonov Strands Labs objavio je Strands Decider, otvoreni model odlučivanja koji radi lokalno
Strands Labs, eksperimentalni dio projekta Strands Agents, objavio je 1. oktobra 2026. model odlučivanja Strands Decider. Model ne piše tekst: bira jednu od ponuđenih opcija, odgovara sa da ili ne ili daje ocjenu na skali, a uz svaki odgovor navodi stepen pouzdanosti. Prema mjerenju tima, medijana trajanja jedne odluke na Nvidijinoj grafičkoj kartici RTX 3090 iznosi 115 milisekundi. Kôd, težine, podaci za obuku i skripte objavljeni su pod licencom Apache-2.0.
Izvor
Amazon releases its own Jev clone as decision models flood the webTechCrunch AI · Original objavljen 1. oktobra 2026.
Modeli odlučivanja su klasa modela koja je privukla pažnju otkako je TypeSafe AI u septembru 2026. objavio Jev. Strands Decider, punog naziva strands-decider-2B, doprinos je projekta Strands Agents toj klasi. TechCrunch ga navodi kao izdanje kompanije Amazon Web Services. Model se može pokretati i ponovo obučavati na hardveru koji programer već ima.
Šta radi model odlučivanja
Veliki jezički model generiše tekst, a model odlučivanja to ne može. Strands Decider čita zadati tekst, koji projekat naziva stanjem (state), i na pitanja o njemu odgovara u jednom od tri oblika:
- Izbor: model bira jednu od opcija navedenih u zahtjevu, na primjer koji tim treba da preuzme prijavu korisnika.
- Da ili ne: model vraća vrijednost između 0 i 1, pri čemu vrijednost bliža jedinici znači da.
- Ocjena: model svrstava tekst na uređenu skalu koju zadaje korisnik.
Kako je model građen i šta zbog toga ne može
Model ima 1,9 milijardi parametara. Tim je pošao od modela Qwen3.5-2B-Base, uklonio dio koji proizvodi tekst i zamijenio ga malim pokazivačkim slojem (pointer head) od oko milion parametara. Taj sloj ocjenjuje svaku ponuđenu opciju u jednom prolazu kroz model, bez petlje generisanja. Osnovni model je prilagođen LoRA adapterom ranga 16.
Posljedicu takve građe autori navode u samoj objavi. Pošto svi odgovori nastaju u jednom paralelnom prolazu, model je na složenim problemima znatno slabiji od modela s rasuđivanjem. Ne može da piše kôd, vodi razgovor ni sažima dokumente.
Šta je tim izmjerio
Sve brojke u nastavku su mjerenja samog projekta, objavljena u repozitorijumu koda. JevBench, mjerilo na kojem su dobijene, održava treća strana.
- Tačnost na javnom skupu JevBench v1: 0,723, odnosno 167 od 231 zadatka.
- Kalibracija na istom skupu: Brierov skor 0,342 i očekivana greška kalibracije 0,052.
- Po težini zadataka: 1,000 na lakim, 0,875 na standardnim i 0,505 na teškim zadacima.
- Vrijeme odziva na Nvidijinoj kartici RTX 3090 pod WSL2: medijana 115 milisekundi po pitanju, a 95. percentil 299 milisekundi.
- Vrijeme odziva na Appleovom čipu M3 Pro: medijana 153 milisekunde za zadatke kraće od 300 tokena i 234 milisekunde za sve zadatke, mjereno na već učitanom modelu.
- Pouzdanost: na kratkim zadacima klasifikacije koje model nije vidio, odgovori s pouzdanošću od 0,9 ili većom tačni su u oko 95 odsto slučajeva.
Šta brojke ne pokazuju
U objavi piše da je model na tabeli JevBench treći od 33 modela u svojoj klasi, a prvi od 30 kada se izuzmu modeli nešto veći od 2 milijarde parametara. Repozitorijum uz to navodi i ogradu. Javni skup ima samo 231 zadatak, a šest ponovljenih obuka po ranijoj verziji postupka dalo je standardnu devijaciju od 3,2 zadatka. Tim zato navodi da razliku manju od oko 10 zadataka između dva pojedinačna mjerenja treba smatrati neriješenom.
Kako se model pokreće
Paket se instalira komandom pip install strands-decider. Komanda strands-decider ask preuzima s platforme Hugging Face model StrandsAgents/strands-decider-2B-hobson-v19 i odgovara na pitanja o tekstu zadatom opcijom --state. U jednom pozivu može se postaviti više pitanja, što je jeftinije, jer se tekst čita samo jednom.
Komanda strands-decider serve pokreće lokalni server koji na adresi /v1/systemone prima zahtjeve u formatu JSON. U repozitorijumu je i razrađen primjer unutar Strands agenta. U tom primjeru model provjerava poziv alata prije izvršenja, pa agent pita korisnika za grad koji nije naveden, umjesto da ga pretpostavi.
Kôd, težine, podaci za obuku i skripte za obuku javno su dostupni pod licencom Apache-2.0. Tim navodi da cijeli postupak obuke na jednoj kartici RTX 3090 traje oko 11 sati.
„Jedan prolaz kroz model, bez generisanja i bez petlje dekodiranja.“
Izvori
Povezano
Microsoftov ThinkingBox pokazuje da nijedan model ne rješava pola zadataka 20 puta zaredom
Microsoftov tim Copilot Studio objavio je 3. oktobra 2026. na blogu platforme Hugging Face rezultate testa performansi ThinkingBox. Test svaki od 507 poslovnih tokova rada pokreće 20 puta po modelu i ocjenjuje stanje baze podataka koje agent ostavi, a ne njegovu završnu poruku. Microsoft navodi da Claude Opus 5.5 ima najbolji rezultat u pojedinačnom pokušaju, 67,16 odsto, ali da u svih 20 pokušaja rješava samo 241 zadatak. Prema autorima, približno četiri od pet neuspjeha potiču od rukovanja alatima, a ne od rezonovanja.
Microsoft, Hugging Faceprovjereno

Ai2 je objavio AstaBrief, model s otvorenim težinama koji piše izvještaje s citatima
Ai2 je 2. oktobra 2026. objavio težine i podatke za obučavanje modela AstaBrief. Model od istraživačkog pitanja i pronađenih odlomaka iz literature pravi izvještaj s citatima. Prema mjerenju Ai2, režim Fast na platformi Asta u prosjeku napravi izvještaj za 51,1 sekundu, a režim koji pokreće Claude za 178,5 sekundi. Licenca je Apache 2.0, a Ai2 navodi da je evaluacija rađena prije pojave sadašnjih vodećih modela.
Ai2provjereno
Google je predstavio Gemini 4 Argon, ali ga zasad dobijaju samo timovi za sajber bezbjednost
Google je 30. septembra 2026. predstavio model Gemini 4 Argon. Model se postepeno uvodi kod izabranih timova za sajber bezbjednost kroz program Fairwind, a za programere, preduzeća i ostale korisnike datum nije naveden. Uvodna cijena je 2 dolara po milionu ulaznih i 10 dolara po milionu izlaznih tokena, a poslije uvodnog perioda iznosi 4 dolara i 20 dolara. Ograničenje izlaza povećano je sa 64 hiljade na 1 milion tokena. Rezultate mjerenja objavio je sam Google i zasad ih niko izvan programa ne može provjeriti.
Googleprovjereno


