Preskoči na sadržaj
Modelisrednji signalprovjereno

Amazon Bedrock je dobio Kimi K3, a izvršno okruženje za agente kreće za oko dvije sekunde

Bedrock je 18. septembra 2026. objavio dvije izmjene. Kimi K3, za koji Moonshot AI navodi da je prvi otvoreni model s 2,8 biliona parametara, postao je opšte dostupan i prvi je model s otvorenim težinama na Bedrocku koji podržava izričito keširanje prompta. Istovremeno je zamijenjeno i izvršno okruženje u kojem se agenti izvode: AWS je izmjerio hladno pokretanje od 1,9 do 2,0 sekunde na 75. percentilu, za kontejnerske slike od 200 MB do 2 GB, naspram 5,4 do 30 sekundi u ranijoj verziji. Memorija se sada oslobađa tokom sesije, umjesto da ostane zauzeta do najveće izmjerene potrošnje.

Potpisuje Redakcija WebAiRadarObjavljeno 4 min čitanjanapisao modelOsvježeno
Slika: Amazon Web Services

Amazon Bedrock je 18. septembra 2026. objavio dvije izmjene, a one odgovaraju na različita pitanja. Prva je koji model se smije pozvati: Kimi K3 kompanije Moonshot AI je od sada opšte dostupan, s kontekstnim prozorom od 1 milion tokena i izvornim razumijevanjem slike. Druga je u čemu se sopstveni agent izvodi: novo izdanje izvršnog okruženja AgentCore Runtime mijenja kako se memorija naplaćuje i koliko traje hladno pokretanje.

Šta donosi Kimi K3, i ko šta tvrdi

AWS saopštava dostupnost i ponašanje platforme, a podatke o samom modelu prenosi od proizvođača. Moonshot AI navodi da je Kimi K3 njihov najsposobniji model i prvi otvoreni model koji je dosegao 2,8 biliona parametara, uz poboljšanje efikasnosti skaliranja od približno 2,5 puta u odnosu na Kimi K2. AWS dodaje da model spaja izvorno razumijevanje slike s kontekstnim prozorom od 1 milion tokena, a upravo to mijenja posao: veliki repozitorijum koda ili niz skeniranih stranica staju u jedan poziv.

Tvrdnja o platformi je AWS-ova i uža je: Kimi K3 je prvi model s otvorenim težinama na Amazon Bedrocku koji podržava izričito keširanje prompta. Bedrock uz to navodi da se podaci obrađuju unutar AWS-ove granice podataka, da se ne dijele s proizvođačem modela i da se ne koriste za obuku, da je nulto zadržavanje podataka uvijek uključeno za zahtjeve prema modelu i da operateri nemaju pristup tokom izvođenja.

Keširanje prompta je mjesto na kojem se mijenja cijena

Izričito keširanje se ne uključuje samo. Kraj dijela prompta koji se ponavlja označava se oznakom prompt_cache_breakpoint, i to poslije najmanje 1.024 tokena, pa kasniji zahtjevi koji se poklope s tim početkom koriste sačuvani sadržaj. Tokeni upisani u keš naplaćuju se po višoj cijeni, u kešu ostaju najmanje 30 minuta, a poklopljeni zahtjevi se za ulaz naplaćuju po sniženoj cijeni.

Postoji i druga poluga, a ona s keširanjem nema veze. Kimi K3 se poziva kroz profil zaključivanja preko više regija, a AWS navodi da globalni profil global.moonshotai.kimi-k3 košta približno 10 odsto manje od geografskog. Profil us.moonshotai.kimi-k3 obradu zadržava u Sjedinjenim Državama, za one koje obavezuju pravila o mjestu čuvanja podataka. Dostupnost je opisana kao svaka regija AWS-a u kojoj Bedrock postoji, kroz zaključivanje preko više regija.

AgentCore Runtime je promijenio šta se plaća i koliko se čeka

Druga objava mijenja računarski sloj bez servera, zasnovan na mikro virtuelnim mašinama, u kojem se agenti na Amazon Bedrocku izvode. Svaka sesija sada kreće s malom količinom memorije, dobija još po potrebi, i vraća memoriju koja više nije u upotrebi umjesto da je zadrži do kraja sesije. AWS to kaže bez uvijanja: plaća se stvarna potrošnja, a ne najviša.

Hladno pokretanje je preuređeno oko snimka stanja. Okruženje za agenta se pripremi jednom, napravi mu se snimak, i svaka nova instanca se vraća iz tog snimka umjesto da ponavlja cio postupak pokretanja. U AWS-ovom sopstvenom ispitivanju to je dalo hladno pokretanje od 1,9 do 2,0 sekunde na 75. percentilu, za kontejnerske slike od 200 MB do 2 GB, naspram 5,4 do 30 sekundi u verziji V1. Sam raspon je i bio problem, jer je veća slika značila sporije pokretanje.

  • Novo okruženje je dostupno u regijama us-east-1, us-east-2, us-west-2, eu-west-1 i ap-northeast-1.
  • Uključuje se ručno: polje platformVersion se pri pravljenju ili izmjeni okruženja postavlja na V2.
  • Ostalo se ne mijenja. Nema unaprijed zakupljenih resursa, skaliranje i dalje ide do nule, a izolacija sesija je i dalje nametnuta hardverom.

Šta ovo mijenja pri izboru mjesta za agenta

Nijedna od dvije objave nije nezavisno mjerenje i ne treba je tako čitati. Brojke o modelu Kimi K3 su opis koji Moonshot AI daje o sopstvenom modelu, a AWS ga prenosi. Brojke o hladnom pokretanju su AWS-ovo mjerenje sopstvene usluge naspram sopstvene ranije verzije. I jedne i druge su svejedno korisne, jer su to brojke po kojima se računa račun, a ne bodovi na rang-listi.

Iz toga se može zaključiti da zanimljiv nije ni model ni izvršno okruženje zasebno, nego to što su stigli istog dana. Kontekst od 1 milion tokena je skup za ponovno slanje u svakom pozivu, a izričito keširanje i okruženje koje oslobađa neiskorišćenu memoriju su dva mjesta na kojima se taj trošak smanjuje. Jedno moguće objašnjenje te istovremenosti je upravo to: agenti s dugim kontekstom su posao za koji su obje izmjene i građene.

„plaća se stvarna potrošnja, a ne najviša“
Amazon Web Services

Izvori

Povezano

Modelisrednji signal

Microsoftov ThinkingBox pokazuje da nijedan model ne rješava pola zadataka 20 puta zaredom

Microsoftov tim Copilot Studio objavio je 3. oktobra 2026. na blogu platforme Hugging Face rezultate testa performansi ThinkingBox. Test svaki od 507 poslovnih tokova rada pokreće 20 puta po modelu i ocjenjuje stanje baze podataka koje agent ostavi, a ne njegovu završnu poruku. Microsoft navodi da Claude Opus 5.5 ima najbolji rezultat u pojedinačnom pokušaju, 67,16 odsto, ali da u svih 20 pokušaja rješava samo 241 zadatak. Prema autorima, približno četiri od pet neuspjeha potiču od rukovanja alatima, a ne od rezonovanja.

Microsoft, Hugging Faceprovjereno

Grafika instituta Ai2 za AstaBrief: ime modela zelenim slovima na tamnoj podlozi po kojoj su rasute ikone dokumenata, od kojih je nekoliko istaknuto.
Modelislab signal

Ai2 je objavio AstaBrief, model s otvorenim težinama koji piše izvještaje s citatima

Ai2 je 2. oktobra 2026. objavio težine i podatke za obučavanje modela AstaBrief. Model od istraživačkog pitanja i pronađenih odlomaka iz literature pravi izvještaj s citatima. Prema mjerenju Ai2, režim Fast na platformi Asta u prosjeku napravi izvještaj za 51,1 sekundu, a režim koji pokreće Claude za 178,5 sekundi. Licenca je Apache 2.0, a Ai2 navodi da je evaluacija rađena prije pojave sadašnjih vodećih modela.

Ai2provjereno

Dijagram arhitekture modela Strands Decider: lijevo je jezički model čiji je dio za generisanje teksta uklonjen, a desno isti osnovni model Qwen3.5-2B-Base s LoRA adapterom, čiji izlazi ulaze u pokazivački sloj koji ponuđene opcije pretvara u vjerovatnoće po opciji.
Modelisrednji signal

Amazonov Strands Labs objavio je Strands Decider, otvoreni model odlučivanja koji radi lokalno

Strands Labs, eksperimentalni dio projekta Strands Agents, objavio je 1. oktobra 2026. model odlučivanja Strands Decider. Model ne piše tekst: bira jednu od ponuđenih opcija, odgovara sa da ili ne ili daje ocjenu na skali, a uz svaki odgovor navodi stepen pouzdanosti. Prema mjerenju tima, medijana trajanja jedne odluke na Nvidijinoj grafičkoj kartici RTX 3090 iznosi 115 milisekundi. Kôd, težine, podaci za obuku i skripte objavljeni su pod licencom Apache-2.0.

Strands Agentsprovjereno