Preskoči na sadržaj
Modelisrednji signalprovjereno

AWS je uveo keširanje modela na SageMaker HyperPodu i izmjerio oko 60 odsto brže širenje

SageMaker HyperPod sada može da čuva težine modela na lokalnom NVMe disku čvora i da unaprijed povuče kontejnersku sliku, pa se pod koji je ranije čekao minutima pokreće za nekoliko sekundi. AWS objavljuje mjerenja na modelima od 57 do 145 gigabajta: oko 60 odsto brže širenje i keš slike koji uklanja preko dva minuta preuzimanja, odnosno 97 odsto tog vremena. Brojke su proizvođačeve i objavljene su bez opisa ogleda. Istog dana je AWS u Amazon Bedrock Managed Knowledge Base uveo i TwelveLabs Marengo 3.0 kao model za vektorske reprezentacije (embedding), pa baza znanja može da indeksira ono što se na snimku vidi, a ne samo ono što je na njemu izgovoreno.

Potpisuje Redakcija WebAiRadarObjavljeno 2 min čitanjanapisao model

Hladan start je najskuplji dio posluživanja velikog modela iza automatskog širenja. Prije nego što odgovori na išta, novi pod preuzima kontejnersku sliku sa ECR-a i težine modela sa S3 ili FSx-a, a kod modela od 145 gigabajta to traje desetinama minuta. Amazon SageMaker HyperPod je sada dobio keširanje modela, koje oba preuzimanja uklanja iz vremena pokretanja. AWS ga je objavio 11. septembra 2026. Dostupno je svim korisnicima u svakom regionu u kojem HyperPod radi.

Dva keša i rezervno rješenje koje ih čini neobaveznim

Keširanje modela ima dva nezavisna dijela. Keš težina čuva težine modela na lokalnom NVMe disku čvora, pa ih pod čita s lokalnog diska umjesto da ih preuzima preko mreže sa S3 ili FSx-a. Keš slike unaprijed povlači kontejnersku sliku na čvorove klastera, pa pod pri pokretanju potpuno preskače preuzimanje sa ECR-a.

Oba keša mogu i da promaše. AWS navodi da pod koji se nađe na čvoru bez pripremljenog keša automatski prelazi na preuzimanje s izvornog mjesta, pa promašaj košta staro vrijeme pokretanja, a ne zaglavljen ili neuspio pod. Mogućnost se uključuje kroz HyperPod Inference Operator, dodavanjem odjeljka modelCacheConfig u resurs InferenceEndpointConfig ili JumpStartModel.

Šta brojke kažu, a šta izostavljaju

AWS objavljuje mjerenja na modelima od 57 do 145 gigabajta: oko 60 odsto brže širenje i smanjenje vremena preuzimanja slike za 97 odsto, čime se uklanja preko dva minuta čekanja. Navodi i da dobitak raste s veličinom modela, što slijedi iz onoga što keš zamjenjuje, jer je preuzimanje srazmjerno veličini težina, a čitanje s lokalnog diska nije.

Objava ne opisuje sam ogled. Ne imenuje modele, ne navodi tipove instanci, nema polazne brojke u sekundama i ne objašnjava kako je hladan čvor razlikovan od pripremljenog, pa je riječ o mjerenju proizvođača, a ne o nezavisnom mjerenju. Cijena se takođe ne pominje, pa se iz objave ne vidi koliko košta držanje težina na lokalnom NVMe disku.

Baza znanja u Bedrocku prestaje da zavisi od transkripcije

Amazon Bedrock Managed Knowledge Base je i ranije umio da pretražuje snimke, tako što bi zvuk i video pretvorio u tekst pa napravio vektorske reprezentacije tog teksta. Model TwelveLabs Marengo 3.0, od istog dana dostupan u toj upravljanoj bazi znanja, umjesto toga u vektorsku reprezentaciju upisuje same vizuelne prizore, govor i signale iz snimka, za šta AWS navodi da hvata značenje do kojeg sama transkripcija ne dopire.

Vektori imaju 512 dimenzija, a rezultat pretrage sadrži vrijeme početka i kraja pronađenog isječka, pa aplikacija može da skoči na taj trenutak umjesto na cijelu datoteku. Podjela snimka na isječke se podešava. AWS tačnost pretrage opisuje kao vrhunsku, ali ne navodi nijedno mjerilo, a u objavi nema ni spiska regiona ni cijena.

„Mjerenja na modelima od 57 do 145 gigabajta pokazuju oko 60 odsto brže širenje“
AWS, objava o SageMaker HyperPodu

Izvori

Povezano

Modelisrednji signal

Microsoftov ThinkingBox pokazuje da nijedan model ne rješava pola zadataka 20 puta zaredom

Microsoftov tim Copilot Studio objavio je 3. oktobra 2026. na blogu platforme Hugging Face rezultate testa performansi ThinkingBox. Test svaki od 507 poslovnih tokova rada pokreće 20 puta po modelu i ocjenjuje stanje baze podataka koje agent ostavi, a ne njegovu završnu poruku. Microsoft navodi da Claude Opus 5.5 ima najbolji rezultat u pojedinačnom pokušaju, 67,16 odsto, ali da u svih 20 pokušaja rješava samo 241 zadatak. Prema autorima, približno četiri od pet neuspjeha potiču od rukovanja alatima, a ne od rezonovanja.

Microsoft, Hugging Faceprovjereno

Grafika instituta Ai2 za AstaBrief: ime modela zelenim slovima na tamnoj podlozi po kojoj su rasute ikone dokumenata, od kojih je nekoliko istaknuto.
Modelislab signal

Ai2 je objavio AstaBrief, model s otvorenim težinama koji piše izvještaje s citatima

Ai2 je 2. oktobra 2026. objavio težine i podatke za obučavanje modela AstaBrief. Model od istraživačkog pitanja i pronađenih odlomaka iz literature pravi izvještaj s citatima. Prema mjerenju Ai2, režim Fast na platformi Asta u prosjeku napravi izvještaj za 51,1 sekundu, a režim koji pokreće Claude za 178,5 sekundi. Licenca je Apache 2.0, a Ai2 navodi da je evaluacija rađena prije pojave sadašnjih vodećih modela.

Ai2provjereno

Dijagram arhitekture modela Strands Decider: lijevo je jezički model čiji je dio za generisanje teksta uklonjen, a desno isti osnovni model Qwen3.5-2B-Base s LoRA adapterom, čiji izlazi ulaze u pokazivački sloj koji ponuđene opcije pretvara u vjerovatnoće po opciji.
Modelisrednji signal

Amazonov Strands Labs objavio je Strands Decider, otvoreni model odlučivanja koji radi lokalno

Strands Labs, eksperimentalni dio projekta Strands Agents, objavio je 1. oktobra 2026. model odlučivanja Strands Decider. Model ne piše tekst: bira jednu od ponuđenih opcija, odgovara sa da ili ne ili daje ocjenu na skali, a uz svaki odgovor navodi stepen pouzdanosti. Prema mjerenju tima, medijana trajanja jedne odluke na Nvidijinoj grafičkoj kartici RTX 3090 iznosi 115 milisekundi. Kôd, težine, podaci za obuku i skripte objavljeni su pod licencom Apache-2.0.

Strands Agentsprovjereno