llama.cpp 0.4.0 dodao je četiri arhitekture modela, prenos preko Apple RDMA i opcije za video
Izdanje 0.4.0 objavljeno je 4. septembra 2026. To je numerisana verzija, a ne jedna od noćnih gradnji. Donosi početnu podršku za Qwen3.8-Flash-Next, za NVIDIA Nemotron-3-Puzzle-75B-A9B, za DSpark kod Nemotrona 3.5 i za nanbeige4.2-3B. Apple RDMA postaje prenos za RPC, video stiže u komandnu liniju, a kvantizacija dobija gornju granicu memorije. Dvije podrazumijevane vrijednosti na serveru su promijenjene, a snimljeno stanje sesije dobija novu oznaku verzije.
Projekat llama.cpp gotovo svakog dana objavi noćnu gradnju, a o njima po pravilu nema šta da se čita. Verzija 0.4.0 objavljena je 4. septembra 2026. Ona spada u drugu vrstu: numerisana je, imenuje četiri arhitekture modela koje se prije nje nisu učitavale, i mijenja dvije podrazumijevane vrijednosti na koje se pokrenut server već oslanja.
Četiri arhitekture koje se ranije nisu učitavale
Najvažnije stavke su nove porodice modela, a ne nove kontrolne tačke. Qwen3.8-Flash-Next stiže pod unutrašnjim imenom qwen4exp, a bilješke uz izdanje kažu da je podrška početna i da optimizacije tek slijede. Ta razlika je važna: težine se učitavaju, ali brzina kojom rade nije ona koju projekat namjerava da isporuči.
Ostale tri su NVIDIA Nemotron-3-Puzzle-75B-A9B, podrška za DSpark kod Nemotrona 3.5 i nanbeige4.2-3B. Uz njih je DeepSeek-V4 dobio obradu slike na ulazu i dodat je DeepSeek-V4-Flash-Vision-Exp, dok su ispravljeni obrada slike kod Gemme 4 i priprema ulaza kod modela Idefics3.
- Qwen3.8-Flash-Next, uz napomenu da je podrška početna i da optimizacije tek slijede.
- NVIDIA Nemotron-3-Puzzle-75B-A9B.
- Podrška za DSpark kod Nemotrona 3.5.
- nanbeige4.2-3B.
Nov prenos, i video stiže u komandnu liniju
Projekat llama.cpp koristi RPC kao način da jedan model raspodijeli na više mašina, a izdanje 0.4.0 tome dodaje Apple RDMA kao prenos, uz nove događajne i asinhrone API-je za RPC. Na stolu s dva Mac računara to je druga žica ispod iste mogućnosti, a ne nova mogućnost.
Video na ulazu je iz koda biblioteke prešao u komandnu liniju. Izdanje dodaje argumente --video-*, mogućnosti za video i pokretanje u pomoćnicima za više modaliteta, i server koji prima adrese s prefiksom data: za video i zvuk. Server je uz to dobio ograničenje veličine konteksta po slotu, pa jedan dug razgovor više ne određuje gornju granicu svakom drugom slotu u istom procesu.
Dvije podrazumijevane vrijednosti su promijenjene, a snimljeno stanje ima novu verziju
Kvantizacija sada ima gornju granicu radne memorije i redove obrađuje u trakama, a učitavanje modela više ne pravi vrhunac potrošnje kakav je pravilo ranije. To troje zajedno omogućava da se veliki model kvantizuje na mašini koja ga ranije nije mogla primiti, i to je praktičan razlog za nadogradnju, prije nego spisak modela.
Tri izmjene mogu da pokvare ono što već radi. Čuvanje rezonovanja je sada podrazumijevano uključeno, server odbija unaprijed popunjene poruke pomoćnika koje sadrže pozive alata, a verzije sesije i stanja su podignute zbog praćenja tokena po ćeliji KV keša. Bilješke posljednju stavku navode među izmjenama API-ja i ne kažu šta se dešava s datotekama koje je zapisala verzija 0.3.0, pa svaki program koji vraća snimljeno stanje treba isprobati prije nego što se nadogradnja proglasi rutinskom.
- Čuvanje rezonovanja je podrazumijevano uključeno, a stvarno stanje te postavke upisuje se u dnevnik.
- Server odbija unaprijed popunjene poruke pomoćnika koje sadrže pozive alata.
- Biblioteka ggml je prešla sa 0.22.0 na 0.23.0, uz rijetku flash pažnju, asinhrono izvršavanje i praćenje zavisnosti pri dodjeli memorije.
„Izdanje 0.4.0 donosi početnu podršku za Qwen3.8-Flash-Next i Nemotron-3-Puzzle.“
Povezano
NVIDIA je objavila besplatan alat koji lokalno izvođenje modela raspoređuje na slobodne računare u kući
Personal AI Router je objavljen 3. septembra 2026. na sajmu IFA. Alat je besplatan, otvorenog koda, i radi na sistemima Windows, macOS i Linux: pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje onom koji ima slobodan kapacitet, pa uporedni podzadaci agenta prestaju da čekaju u redu pred istom grafičkom karticom. Sarađuje s alatima Ollama i LM Studio, a podržava GeForce RTX 20 Series i novije, radne stanice s karticama RTX PRO, DGX Spark i Apple silicijum M4. Memoriju, međutim, ne udružuje, pa model koji ne staje na jedan računar ni dalje ne staje.
NVIDIAprovjereno
Hugging Face objavio je 207 WebGPU kernela i alat koji ih preuzima s Huba
Paket @huggingface/kernels preuzima jednu operaciju grafičkog procesora s Huba i pokreće je u pregledaču koji podržava WebGPU. Svih 207 kernela objavljeno je pod licencom Apache-2.0, a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti i mjerni slučajevi. Hugging Face ih je uporedio sa ONNX Runtime Web 1.30.0 na grafičkom procesoru Apple M4 i navodi geometrijsku sredinu ubrzanja od 2,57 puta na 809 uporedivih slučajeva. Mjereno je samo vrijeme rada na grafičkom procesoru, i to za pojedinačne operacije, a ne za cijele modele.
Hugging Faceprovjereno
llama.cpp je dva dana radio na dugom kontekstu, a dobitak je pao na tri različita backenda
Između 29. i 31. avgusta 2026. llama.cpp je isporučio niz izmjena koje gađaju isto mjesto: dio zaključivanja koji postaje sporiji kako kontekst raste. Vulkan, CUDA i putanje za Metal i OpenCL dobili su svaka svoju popravku, uz brojke koje su autori objavili. Uz njih su zatvorena i tri rušenja. Ništa od toga ne traži zastavicu — stiže sa sljedećim izdanjem.
llama.cppprovjereno


