Preskoči na sadržaj
Mašine i lokalni modelisrednji signalprovjereno

llama.cpp je dva dana radio na dugom kontekstu, a dobitak je pao na tri različita backenda

Između 29. i 31. avgusta 2026. llama.cpp je isporučio niz izmjena koje gađaju isto mjesto: dio zaključivanja koji postaje sporiji kako kontekst raste. Vulkan, CUDA i putanje za Metal i OpenCL dobili su svaka svoju popravku, uz brojke koje su autori objavili. Uz njih su zatvorena i tri rušenja. Ništa od toga ne traži zastavicu — stiže sa sljedećim izdanjem.

Potpisuje Redakcija WebAiRadarObjavljeno 3 min čitanjanapisao modelOsvježeno
Slika: github.com

Izvor

b10707

llama.cpp · Original objavljen 31. avgusta 2026.

Čitano jedno po jedno, posljednja tri dana llama.cpp-a izgledaju kao dnevnik izmjena. Čitano zajedno, to je jedan posao: dugi kontekst je mjesto na kojem lokalno zaključivanje postaje skupo, i četiri odvojene izmjene krenule su na njega, na četiri različita backenda.

Dugi kontekst, tri popravke

Najveća pojedinačna brojka dolazi iz jedne jedine pomoćne funkcije. Ona je prolazila kroz ćelije keša čiji je broj rastao s kontekstom, i taj posao je sada uklonjen. Na kartici RTX PRO 6000 s modelom Qwen3.8-Flash-Next, na 132.000 tokena konteksta, generisanje se popelo sa 33,6 na 50,9 tokena u sekundi, u izdanju b10707. Obrada upita ostaje ista, a na kratkim upitima se ne vidi ništa.

Vulkan je dobio sortiranje po ciframa za izbor najboljih k kandidata, za k od 1024 naviše, koliko traži model Qwen 3.8 Flash Next. Na mašini DGX Spark, na 32.768 tokena konteksta, obrada upita popela se sa 390,1 na 520,8 tokena u sekundi — iznad 498,5 koliko je na istoj mašini izmjereno na CUDA-i. Na nultoj dubini konteksta isti kod je nešto sporiji, pa dobitak pripada dugom kontekstu i ničemu drugom.

Na CUDA-i je pomoćni kod koji dodjeljuje niti u warpu tokenima koristio prečicu samo kad broj aktivnih eksperata dijeli warp bez ostatka, uz jedan jedini ručno upisan izuzetak, gdje se 6 dopunjavalo na 8. Kad se ta dopuna uopšti na sljedeći stepen dvojke, prečicu dobija i broj 10. Na istoj kartici RTX PRO 6000, na 55.000 tokena, obrada upita popela se sa 2.334 na 2.600 tokena u sekundi, u izdanju b10704.

Mali paketi na AMD-u

Dvije konstante u Vulkanovoj putanji za množenje matrice i vektora ponovo su podešene za kartice s arhitekturom RDNA3, a dobitak počinje kod paketa od pet kolona. U autorovom mikro-mjerenju najviše dobijaju četvorobitni kvantizovani tipovi, do 46,2 odsto na osam kolona. Izmjena je uslovljena AMD-ovim hardverom te arhitekture, a autor je imao jednu jedinu mašinu sa Strix Halom, pa ostaje otvoreno da li se iste brojke pojavljuju i na drugim karticama te generacije.

Telefonski čipovi dobili su svoj prolaz

Na generaciji Adreno X2 OpenCL sada podrazumijevano koristi brži način množenja matrica. Autor izmjene mjeri obradu upita za model gpt-oss-20b kao oko 25 odsto bržu, uz drugu izmjenu koja vrijedi približno 9 odsto na modelu gemma-3n-E4B. Brzina generisanja tokena u oba slučaja ostaje nepromijenjena. Oboje je izašlo u izdanju b10687.

Hexagon backend je prestao da broj Qualcommovih NPU jezgara čita iz unaprijed upisane tablice i sada ga traži od čipa u toku rada, u izdanju b10693. Ista izmjena zaustavlja zauzimanje NPU sesija dok se backend pokreće i uspostavlja ih tek kad se model zaista učita. Od uređaja koje je autor testirao, tačno jedan telefon odgovara na novi upit, pa se na svemu ostalom i dalje koriste upisane vrijednosti.

Tri zatvorena rušenja

Prijava greške od 29. avgusta pokazala je da se llama.cpp ruši na Appleovom Metal backendu kad kvantizovana težina sretne operand u formatu F16 na putanji za jedan token. Jezgro koje taj oblik traži nikada nije napisano, a kod je upotrijebio prazan pokazivač koji je zbog toga dobio, umjesto da posao odbije. Ispravljeno u izdanju b10691.

Drugo rušenje, pri pomjeranju konteksta s nekvantizovanim K kešom, zatvoreno je istog jutra u izdanju b10690. Odvojeno od toga, jedan klijent nije mogao da radi s više RPC servera odjednom: pokazivači na udaljene bafere slali su se i kad je bafer pripadao drugom serveru, pa je taj server dobijao adresu koja kod njega ništa ne znači i odbijao da izgradi graf. Ispravka šalje pokazivač samo kad bafer pripada baš toj vezi, a uz nju je dodat i test s dva servera, jer greška ne postoji kad je server samo jedan.

Isti redoslijed obilaska, isti argumenti povratnog poziva, pa se ponašanje ne mijenja.
poruka uz izmjenu u izdanju llama.cpp b10707

Izvori

Ispravke

  • Ovaj tekst je nastao spajanjem osam odvojenih vijesti o llama.cpp-u objavljenih 30. i 31. avgusta 2026. Nijedna činjenica, brojka ni mjerenje iz njih nije promijenjeno — sve stoje ovdje, zajedno. Adrese svih osam trajno preusmjeravaju na ovu stranicu. Razlog spajanja je urednički: osam bilježaka o istom projektu u dva dana čitaocu je davalo dnevnik izmjena umjesto pregleda, a tek zajedno se vidi da sve gađaju isto mjesto — dugi kontekst.

Povezano

LLAMA.CPP0.4.0četiri arhitekture i jedan nov prenos
Mašine i lokalni modelisrednji signal

llama.cpp 0.4.0 dodao je četiri arhitekture modela, prenos preko Apple RDMA i opcije za video

Izdanje 0.4.0 objavljeno je 4. septembra 2026. To je numerisana verzija, a ne jedna od noćnih gradnji. Donosi početnu podršku za Qwen3.8-Flash-Next, za NVIDIA Nemotron-3-Puzzle-75B-A9B, za DSpark kod Nemotrona 3.5 i za nanbeige4.2-3B. Apple RDMA postaje prenos za RPC, video stiže u komandnu liniju, a kvantizacija dobija gornju granicu memorije. Dvije podrazumijevane vrijednosti na serveru su promijenjene, a snimljeno stanje sesije dobija novu oznaku verzije.

llama.cppprovjereno

Mašine i lokalni modelijak signal

NVIDIA je objavila besplatan alat koji lokalno izvođenje modela raspoređuje na slobodne računare u kući

Personal AI Router je objavljen 3. septembra 2026. na sajmu IFA. Alat je besplatan, otvorenog koda, i radi na sistemima Windows, macOS i Linux: pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje onom koji ima slobodan kapacitet, pa uporedni podzadaci agenta prestaju da čekaju u redu pred istom grafičkom karticom. Sarađuje s alatima Ollama i LM Studio, a podržava GeForce RTX 20 Series i novije, radne stanice s karticama RTX PRO, DGX Spark i Apple silicijum M4. Memoriju, međutim, ne udružuje, pa model koji ne staje na jedan računar ni dalje ne staje.

NVIDIAprovjereno

Mašine i lokalni modelijak signal

Hugging Face objavio je 207 WebGPU kernela i alat koji ih preuzima s Huba

Paket @huggingface/kernels preuzima jednu operaciju grafičkog procesora s Huba i pokreće je u pregledaču koji podržava WebGPU. Svih 207 kernela objavljeno je pod licencom Apache-2.0, a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti i mjerni slučajevi. Hugging Face ih je uporedio sa ONNX Runtime Web 1.30.0 na grafičkom procesoru Apple M4 i navodi geometrijsku sredinu ubrzanja od 2,57 puta na 809 uporedivih slučajeva. Mjereno je samo vrijeme rada na grafičkom procesoru, i to za pojedinačne operacije, a ne za cijele modele.

Hugging Faceprovjereno