Preskoči na sadržaj
Mašine i lokalni modelisrednji signalprovjereno

llama.cpp 0.4.0 dodao je četiri arhitekture modela, prenos preko Apple RDMA i opcije za video

Izdanje 0.4.0 objavljeno je 4. septembra 2026. To je numerisana verzija, a ne jedna od noćnih gradnji. Donosi početnu podršku za Qwen3.8-Flash-Next, za NVIDIA Nemotron-3-Puzzle-75B-A9B, za DSpark kod Nemotrona 3.5 i za nanbeige4.2-3B. Apple RDMA postaje prenos za RPC, video stiže u komandnu liniju, a kvantizacija dobija gornju granicu memorije. Dvije podrazumijevane vrijednosti na serveru su promijenjene, a snimljeno stanje sesije dobija novu oznaku verzije.

Potpisuje Redakcija WebAiRadarObjavljeno 2 min čitanjanapisao model

Izvor

llama.cpp v0.4.0

llama.cpp · Original objavljen 4. septembra 2026.

Projekat llama.cpp gotovo svakog dana objavi noćnu gradnju, a o njima po pravilu nema šta da se čita. Verzija 0.4.0 objavljena je 4. septembra 2026. Ona spada u drugu vrstu: numerisana je, imenuje četiri arhitekture modela koje se prije nje nisu učitavale, i mijenja dvije podrazumijevane vrijednosti na koje se pokrenut server već oslanja.

Četiri arhitekture koje se ranije nisu učitavale

Najvažnije stavke su nove porodice modela, a ne nove kontrolne tačke. Qwen3.8-Flash-Next stiže pod unutrašnjim imenom qwen4exp, a bilješke uz izdanje kažu da je podrška početna i da optimizacije tek slijede. Ta razlika je važna: težine se učitavaju, ali brzina kojom rade nije ona koju projekat namjerava da isporuči.

Ostale tri su NVIDIA Nemotron-3-Puzzle-75B-A9B, podrška za DSpark kod Nemotrona 3.5 i nanbeige4.2-3B. Uz njih je DeepSeek-V4 dobio obradu slike na ulazu i dodat je DeepSeek-V4-Flash-Vision-Exp, dok su ispravljeni obrada slike kod Gemme 4 i priprema ulaza kod modela Idefics3.

  • Qwen3.8-Flash-Next, uz napomenu da je podrška početna i da optimizacije tek slijede.
  • NVIDIA Nemotron-3-Puzzle-75B-A9B.
  • Podrška za DSpark kod Nemotrona 3.5.
  • nanbeige4.2-3B.

Nov prenos, i video stiže u komandnu liniju

Projekat llama.cpp koristi RPC kao način da jedan model raspodijeli na više mašina, a izdanje 0.4.0 tome dodaje Apple RDMA kao prenos, uz nove događajne i asinhrone API-je za RPC. Na stolu s dva Mac računara to je druga žica ispod iste mogućnosti, a ne nova mogućnost.

Video na ulazu je iz koda biblioteke prešao u komandnu liniju. Izdanje dodaje argumente --video-*, mogućnosti za video i pokretanje u pomoćnicima za više modaliteta, i server koji prima adrese s prefiksom data: za video i zvuk. Server je uz to dobio ograničenje veličine konteksta po slotu, pa jedan dug razgovor više ne određuje gornju granicu svakom drugom slotu u istom procesu.

Dvije podrazumijevane vrijednosti su promijenjene, a snimljeno stanje ima novu verziju

Kvantizacija sada ima gornju granicu radne memorije i redove obrađuje u trakama, a učitavanje modela više ne pravi vrhunac potrošnje kakav je pravilo ranije. To troje zajedno omogućava da se veliki model kvantizuje na mašini koja ga ranije nije mogla primiti, i to je praktičan razlog za nadogradnju, prije nego spisak modela.

Tri izmjene mogu da pokvare ono što već radi. Čuvanje rezonovanja je sada podrazumijevano uključeno, server odbija unaprijed popunjene poruke pomoćnika koje sadrže pozive alata, a verzije sesije i stanja su podignute zbog praćenja tokena po ćeliji KV keša. Bilješke posljednju stavku navode među izmjenama API-ja i ne kažu šta se dešava s datotekama koje je zapisala verzija 0.3.0, pa svaki program koji vraća snimljeno stanje treba isprobati prije nego što se nadogradnja proglasi rutinskom.

  • Čuvanje rezonovanja je podrazumijevano uključeno, a stvarno stanje te postavke upisuje se u dnevnik.
  • Server odbija unaprijed popunjene poruke pomoćnika koje sadrže pozive alata.
  • Biblioteka ggml je prešla sa 0.22.0 na 0.23.0, uz rijetku flash pažnju, asinhrono izvršavanje i praćenje zavisnosti pri dodjeli memorije.
Izdanje 0.4.0 donosi početnu podršku za Qwen3.8-Flash-Next i Nemotron-3-Puzzle.
llama.cpp, bilješke uz izdanje 0.4.0

Povezano

Mašine i lokalni modelijak signal

NVIDIA je objavila besplatan alat koji lokalno izvođenje modela raspoređuje na slobodne računare u kući

Personal AI Router je objavljen 3. septembra 2026. na sajmu IFA. Alat je besplatan, otvorenog koda, i radi na sistemima Windows, macOS i Linux: pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje onom koji ima slobodan kapacitet, pa uporedni podzadaci agenta prestaju da čekaju u redu pred istom grafičkom karticom. Sarađuje s alatima Ollama i LM Studio, a podržava GeForce RTX 20 Series i novije, radne stanice s karticama RTX PRO, DGX Spark i Apple silicijum M4. Memoriju, međutim, ne udružuje, pa model koji ne staje na jedan računar ni dalje ne staje.

NVIDIAprovjereno

Mašine i lokalni modelijak signal

Hugging Face objavio je 207 WebGPU kernela i alat koji ih preuzima s Huba

Paket @huggingface/kernels preuzima jednu operaciju grafičkog procesora s Huba i pokreće je u pregledaču koji podržava WebGPU. Svih 207 kernela objavljeno je pod licencom Apache-2.0, a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti i mjerni slučajevi. Hugging Face ih je uporedio sa ONNX Runtime Web 1.30.0 na grafičkom procesoru Apple M4 i navodi geometrijsku sredinu ubrzanja od 2,57 puta na 809 uporedivih slučajeva. Mjereno je samo vrijeme rada na grafičkom procesoru, i to za pojedinačne operacije, a ne za cijele modele.

Hugging Faceprovjereno

Mašine i lokalni modelisrednji signal

llama.cpp je dva dana radio na dugom kontekstu, a dobitak je pao na tri različita backenda

Između 29. i 31. avgusta 2026. llama.cpp je isporučio niz izmjena koje gađaju isto mjesto: dio zaključivanja koji postaje sporiji kako kontekst raste. Vulkan, CUDA i putanje za Metal i OpenCL dobili su svaka svoju popravku, uz brojke koje su autori objavili. Uz njih su zatvorena i tri rušenja. Ništa od toga ne traži zastavicu — stiže sa sljedećim izdanjem.

llama.cppprovjereno