Memorija određuje šta možeš da vrtiš lokalno, a cijena po tokenu da li ti se to isplati
Lokalni model ima jedan tvrd uslov prije nego što se uopšte otvori pitanje brzine, kvaliteta ili licence: težine moraju da stanu u memoriju. Izbor mašine se time svodi na računicu na papiru, a Appleovi stoni računari od 25. avgusta daju tri cijene naspram kojih se ona vodi — 899 dolara za granicu od 32 GB, 2.499 za 128 GB i 5.499 za 512 GB. Ovaj vodič pokazuje šta gdje staje, čime se pokreće, za šta je koja veličina dobra i poslije koliko tokena sopstvena mašina postaje jeftinija od plaćanja po tokenu.
Izvor
Apple introduces new Mac Studio with M5 Max and M5 UltraApple Newsroom · Original objavljen 27. avgusta 2026.
Na pitanje koji je lokalni model najbolji dobiješ mišljenja. Na pitanje koji staje dobiješ broj. Broj parametara, kvantizacija i raspoloživa memorija množe se u jedan jedini odgovor, a svako drugo pitanje — koliko brzo, koliko dobro, kojim pokretačem — dolazi tek poslije njega. Svaka brojka ispod provjerena je na stranicama samih proizvođača. Računica je naša, i tako je i označena.
Memorija je granica
Uzmi broj parametara, pomnoži ga brojem bajtova koje jedan parametar zauzima i dobićeš donju granicu onoga što model traži prije nego što išta uradi. Na četiri bita to je pola bajta po parametru, dakle — naša brojka, ne proizvođačeva — otprilike 0,5 GB po milijardi parametara. Na šesnaest bita to su dva bajta, dakle oko 2 GB po milijardi. Model od osam milijardi parametara na četiri bita traži oko 4 GB. Onaj od trideset milijardi traži oko 15 GB, onaj od sto dvadeset milijardi oko 60 GB, a onaj od šest stotina milijardi oko 300 GB.
Kontekstni prozor uzima svoje povrh toga, a taj dio raste s dužinom razgovora. U računici iznad on nije uračunat, a na dugom ulazu nije mali — zato model koji na papiru staje tačno u praksi obično ne stane. Ostavi rezervu i čitaj brojke iznad kao donju granicu, a ne kao stvarnu potrebu.
Kvantizacija je ono što ove brojke uopšte spušta na kućnu mašinu. Projekat llama.cpp objavljuje cjelobrojne formate od 1,5 bita do 8 bita. Ovaj vodič računa na četiri bita zato što su ona sredina tog raspona; niži formati štede memoriju na račun kvaliteta izlaza, a nijedan od tih projekata ne objavljuje koliko tačno.
Šta gdje staje
Apple je 25. avgusta 2026. predstavio nove stone računare i naplatio ih po memoriji. Mac mini s M6 počinje od 899 dolara, sa 16 GB u osnovi i najviše 32 GB, uz propusnost do 170 GB/s. Verzija s M5 Pro počinje od 1.699 dolara i ide do 64 GB, uz 307 GB/s. Mac Studio s M5 Max počinje od 2.499 dolara i ide do 128 GB, uz do 614 GB/s. Mac Studio s M5 Ultra počinje od 5.499 dolara i ide do 512 GB, uz 1,2 TB/s, što je, kako Apple navodi, pedeset odsto više nego M3 Ultra.
Spoji to s računicom odozgo i ponuda se čita kao tri stepenika. Po našim brojkama, 32 GB drži model od trideset milijardi parametara na četiri bita i ostavlja mjesta za kontekst. Sto dvadeset osam gigabajta drži onaj od sto dvadeset milijardi, uz još dosta prostora. Pet stotina dvanaest gigabajta drži model od šest stotina milijardi u jednom komadu, bez dijeljenja na više mašina; za M5 Ultru Apple tvrdi da na njemu ogromni jezički modeli sa stotinama milijardi parametara rade u cjelini na samom uređaju.
PC s odvojenom Nvidijinom karticom ponaša se drugačije, a ta razlika je važnija od bilo koje pojedinačne brojke. Objedinjena memorija znači da procesor i grafika gledaju u isti bazen, pa je granica modela memorija same mašine. Odvojena kartica ima svoju memoriju, i ona je granica — a ne radna memorija računara, koja pomaže samo tako što prihvati preliv, i to uz gubitak brzine. Koliko memorije neka kartica ima, pročitaj na proizvođačevoj stranici sa specifikacijom prije kupovine, ako mašinu biraš po veličini modela: ta brojka se razlikuje od kartice do kartice i mijenja se s generacijama.
Čime se pokreće
Četiri imena pokrivaju gotovo sve, a nisu četiri zamjene za isti posao.
- Ollama je pokretač s kojim većina počinje. To je pozadinska služba uz biblioteku modela, a vodi se iz komandne linije: komanda
ollama runpreuzme model i otvori sesiju. Njegov blog je mjesto na kojem se podrška za nove modele i objavljuje, a 25. avgusta 2026. dodato je i podešavanje kojim Claude Desktop koristi Ollamu kao posrednika treće strane, pa program koji ionako imaš može da radi s lokalnim modelom. - Projekat llama.cpp je pogon ispod većine ostalog. Sopstveni cilj mu je da jezičke i vizuelne modele izvodi uz najmanje podešavanja i s vrhunskom brzinom, na širokom rasponu hardvera, lokalno i u oblaku. Ima podršku za CUDA, Metal, Vulkan, HIP i SYCL, uz izvođenje podijeljeno između procesora i grafike. Njega uzimaš kad hoćeš zastavice, a ne udobnost.
- LM Studio je aplikacija za računar: grafički način da se lokalni model preuzme, pokrene i da se s njim razgovara, a ispod sebe vrti oba pogona, i llama.cpp i MLX. Njega uzimaš kad za tastaturom sjedi neko ko neće otvoriti terminal.
- MLX je Appleov okvir za nizove, namijenjen mašinskom učenju na Appleovim čipovima. Po čemu se razlikuje: nizovi su u dijeljenoj memoriji, a operacije se izvode na bilo kojem podržanom uređaju bez prenosa podataka.
Za šta je koja veličina dobra
Veličine grubo opisuju kakav posao model može da ponese, a nisu rang-lista. Ovo je polazna tačka po našoj procjeni, a ne rezultat mjerenja.
- Od tri do osam milijardi parametara: razvrstavanje, označavanje, izvlačenje podataka po zadatoj šemi, dopunjavanje teksta i uklanjanje ličnih podataka prije nego što tekst napusti mašinu. Ova veličina se poziva na svaki pritisak tastera ili na svaki red u tabeli, staje na prenosni računar, a memorije ostane i za sve ostalo.
- Oko trideset milijardi: pisanje i prerada nacrta, sažimanje dugih dokumenata, odgovaranje na pitanja nad sopstvenim bilješkama i izmjene koda unutar jedne datoteke. To je ono što staje u 32 GB, dakle najveća klasa koja stane na najjeftiniju mašinu iznad.
- Oko sto dvadeset milijardi: agentski posao u više koraka, gdje model mora da drži plan, i izmjene koda koje se protežu kroz nekoliko datoteka. Traži mašinu sa 128 GB, dakle sredinu Appleove ponude.
- Šest stotina milijardi i naviše: klasa zbog koje se mašina sa 512 GB i prodaje. Razlog da se to vrti kod kuće nije brzina, nego to što cio posao ostaje na jednoj mašini.
Kada se lokalno ne isplati
Pošteno poređenje nije cijena mašine naspram mjesečne pretplate. To je cijena mašine naspram onoga koliko isti posao košta po tokenu kod servisa koji poslužuje iste otvorene težine. Te cijene stoje u našoj tabeli otvorenih modela. Računica ispod je naša, a jedinica posla je milion ulaznih i dvjesta pedeset hiljada izlaznih tokena, što je otprilike oblik razgovora ili agentskog zadatka.
Mac mini s M6 košta 899 dolara i staje mu model od oko trideset milijardi parametara. Qwen3.8-27B se na OpenRouteru naplaćuje 0,425 dolara po milionu ulaznih i 2,55 dolara po milionu izlaznih tokena, pa jedna jedinica košta 1,0625 dolara. Mašina se isplati poslije oko 846 jedinica, dakle poslije otprilike 846 miliona ulaznih i 212 miliona izlaznih tokena.
Mac Studio s M5 Max košta 2.499 dolara i drži model od sto dvadeset milijardi. Model gpt-oss-120b se na OpenRouteru naplaćuje 0,037 dolara po milionu ulaznih i 0,17 dolara po milionu izlaznih, pa jedinica košta 0,0795 dolara. Prelomna tačka je oko 31.434 jedinice, dakle otprilike 31,4 milijarde ulaznih i 7,9 milijardi izlaznih tokena. Mašina je manje od tri puta skuplja od minija, a prelomna tačka je trideset sedam puta dalja, jer o njoj ne odlučuje cijena mašine, nego cijena modela po tokenu.
Isto to sada s najskupljim redom iz naše tabele otvorenih modela. DeepSeek V4 Pro kod samog proizvođača košta 1,32 dolara po milionu ulaznih i 3,96 dolara po milionu izlaznih tokena u vršnim satima, pa jedinica košta 2,31 dolara. Naspram Mac Studija s M5 Ultra od 5.499 dolara, prelomna tačka pada na 2.381 jedinicu, dakle na otprilike 2,4 milijarde ulaznih i 595 miliona izlaznih tokena. Isti posao van vršnih sati, gdje DeepSeek naplaćuje tačno upola manje, pomjera prelomnu tačku na oko 4.761 jedinicu. Najskuplja mašina u ponudi svoju cijenu vrati kroz najmanje tokena, jer je posao zbog kojeg se kupuje ujedno i posao koji se najskuplje iznajmljuje.
Četiri stvari ova računica ne obuhvata, i sve četiri su protiv lokalne mašine. Struja u nju nije uračunata. Nije ni tvoje vrijeme, a lokalni pokretač ga traži. Mašina opslužuje jedan po jedan zahtjev sve dok se ne napravi raspoređivanje na više njih, a cijena po tokenu već u sebi sadrži tuđu grupnu obradu. I cijena po tokenu s vremenom pada, dok mašina koju si kupio ostaje mašina koju si kupio.
Zbog svega toga prelomna tačka i nije razlog zbog kojeg se ide lokalno. Razlog je to što podaci ne izlaze s mašine. Apple Mac Studio prodaje upravo na tome: ogromni modeli rade u cjelini na uređaju, uz potpunu privatnost, bez brojanja tokena i bez brige o rastućem trošku oblaka. Ako su na ulazu zdravstveni kartoni, neobjavljen kod ili klijentovi dokumenti, računica iznad nije argument. Ona je samo cijena odluke koju si već donio.
„run huge LLMs with hundreds of billions of parameters entirely on device“
Izvori
- Apple unveils a more powerful Mac mini featuring the all-new M6 and M5 Pro
- Apple introduces M6 and M5 Ultra for a big leap in performance and AI compute
- llama.cpp — LLM inference in C/C++
- Claude Desktop support with Ollama
- LM Studio blog
- MLX — an array framework for Apple silicon
- gpt-oss-120b on OpenRouter
- Qwen3.8 27B on OpenRouter
- DeepSeek API pricing
Povezano
llama.cpp 0.4.0 dodao je četiri arhitekture modela, prenos preko Apple RDMA i opcije za video
Izdanje 0.4.0 objavljeno je 4. septembra 2026. To je numerisana verzija, a ne jedna od noćnih gradnji. Donosi početnu podršku za Qwen3.8-Flash-Next, za NVIDIA Nemotron-3-Puzzle-75B-A9B, za DSpark kod Nemotrona 3.5 i za nanbeige4.2-3B. Apple RDMA postaje prenos za RPC, video stiže u komandnu liniju, a kvantizacija dobija gornju granicu memorije. Dvije podrazumijevane vrijednosti na serveru su promijenjene, a snimljeno stanje sesije dobija novu oznaku verzije.
llama.cppprovjereno
NVIDIA je objavila besplatan alat koji lokalno izvođenje modela raspoređuje na slobodne računare u kući
Personal AI Router je objavljen 3. septembra 2026. na sajmu IFA. Alat je besplatan, otvorenog koda, i radi na sistemima Windows, macOS i Linux: pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje onom koji ima slobodan kapacitet, pa uporedni podzadaci agenta prestaju da čekaju u redu pred istom grafičkom karticom. Sarađuje s alatima Ollama i LM Studio, a podržava GeForce RTX 20 Series i novije, radne stanice s karticama RTX PRO, DGX Spark i Apple silicijum M4. Memoriju, međutim, ne udružuje, pa model koji ne staje na jedan računar ni dalje ne staje.
NVIDIAprovjereno
Hugging Face objavio je 207 WebGPU kernela i alat koji ih preuzima s Huba
Paket @huggingface/kernels preuzima jednu operaciju grafičkog procesora s Huba i pokreće je u pregledaču koji podržava WebGPU. Svih 207 kernela objavljeno je pod licencom Apache-2.0, a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti i mjerni slučajevi. Hugging Face ih je uporedio sa ONNX Runtime Web 1.30.0 na grafičkom procesoru Apple M4 i navodi geometrijsku sredinu ubrzanja od 2,57 puta na 809 uporedivih slučajeva. Mjereno je samo vrijeme rada na grafičkom procesoru, i to za pojedinačne operacije, a ne za cijele modele.
Hugging Faceprovjereno


