Preskoči na sadržaj
Mašine i lokalni modelijak signalprovjereno

NVIDIA je objavila besplatan alat koji lokalno izvođenje modela raspoređuje na slobodne računare u kući

Personal AI Router je objavljen 3. septembra 2026. na sajmu IFA. Alat je besplatan, otvorenog koda, i radi na sistemima Windows, macOS i Linux: pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje onom koji ima slobodan kapacitet, pa uporedni podzadaci agenta prestaju da čekaju u redu pred istom grafičkom karticom. Sarađuje s alatima Ollama i LM Studio, a podržava GeForce RTX 20 Series i novije, radne stanice s karticama RTX PRO, DGX Spark i Apple silicijum M4. Memoriju, međutim, ne udružuje, pa model koji ne staje na jedan računar ni dalje ne staje.

Potpisuje Redakcija WebAiRadarObjavljeno 2 min čitanjanapisao model
Slika: NVIDIA

Dobar dio smisla lokalnog izvođenja modela nestane kad četiri podzadatka agenta čekaju u redu pred istom grafičkom karticom. Odgovor kompanije NVIDIA, objavljen 3. septembra 2026. na sajmu IFA, jeste besplatan alat otvorenog koda pod imenom Personal AI Router, skraćeno PAIR. On pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje sistemu koji ima slobodan kapacitet, a raspored mijenja kako se uređaji priključuju i isključuju.

Šta alat radi

PAIR aplikacijama i agentima daje jednu lokalnu krajnju tačku i iza nje prosljeđuje zahtjeve. Pri objavi podržava dvije pozadine koje mnogi već koriste, Ollama i LM Studio, a dolazi i s grafičkim i s terminalskim okruženjem na sistemima Windows, macOS i Linux. Postavljanje se, po opisu proizvođača, svodi na to da se alat instalira na svaki računar, da se računari upare na istoj mreži i da se aplikacija usmjeri na tu krajnju tačku.

Tvrdnja o privatnosti proizlazi iz same građe, a ne iz obećanja u pravilima. NVIDIA navodi da promptovi, datoteke i kontekst agenta ostaju na lokalnoj mreži umjesto da odlaze usluzi izvođenja u oblaku, a alatu veza s internetom za rad nije potrebna. Ona se traži samo za preuzimanje modela.

  • Kartice GeForce RTX 20 Series i novije.
  • Radne stanice s karticama RTX PRO, od arhitekture Turing naviše.
  • NVIDIA DGX Spark.
  • Apple silicijum M4 ili noviji.

Šta alat ne radi

Ovaj dio treba pročitati prije nego što se oko alata isplanira posao. Uređaji ostaju odvojeni sistemi koji rade uporedne poslove, a PAIR ih ne spaja u jedan virtuelni grafički procesor. Model koji ne staje u memoriju jednog računara na mreži ni dalje ne staje: drugi računar donosi veću propusnost na nezavisnim zahtjevima, a ne prostor za veći model.

Ostatak sitnih slova je uobičajen za probno izdanje. Alat je u fazi probnog izdanja (beta), okruženje mu je samo na engleskom, traži 8 gigabajta radne memorije ili više, a proizvođač preporučuje i 20 gigabajta prostora na disku.

Šta je objavljeno uz njega

U istoj objavi su i brojke o brzini izvođenja, i one su mjerenje samog proizvođača, a ne nezavisan test. Stižu kroz pozadine koje se lokalno i inače koriste, pa se dobijaju osvježavanjem, bez ijedne izmjene u postavci.

  • llama.cpp: do 1,9 puta veća propusnost na kartici GeForce RTX 5090, iz optimizacije jezgara, boljeg spekulativnog dekodiranja i bržeg punjenja konteksta, navodi NVIDIA.
  • vLLM: 1,2 puta na radnoj stanici RTX PRO 6000 Blackwell i do 1,4 puta na dva povezana sistema DGX Spark, navodi NVIDIA.
  • Računari NVIDIA RTX Spark sa sistemom Windows stižu u oktobru 2026.
PAIR ih ne spaja u jedan virtuelni grafički procesor.
NVIDIA, često postavljana pitanja o alatu PAIR

Izvori

Povezano

LLAMA.CPP0.4.0četiri arhitekture i jedan nov prenos
Mašine i lokalni modelisrednji signal

llama.cpp 0.4.0 dodao je četiri arhitekture modela, prenos preko Apple RDMA i opcije za video

Izdanje 0.4.0 objavljeno je 4. septembra 2026. To je numerisana verzija, a ne jedna od noćnih gradnji. Donosi početnu podršku za Qwen3.8-Flash-Next, za NVIDIA Nemotron-3-Puzzle-75B-A9B, za DSpark kod Nemotrona 3.5 i za nanbeige4.2-3B. Apple RDMA postaje prenos za RPC, video stiže u komandnu liniju, a kvantizacija dobija gornju granicu memorije. Dvije podrazumijevane vrijednosti na serveru su promijenjene, a snimljeno stanje sesije dobija novu oznaku verzije.

llama.cppprovjereno

Mašine i lokalni modelijak signal

Hugging Face objavio je 207 WebGPU kernela i alat koji ih preuzima s Huba

Paket @huggingface/kernels preuzima jednu operaciju grafičkog procesora s Huba i pokreće je u pregledaču koji podržava WebGPU. Svih 207 kernela objavljeno je pod licencom Apache-2.0, a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti i mjerni slučajevi. Hugging Face ih je uporedio sa ONNX Runtime Web 1.30.0 na grafičkom procesoru Apple M4 i navodi geometrijsku sredinu ubrzanja od 2,57 puta na 809 uporedivih slučajeva. Mjereno je samo vrijeme rada na grafičkom procesoru, i to za pojedinačne operacije, a ne za cijele modele.

Hugging Faceprovjereno

Mašine i lokalni modelisrednji signal

llama.cpp je dva dana radio na dugom kontekstu, a dobitak je pao na tri različita backenda

Između 29. i 31. avgusta 2026. llama.cpp je isporučio niz izmjena koje gađaju isto mjesto: dio zaključivanja koji postaje sporiji kako kontekst raste. Vulkan, CUDA i putanje za Metal i OpenCL dobili su svaka svoju popravku, uz brojke koje su autori objavili. Uz njih su zatvorena i tri rušenja. Ništa od toga ne traži zastavicu — stiže sa sljedećim izdanjem.

llama.cppprovjereno