Hugging Face objavio je 207 WebGPU kernela i alat koji ih preuzima s Huba
Paket @huggingface/kernels preuzima jednu operaciju grafičkog procesora s Huba i pokreće je u pregledaču koji podržava WebGPU. Svih 207 kernela objavljeno je pod licencom Apache-2.0, a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti i mjerni slučajevi. Hugging Face ih je uporedio sa ONNX Runtime Web 1.30.0 na grafičkom procesoru Apple M4 i navodi geometrijsku sredinu ubrzanja od 2,57 puta na 809 uporedivih slučajeva. Mjereno je samo vrijeme rada na grafičkom procesoru, i to za pojedinačne operacije, a ne za cijele modele.
Izvor
Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AIHugging Face Blog · Original objavljen 1. septembra 2026.
Hugging Face je 1. septembra 2026. objavio paket @huggingface/kernels, a uz njega i 207 WebGPU kernela, svaki u svom repozitorijumu unutar organizacije webgpu-kernels na Hubu. Kernel je ovdje program koji na grafičkom procesoru izvršava jednu operaciju — sabiranje po elementima, množenje matrica, softmax — a u istom repozitorijumu nalaze se i opis interfejsa, testovi tačnosti, mjerni slučajevi i parametrizovani WGSL šabloni za šejdere. Sam paket je učitavač: traži se identifikator repozitorijuma i verzija ugovora, a vraća se funkcija koja se poziva s tipiziranim nizovima i oblicima tenzora.
Šta sadrži repozitorijum jednog kernela
Šejder koji živi unutar izvršnog okruženja ne može se pregledati, verzionisati ni zamijeniti odvojeno od njega. Objavljivanje svake operacije kao zasebnog repozitorijuma to mijenja. Datoteka manifest.json određuje ulaze, izlaze, atribute, ograničenja tipova i pravila po kojima se izvodi oblik izlaza, pa aplikacija ugovor može da pročita bez ijedne pročitane linije WGSL koda. Testovi tačnosti i mjerni slučajevi putuju u istom repozitorijumu, pa dokaz o kernelu i sam kernel ne mogu da se raziđu.
Broj verzije odnosi se na ugovor koji vidi JavaScript, a ne na ONNX opset ni na reviziju modela. Hugging Face te pojmove namjerno razdvaja: aplikacija zavisi od ugovora po kojem je napisana, a implementacija iza njega može se prepisati a da poziv ostane isti.
- Paket se instalira komandom
npm install @huggingface/kernels@preview. - Funkcija
getKernelprima identifikator repozitorijuma na Hubu i verziju ugovora, a vraća funkciju koja se poziva. - Ulazi se predaju kao tipizirani nizovi s oblicima tenzora, a izlaz učitavač zauzima sam.
- Objavljeni kernel
ai.onnx.Addima četiri varijante: za jednake oblike, za vektorizovani broadcasting, za skalarnu obradu i za opšti broadcasting, gdje se manji ulaz automatski proširuje na oblik većeg. - Svaki repozitorijum sadrži
manifest.json,metadata.json,test.json,bench.jsoni šablone*.wgsl.jinja. - Za pokretanje je potreban pregledač s podrškom za WebGPU, što se u JavaScriptu provjerava izrazom
"gpu" in navigator.
Šta mjerenje pokazuje, a šta ne obuhvata
Hugging Face je svoju zbirku uporedio sa izvršnim okruženjem ONNX Runtime Web 1.30.0-dev.20260826-b1f76d586a na grafičkom procesoru Apple M4. Pošlo se od 1.756 test-slučajeva preko svih 207 operacija, a zadržano je 809 slučajeva u kojima su obje strane dale iste rezultate i pouzdana vremena. Na njima kompanija navodi da su njeni kerneli brži 2,57 puta po geometrijskoj sredini i 1,90 puta po medijani, uz 629 pobjeda, 176 poraza i 4 neriješena ishoda.
Tabela po operacijama skromnija je od te brojke. Sabiranje po elementima trajalo je 0,064 milisekunde naspram 0,227 milisekundi, što je razlika od 3,52 puta. Množenje matrica, operacija koja zauzima najveći dio stvarnog izvođenja modela, trajalo je 0,115 naspram 0,131 milisekunde, dakle 1,14 puta. Softmax je bio brži 2,11 puta, a normalizacija po sloju 2,22 puta.
Dva ishoda daleko premašuju taj raspon. Bilinearni Einsum nad veličinom 4096 trajao je 0,136 milisekundi naspram 1.396 milisekundi, više od 10.000 puta brže, a kumulativni zbir po redovima nad tenzorom 256 puta 4096 bio je brži 301 put. Hugging Face oba slučaja opisuje kao neuobičajena, u kojima opšta implementacija upada u spor put, a ne kao ubrzanje koje treba očekivati.
Ograničenje je navedeno u samoj objavi i važno je svakome ko brojku čita kao obećanje. Mjereno je vrijeme rada na samom grafičkom procesoru, bez učitavanja kernela, pravljenja sesija, slanja ulaza, prevođenja šejdera i čitanja rezultata nazad. Riječ je o pojedinačnim operacijama, a ne o modelima. Iz toga se može zaključiti da će razlika na stvarnoj stranici biti manja od 2,57 puta, mada objava brojku na nivou modela ne daje.
Zašto je pregledaču nedostajao ovaj sloj
WebGPU svim savremenim pregledačima daje isti API, a WGSL isti jezik za šejdere, ali prenosivost nije isto što i brzina. Dva šejdera mogu da izračunaju isti rezultat, a da se ponašaju sasvim različito, zavisno od veličine radne grupe, načina pristupa memoriji, vektorizacije, tipa podataka i spajanja operacija. Najbolji izbor mijenja se s oblikom ulaza, uređajem, pregledačem i raspoloživim mogućnostima WebGPU-a.
Uz kernele je objavljen i Fleet, alat koji ih pokreće i ocjenjuje u pregledaču samog posjetioca. Uz saglasnost korisnika, svako pokretanje šalje dokaze o tačnosti i brzini sa stvarnog hardvera, a to je dio koji se u laboratoriji ne može kupiti. Kompanija navodi da s timom ONNX Runtimea radi na tome da poboljšanja uđu u sam projekat.
„Prenosivost, međutim, ne znači automatski i brzinu.“
Povezano
llama.cpp 0.4.0 dodao je četiri arhitekture modela, prenos preko Apple RDMA i opcije za video
Izdanje 0.4.0 objavljeno je 4. septembra 2026. To je numerisana verzija, a ne jedna od noćnih gradnji. Donosi početnu podršku za Qwen3.8-Flash-Next, za NVIDIA Nemotron-3-Puzzle-75B-A9B, za DSpark kod Nemotrona 3.5 i za nanbeige4.2-3B. Apple RDMA postaje prenos za RPC, video stiže u komandnu liniju, a kvantizacija dobija gornju granicu memorije. Dvije podrazumijevane vrijednosti na serveru su promijenjene, a snimljeno stanje sesije dobija novu oznaku verzije.
llama.cppprovjereno
NVIDIA je objavila besplatan alat koji lokalno izvođenje modela raspoređuje na slobodne računare u kući
Personal AI Router je objavljen 3. septembra 2026. na sajmu IFA. Alat je besplatan, otvorenog koda, i radi na sistemima Windows, macOS i Linux: pronalazi saglasne računare na lokalnoj mreži i svaki nezavisan zahtjev za izvođenje šalje onom koji ima slobodan kapacitet, pa uporedni podzadaci agenta prestaju da čekaju u redu pred istom grafičkom karticom. Sarađuje s alatima Ollama i LM Studio, a podržava GeForce RTX 20 Series i novije, radne stanice s karticama RTX PRO, DGX Spark i Apple silicijum M4. Memoriju, međutim, ne udružuje, pa model koji ne staje na jedan računar ni dalje ne staje.
NVIDIAprovjereno
llama.cpp je dva dana radio na dugom kontekstu, a dobitak je pao na tri različita backenda
Između 29. i 31. avgusta 2026. llama.cpp je isporučio niz izmjena koje gađaju isto mjesto: dio zaključivanja koji postaje sporiji kako kontekst raste. Vulkan, CUDA i putanje za Metal i OpenCL dobili su svaka svoju popravku, uz brojke koje su autori objavili. Uz njih su zatvorena i tri rušenja. Ništa od toga ne traži zastavicu — stiže sa sljedećim izdanjem.
llama.cppprovjereno


