Liquid AI objavio nacrtne modele koji kraćaju odziv poziva alata za 57 odsto
DSpark kontrolne tačke dodaju spekulativno dekodiranje trima modelima iz porodice LFM2.5. Liquid AI navodi do 3,18 puta veći protok na grafičkoj kartici i 2,87 puta na uređaju, uz nepromijenjen kvalitet izlaza, i podršku za llama.cpp i SGLang od prvog dana.
Izvor
Up to 3.2x Faster Inference with LFM2.5-DSparkHugging Face Blog · Original objavljen 20. avgust 2026
Liquid AI je objavio DSpark nacrtne kontrolne tačke za tri modela iz porodice LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B i LFM2.5-8B-A1B. One dodaju put spekulativnog dekodiranja koji malo povećanje memorije mijenja za veliko ubrzanje, a kompanija navodi da kvalitet izlaza ostaje isti.
Brojke
Liquid AI navodi do 3,18 puta veći protok na grafičkoj kartici i do 2,87 puta na uređaju. Za agente je važnija druga brojka: odziv poziva alata pada u prosjeku za 57 odsto kod modela LFM2.5-2.6B. Agentske petlje najviše vremena provedu čekajući kratke pozive alata, pa prepolovljeno čekanje mijenja šta je uopšte upotrebljivo na prenosivom računaru ili telefonu.
Podrška za llama.cpp i SGLang je ušla u izvorne projekte na dan objave, a ne sedmicama kasnije, i to je razlika između objave s mjerenjima i nečega što se pokreće još danas.
- Do 3,18 puta veći protok na grafičkoj kartici, do 2,87 puta na uređaju.
- Odziv poziva alata manji za 57 odsto u prosjeku, kod modela LFM2.5-2.6B.
- Nacrtne kontrolne tačke za LFM2.5-1.2B-Instruct, LFM2.5-2.6B i LFM2.5-8B-A1B.
- Podrška za llama.cpp i SGLang objavljena u otvorenom kodu istog dana.
Zašto spekulativno dekodiranje ovdje pomaže
Dekodiranje je ograničeno memorijom, a ne računom. Najveći dio odziva odlazi na prenos težina iz DRAM-a u SRAM, a ne na aritmetiku. Mali nacrtni model predloži nekoliko tokena, ciljni model ih provjeri u jednom prolazu, i trošak učitavanja tih težina se dijeli na sve provjerene tokene umjesto da se plaća za svaki.
DSpark spaja tri dijela: paralelnu okosnicu u duhu DFlasha, uslovljenu obilježjima konteksta ciljnog modela; laku sekvencijalnu glavu modelovanu kao Markovljev lanac između susjednih tokena, koja podiže prihvatanje na kasnijim mjestima; i provjeravač s rasporedom povjerenja, koji odbacuje repove niskog povjerenja kad bi njihova provjera koštala više nego što donosi.
Jedna pojedinost iz obuke koju vrijedi ukrasti
Nacrtni modeli su namjerno jednostavni: samo pažnja, pet slojeva, blok od devet. Liquid AI je odradio 15 epoha nad cijelim skupom, pa izabrao epohu s najvišom stopom prihvatanja, a ne onu s najnižim gubitkom.
Taj izbor je cijeli trik. Gubitak mjeri koliko nacrt uopšteno oponaša ciljni model; stopa prihvatanja mjeri koliko često njegova pogađanja stvarno prežive provjeru, a jedino se to pretvara u brzinu. Optimizovati mjeru po kojoj se plaća, umjesto one koju je lako nacrtati, navika je koju vrijedi ponijeti u svoj posao.
Povezano
GPT-5.6 Sol pao na 4 i 20 dolara i po cijeni pretekao Claude Opus 5
OpenAI je 21. avgusta snizio cijenu Sola na API-ju: ulaz sa 5 na 4 dolara, izlaz sa 30 na 20, a ulaz iz keša sa 0,50 na 0,40. Na standardnom zadatku model je od skupljeg od Claudea Opusa 5 postao jeftiniji od njega. Sniženje je promotivno i traje najmanje do 21. novembra.
OpenAIprovjereno

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa
Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.
Hugging Faceprovjereno
Gemini 3.7 Flash, pročitan iz Googleovih brojki
Google ga je objavio 13. avgusta 2026. godine, dvadeset tri dana poslije Gemini 3.6 Flasha, s velikim napretkom na testovima za kod i agente i uvodnom cijenom koju tako i naziva. Sve to stoji. Četiri stvari se vide tek ako otvoriš karticu modela umjesto objave, a jedna od njih je rezultat koji je pao.
Googleprovjereno
