Kako oboriti račun za model za 89 odsto, bez ijedne izmjene u proizvodu
Četiri poluge, sve objavljene, nijedna lukava: keširaj nepromjenjivi dio prompta, grupiši ono što može da čeka, spusti stepen gdje zadatak to dozvoljava, i prestani da plaćaš množioce koje nisi tražio. Sve je razrađeno do kraja na jednom stvarnom poslu.
Brojka s cjenovnika nije tvoj račun. Tvoj račun je ta brojka puta ono što šalješ, puta koliko često to šalješ, puta niz množilaca koje većina nikad ne pročita. Ovaj vodič prolazi kroz sve četiri poluge na jednom poslu i završava na 11 odsto polazne cifre. Svaka brojka je iz dokumentacije proizvođača, provjerena 23. avgusta 2026.
Posao
Recimo da odgovaraš na pitanja korisnika. Ima ih dvjesta hiljada mjesečno. Svaki zahtjev nosi 12.000 ulaznih tokena, od čega je 8.000 nepromjenjiv sistemski prompt s dokumentacijom proizvoda, a 4.000 samo pitanje i istorija razgovora. Svaki odgovor je oko 800 izlaznih tokena.
To je 2.400 miliona ulaznih i 160 miliona izlaznih tokena mjesečno. Na Claudeu Opus 5, po 5 i 25 dolara za milion, račun je 12.000 dolara za ulaz i 4.000 za izlaz. Recimo 16.000 dolara.
Prva poluga: keširaj ono što se ne mijenja
Tih 8.000 nepromjenjivih tokena odlazi dvjesta hiljada puta mjesečno, svaki put isto. Keširanje promptova naplaćuje jednokratno čuvanje, a onda za čitanje naplaćuje desetinu ulazne cijene.
Anthropic množioce navodi otvoreno: upis u petominutni keš košta 1,25 puta osnovnu ulaznu cijenu, upis u jednočasovni 2 puta, a čitanje iz keša 0,1 puta. Dokumentacija izričito kaže i granicu isplativosti: keširanje se isplati poslije jednog čitanja na petominutnom trajanju, odnosno poslije dva čitanja na jednočasovnom. Na dvjesta hiljada zahtjeva mjesečno si daleko preko obje.
Nepromjenjivih 1.600 miliona tokena sada košta 0,50 dolara po milionu umjesto 5. Ulaz pada s 12.000 na 800 dolara, plus 4.000 za promjenjivi dio. Račun: 8.800 dolara.
- Upis u petominutni keš: 1,25 puta osnovna ulazna cijena.
- Upis u jednočasovni keš: 2 puta osnovna ulazna cijena.
- Čitanje iz keša: 0,1 puta osnovna ulazna cijena.
- Isplati se poslije jednog čitanja (pet minuta) ili dva (jedan čas).
Druga poluga: grupiši sve što može da čeka
I Anthropic i OpenAI prepolovljavaju cijenu tokena za grupnu obradu, i na ulazu i na izlazu. OpenAI navodi rok od 24 časa i odvojen skup znatno viših ograničenja. Anthropic grupne cijene navodi po modelu: Opus 5 na 2,50 i 12,50 dolara, Sonnet 5 na 1 i 5.
Odgovor korisniku koji ga čita u roku od sat vremena ne može u grupu. Noćno razvrstavanje, naknadna obrada, prolasci kroz evaluacije, sažimanje jučerašnjih prijava i dopuna kataloga mogu. U većini sistema više posla može da čeka nego što tim pretpostavlja, jer niko nikad nije pitao koji dio stvarno mora da bude trenutan.
Anthropic navodi i da se množioci keširanja kumuliraju s grupnim popustom. Polovina od 8.800 je 4.400 dolara.
Treća poluga: prestani da kupuješ vrhunski model za svaki zadatak
Claude Sonnet 5 košta 2 i 10 dolara za milion, naspram 5 i 25 kod Opusa 5. Haiku 4.5 košta 1 i 5. Razvrstavanje, izvlačenje podataka, usmjeravanje, označavanje i kratki odgovori rijetko traže vrh, a pošten način da se to utvrdi je pustiti isti skup evaluacija kroz jeftiniji model, a ne pretpostaviti bilo šta.
Prebaci ovaj posao na Sonnet 5, uz keširanje i grupnu obradu: keširani dio košta 0,10 dolara po milionu, promjenjivi ulaz 1, izlaz 5. To je 160 plus 800 plus 800. Račun: 1.760 dolara, sa 16.000.
Četvrta poluga: množioci koje niko nije tražio
Brzi režim na Claudeu Opus 5 i Opus 4.8 košta 10 i 50 dolara za milion, dvostruko od standardne stope, i kumulira se s množiocima za keširanje i mjesto obrade. Vrijedi kad čovjek čeka, ne vrijedi kad čeka red poslova.
Vezivanje obrade za Sjedinjene Države kroz parametar inference_geo množi svaku kategoriju tokena sa 1,1, na Claudeu 4.6 i novijim. OpenAI za obradu u određenom regionu naplaćuje 10 odsto više, za modele objavljene od 5. marta 2026. Ako ugovor to traži, plati. Ako niko nije tražio, nemoj.
OpenAI-jev cjenovnik svaki vodeći model dijeli na kratak i dug kontekst: gpt-5.6-sol je 4 i 20 dolara na kratkom, a 8 i 30 na dugom. I jedno i drugo su promotivne cijene, navedene kao dostupne najmanje do 21. novembra 2026. Stranica ne kaže gdje je granica, pa taj prag potraži u dokumentaciji prije nego što posao s dugim kontekstom isplaniraš po naslovnoj cijeni. Anthropic ide obrnuto i cijeli prozor od milion tokena naplaćuje po standardnoj stopi na Claudeu 4.6 i novijim, uz izričitu napomenu da zahtjev od 900.000 tokena po tokenu košta isto kao onaj od 9.000.
Jedna napomena koja nije poluga
Claude 4.7 i noviji, kao i Claude Mythos Preview, koriste noviji tokenizator koji za isti tekst daje otprilike 30 odsto više tokena nego prethodni. Anthropic navodi da tačno povećanje zavisi od sadržaja.
To znači da poređenje cijene po tokenu između Opusa 5 i, recimo, Sonneta 4.6 potcjenjuje trošak novijeg modela na istom tekstu. O poređenju između proizvođača ne govori ništa, jer bi za to trebalo mjerenje na tvom tekstu, a ne račun nad cjenovnikom. Ako ti je budžet toliko tijesan da 30 odsto igra ulogu, prebroj tokene na stvarnom uzorku prije nego što se obavežeš.
Izvori
Ispravke
Ispravljeno 23. avgusta 2026: vodič je za GPT-5.6 Sol navodio 5 i 30 dolara na kratkom kontekstu i 10 i 45 na dugom. OpenAI je te cijene snizio 21. avgusta 2026, istog dana kad je vodič objavljen, na 4 i 20 dolara na kratkom i 8 i 30 na dugom. Brojke sada stoje onako kako ih nosi objavljeni cjenovnik OpenAI-ja, provjeren 23. avgusta. Nijedan račun u vodiču time se ne mijenja, jer sve računice u njemu idu po cijenama Claudeovih modela.
Povezano
GPT-5.6 Sol pao na 4 i 20 dolara i po cijeni pretekao Claude Opus 5
OpenAI je 21. avgusta snizio cijenu Sola na API-ju: ulaz sa 5 na 4 dolara, izlaz sa 30 na 20, a ulaz iz keša sa 0,50 na 0,40. Na standardnom zadatku model je od skupljeg od Claudea Opusa 5 postao jeftiniji od njega. Sniženje je promotivno i traje najmanje do 21. novembra.
OpenAIprovjereno

Modeli za govor s najboljim rezultatima ponavljaju greške iz samog testa
Hugging Face je kroz tri provjere propustio 11 otvorenih modela za prepoznavanje govora i našao da baš oni s najnižom stopom greške najčešće ponavljaju greške koje postoje samo u referentnom prepisu. Na pojedinim provjerama modeli, izgleda, prepoznaju na kojem se skupu ocjenjuju pa u skladu s tim mijenjaju pravopisnu konvenciju. Niska stopa greške može da znači da je model naučio skup podataka, a ne govor.
Hugging Faceprovjereno
Gemini 3.7 Flash, pročitan iz Googleovih brojki
Google ga je objavio 13. avgusta 2026. godine, dvadeset tri dana poslije Gemini 3.6 Flasha, s velikim napretkom na testovima za kod i agente i uvodnom cijenom koju tako i naziva. Sve to stoji. Četiri stvari se vide tek ako otvoriš karticu modela umjesto objave, a jedna od njih je rezultat koji je pao.
Googleprovjereno