Preskoči na sadržaj
Video i fotosrednji signalprovjereno

Gemini 3.8 Live je dobio video avatar, a Google video naplaćuje samo dok avatar govori

Google je 24. septembra 2026. učinio Gemini 3.8 Live with Live Avatar opšte dostupnim u okruženju Gemini Enterprise, s krajnjim tačkama u SAD i EU. Model odgovara kroz video lik čije usne prate govor, a pritom sluša, gleda kameru ili dijeljeni ekran i u pozadini poziva alate. Video avatara košta 1 dolar po milionu tokena, a svaka sekunda govora računa se kao 6.192 tokena. Prema računu redakcije, to je oko 0,37 dolara po minuti govora, bez zvuka, ulaza i konteksta.

Potpisuje Redakcija WebAiRadarObjavljeno 3 min čitanjanapisao model
Slika: Google

Izvor

Introducing Gemini 3.8 Live with Live Avatar

Google: The Keyword, AI · Original objavljen 24. septembra 2026.

Google je svoj model za razgovor u realnom vremenu proširio videom. Model Gemini 3.8 Live objavljen je 15. septembra 2026. Uz njega sada ide i Live Avatar, lik koji se generiše dok govori, s pokretima usana i izrazom lica usklađenim s govorom. Prema Google Cloudu, funkcija je opšte dostupna u okruženju Gemini Enterprise i kroz Live API, na krajnjim tačkama u SAD i EU.

Šta avatar radi

Video se generiše zajedno sa zvukom, a ne dodaje se naknadno preko njega. Google navodi da model istovremeno prima zvuk, snimak kamere i dijeljeni ekran. Alate može da poziva u pozadini, a da razgovor ne zastane. Kompanija kao primjere upotrebe navodi korisničku podršku, vođeno predstavljanje proizvoda i interaktivne kioske.

Prema Googleu, Gemini 3.8 Live razumije i govori 97 jezika i sam prepoznaje jezik sagovornika. Kompanija tvrdi i da pokreti usana ostaju usklađeni kad sagovornik usred razgovora pređe na drugi jezik. Pregledna stranica dokumentacije za Live API i dalje navodi 24 podržana jezika, pa se podrška za manje zastupljen jezik mora provjeriti na stranici samog modela.

U dokumentaciji se model poziva oznakom gemini-3.8-live, preko WebSocket veze koja čuva stanje sesije. Zvuk se šalje kao PCM na 16 kHz, a vraća se na 24 kHz. Video se šalje kao niz JPEG sličica, jedna u sekundi.

  • Svi korisnici mogu da biraju iz Googleove biblioteke gotovih avatara.
  • Sopstveni avatar pravi se iz jedne referentne fotografije, ali samo uz posebno odobrenje i provjeru u okviru enterprise programa.
  • Google navodi da sav generisani zvuk i video sadrže nevidljiv vodeni žig SynthID.
  • Varijanta Gemini 3.8 Live Extended Thinking, namijenjena složenijem rezonovanju, i dalje je u zatvorenom pregledu.

Koliko košta

Googleov cjenovnik naplaćuje Gemini 3.8 Live API po milionu tokena, na regionalnim krajnjim tačkama. Tekstualni ulaz košta 0,75 dolara, ulaz slike i videa 1 dolar, a zvučni ulaz 3 dolara. Tekstualni izlaz košta 4,50 dolara, zvučni izlaz 12 dolara, a video avatara 1 dolar.

Na račun više od cijena utiče stopa po kojoj se sadržaj pretvara u tokene. Sekunda zvuka računa se kao 25 tokena, a sekunda videa avatara kao 6.192 tokena. Video se naplaćuje samo dok avatar govori, a ne i dok sluša.

Prema računu redakcije, minuta govora avatara iznosi 371.520 tokena videa, odnosno oko 0,37 dolara. Zvuk iste minute dodaje oko 0,018 dolara, pa je ukupno oko 0,39 dolara. Video ima najnižu cijenu po tokenu u tabeli, a ipak košta oko 20 puta više od zvuka, jer proizvodi oko 248 puta više tokena.

Duža sesija košta više od te procjene. Google svaki korak razgovora naplaćuje za sve tokene u kontekstu sesije, pa se tokeni iz ranijih koraka ponovo obrađuju i naplaćuju, do zadate granice konteksta. Iz toga se može zaključiti da je za agenta podrške koji razgovara dvadeset minuta granica konteksta jednako važna kao i cijena po tokenu.

Ko može da ga koristi

Pristup ide preko okruženja Gemini Enterprise i Google Clouda, a ne preko potrošačke aplikacije Gemini. Google funkciju nudi uz zakupljeni kapacitet obrade (provisioned throughput) i poslovne uslove usklađenosti. Za posebne postavke i odobrenje sopstvenog avatara kompanija upućuje na svoju prodajnu službu.

Google nije objavio da li vodeni žig SynthID ostaje čitljiv kad platforma za video pozive ponovo kodira snimak. Za firmu koja želi da korisnicima žigom označi generisani video, to je pitanje koje treba postaviti Googleu prije uvođenja.

„Video se naplaćuje samo dok avatar aktivno govori.“
Google Cloud, cjenovnik

Izvori

MarkeGemini

Povezano

Tri ekrana telefona iz OpenAI-jeve demonstracije probanja u ChatGPT-ju: stranica proizvoda s teksas suknjom na falte i dugmetom Try on, snimanje selfija kamerom i generisana slika iste žene u toj suknji.
Video i fotosrednji signal

ChatGPT uvodi virtuelno probanje odjeće i čuva referentnu fotografiju korisnika

OpenAI je 1. oktobra 2026. u ChatGPT dodao dvije funkcije za kupovinu. Dugme "Try on" uz prikaz odjeće i modnih dodataka generiše sliku korisnika sa izabranim artiklom, na osnovu selfija. Selfi se čuva kao referentna fotografija za buduća probanja, dok ga korisnik u podešavanjima ne zamijeni ili ne obriše. Druga funkcija, Favorites, čuva proizvode u biblioteci ChatGPT-ja.

OpenAIprovjereno

Video i fotosrednji signal

Google je uređivač slika Nano Banana ugradio u Docs i Slides i nazvao ga Google Pics

Google Pics je samostalan alat za pravljenje i uređivanje slika, izgrađen na modelu Nano Banana, a iste komande ulaze i u aplikacije Workspacea. Ugradnja počinje 1. septembra 2026. u aplikacijama Docs i Slides, a Drive dolazi narednih sedmica. Pristup dobijaju pretplatnici na Google AI Pro i Ultra i većina poslovnih korisnika Workspacea, postepenim uvođenjem tokom narednih sedmica. Google ne objavljuje nijedno ograničenje broja slika, nijednu posebnu cijenu ni spisak podržanih jezika.

Googleprovjereno

Video i fotosrednji signal

Gemini Omni 1.1 Flash produžava snimak do četrdeset sekundi, a nacrt pravi u 360p

Googleov model za video sada nastavlja postojeći snimak u koracima od deset sekundi, do ukupno četrdeset, i pri tome gleda do deset sekundi ranijeg materijala umjesto samo posljednje sekunde. Nacrt u 360p nastaje do 60 odsto brže i po trećini cijene, a gotov rad se podiže na 1080p ili 4K.

Googleprovjereno