Preskoči na sadržaj

Pojmovnik

Multimodalan model

Model koji na ulazu prima više od teksta — slike, zvuk, snimke, cijele dokumente — i o njima razmišlja u istom razgovoru.

Praktičan dobitak je što međukorak nestaje. Snimak ekrana više ne mora da se opisuje, skenirani račun ne mora da prođe kroz zaseban čitač; slika ide u isti prompt s pitanjem o njoj.

Ulaz i izlaz su dva različita pitanja. Većina modela koji čitaju slike ne crta ih, a oni koji crtaju obično za to pozovu drugi model — čitanje grafikona i pravljenje grafikona nisu ista sposobnost.

I trošak se broji drugačije. Slika se naplaćuje kao blok tokena čija veličina zavisi od njenih dimenzija, pa snimak ekrana u punoj rezoluciji umije da košta više od stranice teksta koju prikazuje.