Preskoči na sadržaj
Modelisrednji signalprovjereno

NeoMME sa 260 miliona parametara došao je na 0,002 od modela s 3,75 milijardi na ViDoRe v3

Kompanija H objavila je 3. septembra 2026. dva multimodalna enkodera, od 260 miliona i 800 miliona parametara, pod licencom Apache 2.0 i za učitavanje kroz biblioteku Hugging Face Transformers. Na mjerilu ViDoRe v3, koje ocjenjuje pretragu skeniranih dokumenata, manji model postiže 0,523 po mjeri nDCG@10, a to je 0,002 ispod modela ColQwen2.5 koji ima oko četrnaest puta više parametara. Isti model kodira oko 51 stranicu u sekundi na jednoj grafičkoj kartici NVIDIA L40S. Indeks koji pravi može se sabiti sa oko 1,5 megabajta po stranici na 6 kilobajta, uz zadržanih preko 95 odsto kvaliteta pretrage.

Potpisuje Redakcija WebAiRadarObjavljeno 3 min čitanjanapisao model
Slika: Hugging Face

Pretraga skeniranih stranica obično znači jedan od dva loša izbora: pokrenuti optičko prepoznavanje znakova i izgubiti raspored na stranici, ili pokrenuti velik vizuelno-jezički model i platiti ga za svaku stranicu koja ulazi u indeks. NeoMME je tvrdnja da drugi izbor više nije nužan, a brojke iza te tvrdnje dovoljno su određene da se mogu provjeriti.

Šta je objavljeno

NeoMME je porodica od dva multimodalna enkodera, od 260 miliona i 800 miliona parametara, koju je 3. septembra 2026. objavila kompanija H. Sve kontrolne tačke idu pod licencom Apache 2.0, a model se učitava kroz biblioteku Hugging Face Transformers, pa spada u ono što se može postaviti u rad, a ne samo pročitati.

Po građi, model izostavlja uobičajen sklop. Nema zasebno obučenog vizuelnog dijela ni uzročnog dekodera: jedan dvosmjerni Transformer prima i tekstualne tokene i sirove djelove slike veličine 32 sa 32 tačke, istim putem. Obje veličine imaju kontekst od 16.384 tokena, što je po autorima dovoljno za dvije slike u rezoluciji 4K. Slika zadržava svoj odnos stranica, pa gusto ispisana stranica dokumenta dobija više tokena od fotografije s malo sadržaja.

Brojke o pretrazi

Na mjerilu ViDoRe v3, po mjeri nDCG@10, model za pretragu od 260 miliona parametara postiže 0,523. Model ColQwen2.5, sa 3,75 milijardi parametara, postiže 0,524. Poređenje u istoj tabeli je uvjerljivije prema sličnim veličinama: ColModernVBERT sa 250 miliona parametara postiže 0,261, a ColSmol-256M postiže 0,207. Model od 800 miliona parametara postiže 0,556, naspram 0,565 za Vultron Flash od 850 miliona i 0,430 za ColPali v1.3 od 2,92 milijarde parametara.

Druga polovina priče je brzina. Pri istoj ulaznoj slici od 2048 sa 2048 tačaka, na jednoj grafičkoj kartici NVIDIA L40S, model od 260 miliona parametara kodira oko 51 stranicu u sekundi, naspram oko 26 za ColModernVBERT. Trošak pravljenja indeksa je mjesto na kojem projekti pretrage najčešće propadnu, pa dvostruko više stranica po satu grafičke kartice nije sitnica.

Riječ je o mjerenjima samog proizvođača, uz dio uporednih rezultata preuzetih s MTEB liste. Nezavisno ponavljanje još nije objavljeno, a brojke o brzini dolaze iz mjerenja nad unaprijed pripremljenim slikama, uz veličinu grupe podešenu za svaki model posebno. To je povoljna postavka, i u tekstu je jasno navedena.

Problem skladištenja i odgovor na njega

Pretraga s kasnom interakcijom čuva po jedan vektor za svaki dio slike, pa je stranica visoke rezolucije skupa za čuvanje. Stranica od 2048 sa 2048 tačaka daje 4.200 vektora, a izmjerena prosječna veličina na ViDoRe v3 je oko 1,5 megabajta po dokumentu. Ta brojka odlučuje da li je zbirka od milion stranica projekat ili stavka u budžetu.

Primjenjuju se dva postupka sabijanja zajedno. Hijerarhijsko grupisanje tokena spaja slične vektore, a asimetrična kvantizacija dokumente čuva u osmobitnom ili binarnom obliku, dok upitnu stranu drži u većoj preciznosti, jer se upiti prave u hodu i nikad se ne čuvaju. Pri faktoru grupisanja 10 i osmobitnom zapisu na obje strane, indeks pada na 39 kilobajta po stranici, što je 39 puta manje, uz zadržanih preko 99 odsto polaznog kvaliteta. Binarni zapis dokumenata daje 6 kilobajta po stranici, 255 puta manje, uz zadržanih preko 95 odsto.

Sve kontrolne tačke modela objavljujemo pod licencom Apache 2.0.
Tony Wu i Aurélien Lac, kompanija H

Povezano

PREKID 3. SEPTEMBRA4 odjednomChatGPT, Claude, Grok i Gemini
Modelisrednji signal

ChatGPT, Claude, Grok i Gemini imali su smetnje u istom dvočasu, 3. septembra

Anthropic je 3. septembra 2026. zaveo povećan broj grešaka na modelima Claude Mythos 5.1, Claude Fable 5.1 i Claude Opus 5, a OpenAI povećan broj grešaka u ChatGPT-u i Codexu. Grok je korisnicima ispisivao poruku o greškama, a nezavisni nadzor je zabilježio vjerovatan prekid Gemini API-ja. Četiri nezavisna provajdera, jedno prijepodne. Nijedna stranica o stanju usluga ne imenuje zajednički uzrok, a Amazon Web Services, Microsoft Azure i Cloudflare tog jutra nisu prijavili veće smetnje.

Ars Technicaprovjereno

Modelijak signal

OpenAI je objavio GPT-6 Astru po 10 dolara za milion ulaznih tokena, a preduzećima je pristup isključen

Model GPT-6 Astra objavljen je 3. septembra 2026. Prvo ga je dobio ograničen broj organizacija, a narednih dana slijede i korisnici planova ChatGPT Plus, Pro, Business i Enterprise. U API-ju se zove gpt-6-astra i košta 10 dolara po milionu ulaznih i 50 dolara po milionu izlaznih tokena, a isporučuje se i preko Microsoft Azurea i Amazon Bedrocka. Preduzeća ga ne dobijaju sama od sebe, jer je pristup pri objavi podrazumijevano isključen i mora ga uključiti administrator. OpenAI uz to upozorava da dodatne bezbjednosne provjere umiju da pauziraju posao u ChatGPT-u i Codexu, a u API-ju da ga prekinu.

OpenAIprovjereno

Modelisrednji signal

Googleov WeatherNext 3 računa prognozu svakog sata, a programeri je čitaju iz BigQueryja

Google DeepMind i Google Research objavili su WeatherNext 3 dana 3. septembra 2026. Model uči iz mozaika geostacionarnih satelita uživo, a ne samo iz fizičkih simulacija koje kasne šest sati, pa novu prognozu daje svakog sata umjesto svakih šest. Temperatura i vlaga izlaze na mreži od pet kilometara, dok je prethodni model radio na 25 kilometara. Podaci se od dana objave čitaju u okruženjima BigQuery i Earth Engine, pa je ovo izdanje na kojem se može graditi, a ne samo rad koji se čita.

Google DeepMindprovjereno