Preskoči na sadržaj

Pojmovnik

Mješavina stručnjaka (MoE)

Građa koja drži mnogo parametara, ali za svaki token upotrijebi samo mali dio njih, pa velik model odgovara po cijeni znatno manjeg.

Slojevi su podijeljeni u grupe, a usmjerivač za svaki token izabere po nekoliko njih. Ukupna i radna veličina zato prestaju da budu isti broj, pa se u objavama sada navode oba — prvi govori šta model zna, drugi koliko svaki odgovor košta da se izračuna.

To mijenja šta broj parametara uopšte kazuje. Poređenje gustog modela s mješavinom samo po ukupnom broju poredi pogrešnu veličinu; brzinu i cijenu određuje aktivan dio.

Ako ga pokrećeš sam, zamka je memorija. Svi parametri moraju da budu prisutni iako se u jednom trenutku koristi djelić, pa je mješavina jeftina za rad, a skupa za držanje.