Mješavina stručnjaka (MoE)
Građa koja drži mnogo parametara, ali za svaki token upotrijebi samo mali dio njih, pa velik model odgovara po cijeni znatno manjeg.
Slojevi su podijeljeni u grupe, a usmjerivač za svaki token izabere po nekoliko njih. Ukupna i radna veličina zato prestaju da budu isti broj, pa se u objavama sada navode oba — prvi govori šta model zna, drugi koliko svaki odgovor košta da se izračuna.
To mijenja šta broj parametara uopšte kazuje. Poređenje gustog modela s mješavinom samo po ukupnom broju poredi pogrešnu veličinu; brzinu i cijenu određuje aktivan dio.
Ako ga pokrećeš sam, zamka je memorija. Svi parametri moraju da budu prisutni iako se u jednom trenutku koristi djelić, pa je mješavina jeftina za rad, a skupa za držanje.