we_are_coded.by CODE · Светът, декодиран
EN
Понятие

Mixture-of-Experts

ОсновитеОбновено на 16 август 2026we are coded

Как най-големите модели си позволяват да са големи: като не работят целите наведнъж.

Проверено на16 август 2026
Накратко: Mixture-of-Experts (MoE, „смес от специалисти“) е устройство на модел, при което той е разделен на много специализирани части, а за всяка дума от отговора се включват само няколко от тях. Така модел с огромен общ размер работи с малка част от себе си във всеки момент - по-бързо и по-евтино, без да губи знанието на цялото.

В болницата не те преглежда целият лекарски състав. На рецепцията те насочват: това е за кардиолога, това - за очния, това - за лабораторията. Останалите лекари в това време гледат други пациенти. MoE моделът е болница за думи: малък диспечер решава кой специалист да поеме точно това парче от изречението, а останалите мълчат и не харчат ток.

Умното е, че специализацията не се задава от хора - тя се самоподрежда по време на обучението. Никой не казва „ти ще отговаряш за химията“. Просто едни части започват да се палят на код, други на числа, трети на редки езици. Етикети няма; делението работи.

Голям модел, който мисли с малка част от себе си: това е сделката, която направи гигантите платими.

Защо това те засяга, щом не строиш модели

Защото обяснява числата в новините. Когато четеш, че модел има огромен брой параметри, а работи бързо и евтино, отдолу почти винаги стои MoE: общият размер е складът, активната част е сметката. И когато сравняваш модели по размер, сравнението вече не е честно, ако единият е плътен, а другият - смес от специалисти.

Нашият прочит: MoE е поредното доказателство, че напредъкът в AI не идва само от „повече“. Идва от по-хитро подредено повече. Складът расте, но се плаща само това, което излиза от него.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→Hugging Face: Mixture of Experts Explained→Shazeer et al.: Outrageously Large Neural Networks - the Sparsely-Gated MoE layer (arXiv, 2017)