Как най-големите модели си позволяват да са големи: като не работят целите наведнъж.
В болницата не те преглежда целият лекарски състав. На рецепцията те насочват: това е за кардиолога, това - за очния, това - за лабораторията. Останалите лекари в това време гледат други пациенти. MoE моделът е болница за думи: малък диспечер решава кой специалист да поеме точно това парче от изречението, а останалите мълчат и не харчат ток.
Умното е, че специализацията не се задава от хора - тя се самоподрежда по време на обучението. Никой не казва „ти ще отговаряш за химията“. Просто едни части започват да се палят на код, други на числа, трети на редки езици. Етикети няма; делението работи.
Защо това те засяга, щом не строиш модели
Защото обяснява числата в новините. Когато четеш, че модел има огромен брой параметри, а работи бързо и евтино, отдолу почти винаги стои MoE: общият размер е складът, активната част е сметката. И когато сравняваш модели по размер, сравнението вече не е честно, ако единият е плътен, а другият - смес от специалисти.
Нашият прочит: MoE е поредното доказателство, че напредъкът в AI не идва само от „повече“. Идва от по-хитро подредено повече. Складът расте, но се плаща само това, което излиза от него.