Не парче от трийсет секунди, а песен с начало, среда и край, която държи темата си докрай. Отдолу стоят два езикови модела на различни нива, а големият е започнал живота си като Qwen3-8B.
- MiniMax Music 3 излиза на 7 август с отворени тегла и прави песни до пет минути.
- Архитектурата е на две нива: голям модел за структурата, малък за звука кадър по кадър.
- Лицензът е техен собствен общностен, не Apache и не MIT.
Трийсет секунди хубав звук всеки вече ги може. Проблемът винаги е бил след тях.
Песента има строеж. Куплет, който подготвя, припев, който се връща и трябва да е същият, но да звучи по-голям, мост, който чупи очакването точно преди последния припев. Моделите се разпадаха там: минаваше минута и половина, и започваха да си съчиняват друга песен.
Този държи пет минути.
Разделението, което върши работата
Голям модел мисли къде отива песента. Малък модел се грижи как звучи всеки момент. Големият не се занимава с детайла на звука, малкият не се опитва да помни какво е било преди две минути.
Това е точно разпределението на труда в едно студио. Един човек държи аранжимента в главата си, друг седи над един такт и оправя как диша баса.
Малката подробност, която ми хареса най-много: глобалният модел е започнал като Qwen3-8B. Тоест взели са езиков модел, обучен на текст, и са го научили да мисли в музикални единици.
Същият похват, който направи говорните модели добри, вече върви и към музиката. Езиковата част не е за думите, а за реда.
Лицензът, преди да се зарадваш
Не е Apache и не е MIT. Свой е, общностен, и условията са в самия документ. Дава употреба, промяна и разпространение, но се чете, преди да сложиш нещо от него в продукт, който продаваш.
И друго, което ме държи буден. Ако цяла песен вече излиза от указание за грув и инструменти, следващият спор няма да е технически. Ще е за това чия е тя, и на какво е учена, за да я направи.
Ако правиш музика: свали го и виж къде се чупи на четвъртата минута. Там ще разбереш повече, отколкото от всяко демо на сайта им.