we_are_coded.by CODE · Светът, декодиран
EN
MiniMax

MiniMax пусна модел, който прави цяла песен от пет минути, и раздаде теглата

MiniMax (Hugging Face)Аудио

Не парче от трийсет секунди, а песен с начало, среда и край, която държи темата си докрай. Отдолу стоят два езикови модела на различни нива, а големият е започнал живота си като Qwen3-8B.

Накратко
  • MiniMax Music 3 излиза на 7 август с отворени тегла и прави песни до пет минути.
  • Архитектурата е на две нива: голям модел за структурата, малък за звука кадър по кадър.
  • Лицензът е техен собствен общностен, не Apache и не MIT.
Проверено на8 август 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Трийсет секунди хубав звук всеки вече ги може. Проблемът винаги е бил след тях.

Песента има строеж. Куплет, който подготвя, припев, който се връща и трябва да е същият, но да звучи по-голям, мост, който чупи очакването точно преди последния припев. Моделите се разпадаха там: минаваше минута и половина, и започваха да си съчиняват друга песен.

Този държи пет минути.

Фактите, по данни на официалния профил на MiniMax в Hugging Face и картата на модела: MiniMax Music 3 е публикуван на 7 август 2026, с общо 2,43 милиарда параметъра в теглата за сваляне. Архитектурата е йерархична и разделя глобалното от местното: глобален езиков модел от 8 милиарда параметъра води дългия строеж на песента, а местен от 0,6 милиарда възстановява подробния звук във всеки кадър. Глобалният е инициализиран от Qwen3-8B. Синтезът минава през Flow Matching с 2,4 милиарда параметъра. Моделът приема указания за аранжимента: водещи и второстепенни инструменти, развитие по секции, грув, бас, перкусии. Лицензът е собствен, наречен MiniMax-Music3 Community License, и дава право на употреба, промяна и разпространение при условия, изброени в самия документ.

Разделението, което върши работата

Голям модел мисли къде отива песента. Малък модел се грижи как звучи всеки момент. Големият не се занимава с детайла на звука, малкият не се опитва да помни какво е било преди две минути.

Това е точно разпределението на труда в едно студио. Един човек държи аранжимента в главата си, друг седи над един такт и оправя как диша баса.

Разликата между звук и песен е паметта. Едното запълва секунди, другото помни къде отива.

Малката подробност, която ми хареса най-много: глобалният модел е започнал като Qwen3-8B. Тоест взели са езиков модел, обучен на текст, и са го научили да мисли в музикални единици.

Същият похват, който направи говорните модели добри, вече върви и към музиката. Езиковата част не е за думите, а за реда.

Лицензът, преди да се зарадваш

Не е Apache и не е MIT. Свой е, общностен, и условията са в самия документ. Дава употреба, промяна и разпространение, но се чете, преди да сложиш нещо от него в продукт, който продаваш.

И друго, което ме държи буден. Ако цяла песен вече излиза от указание за грув и инструменти, следващият спор няма да е технически. Ще е за това чия е тя, и на какво е учена, за да я направи.

Ако правиш музика: свали го и виж къде се чупи на четвъртата минута. Там ще разбереш повече, отколкото от всяко демо на сайта им.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→MiniMax-Music3, официален профил на MiniMax (Hugging Face)→MiniMax-Music3 Community License (текстът на лиценза)
Оригинал: https://wearecoded.com/articles/minimax-music3-cyala-pesen-pet-minuti.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини