Новият видео модел на Alibaba е жив в ComfyUI. Дава до 30 секунди наведнъж, до двайсет опорни материала и обръщение към всеки от тях по име вътре в самата задача.
- До 30 секунди в едно минаване, вместо няколко клипа, залепени един за друг.
- До 20 опорни материала наведнъж: 10 изображения, 5 видеа, 5 аудио файла.
- Всеки опорен материал се вика по име вътре в задачата, така че се знае къде точно действа.
Досега дългото видео се правеше на парчета и се залепваше. Всеки шев се вижда: героят се променя, светлината скача, камерата започва отначало.
Кое е същинското тук
Тридесетте секунди. Не заради дължината, а заради това, което дължината позволява: непрекъснато движение на камерата, кадър в едно минаване и темпо, което се гради, вместо да се рестартира на всеки пет секунди.
Второто е адресирането. Даваш карта на героя за лицето, видео за движението на камерата, аудио за тембъра, и казваш вътре в задачата кое къде да действа. Дотук опорните материали влизаха накуп и моделът сам решаваше кое колко тежи.
Какво още не знаем
Съобщението е на ComfyUI за модел на Alibaba, тоест числата са на производителя. Не сме го пускали и не знаем как изглежда тридесетата секунда, когато първата е добра.
Това е и мястото, където ще проличи. Дълъг кадър не прощава: ако лицето плува или ръката се сменя, тридесет секунди го показват тридесет пъти по-ясно от пет.