На 2 септември Microsoft Research качи в Hugging Face VibeVoice-ASR-Streaming в два размера, под лиценз MIT. Моделът превръща речта в текст, докато тече, отделя говорещите и приема собствен речник с имена и термини. Езиците са десет, и българският не е сред тях.
- Два варианта, 1.5B и 7B, и двата под MIT.
- Стрийминг транскрипция с отбелязан говорещ и потребителски ключови думи.
- Езици: китайски, английски, френски, немски, италиански, японски, корейски, португалски, руски и испански.
Протокол от среща, който се пише сам, докато хората говорят, и знае кой какво е казал.
Модели за разпознаване на реч (ASR) има много. Интересното тук е комбинацията: поток в реално време, отбелязан говорещ и отворен лиценз, който позволява и търговска употреба.
Българският го няма. Руският го има. За всеки, който е пускал чужд модел за реч на нашия език, това не е изненада. Отворените тегла не учат нов език сами.
Има обаче практична полза. Потребителските ключови думи вършат работа точно там, където общите модели се спъват: имена на хора, на продукти, на места. Ако правиш инструмент за международни срещи на английски, тук има какво да вземеш още днес.
За българска реч това не е решението. Лицензът позволява някой да го дообучи на български, и това е следващото, което ще търсим в хранилищата.