Аудио
Аудио
20 материала · страница 1 от 3Suno пусна Speech: говор и фонова музика в един трак, в бета за всички
Пишеш текст, описваш гласа и музикалния стил и получаваш прочетен текст със собствен саундтрак. Suno го нарича първия аудио модел, който прави глас и музика заедно като едно цяло. Бетата е отворена за цялата общност от 1 октомври.
Чети →ElevenLabs пусна Eleven v4 - глас, който чете тона на изречението, не само думите
На 28 септември ElevenLabs представи Eleven v4, изцяло нова архитектура за текст в реч, и бързия Eleven v4 Turbo за гласови агенти. По данни на компанията моделът е първи в класацията на Artificial Analysis, а в слепи сравнения около 75 на сто от слушателите го предпочитат.
Чети →Grok Voice Transcribe 2.0 пише два пъти по-точно от първата версия по тестове на SpaceXAI, на същата цена
Новият модел за превръщане на реч в текст стъпва на аудио модела зад Grok Voice, разпознава езика сам и следи смяната му насред записа. Цената остава 0,10 долара на час аудио при пакетна обработка и 0,20 при поток.
Чети →Gemini 3.8 Live говори и мисли едновременно, и вече е за всички
Google пусна в обща наличност два гласови модела за Live API. Единият е за бърз разговор без паузи, другият разсъждава на заден план, докато разговорът тече.
Чети →ElevenLabs сложи глас, музика, картина и видео в един конектор за чата
MCP конекторът на ElevenLabs вече не само управлява агенти, но и прави съдържание: реч, транскрипция, дублаж, музика, звукови ефекти, изображения и видео. Една инсталация, вход с акаунт, без сървър и без API ключ.
Чети →ElevenLabs Music v2.5: песента, която направиш, е твоя на всеки план, освен ако не стъпва на чужда
На 11 септември ElevenLabs направи Music v2.5 модел по подразбиране в ElevenMusic и даде сваляне без загуба на всеки план, включително безплатния. Свалянето обаче е блокирано за песни, които стъпват на чужди песни.
Чети →ElevenLabs подписа с Universal Music първата си сделка с голям лейбъл, а платформата за феновете още я няма
ElevenLabs и Universal Music Group сключиха многогодишно лицензионно споразумение и стратегическо сътрудничество. Първата стъпка е платформа за фенове върху лицензирана музика, с ремикси, мешъпи и нови интерпретации от участващи артисти. Платформата е в разработка.
Чети →GPT-Live-1 слуша и говори едновременно, а вече е и в API, с гласов слой за 5 цента на минута
На 10 септември OpenAI пусна в API гласовия модел GPT-Live-1, който досега беше в ChatGPT. Той слуша и говори в един и същи момент, може да оставя мисленето и инструментите на друг модел зад себе си и струва 0,05 долара на минута за гласовия слой.
Чети →Microsoft пусна отворен модел, който записва в реално време кой какво казва, но без български
На 2 септември Microsoft Research качи в Hugging Face VibeVoice-ASR-Streaming в два размера, под лиценз MIT. Моделът превръща речта в текст, докато тече, отделя говорещите и приема собствен речник с имена и термини. Езиците са десет, и българският не е сред тях.
Чети →