we_are_coded.by CODE · Светът, декодиран
EN
OpenAI

GPT-Live-1 слуша и говори едновременно, а вече е и в API, с гласов слой за 5 цента на минута

OpenAI · събитието: 10 септември 2026Аудио

На 10 септември OpenAI пусна в API гласовия модел GPT-Live-1, който досега беше в ChatGPT. Той слуша и говори в един и същи момент, може да оставя мисленето и инструментите на друг модел зад себе си и струва 0,05 долара на минута за гласовия слой.

Накратко
  • Един модел обработва входящия и изходящия звук заедно, вместо веригата разпознаване, езиков модел, синтез.
  • Разсъжденията и инструментите може да се делегират на модел отзад, например GPT-6 Astra или модел на друга компания.
  • По данни на OpenAI: +30 процентни пункта на Full Duplex Bench спрямо GPT-Realtime-2.1; Speak отчита в ранни оценки почти 80% по-малко прекъсвания по време на паузите за мислене при езиковия учител.
Проверено на1 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Почти 80% по-малко прекъсвания по време на паузите за мислене, в ранни оценки. Това е числото на Speak, приложение за учене на езици, и то не е за скорост. Учителят на глас много по-рядко говори върху теб, докато още мислиш.

Който е учил език на глас с машина, познава проблема. Направиш пауза, за да намериш думата, и тя вече отговаря. За нея тишината е край на изречението.

Фактите: на 10 септември 2026 г. OpenAI пусна в API GPT-Live-1, гласов модел, представен първо в ChatGPT, който слуша и говори едновременно. Той обработва входящия и изходящия звук в един модел, вместо във верига от разпознаване на реч, езиков модел и синтез, и може да делегира разсъжденията и извикването на инструменти на модел зад себе си, например GPT-6 Astra или модел на трета страна. Поддържа телефония, задаване на тон, темп и стил през системния промпт, по-добра работа с фонов шум и тишина и дълги сесии. Цената е 0,05 долара на минута за гласовия слой. По данни на OpenAI GPT-Live-1 подобрява резултата на Full Duplex Bench с 30 процентни пункта спрямо GPT-Realtime-2.1. Компанията цитира Speak, според който в ранни оценки при езиковия учител прекъсванията по време на паузите за мислене са намалели с почти 80% спрямо предишните системи с редуване. Изборът на гласове е разширен с различни акценти, диалекти и езици, а още езици се обещават през следващите месеци.

Пълен дуплекс, с прости думи

Досега гласовите агенти работеха като радиостанция: ти говориш, пускаш бутона, той говори. Пълният дуплекс е телефонът. И двамата можете да говорите едновременно, да се прекъснете, да кажете „аха" насред чуждото изречение, без разговорът да се разпадне.

Разговорът е и да знаеш кога да мълчиш.

Хитрото е разделението. Гласовият модел държи разговора жив, а тежката мисъл може да отиде при друг модел отзад. Значи може да сложиш по-лек модел за записване на час и по-тежък за сложен проблем.

Числата за бенчмарка са на OpenAI. Цената от 0,05 долара, тоест 5 цента на минута, е само за гласа; моделът отзад се плаща отделно и сметката за него зависи от това колко мисли.

Ако правиш гласов асистент за клиенти на български, провери първо дали езикът ти е сред поддържаните. После пробвай не скоростта, а колко търпелив е, когато човекът отсреща търси думата.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→OpenAI - Build more natural voice experiences with GPT-Live-1 in the API, 10.09.2026
Оригинал: https://wearecoded.com/articles/gpt-live-1-slusha-i-govori-v-api.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини