На 10 септември OpenAI пусна в API гласовия модел GPT-Live-1, който досега беше в ChatGPT. Той слуша и говори в един и същи момент, може да оставя мисленето и инструментите на друг модел зад себе си и струва 0,05 долара на минута за гласовия слой.
- Един модел обработва входящия и изходящия звук заедно, вместо веригата разпознаване, езиков модел, синтез.
- Разсъжденията и инструментите може да се делегират на модел отзад, например GPT-6 Astra или модел на друга компания.
- По данни на OpenAI: +30 процентни пункта на Full Duplex Bench спрямо GPT-Realtime-2.1; Speak отчита в ранни оценки почти 80% по-малко прекъсвания по време на паузите за мислене при езиковия учител.
Почти 80% по-малко прекъсвания по време на паузите за мислене, в ранни оценки. Това е числото на Speak, приложение за учене на езици, и то не е за скорост. Учителят на глас много по-рядко говори върху теб, докато още мислиш.
Който е учил език на глас с машина, познава проблема. Направиш пауза, за да намериш думата, и тя вече отговаря. За нея тишината е край на изречението.
Пълен дуплекс, с прости думи
Досега гласовите агенти работеха като радиостанция: ти говориш, пускаш бутона, той говори. Пълният дуплекс е телефонът. И двамата можете да говорите едновременно, да се прекъснете, да кажете „аха" насред чуждото изречение, без разговорът да се разпадне.
Хитрото е разделението. Гласовият модел държи разговора жив, а тежката мисъл може да отиде при друг модел отзад. Значи може да сложиш по-лек модел за записване на час и по-тежък за сложен проблем.
Числата за бенчмарка са на OpenAI. Цената от 0,05 долара, тоест 5 цента на минута, е само за гласа; моделът отзад се плаща отделно и сметката за него зависи от това колко мисли.
Ако правиш гласов асистент за клиенти на български, провери първо дали езикът ти е сред поддържаните. После пробвай не скоростта, а колко търпелив е, когато човекът отсреща търси думата.