we_are_coded.by CODE · Светът, декодиран
EN
SpaceXAI

Grok Voice Transcribe 2.0 пише два пъти по-точно от първата версия по тестове на SpaceXAI, на същата цена

SpaceXAI News · събитието: 18 септември 2026Аудио

Новият модел за превръщане на реч в текст стъпва на аудио модела зад Grok Voice, разпознава езика сам и следи смяната му насред записа. Цената остава 0,10 долара на час аудио при пакетна обработка и 0,20 при поток.

Накратко
  • По данни на компанията моделът е първи по точност сред 32 модела за поточна транскрипция в класацията на Artificial Analysis.
  • При кратките гласови команди във вътрешния им тест грешката по думи пада от 20,6 на 6,8 на сто.
  • В графиката им с езиците български няма.
Проверено на1 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Номер на сметка, продиктуван по телефона с шум отзад. Имейл адрес, казан набързо. Точно там транскрипцията е най-трудна, и точно там грешката струва най-скъпо.

SpaceXAI мери точно на това място, и го казва.

Фактите: на 18 септември 2026 г. SpaceXAI пусна Grok Voice Transcribe 2.0. По данни на компанията моделът е два пъти по-точен от версия 1.0 при същата цена и е първи по точност сред 32 модела за поточна транскрипция в публичната класация на Artificial Analysis. Стъпва на аудио модела зад Grok Voice, който по думите им обслужва десетки хиляди обаждания в поддръжката на ден и асистента Grok в колите на Tesla. Транскрибира десетки езици, разпознава езика сам и следи смяната му в един запис. Вътрешните им тестове включват телефонни разговори при 8 kHz, разговори с Grok, продиктувани кодове и имейли и кратки команди на 19 езика; при кратките фрази грешката по думи пада от 20,6 на сто на 6,8 на сто. Цената е 0,10 долара на час аудио при пакетна обработка и 0,20 долара при поток, с разделяне по говорещи и времеви маркери. Atlassian го ползва за транскрипцията в Loom. Версия 2.0 скоро става стандартна в API, а 1.0 излиза от употреба в следващите седмици.

Цената е силната част. Поточната транскрипция е около половината от това, което показват за ElevenLabs и Deepgram в собствената си графика. При кол център с хиляди часове на месец това вече е ред в бюджета, а не закръгляване.

Транскрипцията се съди по имената и числата, не по гладкия текст.

Класирането обаче е тяхно цитиране на чужда класация, а графиката с езиците е без посочен външен източник. И едно, което е важно за нас: в графиката с езиците български няма. Това не значи, че не го пише. Значи, че не го мерят пред нас.

За разговори на български единственият честен тест е твой запис с твоя шум. Пусни един час и брой грешките в имената и числата.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→SpaceXAI News - Introducing Grok Voice Transcribe 2.0, 18.09.2026
Оригинал: https://wearecoded.com/articles/grok-voice-transcribe-2.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини