Сегодня 29 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

SpaceXAI удвоила точность распознавания речи в новой модели Grok Voice Transcribe 2.0

SpaceXAI выпустила новую модель Grok Voice Transcribe 2.0 для преобразования речи в текст. По заявлению разработчиков, она допускает вдвое меньше ошибок, чем предыдущая версия, при той же стоимости. Модель ориентирована на сложные записи, включая телефонные разговоры с помехами, одновременную речь нескольких людей, а также региональные акценты и диалекты.

 Источник изображения: Grok

Источник изображения: Grok

Grok Voice Transcribe 2.0, как сообщает MarkTechPost, построена на базе аудиомодели, которая используется в Grok Voice. Технология уже ежедневно обрабатывает десятки тысяч звонков в службы поддержки, расшифровывает миллионы часов видеоматериалов и применяется в голосовом ассистенте автомобилей Tesla. Для обучения использовались многоязычные записи с шумами и помехами, после чего модель дополнительно дорабатывалась методами постобучения.

В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 заняла первое место среди 32 потоковых моделей по показателю AA-WER Streaming. Компания также протестировала её на четырёх внутренних наборах данных: телефонных разговорах; диалогах с Grok; произнесённых номерах телефонов, обычных и электронных адресах; коротких фразах для голосовых ассистентов на 19 языках. Во всех четырёх случаях версия 2.0 показала лучшие результаты, чем версия 1.0, однако внутренние данные предоставлены самой SpaceXAI и независимо не подтверждались.

Одним из главных улучшений разработчики называют многоязычное распознавание. Модель автоматически определяет язык, поддерживает десятки языков и способна продолжать расшифровку при смене языка непосредственно во время разговора. На наборе коротких фраз показатель WER, отражающий долю ошибок при распознавании слов, снизился с 20,6 до 6,8 %, то есть примерно на 67 %. Документация также указывает на поддержку автоматического форматирования чисел, денежных сумм и единиц измерения для 25 языков.

Модель доступна через Speech to Text API в пакетном и потоковом режимах. В потоковом режиме поддерживается аудиокодек Opus с потоком данных около 4 Кбайт/с. Для сравнения: несжатый звук в формате PCM с частотой дискретизации 24 кГц требует около 48 Кбайт/с. API поддерживает временные метки и оценки уверенности распознавания каждого слова, разделение речи разных собеседников без дополнительной платы, до восьми аудиоканалов и возможность задать до 100 ключевых терминов. Также предусмотрены автоматическое форматирование чисел и дат, удаление слов-паразитов и определение момента окончания реплики для голосовых ассистентов.

В пакетном режиме можно загружать файлы размером до 500 Мбайт в 12 аудиоформатах, а потоковое распознавание осуществляется через WebSocket. В API модель имеет идентификатор grok-voice-transcribe-2.0. Пакетная расшифровка стоит $0,10 за час аудио, потоковая — $0,20 за час.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Красочный ритм-платформер Suri: The Seventh Note получил дату релиза — игра выйдет до конца октября 34 мин.
«Впиши своё имя в историю легендарной серии»: Acer проведёт первый в России любительский турнир Predator League Open Cup по Valorant 2 ч.
Паранормальный симулятор библиотекаря Something is Wrong with the Library отправит игроков сортировать книги и избавляться от нечисти 2 ч.
Google заменит ИИ-ботов Gem в приложении Gemini на «навыки», но вряд ли это поможет конкуренции с Muse 2 ч.
Культурный мегапроект соавтора Disco Elysium скоро выйдет из тени — объявлена дата анонса амбициозной ролевой игры Red Rooster 5 ч.
CD Projekt Red раскрыла полный список улучшений и окончательные системные требования The Witcher 3: Wild Hunt — Remastered 6 ч.
Minecraft получит первое за 15 лет новое измерение — продажи игры превысили 425 миллионов копий 7 ч.
ИИ-агентов научат соблюдать «границы»: Nvidia представила платформу Open Agent Safety 8 ч.
«Давненько я так сильно не ждал игру»: релизный трейлер Ace Combat 8: Wings of Theve разгорячил фанатов перед скорым взлётом 8 ч.
Китайский ИИ завоёвывает корпоративную Америку: компании США всё чаще используют открытые ИИ-модели ради экономии 11 ч.
Новая статья: Обзор смартфона Samsung Galaxy S26 FE: неисправимый консерватор 12 мин.
Thermal Grizzly и Noctua выпустили монитор питания видеокарт WireView Pro II с очень тихим вентилятором 2 ч.
«Культурный ренессанс»: Bose представила проводные наушники с шумоподавлением за $99 5 ч.
Хуанг уверен в дальнейшем росте Nvidia: компания расширила выкуп акций на рекордные $150 млрд 5 ч.
Мини-ПК за $7399: представлена рабочая станция Minisforum на Ryzen AI Max+ Pro 495 с 192 Гбайт памяти и SSD на 2 Тбайт 5 ч.
Honor представила Magic 9 — компактный флагман со Snapdragon 8 Elite Gen 5, парой 200-Мп камер ARRI и поддержкой телеконвертеров 7 ч.
Батарея на 11 000 мА·ч, прошлогодний Snapdragon и камера на 200 Мп: Honor представила геймерский смартфон Magic 9 Super Edition 8 ч.
В России подскочили продажи восстановленных Android-смартфонов 8 ч.
Исторический пуск: Starship впервые вышел на орбиту Земли — несмотря на барахлящие двигатели 8 ч.
Honor представила флагман Magic 9 Pro Max с двумя 200-Мп камерами и квадратной фронталкой 8 ч.