Сегодня 11 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi выпустила ИИ-модель CocktailASR-1 для распознавания речи в шумных помещениях

Xiaomi представила открытую модель искусственного интеллекта CocktailASR-1. Она предназначена для решения одной из наиболее сложных задач в области расшифровки аудио — выделения голоса конкретного человека в ситуации, когда несколько людей говорят одновременно.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

В Xiaomi проблему условно обозначили как «эффект коктейльной вечеринки». Большинство специализированных ИИ-моделей справляются с распознаванием речи, когда говорит один человек, но если друг на друга накладываются несколько голосов, ситуация значительно усложняется. Текст искажается, предложения сливаются, а реплики приписываются не тем собеседникам. В обратном направлении компания решила эту задачу с моделью OmniVoice — CocktailASR-1 же не генерирует, а выделяет и расшифровывает речь. Для работы с моделью необходимо представить короткий образец с голосом нужного человека. Она использует его как эталон, а затем, проанализировав запись с несколькими участниками, распознает и расшифрует речь только этого человека.

В ряде тестов по распознаванию речи в условиях многоголосных образцов она, отметили в Xiaomi, продемонстрировала ведущие результаты и превзошла существующие аналоги, предназначенные для решения той же задачи. Сложными условиями её возможности не исчерпываются — она умеет расшифровывать речь и в том случае, когда на записи голос только одного человека. Она также умеет избегать необоснованных предположений: если в предложенной записи указанный в качестве образца голос отсутствует, она выдаст пустой текст и не будет пытаться расшифровать слова другого человека.

Наконец, у Xiaomi CocktailASR-1 есть режим цепочки рассуждений — он позволяет пользователям изучать логику, на основе которой выполнялась расшифровка, а не просто видеть итоговый текст. Новая модель доступна на GitHub и Hugging Face.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Обширная метроидвания Aeterna Lucis отправит игроков предотвращать конец света и низвергать бога Хаоса — новый трейлер и дата выхода 20 мин.
OpenAI ускорит научные исследования с помощью ИИ — первый «исследователь-стажёр» появится уже в сентябре 52 мин.
«Нужно брать деньги и бежать»: власти Майами-Бич одобрили «ненавязчивую» рекламную кампанию GTA VI в городе 53 мин.
Xiaomi выпустила ИИ-модель CocktailASR-1 для распознавания речи в шумных помещениях 54 мин.
Цукерберг хотел плоскую Meta, но ИИ всё изменил — пониженных сотрудников возвращают на руководящие должности 2 ч.
Ранний доступ в Google Play может превратиться в рассадник вредоносов 3 ч.
OpenAI научила ИИ говорить и слушать одновременно — полнодуплексная модель GPT-Live-1 доступна разработчикам 3 ч.
Google выпустила приложение Gemini для Windows 5 ч.
Пропавший с радаров онлайн-шутер про ограбления Fairgames от Sony засветился на закрытом тестировании под подставным названием 5 ч.
Аналитики объяснили, почему Sony бросила шпионский экшен нового поколения Physint от Кодзимы 6 ч.