Сегодня 03 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про аудиоредакторы

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Журналисты показали скриншоты ранней версии ремейка Splinter Cell, включая записку от разработчиков на русском языке 9 ч.
CD Projekt Red отчиталась об успехах за первую половину 2026 года — продажи Cyberpunk 2077: Phantom Liberty взяли новую высоту 12 ч.
В грозу между струйками: Google увернулась от очередной попытки принудить её к разделению 12 ч.
Кооперативный хоррор Reanimal от создателей Little Nightmares удостоился престижной награды от принца Швеции 13 ч.
Google выпустила ИИ-модель Gemini 3.8 Flash и её спецверсию Cyber — всего через три недели после предшественниц 13 ч.
Создатель SteamDB продал сервис площадке Nexus Mods, потому что устал от ИИ в интернете 14 ч.
Массовые увольнения из-за ИИ, возможно, уже закончились 14 ч.
Opera проиграла Microsoft в суде ЕС — Edge не признали «привратником» по закону о цифровых рынках 15 ч.
Геймплейное видео триллера Ontos от авторов Soma и Amnesia: крысы, головоломки и атмосферные диалоги 16 ч.
Microsoft повысит безопасность Windows 11 ценой производительности в играх 16 ч.
Чтобы высадить людей на Луне не позднее 2028 года, NASA решило упростить скафандр для этой миссии 3 ч.
Новая статья: Один GPU хорошо, а два лучше: обзор внешней видеокарты AORUS RTX 5060 Ti AI BOX 8 ч.
Sugon готовит первую мобильную рабочую станцию с 64-поточным CPU и толщиной меньше 17 мм 13 ч.
Смартфоны получат аналог Nvidia DLSS: её принесёт следующий флагманский чип Qualcomm Snapdragon 13 ч.
Huawei представила смартфоны Nova 16s и 16s Pro, планшет MatePad Pro и наушники FreeBuds Neo 13 ч.
Packard Bell возродился к столетию — Acer вернула легендарный бренд с компактным ноутбуком DotBook и не только 13 ч.
Широких складных смартфонов скоро станет больше: Xiaomi 18 Fold показался перед анонсом 7 сентября 13 ч.
Старый конь борозды не портит: поставки ленточных накопителей резко подскочили в первой четверти 2026 года 14 ч.
Анонсированы смарт-часы Huawei Watch D3, которые научились измерять артериальное давление ещё точнее 15 ч.
Acer представила игровые мониторы Nitro и Predator с разрешением до 5K и частотой до 1000 Гц на панелях QD-OLED, IPS и VA 15 ч.