OpenAI открыла через API доступ к новейшей голосовой модели искусственного интеллекта, поддерживающей полнодуплексный режим, то есть она может одновременно говорить и слушать. Это позволяет разработчикам создавать голосовые приложения с новыми сценариями диалогового взаимодействия.
Источник изображения: Brecht Corbeel / unsplash.com
Модель OpenAI GPT-Live-1 была анонсирована в июле — она позволяет вводить запросы не текстом, а голосом. Первоначально она была доступна только через интерфейс ChatGPT, а теперь может использоваться по API. Полнодуплексный режим позволяет GPT-Live-1 одновременно слушать и генерировать речь, что делает общение более естественным. В обычном разговоре люди часто говорят одновременно, и необходимость строго соблюдать очерёдность, как при полудуплексной радиосвязи, может вызывать раздражение.
Особое внимание в OpenAI уделили возможностям настройки модели: внедряющие GPT-Live-1 разработчики могут адаптировать механизмы голосового взаимодействия и связанные с ними рабочие сценарии под нужды пользователей приложений. «Основное преимущество GPT-Live-1 — способность штатно обрабатывать ситуации, когда собеседник перебивает ИИ, — уже приносит бизнесу ощутимую пользу: в ходе предварительного тестирования сервис Speak установил, что GPT-Live-1 даёт ученикам больше времени перед ответом виртуального преподавателя языка, сократив случаи с перебиванием на 80 % по сравнению с предыдущими системами, работающими в режиме строгой очерёдности реплик», — рассказали в OpenAI.
GPT-Live-1 предназначается для ведения устного диалога, в то время как модель в бэкенде, например, флагманская GPT-6 Astra или более экономичная для простых задач, занимается поиском информации, работает с инструментами и управляет задачами. Новая модель представляет собой шаг вперёд по сравнению с выпущенной в 2024 году Realtime. В тесте Tau3, который оценивает интеллектуальные возможности голосовых агентов при выполнении задач по обслуживанию клиентов, GPT-Live-1 набрала 86,2 %, а GPT-Realtime-2.1 и GPT-Realtime-2 показали 45,7 % и 42,4 % соответственно. Новая модель, по собственным оценкам OpenAI, демонстрирует на 30 % более высокую эффективность в тесте Full Duplex Bench по сравнению с GPT-Realtime-2.1, превосходя предшественницу по таким параметрам как задержка при смене говорящего и качество интерактивного взаимодействия. Её уже внедрили на сервисе Yelp Host — теперь бронирование столиков стало более естественным.
Стоимость работы с GPT-Live-1 составляет $0,05 за минуту плюс затраты на работу модели в бэкенде. Она также доступна через OpenAI Presence — корпоративную платформу для создания интеллектуальных агентов.