OpenAI представила GPT-Live-1: ИИ теперь может говорить и слушать одновременно
OpenAI анонсировала модель GPT-Live-1, позволяющую ИИ одновременно вести разговор и воспринимать речь. Доступ к ней предоставлен разработчикам через API.
OpenAI объявила о запуске новой голосовой модели искусственного интеллекта GPT-Live-1, которая поддерживает полнодуплексный режим общения. Это означает, что модель может одновременно слушать и генерировать речь, что открывает новые возможности для создания голосовых приложений с более естественными сценариями взаимодействия.
Ранее модель была представлена в июле и была доступна только через интерфейс ChatGPT, но теперь разработчики могут использовать её через API. Полнодуплексный режим позволяет избежать проблем с очередностью реплик, что часто бывает в обычных разговорах. OpenAI подчеркивает, что новая модель может эффективно обрабатывать ситуации, когда собеседник перебивает ИИ.
Разработчики, интегрирующие GPT-Live-1, могут настроить голосовые взаимодействия в соответствии с потребностями пользователей. В ходе предварительных испытаний сервис Speak отметил, что модель предоставляет ученикам больше времени для ответа на вопросы виртуального преподавателя, что уменьшает случаи перебивания на 80 % по сравнению с предыдущими версиями.
GPT-Live-1 предназначена для устного общения, в то время как другие модели, такие как GPT-6 Astra, обрабатывают запросы на бэкенде. В тесте Tau3, который оценивает навыки голосовых агентов в обслуживании клиентов, GPT-Live-1 показала результат 86,2 %, что значительно выше, чем у её предшественников. Новая модель также продемонстрировала на 30 % большую эффективность в тестах по сравнению с GPT-Realtime-2.1, улучшив параметры задержки и качество интерактивного взаимодействия.
Стоимость использования GPT-Live-1 составляет $0,05 за минуту, плюс расходы на работу модели на бэкенде. Она доступна и через платформу OpenAI Presence, предназначенную для разработки интеллектуальных агентов.
По материалам: 3dnews.ru