ТЕХНОЛОГИИ

Сбер разрабатывает голосовой ИИ с полным дуплексом для одновременной речи и слушания

Сбербанк анонсировал создание голосового ИИ, который сможет одновременно говорить и слушать. Технология основана на одной модели, что значительно ускорит взаимодействие.

Сбербанк ведет работу над новым искусственным интеллектом для голосового общения, который будет функционировать в полнодуплексном режиме, позволяя одновременно слушать и говорить. Об этом сообщил Сергей Марков, директор по развитию технологий ИИ в банке.

В отличие от существующих голосовых ассистентов, работающих в полудуплексном режиме, новая система будет использовать единую модель, способную обрабатывать все действия одновременно. Это значит, что время ответа сократится до 160–320 миллисекунд — такого же, как у человека в разговоре. Также планируется внедрение видеомодальности, что позволит ИИ видеть пользователя и управлять движениями своего видеоаватара.

Подобные технологии уже были представлены на международной арене: первой моделью с полным дуплексом стала Moshi от французской компании Kyutai, выпущенная в 2024 году. В дальнейшем аналогичные разработки появились у Google и OpenAI. В России аналогов пока нет, однако «Яндекс» разработал систему Realtime API, которая может быстро отвечать, но всё же ожидает смены реплики собеседника, в отличие от нового решения от Сбера.

По материалам: 3dnews.ru