Google представила новые ИИ-модели синтеза речи Gemini 3.8 Flash TTS
Google анонсировала выпуск Gemini 3.8 Flash TTS и Flash-Lite TTS, новых моделей для синтеза речи, которые могут клонировать голоса и создавать выразительные аудиодорожки.
Компания Google анонсировала две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти модели расширяют возможности генерации голоса, позволяя пользователям создавать уникальные голосовые профили, управлять интонацией и создавать выразительные диалоги для различных медиаформатов, включая игры и аудиокниги.
Gemini 3.8 Flash TTS предлагает возможность кастомизации голосов, поддерживая более 100 языков и диалектов, а также предоставляет доступ к более чем 2000 уже готовым голосовым вариантам, включая региональные акценты. Кроме того, новая функция клонирования позволяет создавать копии голосов на основе 30-секундной аудиозаписи, при условии, что пользователь имеет соответствующее разрешение.
После выбора желаемого голоса, разработчики могут управлять каждой репликой отдельно, используя текстовые команды. Gemini 3.8 Flash TTS также может изменять темп и стиль исполнения, добавляя элементы, такие как шёпот и различные звуковые реакции, что делает ее подходящей для создания динамичного контента.
Обе модели обеспечивают длительную генерацию аудио, сохраняя качество и естественный ритм, что позволяет создавать продолжительные записи. Gemini 3.8 Flash-Lite TTS ориентирована на крупные проекты, такие как дубляж и создание голосовых ИИ-агентов.
По информации Google, Gemini 3.8 Flash TTS заняла первое место в бенчмарке Voice Design от Hume AI, а также продемонстрировала высокие результаты в тестах на моделирование акцентов. Новые модели доступны в Google AI Studio и через Gemini API, а также интегрированы с платформами Agora, LiveKit, Pipecat и Vercel.
По материалам: 3dnews.ru