Компания Google выпустила две новые ИИ-модели Gemini для преобразования текста в речь. Первая подходит для массовых генераций с минимальными затратами, а вторая — для более масштабных разработок. Использовать их разработчики предлагают в создании фильмов, игр, подкастов, озвучивания книг и других творческих задач. 

Gemini 3.8 Flash-Lite TTS (text-to-speech) разработана и оптимизирована для дубляжа текста, создания аудиоконтента и озвучки собственных голосовых агентов. При ее использовании можно контролировать тон, темп и выразительность говорящего. 

Gemini 3.8 Flash TTS позволяет с нуля создавать совершенно новые голоса, чтобы оживлять персонажей. Пользователю доступна возможность управлять каждой репликой, контролировать мельчайшие детали актерской игры, смену диалекта и другие функции, утверждают в Google. 

Изначально система предоставляет доступ к 30 голосам озвучки, которые можно адаптировать до бесконечности: создавать уникальные голоса с нуля на более чем 100 языках и диалектах (в том числе русском). Также в библиотеке есть более 2 тысяч полностью готовых к использованию голосов.

Модель позволяет копировать собственный голос, ей достаточно «услышать» 30-секундный образец говорящего (это должен быть сам пользователь или запись голоса, на которую у него есть права). 

Скоро разработчики обещают внедрить возможность в мельчайших деталях настраивать тембр, высоту, темп и акцент голоса на готовых вариантах из библиотеки (например, «добавить легкий южный акцент» или «смягчить произношение»).

Подготовленный голос, как утверждают в Google, может сохранять естественный темп и тембр персонажа на протяжении нескольких часов непрерывного аудио. В процессе можно добавлять реалистичности звучанию: смех, вздох, междометия и так далее. 

Gemini 3.8 Flash TTS ограниченно бесплатно доступна в Google AI Studio и в Gemini Notebook, а Flash-Lite TTS — в Google Vids. 

Источник: Google