Google представила две TTS-модели Gemini с генерацией голосов по текстовому описанию
Flash TTS создаёт голос с заданными ролью, акцентом и тембром; обе модели поддерживают более 100 языков и режиссёрские указания для отдельных реплик. Голосовой клон требует 30-секундный образец и записанное согласие владельца голоса.
Flash предназначена для творческих задач, Lite — для масштаба
Google представила Gemini 3.8 Flash TTS и Flash-Lite TTS для генерации речи. Flash рассчитана на игровые персонажи, аудиокниги и подкасты; Lite — на массовое озвучивание, дубляж и голосовых агентов. Обе версии поддерживают более 100 языков и позволяют задавать подачу для каждой строки сценария.
В Flash пользователь может создать голос с нуля текстовым описанием его роли, акцента и вокальных особенностей или выбрать из каталога более чем 2 000 готовых голосов. Клонирование строит голосовой профиль по 30-секундному аудиообразцу; человек, чей голос копируют, должен отдельно записать устное согласие, которое совпадает с образцом. Генерации получают неслышимую водяную метку SynthID, по заявлению Google.
Обе модели понимают ремарки в сценарии, могут генерировать диалог двумя голосами и добавлять смех, вздохи и паузы. Обещанный Voice Remix для изменения тембра, высоты, темпа и акцента библиотечных голосов на момент публикации ещё не был доступен.
Тарифы и испытания отличаются для бесплатного и платного доступа
| Период и тип токена | Flash TTS | Flash-Lite TTS |
|---|---|---|
| До конца 2026 года — входной текст | $0,50 | $0,50 |
| До конца 2026 года — сгенерированное аудио | $9 | $6 |
| С 1 января 2027 года — входной текст | $1 | $1 |
| С 1 января 2027 года — сгенерированное аудио | $18 | $12 |
Google считает секунду сгенерированного звука за 25 аудиотокенов: по её расчёту, час выхода в 2026 году стоит около 0,81 доллара для Flash и 0,54 доллара для Lite, без учёта текстового ввода. После повышения тарифов с января 2027 года значения удвоятся. Компания также сообщает, что данные бесплатного уровня используются для улучшения продуктов, а платного — нет.
The Decoder в двух пробах отметил убедительное управление акцентом, но также высокий фоновый свист в обеих генерациях и изменение голоса к концу одного клипа. Эти небольшие журналистские пробы не заменяют систематического сравнения качества.