Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS: голос создаётся текстовым описанием
Google выпустила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — две новые модели синтеза речи в семействе Gemini Audio. Компания называет их самыми выразительными моделями генерации звука на сегодня. Flash TTS нацелена на творческую режиссуру и персонажные голоса, Flash-Lite TTS — на массовое и экономичное производство. Обе позволяют разработчикам управлять подачей строчка за строчкой с помощью обычного текстового описания.
Можно ли это развернуть? Да: обе модели уже доступны через Gemini API и Google AI Studio. Доступ только через API, открытых весов для самостоятельного хостинга нет. Корпоративный доступ через Gemini Enterprise указан как «скоро».
Что выпустила Google
Релиз делит синтез речи на два уровня с общими средствами управления:
- Gemini 3.8 Flash TTS создана для глубокой творческой режиссуры и дизайна персонажей. Целевые сценарии — игры, иммерсивные аудиокниги, подкасты и интерактивные медиа. Модель даёт детальный контроль над актёрскими нюансами, темпом, сменой диалекта и реакциями-поддакиваниями.
- Gemini 3.8 Flash-Lite TTS создана для больших объёмов и экономии. Google позиционирует её для дубляжа, создания аудиоконтента и выразительных голосовых агентов: доступен тонкий контроль тона, темпа и выразительных нюансов.
В AI Studio ссылки на площадку используют идентификаторы моделей gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.
Дизайн голоса по текстовому описанию
Раньше Gemini TTS предлагала 30 оригинальных голосов. Релиз 3.8 переходит к куда более крупной голосовой системе.
- Генеративный дизайн голоса: Flash TTS создаёт новые голоса по описанию роли, акцента и характеристик голоса. Работает более чем со 100 языками и диалектами. В демонстрациях Google есть диджей из Мельбурна, монотонный робот и японский дракон.
- Библиотека голосов: разработчикам доступно более 2000 готовых к работе голосов, включая региональные варианты — мексиканский испанский, квебекский французский, шотландский английский.
- Сохранение и масштабирование: собственные голоса можно сохранять и переиспользовать с минимальным «дрейфом» между проектами.
- Ремикс голоса (скоро): пользователи смогут менять тембр, высоту, темп и акцент библиотечного голоса с помощью подсказок.
Режиссура исполнения
Обе модели принимают режиссёрские указания, записанные прямо в сценарии. Gemini также может управлять подачей по естественным репликам сценария.
- Длинные формы: качество голоса, темп и тембр сохраняются на протяжении многочасового непрерывного аудио.
- Нативное разделение на двух говорящих: один сценарий ведёт многоходовой диалог с различимыми, раздельными голосами.
- Вокальные вставки: невербальные сигналы вроде <laughs>, <sigh> и <gasp> добавляют разговору живость.
- Поддакивания: вставки активного слушания вроде |mhm| и |yeah| управляют реакциями и комедийной паузой.
Клонирование голоса и контроль безопасности
Клонирование голоса строит устойчивый вокальный профиль по 30-секундному образцу. Образец должен быть вашим голосом или голосом, на который у вас есть права. Для клонирования требуется запись устного согласия владельца голоса, сверяемая с исходным диктором.
Каждый клип моделей Gemini Audio несёт водяной знак SynthID. Эта незаметная метка встраивается прямо в аудиовыход. Клонированные голоса также сопровождаются контент-учётными данными C2PA. Более широкий подход к безопасности Google описывает в карточке модели Gemini 3.8 Audio.
Результаты бенчмарков
Google приводит следующие результаты новых моделей:
- Бенчмарк дизайна голоса Hume AI: Flash TTS занимает первое место с оценкой 71,4 (по данным Hume AI).
- Моделирование акцентов: Flash TTS лидирует с показателем 60,8.
- Общий индекс качества Hume AI: Flash TTS — первое место, Flash-Lite TTS — второе.
- Слепое предпочтение в Voice Arena: обе модели занимают верхние позиции в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.
Главное
- Google выпустила Gemini 3.8 Flash TTS для творческих задач и Flash-Lite TTS для масштабирования.
- Flash TTS создаёт новые голоса по описаниям на более чем 100 языках и диалектах.
- Разработчики получают более 2000 рабочих голосов вместо 30 оригинальных.
- Для клонирования голоса нужен 30-секундный образец и совпадающая запись согласия.
- Flash TTS занимает первое место в бенчмарке дизайна голоса Hume AI с оценкой 71,4.
Вопросы и ответы
- Что такое Gemini 3.8 Flash TTS? Это модель синтеза речи Google для творческого дизайна голоса и построчного управления исполнением. Доступна через Gemini API и Google AI Studio.
- Чем отличается Flash-Lite TTS? Она оптимизирована для больших объёмов и экономичных задач вроде дубляжа и голосовых агентов. Занимает второе место в общем индексе качества Hume AI.
- Можно ли клонировать собственный голос? Да, при наличии 30-секундного образца и записи устного согласия. Функция недоступна в AI Studio в ряде регионов, включая Великобританию, ЕЭЗ и Индию.
