Google DeepMind представил Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS 23 сентября 2026 года, расширив семейство Gemini Audio моделями, которые компания называет самыми выразительными в своей линейке на сегодняшний день.
Flash TTS создан для творческого управления голосом: разработчики могут генерировать совершенно новые голоса персонажей из текстовых описаний, задавать подачу построчно (темп, диалект, актёрские подсказки) и прописывать сцены с двумя говорящими, добавляя звуковые вставки вроде <laughs> или <sigh> для естественной смены реплик. Flash-Lite TTS предназначен для высоконагруженных и недорогих сценариев - дубляжа и голосовых агентов - с теми же тонкими настройками тона и темпа.
Обе модели поддерживают более 100 языков и диалектов, а библиотека, по данным Google, выросла с 30 исходных голосов до более чем 2000 готовых к использованию, включая региональные варианты вроде мексиканского испанского, квебекского французского и шотландского английского. Функция репликации голоса позволяет воссоздать устойчивый голосовой профиль по 30-секундному образцу - при обязательной проверке согласия, водяных знаках SynthID и credentials C2PA. Ремикс голоса - тонкая настройка существующего голоса из библиотеки через промпты - появится позже. Репликация голоса недоступна в Иллинойсе, Техасе, ЕЭЗ, Великобритании, Швейцарии и Индии.
По результатам тестов Google сообщает, что Flash TTS занял первое место в Voice Design Benchmark от Hume AI (71,4) и лидирует в моделировании акцентов (60,8), а Flash и Flash-Lite заняли первое и второе места соответственно в Overall Quality Index от Hume AI. В слепых оценках на Voice Arena обе модели опередили конкурентов в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.
Развёртывание для разработчиков стартует сегодня через Gemini API и Google AI Studio для обеих моделей. Корпоративный доступ через API в Gemini Enterprise заявлен как «скоро». Flash TTS также доступен обычным пользователям через Gemini Notebook, а Flash-Lite TTS - через Google Vids. Платформы для разработчиков, включая Agora, LiveKit, Pipecat и Vercel, обеспечивают развёртывание этих моделей, а среди партнёров, интегрирующих TTS-модели для дубляжа, локализации и разговорных голосовых агентов, Google называет Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang.