Skip to content

Google выпускает две новые TTS-модели для промышленных голосовых агентов

Короткий ответ

23 сентября 2026 года Google выпустил Gemini 3.8 Flash TTS и Flash-Lite TTS с созданием кастомных голосов, библиотекой из 2000+ готовых голосов и построчным контролем подачи через Gemini API. Корпоративный доступ через Gemini Enterprise появится позже - разработчики уже могут строить интеграции голосовых агентов, но путь для корпоративных закупок пока не открыт полностью.

Что это значит для операций

Для команды поддержки или продаж, рассматривающей голосового агента, это меняет то, что технически доступно уже сегодня: Gemini API открыт для разработчиков и позволяет создавать брендированные голоса, многоязычный дубляж или разговорных агентов с реалистичным темпом и естественными паузами, причём Flash-Lite прямо позиционируется как решение для высоконагруженных и недорогих голосовых агентов. Загвоздка в том, что доступ через Gemini Enterprise всё ещё «скоро появится» через API, поэтому компании на 10-200 человек без штатных разработчиков, скорее всего, придётся подождать или работать через партнёрские платформы (среди названных интеграторов - Agora, LiveKit, Pipecat, Vercel), а не получить это через корпоративную консоль прямо сейчас.

Google DeepMind представил Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS 23 сентября 2026 года, расширив семейство Gemini Audio моделями, которые компания называет самыми выразительными в своей линейке на сегодняшний день.

Flash TTS создан для творческого управления голосом: разработчики могут генерировать совершенно новые голоса персонажей из текстовых описаний, задавать подачу построчно (темп, диалект, актёрские подсказки) и прописывать сцены с двумя говорящими, добавляя звуковые вставки вроде <laughs> или <sigh> для естественной смены реплик. Flash-Lite TTS предназначен для высоконагруженных и недорогих сценариев - дубляжа и голосовых агентов - с теми же тонкими настройками тона и темпа.

Обе модели поддерживают более 100 языков и диалектов, а библиотека, по данным Google, выросла с 30 исходных голосов до более чем 2000 готовых к использованию, включая региональные варианты вроде мексиканского испанского, квебекского французского и шотландского английского. Функция репликации голоса позволяет воссоздать устойчивый голосовой профиль по 30-секундному образцу - при обязательной проверке согласия, водяных знаках SynthID и credentials C2PA. Ремикс голоса - тонкая настройка существующего голоса из библиотеки через промпты - появится позже. Репликация голоса недоступна в Иллинойсе, Техасе, ЕЭЗ, Великобритании, Швейцарии и Индии.

По результатам тестов Google сообщает, что Flash TTS занял первое место в Voice Design Benchmark от Hume AI (71,4) и лидирует в моделировании акцентов (60,8), а Flash и Flash-Lite заняли первое и второе места соответственно в Overall Quality Index от Hume AI. В слепых оценках на Voice Arena обе модели опередили конкурентов в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.

Развёртывание для разработчиков стартует сегодня через Gemini API и Google AI Studio для обеих моделей. Корпоративный доступ через API в Gemini Enterprise заявлен как «скоро». Flash TTS также доступен обычным пользователям через Gemini Notebook, а Flash-Lite TTS - через Google Vids. Платформы для разработчиков, включая Agora, LiveKit, Pipecat и Vercel, обеспечивают развёртывание этих моделей, а среди партнёров, интегрирующих TTS-модели для дубляжа, локализации и разговорных голосовых агентов, Google называет Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang.

Источник: Google DeepMind

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.