Google DeepMind presentó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS el 23 de septiembre de 2026, ampliando su familia Gemini Audio con lo que la compañía describe como sus modelos de generación de voz más expresivos hasta la fecha.
Flash TTS está diseñado para la dirección creativa: los desarrolladores pueden generar voces de personajes completamente nuevas a partir de indicaciones en lenguaje natural, dirigir la entrega línea por línea (ritmo, dialecto, indicaciones de actuación) y guionizar escenas de dos hablantes con estallidos vocales como <laughs> o <sigh> para lograr turnos de conversación realistas. Flash-Lite TTS se posiciona para casos de uso de alto volumen y costo eficiente, como doblaje y agentes de voz, con los mismos controles finos de tono y ritmo.
Ambos modelos admiten más de 100 idiomas y dialectos, y Google afirma que la biblioteca escala de 30 voces originales a más de 2.000 voces listas para producción, incluidas variedades regionales como español mexicano, francés de Quebec e inglés escocés. La réplica de voz permite recrear un perfil vocal consistente a partir de una muestra de 30 segundos, con controles de verificación de consentimiento, marca de agua SynthID y credenciales C2PA. El remezclado de voz —ajustar una voz existente de la biblioteca mediante indicaciones— llegará próximamente. La réplica de voz no está disponible en Illinois, Texas, el EEE, el Reino Unido, Suiza ni India.
En cuanto a benchmarks, Google reporta que Flash TTS obtuvo el primer puesto en el Voice Design Benchmark de Hume AI (71.4) y lideró el modelado de acentos (60.8), mientras que Flash y Flash-Lite quedaron en primer y segundo lugar respectivamente en el Overall Quality Index de Hume AI. En evaluaciones ciegas en Voice Arena, ambos modelos lideraron entre sus competidores en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi.
El despliegue comienza hoy para desarrolladores a través de la API de Gemini y Google AI Studio para ambos modelos. El acceso empresarial vía API en Gemini Enterprise figura como "próximamente". Flash TTS también llega a usuarios generales a través de Gemini Notebook, mientras que Flash-Lite TTS llega a usuarios generales a través de Google Vids. Plataformas de desarrolladores como Agora, LiveKit, Pipecat y Vercel están habilitando el despliegue de estos modelos, y Google nombra a Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang como socios que integran los modelos TTS para doblaje, localización y agentes de voz conversacionales.