O Google DeepMind apresentou o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS em 23 de setembro de 2026, ampliando sua família Gemini Audio com o que a empresa chama de seus modelos de geração de voz mais expressivos até agora.
O Flash TTS foi construído para direção criativa: desenvolvedores podem gerar vozes de personagens totalmente novas a partir de prompts em linguagem natural, dirigir a entrega linha por linha (ritmo, dialeto, indicações de atuação) e roteirizar cenas com dois locutores incluindo sons vocais como <laughs> ou <sigh> para alternância de turnos realista. O Flash-Lite TTS é posicionado para casos de uso de alto volume e custo eficiente, como dublagem e agentes de voz, com os mesmos controles refinados de tom e ritmo.
Ambos os modelos suportam mais de 100 idiomas e dialetos, e o Google afirma que a biblioteca cresce de 30 vozes originais para mais de 2.000 vozes prontas para produção, incluindo variedades regionais como espanhol mexicano, francês quebequense e inglês escocês. A replicação de voz permite que um usuário recrie um perfil vocal consistente a partir de uma amostra de 30 segundos, protegida por verificação de consentimento, marca d'água SynthID e credenciais C2PA. A remixagem de voz — ajuste fino de uma voz existente da biblioteca com prompts — está por vir. A replicação de voz não está disponível em Illinois, Texas, no EEE, Reino Unido, Suíça ou Índia.
Em benchmarks, o Google relata que o Flash TTS ficou em primeiro lugar no Voice Design Benchmark da Hume AI (71,4) e liderou a modelagem de sotaques (60,8), enquanto o Flash e o Flash-Lite ficaram em primeiro e segundo lugar, respectivamente, no Overall Quality Index da Hume AI. Em avaliações cegas no Voice Arena, ambos os modelos lideraram entre os concorrentes em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi.
O lançamento começa hoje para desenvolvedores pela API do Gemini e pelo Google AI Studio, para ambos os modelos. O acesso empresarial via API no Gemini Enterprise consta como em breve. O Flash TTS também chega a usuários gerais pelo Gemini Notebook, enquanto o Flash-Lite TTS chega a usuários gerais pelo Google Vids. Plataformas de desenvolvedores como Agora, LiveKit, Pipecat e Vercel estão habilitando a implantação desses modelos, e o Google cita Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang como parceiros que integram os modelos de TTS para dublagem, localização e agentes de voz conversacionais.