Skip to content

Google lança dois modelos de TTS voltados para agentes de voz em produção

Resposta curta

O Google lançou o Gemini 3.8 Flash TTS e o Flash-Lite TTS em 23 de setembro de 2026, oferecendo criação de vozes personalizadas, mais de 2.000 vozes prontas e controle de entrega linha a linha via API do Gemini. O acesso via API empresarial pelo Gemini Enterprise ainda está por vir, ou seja, desenvolvedores já podem construir integrações de agentes de voz, mas o caminho de compra corporativa ainda não está totalmente aberto.

O que isso significa na operação

Para uma equipe de suporte ou vendas avaliando um agente de voz, isso muda o que é tecnicamente possível hoje: a API do Gemini já está disponível para desenvolvedores criarem vozes personalizadas com marca própria, dublagem multilíngue ou agentes conversacionais com ritmo e naturalidade realistas, e o Flash-Lite é apresentado explicitamente para agentes de voz de alto volume e custo eficiente. O problema é que o acesso via Gemini Enterprise ainda está 'a caminho' pela API, então uma empresa de 10 a 200 pessoas sem desenvolvedores internos provavelmente vai precisar esperar ou passar por uma plataforma parceira (Agora, LiveKit, Pipecat e Vercel são citadas como integradoras) em vez de obter isso por um console empresarial hoje.

O Google DeepMind apresentou o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS em 23 de setembro de 2026, ampliando sua família Gemini Audio com o que a empresa chama de seus modelos de geração de voz mais expressivos até agora.

O Flash TTS foi construído para direção criativa: desenvolvedores podem gerar vozes de personagens totalmente novas a partir de prompts em linguagem natural, dirigir a entrega linha por linha (ritmo, dialeto, indicações de atuação) e roteirizar cenas com dois locutores incluindo sons vocais como <laughs> ou <sigh> para alternância de turnos realista. O Flash-Lite TTS é posicionado para casos de uso de alto volume e custo eficiente, como dublagem e agentes de voz, com os mesmos controles refinados de tom e ritmo.

Ambos os modelos suportam mais de 100 idiomas e dialetos, e o Google afirma que a biblioteca cresce de 30 vozes originais para mais de 2.000 vozes prontas para produção, incluindo variedades regionais como espanhol mexicano, francês quebequense e inglês escocês. A replicação de voz permite que um usuário recrie um perfil vocal consistente a partir de uma amostra de 30 segundos, protegida por verificação de consentimento, marca d'água SynthID e credenciais C2PA. A remixagem de voz — ajuste fino de uma voz existente da biblioteca com prompts — está por vir. A replicação de voz não está disponível em Illinois, Texas, no EEE, Reino Unido, Suíça ou Índia.

Em benchmarks, o Google relata que o Flash TTS ficou em primeiro lugar no Voice Design Benchmark da Hume AI (71,4) e liderou a modelagem de sotaques (60,8), enquanto o Flash e o Flash-Lite ficaram em primeiro e segundo lugar, respectivamente, no Overall Quality Index da Hume AI. Em avaliações cegas no Voice Arena, ambos os modelos lideraram entre os concorrentes em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi.

O lançamento começa hoje para desenvolvedores pela API do Gemini e pelo Google AI Studio, para ambos os modelos. O acesso empresarial via API no Gemini Enterprise consta como em breve. O Flash TTS também chega a usuários gerais pelo Gemini Notebook, enquanto o Flash-Lite TTS chega a usuários gerais pelo Google Vids. Plataformas de desenvolvedores como Agora, LiveKit, Pipecat e Vercel estão habilitando a implantação desses modelos, e o Google cita Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang como parceiros que integram os modelos de TTS para dublagem, localização e agentes de voz conversacionais.

Fonte: Google DeepMind

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.