Skip to content

AWS lança contêiner pronto para transcrição de chamadas com identificação de locutor

Resposta curta

A AWS lançou o WhisperX Deep Learning Container, uma imagem GPU pré-construída que combina transcrição Whisper, alinhamento forçado wav2vec2 e diarização de locutores, pronta para endpoints do SageMaker AI sem build customizado. Ela gera timestamps por palavra e rótulos de locutor, voltada para QA de contact center, atas de reunião e revisão de compliance.

O que isso significa na operação

Para uma equipe de suporte ou vendas afogada em gravações de chamadas, isso elimina boa parte do trabalho de engenharia necessário para obter transcrições que não dizem apenas o que foi falado, mas quem falou e quando, até o nível da palavra. Essa é a diferença entre uma transcrição que serve para busca em revisão de compliance e uma sobre a qual dá para construir QA automatizado, coaching ou pontuação de sentimento. A ressalva: isso ainda é um componente de infraestrutura da AWS, não um produto pronto — alguém precisa configurar os endpoints do SageMaker, escolher entre implantação em tempo real ou assíncrona conforme a duração das chamadas, e gerenciar custos de GPU, autoscaling e segurança do S3. Equipes sem engenharia de ML interna ainda vão precisar de um integrador de sistemas ou de um fornecedor que já tenha construído essa camada.

A AWS publicou um guia de implantação para o WhisperX Deep Learning Container (DLC), uma imagem pronta para GPU que reúne o modelo de fala para texto Whisper, da OpenAI, com alinhamento forçado wav2vec2 e diarização de locutores. O contêiner segue o contrato padrão de serving do SageMaker AI, então as equipes o implantam em um endpoint em tempo real ou assíncrono sem montar o pipeline do zero nem fornecer um token do Hugging Face.

O problema central que o WhisperX resolve: a transcrição genérica entrega timestamps no nível da fala (com erro de vários segundos) e nenhum rótulo de locutor. Isso compromete fluxos de revisão de compliance, legendagem e redação de conteúdo sensível. O WhisperX adiciona timestamps por palavra e marcações de locutor, produzindo saída nos formatos json, verbose_json, srt ou vtt.

A AWS descreve dois padrões de implantação. Endpoints em tempo real servem para clipes curtos e interativos que terminam dentro do limite de resposta de 60 segundos do SageMaker, com cobrança enquanto o endpoint estiver ativo. Endpoints assíncronos intermedeiam entrada e saída via S3, eliminam o limite de tempo e podem escalar automaticamente até zero quando ociosos, voltados para gravações longas e processamento em lote de alto volume.

Detalhes de produção que a AWS destaca como essenciais: as variantes GPU exigem fixar o InferenceAmiVersion como al2-ami-sagemaker-inference-gpu-3-1, já que os drivers da AMI padrão do host falham ao iniciar a imagem CUDA 12.8; a inferência é serializada em uma requisição por contêiner, então o throughput escala adicionando instâncias, não concorrência; e a escolha de instância vai de ml.g4dn.xlarge, para economia, até ml.g5.2xlarge, para folga de capacidade.

Os casos de uso listados pela própria AWS incluem medição de tempo de conversa em contact centers, aderência a script e análise de sentimento, atas de reunião pesquisáveis, legendagem para mídia e bibliotecas de e-learning, e transcrições com rótulo de locutor para auditorias e descoberta jurídica nos setores de saúde, jurídico e financeiro.

Fonte: AWS Machine Learning Blog

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.