Skip to content

AWS empaqueta un contenedor listo para transcribir llamadas con identificación de hablante

Respuesta corta

AWS lanzó el WhisperX Deep Learning Container, una imagen GPU preconstruida que combina transcripción Whisper, alineación forzada wav2vec2 y diarización de hablantes, desplegable en endpoints de SageMaker AI sin necesidad de un build propio. Genera marcas de tiempo por palabra y etiquetas de hablante, orientado a control de calidad en contact centers, notas de reuniones y revisión de cumplimiento.

Qué significa para las operaciones

Para un equipo de soporte o ventas que acumula grabaciones de llamadas, esto elimina una parte real del trabajo de ingeniería necesario para obtener transcripciones que digan no solo qué se dijo, sino quién lo dijo y cuándo, hasta el nivel de palabra. Esa es la diferencia entre una transcripción que sirve para buscar en una revisión de cumplimiento y una sobre la que realmente se puede construir QA automatizado, coaching o puntuación de sentimiento. La salvedad: sigue siendo un componente de infraestructura de AWS, no un producto terminado; alguien tiene que conectar los endpoints de SageMaker, elegir entre despliegue en tiempo real o asíncrono según la duración de las llamadas, y gestionar costos de GPU, autoescalado y seguridad de S3. Los equipos sin ingeniería de ML propia seguirán necesitando un integrador de sistemas o un proveedor que ya tenga esta capa construida.

AWS publicó una guía de despliegue para el WhisperX Deep Learning Container (DLC), una imagen lista para GPU que combina el modelo de voz a texto Whisper de OpenAI con alineación forzada wav2vec2 y diarización de hablantes. El contenedor sigue el contrato de servicio estándar de SageMaker AI, de modo que los equipos lo despliegan en un endpoint en tiempo real o asíncrono sin ensamblar el pipeline por su cuenta ni proporcionar un token de Hugging Face.

El problema central que resuelve WhisperX: la transcripción genérica entrega marcas de tiempo a nivel de enunciado (con desfases de varios segundos) y sin etiquetas de hablante. Eso rompe los flujos de revisión de cumplimiento, subtitulado y redacción. WhisperX añade marcas de tiempo por palabra y etiquetas de hablante, produciendo salida en formatos json, verbose_json, srt o vtt.

AWS plantea dos patrones de despliegue. Los endpoints en tiempo real son adecuados para clips cortos e interactivos que terminan dentro del límite de respuesta de 60 segundos de SageMaker, con facturación mientras el endpoint está activo. Los endpoints asíncronos intermedian entrada y salida a través de S3, eliminan el límite de tiempo y pueden autoescalar a cero cuando están inactivos, pensados para grabaciones largas y procesamiento por lotes de alto volumen.

Detalles de producción que AWS marca como esenciales: las variantes GPU requieren fijar InferenceAmiVersion a al2-ami-sagemaker-inference-gpu-3-1, ya que los controladores de la AMI de host por defecto no logran iniciar la imagen CUDA 12.8; la inferencia se serializa a una solicitud por contenedor, por lo que el rendimiento escala añadiendo instancias, no concurrencia; y la elección de instancia va desde ml.g4dn.xlarge por costo hasta ml.g5.2xlarge por margen de rendimiento.

Los casos de uso que la propia AWS enumera incluyen medición de tiempo de habla en contact centers, adherencia a guiones y análisis de sentimiento, notas de reuniones consultables, subtitulado para bibliotecas de medios y e-learning, y transcripciones con etiquetas de hablante para auditorías y descubrimiento legal en salud, derecho y finanzas.

Fuente: AWS Machine Learning Blog

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.