AWS publicó una guía de despliegue para el WhisperX Deep Learning Container (DLC), una imagen lista para GPU que combina el modelo de voz a texto Whisper de OpenAI con alineación forzada wav2vec2 y diarización de hablantes. El contenedor sigue el contrato de servicio estándar de SageMaker AI, de modo que los equipos lo despliegan en un endpoint en tiempo real o asíncrono sin ensamblar el pipeline por su cuenta ni proporcionar un token de Hugging Face.
El problema central que resuelve WhisperX: la transcripción genérica entrega marcas de tiempo a nivel de enunciado (con desfases de varios segundos) y sin etiquetas de hablante. Eso rompe los flujos de revisión de cumplimiento, subtitulado y redacción. WhisperX añade marcas de tiempo por palabra y etiquetas de hablante, produciendo salida en formatos json, verbose_json, srt o vtt.
AWS plantea dos patrones de despliegue. Los endpoints en tiempo real son adecuados para clips cortos e interactivos que terminan dentro del límite de respuesta de 60 segundos de SageMaker, con facturación mientras el endpoint está activo. Los endpoints asíncronos intermedian entrada y salida a través de S3, eliminan el límite de tiempo y pueden autoescalar a cero cuando están inactivos, pensados para grabaciones largas y procesamiento por lotes de alto volumen.
Detalles de producción que AWS marca como esenciales: las variantes GPU requieren fijar InferenceAmiVersion a al2-ami-sagemaker-inference-gpu-3-1, ya que los controladores de la AMI de host por defecto no logran iniciar la imagen CUDA 12.8; la inferencia se serializa a una solicitud por contenedor, por lo que el rendimiento escala añadiendo instancias, no concurrencia; y la elección de instancia va desde ml.g4dn.xlarge por costo hasta ml.g5.2xlarge por margen de rendimiento.
Los casos de uso que la propia AWS enumera incluyen medición de tiempo de habla en contact centers, adherencia a guiones y análisis de sentimiento, notas de reuniones consultables, subtitulado para bibliotecas de medios y e-learning, y transcripciones con etiquetas de hablante para auditorías y descubrimiento legal en salud, derecho y finanzas.