Destacado
AWS empaqueta un contenedor listo para transcribir llamadas con identificación de hablante
AWS lanzó el WhisperX Deep Learning Container, una imagen GPU preconstruida que combina transcripción Whisper, alineación forzada wav2vec2 y diarización de hablantes, desplegable en endpoints de SageMaker AI sin necesidad de un build propio. Genera marcas de tiempo por palabra y etiquetas de hablante, orientado a control de calidad en contact centers, notas de reuniones y revisión de cumplimiento.
Qué cambia en operaciones — Para un equipo de soporte o ventas que acumula grabaciones de llamadas, esto elimina una parte real del trabajo de ingeniería necesario para obtener transcripciones que digan no solo qué se dijo, sino quién lo dijo y cuándo, hasta el nivel de palabra. Esa es la diferencia entre una transcripción que sirve para buscar en una revisión de cumplimiento y una sobre la que realmente se puede construir QA automatizado, coaching o puntuación de sentimiento. La salvedad: sigue siendo un componente de infraestructura de AWS, no un producto terminado; alguien tiene que conectar los endpoints de SageMaker, elegir entre despliegue en tiempo real o asíncrono según la duración de las llamadas, y gestionar costos de GPU, autoescalado y seguridad de S3. Los equipos sin ingeniería de ML propia seguirán necesitando un integrador de sistemas o un proveedor que ya tenga esta capa construida.