Главное
AWS выпустил готовый контейнер для транскрипции звонков с разметкой по говорящим
AWS выпустил Deep Learning Container WhisperX - готовый GPU-образ, объединяющий транскрипцию Whisper, принудительное выравнивание wav2vec2 и диаризацию спикеров, который разворачивается на эндпоинтах SageMaker AI без кастомной сборки. На выходе - пословные тайм-коды и метки говорящих для контроля качества в контакт-центрах, заметок со встреч и комплаенс-проверок.
Что меняется для операций — Для команды поддержки или продаж, тонущей в записях звонков, это снимает изрядную часть инженерной работы по получению транскриптов, которые показывают не просто что было сказано, а кто и когда это сказал - вплоть до отдельного слова. Это разница между транскриптом, который можно искать для комплаенс-проверки, и транскриптом, на основе которого реально строить автоматический контроль качества, коучинг или скоринг тональности. Оговорка: это по-прежнему инфраструктурный компонент AWS, а не готовый продукт - кто-то всё равно должен настроить эндпоинты SageMaker, выбрать реальное время или асинхронную обработку в зависимости от длины звонков и управлять расходами на GPU, автомасштабированием и безопасностью S3. Командам без собственной ML-инженерии по-прежнему понадобится системный интегратор или вендор, у которого этот слой уже встроен.