Skip to content

AWS выпустил готовый контейнер для транскрипции звонков с разметкой по говорящим

Короткий ответ

AWS выпустил Deep Learning Container WhisperX - готовый GPU-образ, объединяющий транскрипцию Whisper, принудительное выравнивание wav2vec2 и диаризацию спикеров, который разворачивается на эндпоинтах SageMaker AI без кастомной сборки. На выходе - пословные тайм-коды и метки говорящих для контроля качества в контакт-центрах, заметок со встреч и комплаенс-проверок.

Что это значит для операций

Для команды поддержки или продаж, тонущей в записях звонков, это снимает изрядную часть инженерной работы по получению транскриптов, которые показывают не просто что было сказано, а кто и когда это сказал - вплоть до отдельного слова. Это разница между транскриптом, который можно искать для комплаенс-проверки, и транскриптом, на основе которого реально строить автоматический контроль качества, коучинг или скоринг тональности. Оговорка: это по-прежнему инфраструктурный компонент AWS, а не готовый продукт - кто-то всё равно должен настроить эндпоинты SageMaker, выбрать реальное время или асинхронную обработку в зависимости от длины звонков и управлять расходами на GPU, автомасштабированием и безопасностью S3. Командам без собственной ML-инженерии по-прежнему понадобится системный интегратор или вендор, у которого этот слой уже встроен.

AWS опубликовал руководство по развёртыванию для Deep Learning Container (DLC) WhisperX - готового к работе с GPU образа, который объединяет модель речь-в-текст Whisper от OpenAI с принудительным выравниванием wav2vec2 и диаризацией спикеров. Контейнер следует стандартному контракту обслуживания SageMaker AI, поэтому команды разворачивают его на эндпоинт в реальном времени или асинхронный, не собирая пайплайн самостоятельно и не предоставляя токен Hugging Face.

Основная проблема, которую решает WhisperX: обычная транскрипция даёт тайм-коды на уровне высказываний (с погрешностью в несколько секунд) и не размечает говорящих. Это ломает процессы комплаенс-проверки, субтитрирования и редактирования конфиденциальных данных. WhisperX добавляет пословные тайм-коды и метки говорящих, выдавая результат в форматах json, verbose_json, srt или vtt.

AWS описывает два паттерна развёртывания. Эндпоинты реального времени подходят для коротких интерактивных клипов, укладывающихся в лимит ответа SageMaker в 60 секунд, тарификация идёт, пока эндпоинт активен. Асинхронные эндпоинты передают вход и выход через S3, снимают ограничение по времени и могут автомасштабироваться до нуля инстансов в простое - это рассчитано на длинные записи и объёмную пакетную обработку.

AWS отмечает как критичные следующие производственные детали: для GPU-вариантов нужно жёстко зафиксировать InferenceAmiVersion как al2-ami-sagemaker-inference-gpu-3-1, поскольку драйверы стандартного хостового AMI не запускают образ с CUDA 12.8; вывод сериализован до одного запроса на контейнер, поэтому пропускная способность масштабируется добавлением инстансов, а не параллелизмом; выбор инстанса варьируется от ml.g4dn.xlarge для экономии до ml.g5.2xlarge для запаса мощности.

Среди перечисленных AWS сценариев применения: измерение времени разговора в контакт-центрах, проверка соответствия скрипту и анализ тональности, поисковые заметки со встреч, субтитрирование для медиа и библиотек e-learning, а также транскрипты с разметкой говорящих для аудитов и судебных разбирательств в здравоохранении, юриспруденции и финансах.

Источник: AWS Machine Learning Blog

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.