Skip to content

SageMaker научился маршрутизировать запросы по кэшу — латентность собственных LLM падает без правок кода

Короткий ответ

AWS представила prefix-aware routing для Amazon SageMaker Inference: запросы с одинаковым префиксом промпта направляются на одну и ту же GPU-инстанцию, чтобы переиспользовать её KV-кэш. Это сокращает время до первого токена и экономит вычисления GPU при повторяющихся системных промптах или длинной истории диалога — без изменений в коде приложения.

Что это значит для операций

Большинство B2B-компаний с 10-200 сотрудниками работают через хостед-API вроде OpenAI или Anthropic, и это обновление их напрямую не касается. Но если ваша поддержка или операционная автоматизация использует самостоятельно размещённую или дообученную модель за SageMaker — что типично при работе с чувствительными данными клиентов, историями тикетов или проприетарными сценариями продаж, которые должны оставаться в вашем VPC — эта маршрутизация даёт бесплатное снижение латентности и затрат. Support-боты и инструменты agent-assist, переиспользующие один и тот же системный промпт для тысяч тикетов в день, получат более быстрый первый токен ответа и меньший расход GPU просто за счёт перехода на новую стратегию маршрутизации, без изменения самих промптов или логики приложения.

AWS анонсировала prefix-aware routing для Amazon SageMaker Inference — функцию балансировки нагрузки, которая направляет входящие запросы к LLM на ту GPU-инстанцию, которая с наибольшей вероятностью уже хранит совпадающий префикс промпта в своём key-value (KV) кэше.

При инференсе больших языковых моделей весь промпт пересчитывается заново при каждом вызове, если кэш внимания нельзя переиспользовать. Нагрузки, повторяющие системный промпт, few-shot-примеры или растущую историю диалога — обычная ситуация для чат-ботов поддержки и copilot-инструментов продаж — сильно выигрывают от попаданий в кэш, поскольку модели нужно вычислить только новые токены, а не весь контекст заново. Стандартная балансировка по принципу round-robin или least-connections распределяет запросы случайным образом между инстанциями, что приводит к частым промахам кэша и вынужденному полному пересчёту.

Prefix-aware routing отслеживает, какие бэкенд-инстанции недавно обслуживали тот или иной префикс промпта, и приоритетно направляет совпадающие запросы именно туда. По данным AWS, это повышает частоту попаданий в кэш и снижает как латентность, так и вычислительные затраты для многоходовых и шаблонных промптов, особенно при высоких объёмах запросов, где churn кэша иначе становится обычным явлением. Функция доступна как конфигурация стратегии маршрутизации на эндпоинтах SageMaker Inference и не требует изменений в коде модели или клиентских приложениях.

Это оптимизация уровня инфраструктуры, а не новая модель или API. Она применима именно к командам, размещающим собственные или дообученные модели на SageMaker, а не к пользователям управляемых API-эндпоинтов от OpenAI, Anthropic или хостед-моделей Bedrock, где маршрутизация обрабатывается провайдером внутренне.

Для компаний, которые действительно запускают инференс на SageMaker — часто это осознанный выбор ради хранения данных клиентов внутри частного VPC, соответствия требованиям резидентности данных или снижения предельных затрат при большом объёме — обновление напрямую влияет на две операционно значимые вещи: латентность ответа в живых чат-взаимодействиях и стоимость GPU на один диалог. Инструменты поддержки, где оператор ждёт ответа модели перед тем как ответить клиенту, или инструменты исходящих продаж, генерирующие персонализированные сообщения в масштабе, — это те нагрузки, где после включения новой стратегии маршрутизации разница будет наиболее заметна.

Источник: AWS Machine Learning Blog

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.