AWS анонсировала prefix-aware routing для Amazon SageMaker Inference — функцию балансировки нагрузки, которая направляет входящие запросы к LLM на ту GPU-инстанцию, которая с наибольшей вероятностью уже хранит совпадающий префикс промпта в своём key-value (KV) кэше.
При инференсе больших языковых моделей весь промпт пересчитывается заново при каждом вызове, если кэш внимания нельзя переиспользовать. Нагрузки, повторяющие системный промпт, few-shot-примеры или растущую историю диалога — обычная ситуация для чат-ботов поддержки и copilot-инструментов продаж — сильно выигрывают от попаданий в кэш, поскольку модели нужно вычислить только новые токены, а не весь контекст заново. Стандартная балансировка по принципу round-robin или least-connections распределяет запросы случайным образом между инстанциями, что приводит к частым промахам кэша и вынужденному полному пересчёту.
Prefix-aware routing отслеживает, какие бэкенд-инстанции недавно обслуживали тот или иной префикс промпта, и приоритетно направляет совпадающие запросы именно туда. По данным AWS, это повышает частоту попаданий в кэш и снижает как латентность, так и вычислительные затраты для многоходовых и шаблонных промптов, особенно при высоких объёмах запросов, где churn кэша иначе становится обычным явлением. Функция доступна как конфигурация стратегии маршрутизации на эндпоинтах SageMaker Inference и не требует изменений в коде модели или клиентских приложениях.
Это оптимизация уровня инфраструктуры, а не новая модель или API. Она применима именно к командам, размещающим собственные или дообученные модели на SageMaker, а не к пользователям управляемых API-эндпоинтов от OpenAI, Anthropic или хостед-моделей Bedrock, где маршрутизация обрабатывается провайдером внутренне.
Для компаний, которые действительно запускают инференс на SageMaker — часто это осознанный выбор ради хранения данных клиентов внутри частного VPC, соответствия требованиям резидентности данных или снижения предельных затрат при большом объёме — обновление напрямую влияет на две операционно значимые вещи: латентность ответа в живых чат-взаимодействиях и стоимость GPU на один диалог. Инструменты поддержки, где оператор ждёт ответа модели перед тем как ответить клиенту, или инструменты исходящих продаж, генерирующие персонализированные сообщения в масштабе, — это те нагрузки, где после включения новой стратегии маршрутизации разница будет наиболее заметна.