AWS anunció el enrutamiento consciente de prefijos para Amazon SageMaker Inference, una función de balanceo de carga que dirige las solicitudes entrantes de LLM hacia la instancia GPU que con mayor probabilidad ya tiene un prefijo de prompt coincidente en su caché de clave-valor (KV).
La inferencia de modelos de lenguaje grandes reprocesa todo el prompt en cada llamada a menos que se pueda reutilizar la caché de atención subyacente. Las cargas de trabajo que repiten un prompt de sistema, ejemplos de pocos disparos o un historial de conversación creciente —la norma en chatbots de soporte y copilotos de ventas— se benefician enormemente de los aciertos de caché, ya que el modelo solo necesita computar los tokens nuevos en lugar de todo el contexto cada vez. El balanceo de carga estándar por round-robin o por menor número de conexiones distribuye las solicitudes de forma aleatoria entre instancias, provocando fallos de caché frecuentes y forzando el recómputo completo.
El enrutamiento consciente de prefijos rastrea qué instancias backend han servido recientemente un prefijo de prompt dado y envía preferentemente las solicitudes coincidentes a esas instancias. AWS reporta que esto mejora las tasas de acierto de caché y reduce tanto la latencia como el costo de cómputo para cargas de trabajo multiturno y de prompts con plantillas, particularmente en volúmenes de solicitudes más altos donde la fragmentación de caché suele ser común. La función está disponible como una configuración de estrategia de enrutamiento en los endpoints de SageMaker Inference y no requiere cambios en el código del modelo ni en las aplicaciones cliente.
Se trata de una optimización a nivel de infraestructura, no de un nuevo modelo o API. Se aplica específicamente a equipos que alojan sus propios modelos o modelos afinados en SageMaker, y no a usuarios de endpoints de API gestionados de OpenAI, Anthropic o los modelos fundacionales alojados de Bedrock, donde el enrutamiento lo gestiona internamente el proveedor.
Para las empresas que sí ejecutan inferencia en SageMaker —a menudo una decisión deliberada para mantener los datos de clientes dentro de una VPC privada, cumplir un requisito de residencia de datos o reducir el costo marginal a alto volumen— la actualización actúa directamente sobre dos aspectos operativamente relevantes: la latencia de respuesta en interacciones de chat en vivo y el costo de GPU por conversación. Las herramientas de soporte donde los agentes esperan la respuesta de un modelo antes de contestar a un cliente, o las herramientas de ventas salientes que generan mensajes personalizados a escala, son las cargas de trabajo con mayor probabilidad de mostrar una diferencia medible tras habilitar la nueva estrategia de enrutamiento.