Skip to content

SageMaker incorpora enrutamiento por prefijos para reducir la latencia de LLMs autoalojados

Respuesta corta

AWS introdujo el enrutamiento consciente de prefijos para Amazon SageMaker Inference, que dirige solicitudes con un prefijo de prompt común a la misma instancia GPU para reutilizar su caché KV. Esto reduce el tiempo hasta el primer token y el cómputo de GPU necesario para prompts de sistema repetidos o historiales de conversación largos, sin requerir cambios en el código de la aplicación.

Qué significa para las operaciones

La mayoría de las empresas B2B de 10 a 200 personas usan una API alojada como OpenAI o Anthropic, y este cambio no las afecta directamente. Pero si tu automatización de operaciones o soporte corre un modelo autoalojado o afinado detrás de SageMaker —algo común cuando se manejan datos sensibles de clientes, historiales de tickets o guiones de venta propietarios que deben permanecer en tu propia VPC— esta actualización de enrutamiento es una reducción gratuita de latencia y costo. Los bots de soporte y las herramientas de asistencia a agentes que reutilizan el mismo prompt de sistema en miles de tickets al día verán una respuesta más rápida en el primer token y menor gasto en GPU con solo actualizar a la nueva estrategia de enrutamiento, sin cambios en los prompts ni en la lógica de la aplicación.

AWS anunció el enrutamiento consciente de prefijos para Amazon SageMaker Inference, una función de balanceo de carga que dirige las solicitudes entrantes de LLM hacia la instancia GPU que con mayor probabilidad ya tiene un prefijo de prompt coincidente en su caché de clave-valor (KV).

La inferencia de modelos de lenguaje grandes reprocesa todo el prompt en cada llamada a menos que se pueda reutilizar la caché de atención subyacente. Las cargas de trabajo que repiten un prompt de sistema, ejemplos de pocos disparos o un historial de conversación creciente —la norma en chatbots de soporte y copilotos de ventas— se benefician enormemente de los aciertos de caché, ya que el modelo solo necesita computar los tokens nuevos en lugar de todo el contexto cada vez. El balanceo de carga estándar por round-robin o por menor número de conexiones distribuye las solicitudes de forma aleatoria entre instancias, provocando fallos de caché frecuentes y forzando el recómputo completo.

El enrutamiento consciente de prefijos rastrea qué instancias backend han servido recientemente un prefijo de prompt dado y envía preferentemente las solicitudes coincidentes a esas instancias. AWS reporta que esto mejora las tasas de acierto de caché y reduce tanto la latencia como el costo de cómputo para cargas de trabajo multiturno y de prompts con plantillas, particularmente en volúmenes de solicitudes más altos donde la fragmentación de caché suele ser común. La función está disponible como una configuración de estrategia de enrutamiento en los endpoints de SageMaker Inference y no requiere cambios en el código del modelo ni en las aplicaciones cliente.

Se trata de una optimización a nivel de infraestructura, no de un nuevo modelo o API. Se aplica específicamente a equipos que alojan sus propios modelos o modelos afinados en SageMaker, y no a usuarios de endpoints de API gestionados de OpenAI, Anthropic o los modelos fundacionales alojados de Bedrock, donde el enrutamiento lo gestiona internamente el proveedor.

Para las empresas que sí ejecutan inferencia en SageMaker —a menudo una decisión deliberada para mantener los datos de clientes dentro de una VPC privada, cumplir un requisito de residencia de datos o reducir el costo marginal a alto volumen— la actualización actúa directamente sobre dos aspectos operativamente relevantes: la latencia de respuesta en interacciones de chat en vivo y el costo de GPU por conversación. Las herramientas de soporte donde los agentes esperan la respuesta de un modelo antes de contestar a un cliente, o las herramientas de ventas salientes que generan mensajes personalizados a escala, son las cargas de trabajo con mayor probabilidad de mostrar una diferencia medible tras habilitar la nueva estrategia de enrutamiento.

Fuente: AWS Machine Learning Blog

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.