AWS lanzó el almacenamiento en caché de prompts para Amazon Bedrock, su servicio administrado para construir aplicaciones de IA generativa sobre modelos fundacionales como Claude de Anthropic y los propios modelos Titan/Nova de Amazon.
La caché de prompts permite que una aplicación marque partes de un prompt —como una instrucción de sistema, un documento extenso usado como contexto, o un conjunto de definiciones de herramientas— como reutilizables. En llamadas posteriores que repiten el mismo segmento cacheado, Bedrock omite el reprocesamiento de ese contenido y lo sirve desde la caché, en lugar de ejecutarlo de nuevo a través de todo el pipeline de inferencia del modelo.
AWS afirma que esto puede reducir los costos de tokens de entrada hasta en un 90% y la latencia hasta en un 85% en modelos compatibles, dependiendo de cuánto del prompt sea cacheable y con qué frecuencia se repita entre llamadas. La función apunta directamente a aplicaciones con un contexto grande y estático que se reutiliza en muchas solicitudes —un patrón habitual en sistemas de generación aumentada por recuperación (RAG), bots de soporte al cliente que consultan una base de conocimiento fija, y asistentes de código que reutilizan prompts de sistema extensos.
La mecánica importa para cualquiera que opere cargas de trabajo de IA en producción: la caché se aplica por modelo y típicamente requiere que el prefijo cacheado permanezca idéntico byte a byte entre llamadas, lo que significa que los equipos deben estructurar los prompts de modo que el contenido estático (instrucciones, documentos de referencia) vaya primero y el contenido variable (la consulta real del usuario) vaya al final. La publicación de AWS repasa patrones de implementación y las compensaciones entre costo y latencia según distintos perfiles de tráfico.
No se trata de un modelo nuevo ni de una capacidad nueva en cuanto a lo que la IA puede hacer: es una optimización de costo y rendimiento para aplicaciones ya existentes basadas en Bedrock. Los equipos que ya ejecutan automatización de soporte, herramientas de habilitación de ventas o copilotos internos sobre Bedrock pueden aplicar esto sin rediseñar su elección de modelo, aunque puede ser necesario ajustar la estructura del prompt para maximizar la porción cacheada.
Para las empresas que evalúan construir sobre Bedrock frente a alternativas como la API de OpenAI o Azure AI, esto cierra parte de la brecha de costos que ya ofrecían las funciones de caché de la competencia, y es un dato relevante en las comparaciones de proveedores para decisiones de infraestructura tomadas este año.