Skip to content

AWS enseña cómo reducir el costo de tokens en RAG sobre Bedrock filtrando contexto irrelevante

Respuesta corta

AWS publicó un método para Amazon Bedrock que comprime los documentos recuperados dejando solo los pasajes relevantes para la consulta del usuario antes de enviarlos a un LLM, reduciendo el volumen de tokens por solicitud. Para empresas con bots de soporte o búsqueda interna basados en RAG, esto puede bajar de forma significativa el costo por consulta y la latencia de respuesta sin afectar la calidad de las respuestas.

Qué significa para las operaciones

Si tu bot de soporte, asistente de ventas o buscador de conocimiento interno corre sobre un pipeline de generación aumentada por recuperación a través de Bedrock (o una arquitectura similar), la factura de tokens crece según cuánto contexto irrelevante se mete en cada prompt: documentos largos, texto repetitivo y pasajes casi duplicados que se recuperan 'por las dudas'. La compresión consciente de la consulta ataca ese problema filtrando los fragmentos recuperados contra la pregunta real antes de que lleguen al modelo, que es exactamente la palanca que determina si el asistente de IA de un equipo de soporte de 20 personas cuesta 200 o 2.000 dólares al mes a escala. Los equipos que ya corren RAG en producción deberían tratar esto como un ítem concreto de reducción de costos, no como una mejora futura: no requiere cambiar de modelo, solo insertar un paso de compresión en el pipeline existente de recuperación a generación.

El blog de Machine Learning de AWS detalló una técnica para reducir el costo de los sistemas de generación aumentada por recuperación (RAG) construidos sobre Amazon Bedrock. El enfoque, llamado compresión consciente de la consulta, filtra los pasajes recuperados contra la pregunta específica del usuario antes de enviarlos al modelo de lenguaje subyacente, en lugar de reenviar documentos o fragmentos completos tal como fueron recuperados.

La mayoría de los sistemas RAG recuperan una cantidad fija de fragmentos de documentos por consulta y pasan todos al contexto del modelo, sin importar cuánto de ese texto sea realmente relevante para la pregunta. Eso infla el número de tokens por solicitud, y como Bedrock y la mayoría de los LLM alojados cobran por token, infla directamente la factura. El método de AWS puntúa y recorta el contenido recuperado hasta quedarse con las partes que importan para una consulta dada, reduciendo los tokens enviados al modelo sin necesitar un índice de recuperación distinto ni un modelo subyacente diferente.

Esto importa operativamente porque RAG se convirtió en la arquitectura por defecto para bots de soporte con IA, búsqueda de conocimiento interno y asistentes de habilitación de ventas en empresas pequeñas y medianas: sistemas que responden preguntas extrayendo información de documentos, tickets o manuales de producto de la empresa en lugar de depender solo de los datos de entrenamiento del modelo. A medida que el uso escala de un piloto a un despliegue completo, los costos de tokens por ventanas de contexto sobredimensionadas suelen ser el rubro más grande, superando incluso el costo de las llamadas al modelo en sí.

Para una empresa B2B de 10 a 200 personas que ya opera o está pilotando una herramienta de soporte o búsqueda basada en RAG sobre Bedrock, esta técnica es directamente aplicable: es una modificación del pipeline, no un rediseño completo, y la publicación de AWS incluye los detalles técnicos necesarios para implementarla. Las empresas que evalúan proveedores de automatización de soporte con IA también deberían preguntar si el pipeline de recuperación del proveedor ya aplica compresión o un filtrado similar: la diferencia se nota en la factura mensual, no en la demo.

La publicación de AWS no incluyó cifras de precios, benchmarks de latencia ni números de adopción más allá de la descripción arquitectónica; los equipos deberían tratar la magnitud del ahorro como dependiente de la carga de trabajo y no confirmada hasta probarla contra su propio corpus de recuperación.

Fuente: AWS Machine Learning Blog

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.