El blog de Machine Learning de AWS detalló una técnica para reducir el costo de los sistemas de generación aumentada por recuperación (RAG) construidos sobre Amazon Bedrock. El enfoque, llamado compresión consciente de la consulta, filtra los pasajes recuperados contra la pregunta específica del usuario antes de enviarlos al modelo de lenguaje subyacente, en lugar de reenviar documentos o fragmentos completos tal como fueron recuperados.
La mayoría de los sistemas RAG recuperan una cantidad fija de fragmentos de documentos por consulta y pasan todos al contexto del modelo, sin importar cuánto de ese texto sea realmente relevante para la pregunta. Eso infla el número de tokens por solicitud, y como Bedrock y la mayoría de los LLM alojados cobran por token, infla directamente la factura. El método de AWS puntúa y recorta el contenido recuperado hasta quedarse con las partes que importan para una consulta dada, reduciendo los tokens enviados al modelo sin necesitar un índice de recuperación distinto ni un modelo subyacente diferente.
Esto importa operativamente porque RAG se convirtió en la arquitectura por defecto para bots de soporte con IA, búsqueda de conocimiento interno y asistentes de habilitación de ventas en empresas pequeñas y medianas: sistemas que responden preguntas extrayendo información de documentos, tickets o manuales de producto de la empresa en lugar de depender solo de los datos de entrenamiento del modelo. A medida que el uso escala de un piloto a un despliegue completo, los costos de tokens por ventanas de contexto sobredimensionadas suelen ser el rubro más grande, superando incluso el costo de las llamadas al modelo en sí.
Para una empresa B2B de 10 a 200 personas que ya opera o está pilotando una herramienta de soporte o búsqueda basada en RAG sobre Bedrock, esta técnica es directamente aplicable: es una modificación del pipeline, no un rediseño completo, y la publicación de AWS incluye los detalles técnicos necesarios para implementarla. Las empresas que evalúan proveedores de automatización de soporte con IA también deberían preguntar si el pipeline de recuperación del proveedor ya aplica compresión o un filtrado similar: la diferencia se nota en la factura mensual, no en la demo.
La publicación de AWS no incluyó cifras de precios, benchmarks de latencia ni números de adopción más allá de la descripción arquitectónica; los equipos deberían tratar la magnitud del ahorro como dependiente de la carga de trabajo y no confirmada hasta probarla contra su propio corpus de recuperación.