Skip to content

AWS ensina a cortar custos de token em pipelines RAG no Bedrock filtrando contexto irrelevante

Resposta curta

A AWS publicou um método para o Amazon Bedrock que comprime documentos recuperados, mantendo apenas os trechos relevantes à pergunta do usuário antes de enviá-los ao LLM, reduzindo o volume de tokens por requisição. Para empresas com bots de suporte ou busca interna baseados em RAG, isso pode reduzir de forma significativa o custo por consulta e a latência das respostas, sem alterar a qualidade.

O que isso significa na operação

Se o bot de suporte, o assistente de vendas ou a busca de conhecimento interno da sua empresa roda em um pipeline de retrieval-augmented generation via Bedrock (ou arquitetura semelhante), a conta de tokens cresce proporcionalmente à quantidade de contexto irrelevante empilhado em cada prompt — documentos longos, texto padrão e trechos quase duplicados recuperados 'por garantia'. A compressão sensível à consulta resolve isso filtrando os trechos recuperados contra a pergunta real antes que cheguem ao modelo, e é exatamente essa alavanca que determina se o assistente de IA de uma equipe de suporte de 20 pessoas custa R$1.000 ou R$10.000 por mês em escala. Times que já rodam RAG em produção devem tratar isso como item concreto de redução de custo, não como upgrade futuro — não exige troca de modelo, apenas a inserção de uma etapa de compressão no pipeline existente de recuperação para geração.

O blog de Machine Learning da AWS detalhou uma técnica para reduzir o custo de sistemas de retrieval-augmented generation (RAG) construídos sobre o Amazon Bedrock. A abordagem, chamada de compressão sensível à consulta (query-aware compression), filtra os trechos recuperados de acordo com a pergunta específica do usuário antes de enviá-los ao modelo de linguagem subjacente, em vez de encaminhar documentos ou blocos de texto inteiros como estão.

A maioria dos sistemas RAG recupera um número fixo de blocos de documento por consulta e passa todos eles para a janela de contexto do modelo, independentemente de quanto desse texto é realmente relevante para a pergunta. Isso infla a contagem de tokens por requisição — e, como o Bedrock e a maioria dos LLMs hospedados cobram por token, isso infla diretamente a fatura. O método da AWS pontua e reduz o conteúdo recuperado às partes que importam para determinada consulta, diminuindo os tokens enviados ao modelo sem exigir um índice de recuperação diferente ou um modelo subjacente diferente.

Isso importa operacionalmente porque o RAG se tornou a arquitetura padrão para bots de suporte com IA, busca de conhecimento interno e assistentes de capacitação de vendas em empresas pequenas e médias — sistemas que respondem perguntas puxando informações de documentos, tickets ou manuais de produto da empresa, em vez de depender apenas dos dados de treinamento de um modelo. À medida que o uso escala de um piloto para uma implantação completa, os custos de token gerados por janelas de contexto superdimensionadas costumam ser o maior item de despesa, superando o custo das próprias chamadas ao modelo.

Para uma empresa B2B de 10 a 200 funcionários que já roda ou está pilotando uma ferramenta de suporte ou busca baseada em RAG no Bedrock, essa técnica é diretamente aplicável: trata-se de uma modificação de pipeline, não de uma reconstrução de arquitetura, e o post da AWS inclui os mecanismos necessários para implementá-la. Empresas avaliando fornecedores de automação de suporte com IA também devem perguntar se o pipeline de recuperação do fornecedor já aplica compressão ou filtragem semelhante — a diferença aparece na fatura mensal, não na demonstração.

O post da AWS não trouxe números de preço, benchmarks de latência ou dados de adoção além da descrição arquitetural; as equipes devem tratar a magnitude da economia como dependente da carga de trabalho e não confirmada até ser testada contra o próprio corpus de recuperação.

Fonte: AWS Machine Learning Blog

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.