Destaque
Bedrock ganha cache de prompts e derruba custo de ferramentas de suporte com IA
A AWS adicionou cache de prompts ao Amazon Bedrock, permitindo que aplicações reaproveitem trechos de prompt já processados (instruções de sistema, contexto longo, exemplos) em vez de reprocessá-los a cada chamada. A AWS relata redução de até 90% no custo de tokens de entrada e até 85% na latência para modelos suportados, cortando diretamente o custo operacional de agentes e chats de IA construídos no Bedrock.
O que muda na operação — Se o seu chatbot de suporte, assistente interno de conhecimento ou copiloto de vendas roda no Bedrock e envia o mesmo prompt de sistema ou a mesma documentação de produto a cada requisição — o que a maioria das ferramentas com recuperação aumentada faz —, isso reduz o custo por consulta e acelera o tempo de resposta sem qualquer mudança no modelo em si. Times que operam automação de suporte em alto volume (centenas ou milhares de tickets por dia) devem verificar se o cache é aplicado automaticamente ou configurá-lo explicitamente, já que a AWS destaca que o recurso funciona melhor quando uma parte grande do prompt — como um trecho de base de conhecimento ou definições de ferramentas — permanece idêntica entre chamadas. Para uma empresa de 10 a 200 pessoas que já paga por token em fluxos de suporte ou vendas com IA no Bedrock, isso é uma alavanca de custo direta que vale a pena checar já neste trimestre, não uma consideração para o futuro.