Skip to content

AWS reformula o Bedrock AgentCore para cortar custo de memória ociosa e atrasos de cold start

Resposta curta

A AWS lançou uma nova versão do runtime do Bedrock AgentCore que libera memória assim que uma sessão de agente para de usá-la, em vez de cobrar pelo pico de uso durante toda a sessão, e mantém a latência de cold start perto de 2 segundos independente do tamanho do container, contra até 30 segundos no runtime anterior.

O que isso significa na operação

Se seus agentes de suporte ou vendas rodam no Bedrock AgentCore, isso muda dois números que realmente importam: a fatura da AWS e o tempo de espera do cliente quando um agente ocioso volta a funcionar. Antes, um agente de longa duração ou com picos de uso continuava pagando pelo pico de memória durante toda a sessão, e os cold starts pioravam conforme a imagem do container ou a concorrência cresciam — um problema real para agentes que ficam parados a maior parte do dia e disparam em horário comercial. O novo runtime cobra mais próximo do uso real e mantém o cold start estável em cerca de 2 segundos independente do tamanho da imagem, então times que rodam vários agentes (um triador de suporte, um bot de qualificação de leads, um assistente interno de operações) podem deixá-los escalados a zero entre requisições sem a antiga penalidade de latência quando um cliente ou representante os aciona a frio. É uma mudança de infraestrutura, não uma nova capacidade, mas reduz o custo operacional exatamente do padrão que a maioria das empresas de 10 a 200 pessoas usa: vários agentes especializados que ficam ociosos na maior parte do tempo.

A AWS anunciou uma nova versão do runtime por trás do Amazon Bedrock AgentCore, a camada de computação gerenciada que times usam para implantar e rodar agentes de IA sem operar sua própria infraestrutura.

A mudança ataca dois custos que aparecem quando agentes deixam de ser trocas curtas de chat e passam a ser trabalho de produção mais longo e, muitas vezes, ocioso. Primeiro, memória: o runtime original mantinha a alocação de pico de memória de uma sessão até ela terminar, mesmo depois que o agente parava de usá-la, então agentes com picos de uso ou de longa duração pagavam pelo teto máximo durante todo o tempo em que rodavam. O novo runtime começa cada sessão com uma pegada de memória pequena e carrega mais apenas conforme a carga de trabalho exige, liberando memória assim que ela fica ociosa. A AWS diz que a cobrança agora acompanha esse uso liberado, e não o pico.

Segundo, cold starts: antes, inicializar um ambiente novo ficava mais lento conforme o tamanho da imagem do container ou a concorrência aumentavam. Testes da própria AWS — 5.000 invocações a frio por agente em cinco tamanhos de imagem, usando um agente vazio de eco que não chama nenhum modelo ou ferramenta — mostraram a latência P75 de cold start do runtime original subindo de cerca de 5,4 segundos para quase 30 segundos conforme o tamanho da imagem aumentava. O novo runtime prepara e tira um snapshot do ambiente uma única vez, depois restaura esse snapshot para cada nova instância, mantendo a latência P75 de cold start em cerca de 2 segundos, de imagens de 200 MB até 2 GB, independente do tamanho.

A AWS descreve o efeito líquido como uma taxa por unidade mais alta, mas muito menos horas-GB cobradas, com a fatura total caindo para a maioria dos agentes porque a redução na pegada de memória supera o aumento da taxa.

Para usar o novo runtime, desenvolvedores definem o parâmetro platformVersion como V2 ao criar ou atualizar um runtime. A AWS também listou vários recursos ainda por vir: preço de linha de base garantida (reservando um piso de memória e permitindo picos acima dele), opções maiores de computação e armazenamento, suporte a microVM x86, suspensão/retomada de sessão com snapshot de memória, e identidade com escopo restrito para agentes não supervisionados via chaves de contexto de sessão, voltado a limitar o que um agente pode fazer quando roda sem um humano observando.

Fonte: AWS Machine Learning Blog

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.