Ir para o conteúdo

AWS Machine Learning Blog na mesa de operações

Tudo o que publicamos em AWS Machine Learning Blog, lido da mesa de operações: o que muda para uma empresa B2B de 10 a 200 pessoas.

  1. Destaque

    AWS libera Claude Sonnet 5.5 na Bedrock como camada de execução mais barata ao lado do Opus 5.5

    A AWS disponibilizou o Claude Sonnet 5.5 na Amazon Bedrock e na Claude Platform on AWS. Ele custa menos por tarefa e roda mais rápido que o Sonnet 5 em trabalhos bem delimitados, como codificação, geração de SQL e redação de documentos, mantendo os controles de IAM, CloudTrail e Guardrails da AWS. Foi projetado para atuar em conjunto com o Opus 5.5, que fica com o trabalho que exige julgamento.

    O que muda na operação — Para uma empresa que já roda assistentes de codificação, triagem de alertas ou geração de documentos baseados em Bedrock, isso é uma alavanca direta de custo e latência, não uma capacidade nova para avaliar do zero: direcionar tarefas bem definidas e de alto volume (geração de SQL, primeira resposta a alertas, edição de planilhas, trabalho documental rotineiro) para o Sonnet 5.5, reservando o Opus 5.5 para depuração de releases, revisão de segurança ou redação de contratos, deve reduzir o gasto por tarefa sem mexer na configuração existente de IAM, CloudTrail ou Guardrails. Times com orçamento mensal fixo de IA para agentes de codificação em IDE ou triagem de tickets de suporte têm o ganho mais imediato, já que o Sonnet 5.5 é voltado especificamente para cargas contínuas ou em escala com teto de gasto fixo.

  1. AWS lança contêiner pronto para transcrição de chamadas com identificação de locutor

    Para uma equipe de suporte ou vendas afogada em gravações de chamadas, isso elimina boa parte do trabalho de engenharia necessário para obter transcrições que não dizem apenas o que foi falado, mas quem falou e quando, até o nível da palavra. Essa é a diferença entre uma transcrição que serve para busca em revisão de compliance e uma sobre a qual dá para construir QA automatizado, coaching ou pontuação de sentimento. A ressalva: isso ainda é um componente de infraestrutura da AWS, não um produto pronto — alguém precisa configurar os endpoints do SageMaker, escolher entre implantação em tempo real ou assíncrona conforme a duração das chamadas, e gerenciar custos de GPU, autoscaling e segurança do S3. Equipes sem engenharia de ML interna ainda vão precisar de um integrador de sistemas ou de um fornecedor que já tenha construído essa camada.

  1. Opus 5.5 da Anthropic chega ao AWS Bedrock com custo menor por tarefa

    Para uma empresa B2B de 10 a 200 pessoas que roda assistentes de codificação agentica ou trabalho intensivo em documentos no Bedrock, o Opus 5.5 oferece uma alavanca direta: custo médio menor por tarefa e relatórios mais claros e passo a passo durante sessões longas, algo relevante para quem revisa a saída do agente antes que ela chegue a um cliente ou a um contrato. O detalhe é que os novos classificadores de segurança recusam mais pedidos que versões anteriores do Opus em áreas como biologia e cibersegurança — times com bots de suporte ou operações que ocasionalmente tocam em temas próximos de segurança (triagem de vulnerabilidades, redação de resposta a incidentes) devem testar o comportamento de recusa antes de colocar esse modelo em produção, já que uma resposta bloqueada no meio de um fluxo de trabalho é pior do que uma ligeiramente mais cara.

  1. Grok 4.6 chega à Amazon Bedrock com guardrails e trade-offs de preço entre regiões

    Para uma empresa de 10 a 200 pessoas rodando agentes de vendas ou suporte na AWS Bedrock, isso é uma decisão real de arquitetura, não apenas mais um modelo para testar. Guardrails, registro de invocações e cache de prompt agora funcionam no endpoint bedrock-runtime, que é o indicado quando se precisa de um limite de política em torno de um agente não supervisionado e de uma trilha de auditoria do que ele de fato fez. Mas saída estruturada em JSON e uso de ferramentas no lado do servidor continuam restritos ao bedrock-mantle, então um workflow que depende de saída com schema rígido precisa escolher esse endpoint em vez do outro. O preço adiciona mais uma alavanca: rotear pelo perfil Global de inferência entre regiões, mais barato, em vez do perfil Geo restrito aos EUA, ou cair para o nível de serviço Flex pela metade da tarifa padrão em trabalhos de lote não urgentes, muda a economia unitária de um agente mais do que a escolha do modelo em si.

  1. AWS reformula o Bedrock AgentCore para cortar custo de memória ociosa e atrasos de cold start

    Se seus agentes de suporte ou vendas rodam no Bedrock AgentCore, isso muda dois números que realmente importam: a fatura da AWS e o tempo de espera do cliente quando um agente ocioso volta a funcionar. Antes, um agente de longa duração ou com picos de uso continuava pagando pelo pico de memória durante toda a sessão, e os cold starts pioravam conforme a imagem do container ou a concorrência cresciam — um problema real para agentes que ficam parados a maior parte do dia e disparam em horário comercial. O novo runtime cobra mais próximo do uso real e mantém o cold start estável em cerca de 2 segundos independente do tamanho da imagem, então times que rodam vários agentes (um triador de suporte, um bot de qualificação de leads, um assistente interno de operações) podem deixá-los escalados a zero entre requisições sem a antiga penalidade de latência quando um cliente ou representante os aciona a frio. É uma mudança de infraestrutura, não uma nova capacidade, mas reduz o custo operacional exatamente do padrão que a maioria das empresas de 10 a 200 pessoas usa: vários agentes especializados que ficam ociosos na maior parte do tempo.

  1. Bedrock ganha cache de prompts e derruba custo de ferramentas de suporte com IA

    Se o seu chatbot de suporte, assistente interno de conhecimento ou copiloto de vendas roda no Bedrock e envia o mesmo prompt de sistema ou a mesma documentação de produto a cada requisição — o que a maioria das ferramentas com recuperação aumentada faz —, isso reduz o custo por consulta e acelera o tempo de resposta sem qualquer mudança no modelo em si. Times que operam automação de suporte em alto volume (centenas ou milhares de tickets por dia) devem verificar se o cache é aplicado automaticamente ou configurá-lo explicitamente, já que a AWS destaca que o recurso funciona melhor quando uma parte grande do prompt — como um trecho de base de conhecimento ou definições de ferramentas — permanece idêntica entre chamadas. Para uma empresa de 10 a 200 pessoas que já paga por token em fluxos de suporte ou vendas com IA no Bedrock, isso é uma alavanca de custo direta que vale a pena checar já neste trimestre, não uma consideração para o futuro.

  1. Rede de Dados Fintech Automatiza Integração de Parceiros com Agentes de IA do Bedrock

    Para uma empresa B2B de 10 a 200 funcionários, a integração de clientes e fornecedores costuma ser a etapa mais lenta e manual da passagem de vendas para entrega — contratos, verificações de conformidade, especificações de integração e configuração de contas, tudo revisado à mão. A abordagem da Ninth Wave mostra como um agente baseado no Bedrock pode ler documentos de onboarding, sinalizar exceções e gerar orientações de próximos passos automaticamente — a mesma arquitetura que uma equipe de operações poderia aplicar para reduzir um processo de integração de duas semanas para poucos dias, sem contratar mais gente.

  1. AWS lança pontuação de qualidade em tempo real para agentes de IA em produção

    Se sua empresa já colocou um agente de IA para lidar com chamados de suporte, qualificar leads ou disparar fluxos de trabalho, provavelmente você não tem nenhuma visibilidade sobre se a qualidade das respostas desse agente está piorando com o tempo — uma atualização de modelo, um caso de borda novo ou uma mudança na documentação pode quebrá-lo silenciosamente. O AgentCore Evaluations permite definir limites de qualidade (precisão, relevância, segurança) e receber alertas automáticos quando um agente em produção começa a desviar do esperado, em vez de descobrir isso três semanas depois numa reclamação de cliente. Para uma empresa de 10 a 200 pessoas sem equipe dedicada de monitoramento de ML, essa é a diferença entre identificar um bot de suporte quebrado em horas ou descobrir isso por um cliente irritado.

  1. SageMaker ganha roteamento inteligente para reduzir latência de LLMs auto-hospedados

    A maioria das empresas B2B de 10 a 200 pessoas usa uma API hospedada como OpenAI ou Anthropic, e essa mudança não as afeta diretamente. Mas se a automação de operações ou suporte roda um modelo auto-hospedado ou ajustado (fine-tuned) atrás do SageMaker — comum ao lidar com dados sensíveis de clientes, históricos de tickets ou scripts de vendas proprietários que precisam permanecer na própria VPC — essa atualização de roteamento representa uma redução gratuita de latência e custo. Bots de suporte e ferramentas de assistência a agentes que reutilizam o mesmo prompt de sistema em milhares de tickets por dia terão resposta mais rápida no primeiro token e menor gasto com GPU apenas ao migrar para a nova estratégia de roteamento, sem qualquer mudança nos prompts ou na lógica da aplicação.

  1. Claude 5.1 chega ao Amazon Bedrock e amplia opções de modelo para times que operam na AWS

    Se o seu atendimento ao cliente, o suporte a vendas ou os copilotos internos já chamam o Claude via Bedrock, este é um upgrade de baixo atrito: basta trocar o ID do modelo na integração existente, em vez de migrar de plataforma. Antes de ativar essa mudança em um fluxo de produção — um bot de triagem de suporte, um resumidor de CRM, um assistente de revisão de contratos —, rode a nova versão contra uma amostra de tickets ou negociações reais e compare qualidade de saída, latência e custo por chamada lado a lado com o modelo que você já paga hoje. A Anthropic e a AWS não publicaram, até o momento, deltas de benchmark verificados de forma independente para este lançamento, então trate qualquer alegação de capacidade como não confirmada até testar com seus próprios dados. Empresas que ainda não usam o Bedrock ganham mais um motivo para consolidar o acesso a modelos via AWS, caso já paguem por EC2, S3 ou outros serviços da AWS, já que isso simplifica cobrança e permissões de IAM em comparação a gerenciar uma chave de API separada da Anthropic.

  1. AWS ensina como montar um bot de pedidos no WhatsApp com Bedrock AgentCore

    Para uma empresa B2B que recebe pedidos recorrentes pelo WhatsApp — distribuidoras, atacadistas, fornecedores de alimentos e bebidas, vendedores de peças de reposição — isso elimina boa parte do trabalho manual de digitação de pedidos: a equipe deixa de precisar ler mensagens ou fotos recebidas e digitá-las em um sistema de pedidos. O detalhe é que essa é uma arquitetura de referência voltada a desenvolvedores, não um produto pronto, então exige tempo de engenharia AWS para adaptação a um catálogo, ERP ou CRM específico, e alguém ainda precisa cuidar de exceções como fotos pouco claras, itens fora de estoque ou disputas de preço. Empresas que já usam o WhatsApp como canal de pedidos devem tratar isso como um sinal de build-vs-buy: a capacidade subjacente já está disponível no Bedrock agora, então o custo de automatizar esse fluxo de trabalho acabou de cair, mas só para equipes com capacidade de engenharia em nuvem, não como uma ferramenta plug-and-play.

  1. AWS ensina a cortar custos de token em pipelines RAG no Bedrock filtrando contexto irrelevante

    Se o bot de suporte, o assistente de vendas ou a busca de conhecimento interno da sua empresa roda em um pipeline de retrieval-augmented generation via Bedrock (ou arquitetura semelhante), a conta de tokens cresce proporcionalmente à quantidade de contexto irrelevante empilhado em cada prompt — documentos longos, texto padrão e trechos quase duplicados recuperados 'por garantia'. A compressão sensível à consulta resolve isso filtrando os trechos recuperados contra a pergunta real antes que cheguem ao modelo, e é exatamente essa alavanca que determina se o assistente de IA de uma equipe de suporte de 20 pessoas custa R$1.000 ou R$10.000 por mês em escala. Times que já rodam RAG em produção devem tratar isso como item concreto de redução de custo, não como upgrade futuro — não exige troca de modelo, apenas a inserção de uma etapa de compressão no pipeline existente de recuperação para geração.

  2. AWS lança camada de controle de acesso para agentes de IA que chamam ferramentas externas

    Se sua empresa conectou um agente de IA ao CRM, ao sistema de tickets ou a APIs internas para automatizar prospecção de vendas ou triagem de suporte, esse agente provavelmente tem mais acesso do que deveria e nenhum registro do que de fato fez. O AgentCore Gateway permite definir permissões por ferramenta (por exemplo, um agente pode ler registros de clientes, mas não alterar cobrança) e gerar um log de cada chamada, algo que importa no momento em que um cliente pergunta quais dados uma IA acessou ou uma revisão de segurança faz a mesma pergunta. Para uma empresa de 10 a 200 funcionários sem equipe dedicada de segurança, isso transforma a governança de agentes de um retrofit artesanal em uma configuração que se ativa, desde que a empresa já esteja na AWS ou disposta a rotear o tráfego de agentes pelo Bedrock.

  1. AWS Permite que Agentes de IA Paguem Fornecedores Diretamente, Sem Aprovação Humana

    Para uma empresa B2B de 10 a 200 funcionários, isso fecha uma lacuna que mantinha os fluxos de compras e faturamento parcialmente manuais: um agente responsável por renovações de fornecedores, reforços de verba publicitária ou mudanças em assinaturas de SaaS agora pode executar o pagamento diretamente, em vez de depender de uma pessoa para inserir o cartão ou aprovar a transação. O movimento prático não é entregar aos agentes um cheque em branco — é definir limites rígidos de gasto, listas de fornecedores permitidos e registro de transações antes de conectar qualquer agente com capacidade de pagamento a uma conta real, começando por gastos recorrentes de baixo risco (renovações de assinaturas, faturas pequenas de fornecedores) em vez de compras em aberto.

  1. AWS permite restringir a busca web de agentes a domínios aprovados e conteúdo recente

    Para uma empresa B2B de 10 a 200 pessoas rodando um agente de suporte ou vendas que busca resultados web ao vivo para responder clientes, isso fecha uma lacuna real: até agora, um agente baseado em busca aberta na web podia trazer um post de blog de três anos atrás ou a página de um concorrente com a mesma facilidade com que traria a documentação da própria empresa. Times construindo sobre o AgentCore agora podem travar a busca em uma lista branca (docs.suaempresa.com, sites de parceiros confiáveis, órgãos de padronização do setor) e exigir conteúdo publicado dentro de uma janela definida, o que importa para tudo que envolve preços, compliance ou especificações de produto que mudam com frequência. Isso também dá às equipes de operações e jurídico um controle concreto para apontar quando um cliente ou auditor pergunta como o agente decidiu o que citar, em vez de um inverificável 'ele buscou na web'.

  2. AWS lança roteamento entre regiões para o GPT-5.6 no Bedrock

    Se o seu chatbot de suporte, agente de qualificação de leads ou automação de operações chama o GPT-5.6 via Amazon Bedrock, isso elimina uma dor operacional real: picos de demanda em uma única região que causam respostas atrasadas ou perdidas em horários de pico. Em vez de escrever e manter sua própria lógica de retry e failover entre regiões, o Bedrock agora cuida desse roteamento, o que significa menos alertas de madrugada quando um fluxo de IA voltado ao cliente começa a sofrer throttling. Equipes com operações enxutas (10 a 200 pessoas) raramente têm tempo de engenharia sobrando para construir infraestrutura de resiliência por conta própria, então este é um caso em que o provedor de nuvem absorve essa complexidade — um ganho direto, ainda que modesto, para a disponibilidade de qualquer pipeline de vendas ou suporte baseado em IA construído sobre o Bedrock.

  1. AWS mostra agentes de IA capazes de pagar contas de verdade, não só sugerir

    Em uma empresa B2B de 10 a 200 pessoas, tarefas de compras, renovação de assinaturas e pagamento a fornecedores hoje ficam paradas na fila de alguém como etapa de aprovação, porque nenhuma camada de automação era considerada confiável para movimentar dinheiro. Essa integração dá às equipes de operações um padrão concreto para agentes que concluem a própria transação — por exemplo, renovar uma assinatura SaaS, pagar uma fatura recorrente de fornecedor ou reabastecer estoque — dentro de limites de gasto e regras de autorização definidas, transformando um fluxo de aprovação de várias etapas em uma ação autônoma e monitorada.

  1. AWS detalha como montar agentes de IA multi-etapa sem construir orquestração própria

    Para uma empresa B2B de 10 a 200 pessoas, isso importa menos como tutorial de programação e mais como sinal do que já dá para comprar versus o que ainda precisa ser construído. Se você comanda desenvolvimento de vendas, suporte de nível 1 ou operações de order-to-cash, workflows agênticos que consultam um CRM, buscam status de pedido, escalam para um humano e mantêm contexto ao longo de uma sessão são exatamente o tipo de tarefa que essas ferramentas visam. O recado prático não é "construa isso você mesmo" — é que os blocos fundamentais (memória de sessão, invocação de ferramentas, agentes cientes de identidade) já estão padronizados o suficiente para que uma consultoria ou fornecedor monte um agente funcional para um processo específico em semanas, não meses. Líderes de operações devem perguntar a qualquer fornecedor de automação que ofereça "agentes de IA" se ele usa infraestrutura gerenciada como essa, já que isso afeta confiabilidade, limites de segurança e a velocidade com que mudanças podem ser feitas depois.

  1. AWS permite que agentes de IA operem sistemas web antigos sem API

    A maioria das empresas B2B com 10 a 200 funcionários carrega pelo menos um sistema legado sem API: uma ferramenta antiga de gestão de pedidos, um portal de fornecedor, um sistema interno de tickets ou o painel administrativo desatualizado de algum fornecedor. Até agora, automatizar em torno disso significava escolher entre scripts de scraping frágeis e customizados, uma substituição de sistema custosa, ou aceitar que alguém da equipe redigite dados manualmente entre sistemas todos os dias. O Browser Tool do AgentCore oferece uma forma gerenciada e isolada (sandbox) para que um agente de IA opere essa interface antiga diretamente, automatizando, na prática, a etapa humana de clicar e copiar, sem mexer na aplicação subjacente. Para quem lidera operações ou suporte, isso importa para uma classe específica de tarefas: puxar atualizações de status de um sistema de rastreamento legado para um CRM, registrar renovações num portal antigo de fornecedor, ou reconciliar registros entre sistemas que ninguém quer migrar. Não substitui uma integração de verdade, mas fecha a lacuna onde a integração não existe ou não compensa construir, e é uma capacidade que vale a pena sinalizar para quem cuida do roteiro de automação de processos da empresa.

  1. Modelo Nemotron da NVIDIA, rápido e barato, chega ao SageMaker da AWS

    Se o time de operações ou engenharia da sua empresa já roda na AWS, isso importa menos como uma notícia de "novo modelo de IA" e mais como uma questão de compras e latência: o deploy com um clique dentro do SageMaker JumpStart reduz a sobrecarga de integração para adicionar um modelo rápido e mais barato a chatbots de vendas, triagem de suporte ou automação de fluxos internos. Para uma empresa de 10 a 200 pessoas, isso é a diferença entre um sprint de engenharia de duas semanas e uma tarde testando se um modelo mais leve dá conta do roteamento de tickets ou da qualificação de leads o suficiente para substituir um modelo mais caro. A ressalva: essa é uma conveniência específica da AWS, não uma mudança universal de capacidade — se sua empresa não está na AWS, ou ainda não tem infraestrutura para testar trocas de modelo em A/B com segurança, não há nada a fazer aqui hoje além de anotar que a opção existe.

  1. AWS amplia AgentCore Observability para agentes de IA on-premises e multicloud

    Se o time de vendas, suporte ou operações da sua empresa tem agentes de IA espalhados em lugares diferentes — um chatbot hospedado na AWS, uma automação interna rodando em servidor local, uma ferramenta de fornecedor em outra nuvem —, provavelmente você nunca teve uma visão única do que de fato acontece entre eles. Essa atualização significa que uma empresa de 10 a 200 funcionários agora pode ter um único painel mostrando qual agente atendeu qual chamado, quanto tempo levou e onde falhou, independentemente de onde esse agente esteja rodando. Para times de operações enxutos, sem engenheiro de plataforma dedicado, essa é a diferença entre depurar no escuro e ter um registro de auditoria de verdade quando um cliente reclama que uma resposta automatizada saiu errada ou demorou demais.

  1. AWS abre customização de recompensa para agentes de IA em interações multi-turno

    A maioria das equipes de vendas, suporte e operações não treina modelos do zero, mas muitas já operam agentes de IA que conduzem interações de múltiplas etapas — qualificar um lead ao longo de várias mensagens, resolver um chamado de suporte com idas e vindas, ou executar um fluxo interno em vários estágios. O problema central que esse post da AWS aborda também é real para essas equipes: uma checagem de "essa resposta foi boa?" turno a turno não captura se o agente de fato levou o cliente a uma resolução, seguiu a política até o fim, ou evitou girar em círculos. Se você está avaliando fornecedores ou construindo lógica própria de agentes, pergunte especificamente como o sucesso é medido ao longo de toda a interação, não apenas por mensagem — essa é exatamente a distinção que o design de funções de recompensa tenta resolver, e ela se aplica diretamente a como você deveria avaliar internamente o desempenho dos seus próprios agentes.

Próximo passo

Diagnóstico gratuito

Quinze minutos, sem e-mail. Sai um mapa de para onde o trabalho vai e a ordem do que vale automatizar primeiro.

Fazer o diagnóstico gratuito

Começa na hora, no navegador.

Preço
Grátis
Duração
15 minutos

A lista ordenada de candidatos fica com você de qualquer jeito.