Skip to content

Grok 4.6 chega à Amazon Bedrock com guardrails e trade-offs de preço entre regiões

Resposta curta

O Grok 4.6, da xAI, estreou na Amazon Bedrock em 18 de agosto de 2026, o segundo modelo da xAI na plataforma. Ele traz janela de contexto de 500 mil tokens, quatro níveis de esforço de raciocínio, Bedrock Guardrails, registro de invocações e inferência entre regiões — recursos que moldam como equipes B2B constroem e precificam fluxos agênticos na AWS.

O que isso significa na operação

Para uma empresa de 10 a 200 pessoas rodando agentes de vendas ou suporte na AWS Bedrock, isso é uma decisão real de arquitetura, não apenas mais um modelo para testar. Guardrails, registro de invocações e cache de prompt agora funcionam no endpoint bedrock-runtime, que é o indicado quando se precisa de um limite de política em torno de um agente não supervisionado e de uma trilha de auditoria do que ele de fato fez. Mas saída estruturada em JSON e uso de ferramentas no lado do servidor continuam restritos ao bedrock-mantle, então um workflow que depende de saída com schema rígido precisa escolher esse endpoint em vez do outro. O preço adiciona mais uma alavanca: rotear pelo perfil Global de inferência entre regiões, mais barato, em vez do perfil Geo restrito aos EUA, ou cair para o nível de serviço Flex pela metade da tarifa padrão em trabalhos de lote não urgentes, muda a economia unitária de um agente mais do que a escolha do modelo em si.

O Grok 4.6, da xAI, já está disponível na Amazon Bedrock, segundo o AWS Machine Learning Blog, tendo estreado na plataforma em 18 de agosto de 2026 como o segundo modelo da xAI por lá, depois do Grok 4.3. O modelo oferece janela de contexto de 500 mil tokens e quatro níveis configuráveis de esforço de raciocínio — low, medium, high e um novo xhigh — definidos por parâmetros da API do Bedrock em vez de um campo dedicado de raciocínio.

O Grok 4.6 amplia sua presença em relação ao lançamento anterior: roda tanto no endpoint bedrock-mantle (compatível com OpenAI) quanto no bedrock-runtime, e suporta a Converse API além de Chat Completions e Responses, incluindo streaming. O suporte a recursos varia por endpoint. O bedrock-mantle cobre chamada de ferramentas do lado do cliente, saídas estruturadas, cache de prompt, streaming de resposta e detecção de abuso. O bedrock-runtime cobre raciocínio, cache de prompt, streaming de resposta, logs de invocação e, novidade deste lançamento, o Amazon Bedrock Guardrails — filtros de conteúdo, tópicos negados, redação de PII e políticas de palavras avaliadas tanto no prompt quanto na resposta. Saídas estruturadas e uso de ferramentas no lado do servidor não estão disponíveis no bedrock-runtime.

O Grok 4.6 não é oferecido para inferência dentro da própria região no bedrock-runtime; as requisições são roteadas por perfis de inferência entre regiões. Um perfil Geo mantém o tráfego dentro das regiões dos EUA para residência de dados, enquanto um perfil Global roteia globalmente por uma lista mais longa que abrange EUA, Canadá, Europa, Ásia-Pacífico, Oriente Médio, África e América do Sul. O Global também é mais barato: US$ 2,00 por milhão de tokens de entrada contra US$ 2,20 no Geo. No bedrock-mantle, a inferência dentro da própria região só está disponível na região Oeste dos EUA (Oregon).

O preço inclui três níveis de serviço construídos como multiplicadores sobre as tarifas padrão: Priority a 1,75x para processamento mais rápido, e Flex a 0,5x para trabalhos que não são sensíveis ao tempo. A xAI lista o preço do Grok 4.6 a partir de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, com uma variante mais rápida ao dobro desse valor. A entrada em cache é cobrada a aproximadamente um quarto da tarifa padrão de entrada, o que o post destaca como relevante para agentes que reenviam um prompt de sistema extenso ou um documento a cada turno.

Os números de benchmark relatados para o Grok 4.6 High, publicados pela xAI em 12 de agosto de 2026, incluem um AA Intelligence Index de 61, uma pontuação GDPVal-AA v2 de 1753 e 69,9% no CursorBench v3.2, entre outros citados no post.

Fonte: AWS Machine Learning Blog

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.