Ir para o conteúdo

Novo modo 'Ultrafast' da OpenAI reduz em até 8x o tempo de resposta de agentes

Resposta curta

A OpenAI lançou o GPT-6 Astra Ultrafast, modo de inferência mais rápido rodando em GPUs NVIDIA Blackwell, com geração de tokens até 8x mais veloz que o Astra Standard. Já está disponível na API da OpenAI e para usuários elegíveis do ChatGPT Work e Codex, com o objetivo de reduzir a espera em loops de agentes que escrevem código, chamam ferramentas e agem sobre os resultados.

O que isso significa na operação

Se sua operação de suporte ou atendimento usa agentes de IA que encadeiam múltiplas chamadas de ferramenta por interação com o cliente — buscar um registro no CRM, checar estoque, redigir uma resposta —, o atraso entre cada etapa se acumula em espera real para o usuário final. O modo Ultrafast mira exatamente esse loop: geração mais rápida entre chamadas de ferramenta significa que um agente de múltiplas etapas conclui seu raciocínio antes que o humano perceba a pausa. Antes de migrar fluxos de produção, consulte o guia do Ultrafast para saber quais planos e endpoints têm acesso atualmente e qual a diferença de preço em relação ao Astra Standard — a fonte não especifica o custo, então essa é uma pergunta para seu representante de API, não uma suposição para construir em cima.

A OpenAI lançou o GPT-6 Astra Ultrafast, um modo de inferência mais rápido do seu modelo Astra, rodando em GPUs NVIDIA Blackwell. Já está disponível via API da OpenAI e para usuários elegíveis do ChatGPT Work e Codex.

O número principal: o Ultrafast entrega geração de tokens até 8x mais rápida que o modo Standard do Astra. A OpenAI enquadra esse ganho em torno de fluxos de trabalho agênticos — agentes de codificação executando ciclos de edição-teste-depuração, e qualquer aplicação em que um modelo escreve código, chama uma ferramenta, verifica o resultado e decide o próximo passo. Encurtar cada etapa de geração nesse loop encurta o ciclo inteiro, já que o atraso se repete a cada ação do agente.

Philippe Tillet, líder de inferência da OpenAI, afirmou que as ferramentas e a documentação da NVIDIA permitiram que os modelos da OpenAI se tornassem "excepcionalmente bons em programar GPUs Blackwell e Rubin", transformando isso em kernels de alto desempenho que melhoram latência, throughput e custo no hardware NVIDIA. Uday Ruddarraju, diretor de tecnologia de computação da OpenAI, disse que a empresa usou seus próprios modelos para otimizar o software de inferência rodando nas GPUs da NVIDIA, com a plataforma programável da NVIDIA viabilizando a aceleração por trás do Ultrafast.

A OpenAI também observa que o trabalho de otimização continua após a implantação: a empresa usa seus próprios modelos para continuar refinando o software de inferência na mesma plataforma de GPU, e que uma pilha programável da NVIDIA permite que as equipes reutilizem infraestrutura entre treinamento, inferência e aprendizado por reforço, em vez de provisionar separadamente para cada um.

Desenvolvedores já podem acessar o GPT-6 Astra Ultrafast pela API; a OpenAI remete ao seu guia do Ultrafast para detalhes de acesso, preços e implementação.

Fonte: NVIDIA Blog

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.