A OpenAI lançou o GPT-6 Astra Ultrafast, um modo de inferência mais rápido do seu modelo Astra, rodando em GPUs NVIDIA Blackwell. Já está disponível via API da OpenAI e para usuários elegíveis do ChatGPT Work e Codex.
O número principal: o Ultrafast entrega geração de tokens até 8x mais rápida que o modo Standard do Astra. A OpenAI enquadra esse ganho em torno de fluxos de trabalho agênticos — agentes de codificação executando ciclos de edição-teste-depuração, e qualquer aplicação em que um modelo escreve código, chama uma ferramenta, verifica o resultado e decide o próximo passo. Encurtar cada etapa de geração nesse loop encurta o ciclo inteiro, já que o atraso se repete a cada ação do agente.
Philippe Tillet, líder de inferência da OpenAI, afirmou que as ferramentas e a documentação da NVIDIA permitiram que os modelos da OpenAI se tornassem "excepcionalmente bons em programar GPUs Blackwell e Rubin", transformando isso em kernels de alto desempenho que melhoram latência, throughput e custo no hardware NVIDIA. Uday Ruddarraju, diretor de tecnologia de computação da OpenAI, disse que a empresa usou seus próprios modelos para otimizar o software de inferência rodando nas GPUs da NVIDIA, com a plataforma programável da NVIDIA viabilizando a aceleração por trás do Ultrafast.
A OpenAI também observa que o trabalho de otimização continua após a implantação: a empresa usa seus próprios modelos para continuar refinando o software de inferência na mesma plataforma de GPU, e que uma pilha programável da NVIDIA permite que as equipes reutilizem infraestrutura entre treinamento, inferência e aprendizado por reforço, em vez de provisionar separadamente para cada um.
Desenvolvedores já podem acessar o GPT-6 Astra Ultrafast pela API; a OpenAI remete ao seu guia do Ultrafast para detalhes de acesso, preços e implementação.