OpenAI lanzó GPT-6 Astra Ultrafast, un modo de inferencia más rápido de su modelo Astra que corre sobre GPUs NVIDIA Blackwell. Ya está disponible a través de la API de OpenAI y para usuarios elegibles de ChatGPT Work y Codex.
El dato central: Ultrafast ofrece hasta 8 veces más velocidad de generación de tokens que el modo Standard de Astra. OpenAI enmarca esta mejora en torno a flujos de trabajo agénticos —agentes de código que ejecutan ciclos de editar-probar-depurar, y cualquier aplicación donde un modelo escribe código, llama a una herramienta, revisa el resultado y decide qué hacer a continuación. Acortar cada paso de generación en ese bucle acorta el ciclo completo, ya que la demora se repite cada vez que el agente realiza una acción.
Philippe Tillet, responsable de inferencia de OpenAI, dijo que las herramientas y la documentación de NVIDIA permitieron que los modelos de OpenAI se volvieran "excepcionalmente buenos programando GPUs Blackwell y Rubin", traduciendo eso en kernels de alto rendimiento que mejoran la latencia, el rendimiento y el costo en hardware de NVIDIA. Uday Ruddarraju, director de tecnología de cómputo de OpenAI, dijo que la compañía usó sus propios modelos para optimizar el software de inferencia que corre sobre GPUs de NVIDIA, con la plataforma programable de NVIDIA habilitando la aceleración detrás de Ultrafast.
OpenAI también señala que el trabajo de rendimiento continúa después del despliegue: está usando sus propios modelos para seguir refinando el software de inferencia sobre la misma plataforma de GPU, y que un stack programable de NVIDIA permite a los equipos reutilizar infraestructura entre entrenamiento, inferencia y aprendizaje por refuerzo en lugar de aprovisionar por separado para cada uno.
Los desarrolladores ya pueden acceder a GPT-6 Astra Ultrafast a través de la API; OpenAI remite a su guía de Ultrafast para detalles de acceso, precios e implementación.