Saltar al contenido

OpenAI lanza un modo 'Ultrafast' que recorta hasta 8 veces el tiempo de respuesta de sus agentes

Respuesta corta

OpenAI lanzó GPT-6 Astra Ultrafast, un modo de inferencia más rápido sobre GPUs NVIDIA Blackwell que ofrece hasta 8 veces más velocidad de generación de tokens que Astra Standard. Ya está disponible en la API de OpenAI y para usuarios elegibles de ChatGPT Work y Codex, pensado para reducir la espera dentro de bucles de agentes que escriben código, llaman herramientas y actúan sobre los resultados.

Qué significa para las operaciones

Si tu stack de soporte u operaciones corre agentes de IA que encadenan varias llamadas a herramientas por interacción con el cliente —consultar un registro de CRM, revisar inventario, redactar una respuesta—, la demora entre cada paso se acumula en un tiempo de espera real para el usuario final. El modo Ultrafast apunta exactamente a ese bucle: generación más rápida entre llamadas a herramientas significa que un agente de varios pasos termina su razonamiento antes de que un humano note la pausa. Antes de migrar flujos de producción, revisa la guía de Ultrafast para saber qué planes y endpoints tienen acceso actualmente y cuál es la diferencia de precio frente a Astra Standard —la fuente no especifica el costo, así que es una pregunta para tu representante de API, no un supuesto sobre el que construir.

OpenAI lanzó GPT-6 Astra Ultrafast, un modo de inferencia más rápido de su modelo Astra que corre sobre GPUs NVIDIA Blackwell. Ya está disponible a través de la API de OpenAI y para usuarios elegibles de ChatGPT Work y Codex.

El dato central: Ultrafast ofrece hasta 8 veces más velocidad de generación de tokens que el modo Standard de Astra. OpenAI enmarca esta mejora en torno a flujos de trabajo agénticos —agentes de código que ejecutan ciclos de editar-probar-depurar, y cualquier aplicación donde un modelo escribe código, llama a una herramienta, revisa el resultado y decide qué hacer a continuación. Acortar cada paso de generación en ese bucle acorta el ciclo completo, ya que la demora se repite cada vez que el agente realiza una acción.

Philippe Tillet, responsable de inferencia de OpenAI, dijo que las herramientas y la documentación de NVIDIA permitieron que los modelos de OpenAI se volvieran "excepcionalmente buenos programando GPUs Blackwell y Rubin", traduciendo eso en kernels de alto rendimiento que mejoran la latencia, el rendimiento y el costo en hardware de NVIDIA. Uday Ruddarraju, director de tecnología de cómputo de OpenAI, dijo que la compañía usó sus propios modelos para optimizar el software de inferencia que corre sobre GPUs de NVIDIA, con la plataforma programable de NVIDIA habilitando la aceleración detrás de Ultrafast.

OpenAI también señala que el trabajo de rendimiento continúa después del despliegue: está usando sus propios modelos para seguir refinando el software de inferencia sobre la misma plataforma de GPU, y que un stack programable de NVIDIA permite a los equipos reutilizar infraestructura entre entrenamiento, inferencia y aprendizaje por refuerzo en lugar de aprovisionar por separado para cada uno.

Los desarrolladores ya pueden acceder a GPT-6 Astra Ultrafast a través de la API; OpenAI remite a su guía de Ultrafast para detalles de acceso, precios e implementación.

Fuente: NVIDIA Blog

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.