OpenAI выпустила GPT-6 Astra Ultrafast - более быстрый режим инференса модели Astra, работающий на GPU NVIDIA Blackwell. Режим уже доступен через OpenAI API и части пользователей ChatGPT Work и Codex.
Главная цифра: Ultrafast даёт ускорение генерации токенов до 8 раз по сравнению со стандартным режимом Astra. OpenAI описывает прирост в контексте агентных рабочих процессов - агентов для написания кода, выполняющих циклы правки-тестирования-отладки, и любых приложений, где модель пишет код, вызывает инструмент, проверяет результат и решает, что делать дальше. Сокращение каждого шага генерации в этом цикле сокращает весь цикл целиком, поскольку задержка повторяется при каждом действии агента.
Филипп Тилле (Philippe Tillet), руководитель направления инференса в OpenAI, рассказал, что инструментарий и документация NVIDIA позволили моделям OpenAI стать «исключительно хороши в программировании GPU Blackwell и Rubin», что превратилось в высокопроизводительные ядра (kernels), улучшающие задержку, пропускную способность и стоимость на оборудовании NVIDIA. Удай Руддарраджу (Uday Ruddarraju), технический директор OpenAI по вычислениям, отметил, что компания использовала собственные модели для оптимизации программного обеспечения инференса, работающего на GPU NVIDIA, а программируемая платформа NVIDIA обеспечила ускорение, лежащее в основе Ultrafast.
OpenAI также отмечает, что работа над производительностью продолжается и после развёртывания: компания использует собственные модели для дальнейшей доработки ПО инференса на той же платформе GPU, а программируемый стек NVIDIA позволяет командам переиспользовать инфраструктуру для обучения, инференса и обучения с подкреплением вместо отдельного выделения ресурсов под каждую задачу.
Разработчики уже могут получить доступ к GPT-6 Astra Ultrafast через API; за деталями по доступу, цене и внедрению OpenAI отсылает к своему гайду по Ultrafast.