Перейти к содержимому

OpenAI ускорила агентов: новый режим Ultrafast сокращает время отклика до 8 раз

Короткий ответ

OpenAI выпустила GPT-6 Astra Ultrafast - более быстрый режим инференса на GPU NVIDIA Blackwell, дающий ускорение генерации токенов до 8 раз по сравнению с Astra Standard. Режим доступен в OpenAI API и части пользователей ChatGPT Work и Codex. Цель - сократить задержки внутри агентных циклов, где модель пишет код, вызывает инструменты и действует по результатам.

Что это значит для операций

Если ваш стек поддержки или операций использует AI-агентов, которые цепочкой вызывают несколько инструментов за одно обращение клиента - достают запись из CRM, проверяют остатки на складе, составляют ответ - задержка между каждым шагом складывается в реальное время ожидания для пользователя. Ultrafast нацелен именно на этот цикл: более быстрая генерация между вызовами инструментов означает, что многошаговый агент завершает рассуждение раньше, чем человек заметит паузу. Перед переводом production-процессов на новый режим стоит проверить гайд по Ultrafast на предмет того, каким тарифам и эндпоинтам сейчас доступен доступ и в чём разница в цене относительно Astra Standard - источник не называет конкретную стоимость, так что это вопрос к своему представителю API, а не предположение, на которое можно опираться.

OpenAI выпустила GPT-6 Astra Ultrafast - более быстрый режим инференса модели Astra, работающий на GPU NVIDIA Blackwell. Режим уже доступен через OpenAI API и части пользователей ChatGPT Work и Codex.

Главная цифра: Ultrafast даёт ускорение генерации токенов до 8 раз по сравнению со стандартным режимом Astra. OpenAI описывает прирост в контексте агентных рабочих процессов - агентов для написания кода, выполняющих циклы правки-тестирования-отладки, и любых приложений, где модель пишет код, вызывает инструмент, проверяет результат и решает, что делать дальше. Сокращение каждого шага генерации в этом цикле сокращает весь цикл целиком, поскольку задержка повторяется при каждом действии агента.

Филипп Тилле (Philippe Tillet), руководитель направления инференса в OpenAI, рассказал, что инструментарий и документация NVIDIA позволили моделям OpenAI стать «исключительно хороши в программировании GPU Blackwell и Rubin», что превратилось в высокопроизводительные ядра (kernels), улучшающие задержку, пропускную способность и стоимость на оборудовании NVIDIA. Удай Руддарраджу (Uday Ruddarraju), технический директор OpenAI по вычислениям, отметил, что компания использовала собственные модели для оптимизации программного обеспечения инференса, работающего на GPU NVIDIA, а программируемая платформа NVIDIA обеспечила ускорение, лежащее в основе Ultrafast.

OpenAI также отмечает, что работа над производительностью продолжается и после развёртывания: компания использует собственные модели для дальнейшей доработки ПО инференса на той же платформе GPU, а программируемый стек NVIDIA позволяет командам переиспользовать инфраструктуру для обучения, инференса и обучения с подкреплением вместо отдельного выделения ресурсов под каждую задачу.

Разработчики уже могут получить доступ к GPT-6 Astra Ultrafast через API; за деталями по доступу, цене и внедрению OpenAI отсылает к своему гайду по Ultrafast.

Источник: NVIDIA Blog

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.