Компания OpenAI сообщила, что утроила показатели своей модели на бенчмарке ARC-AGI-3, включив две уже существующие настройки конфигурации — без каких-либо изменений в обучении или архитектуре модели. ARC-AGI-3 создан для проверки способности AI-систем решать по-настоящему новые задачи — то есть рассуждать так, чтобы решение нельзя было подобрать простым сопоставлением с данными обучения. Этот бенчмарк широко используется как индикатор прогресса в сторону более универсальных возможностей рассуждения.
По версии OpenAI, улучшение целиком объясняется тем, как модель была настроена для работы, а не переобучением или дополнительной тонкой настройкой (fine-tuning). Компания не раскрыла полные технические детали того, за что именно отвечают эти две настройки, ограничившись формулировкой, что они связаны с тем, как модель подходит к задаче и работает над ней в процессе вывода (inference). В публикации OpenAI это преподносится как доказательство того, что значительная часть «потолка» возможностей модели по рассуждению определяется легко упускаемыми настройками конфигурации, а не базовыми знаниями или масштабом самой модели.
Эта деталь заслуживает внимания именно потому, что она противоречит доминирующему в индустрии нарративу, согласно которому прирост возможностей в основном достигается за счёт более крупных циклов обучения или новых поколений моделей. Результат такого рода — утроение показателя на сложном бенчмарке исключительно за счёт настроек — говорит о том, что заметная доля «возможностей» уже сейчас скрыто присутствует в моделях, работающих в производственных продуктах, но остаётся невостребованной, потому что никто не менял значения по умолчанию.
Пока неподтверждено, насколько широко этот конкретный вывод применим за пределами самого бенчмарка ARC-AGI-3, и в публикации OpenAI не утверждается, что такой же эффект утроения проявится на других задачах или в других продуктах, построенных на её моделях. Результаты на бенчмарках также не переносятся напрямую на реальные рабочие задачи: ARC-AGI-3 проверяет узкую категорию абстрактных логических головоломок, а не тот хаотичный, отраслевой труд, который встречается в воронках продаж или очередях обращений в поддержку.
Тем не менее более широкая закономерность, которую иллюстрирует эта публикация — что именно конфигурация, а не только выбор модели, существенно влияет на качество результата — регулярно проявляется в реальных внедрениях AI, и далеко не только в собственном бенчмарке OpenAI. Вендоры поставляют настройки по умолчанию, заточенные под широкую аудиторию и экономию затрат, а не под конкретные требования к точности той или иной компании. Мало кто пересматривает эти настройки после первоначальной установки, и ещё меньше компаний систематически проверяют альтернативные конфигурации на собственных данных и рабочих процессах.
OpenAI не уточнила, доступны ли эти две настройки (или их аналоги) разработчикам, работающим с её API, или зарезервированы только для внутреннего использования. Это различие важно для тех, кто пытается оценить, есть ли у данной находки прямая практическая применимость к инструментам, уже построенным на моделях OpenAI, — или же речь идёт преимущественно об исследовательском раскрытии, касающемся собственной методологии бенчмаркинга компании.