Skip to content

OpenAI утроила результаты ARC-AGI-3, просто переключив две настройки

Короткий ответ

OpenAI утроила результаты на бенчмарке ARC-AGI-3 — тесте на решение нестандартных задач — просто включив две уже существующие настройки, без какого-либо переобучения модели. Это важно, потому что показывает: значительный, «невидимый» прирост производительности может обеспечиваться одной лишь конфигурацией, а не только увеличением модели. Это меняет подход операторов к оценке уже оплаченных ими AI-инструментов.

Что это значит для операций

Если вы отвечаете за продажи, поддержку или операционку в компании на 10-200 человек, практический вывод здесь не «гоняйтесь за баллами ARC-AGI-3» — а в том, что AI-модели и копилоты, на которые у вас уже куплены лицензии, скорее всего работают на малой доле реальных возможностей из-за настроек по умолчанию, которые никто никогда не пересматривал. Бот для сортировки обращений в поддержку, инструмент для черновиков продающих писем или агент, обрабатывающий исключения в заказах, может недорабатывать не потому, что модель слабая, а потому что глубина рассуждений, права на использование инструментов или настройки контекста остались на дефолтах, заточенных под скорость или стоимость, а не точность. Прежде чем делать вывод, что инструмент вендора «недостаточно хорош», и заказывать дорогую переработку, стоит провести аудит: какие настройки вообще существуют, чем они жертвуют, и проверял ли кто-то альтернативы на ваших реальных рабочих процессах, а не на демо. Это именно та настроечная работа, которая быстро окупается и почти никогда не делается внутри компании, потому что формально не входит ни в чью должностную инструкцию.

Компания OpenAI сообщила, что утроила показатели своей модели на бенчмарке ARC-AGI-3, включив две уже существующие настройки конфигурации — без каких-либо изменений в обучении или архитектуре модели. ARC-AGI-3 создан для проверки способности AI-систем решать по-настоящему новые задачи — то есть рассуждать так, чтобы решение нельзя было подобрать простым сопоставлением с данными обучения. Этот бенчмарк широко используется как индикатор прогресса в сторону более универсальных возможностей рассуждения.

По версии OpenAI, улучшение целиком объясняется тем, как модель была настроена для работы, а не переобучением или дополнительной тонкой настройкой (fine-tuning). Компания не раскрыла полные технические детали того, за что именно отвечают эти две настройки, ограничившись формулировкой, что они связаны с тем, как модель подходит к задаче и работает над ней в процессе вывода (inference). В публикации OpenAI это преподносится как доказательство того, что значительная часть «потолка» возможностей модели по рассуждению определяется легко упускаемыми настройками конфигурации, а не базовыми знаниями или масштабом самой модели.

Эта деталь заслуживает внимания именно потому, что она противоречит доминирующему в индустрии нарративу, согласно которому прирост возможностей в основном достигается за счёт более крупных циклов обучения или новых поколений моделей. Результат такого рода — утроение показателя на сложном бенчмарке исключительно за счёт настроек — говорит о том, что заметная доля «возможностей» уже сейчас скрыто присутствует в моделях, работающих в производственных продуктах, но остаётся невостребованной, потому что никто не менял значения по умолчанию.

Пока неподтверждено, насколько широко этот конкретный вывод применим за пределами самого бенчмарка ARC-AGI-3, и в публикации OpenAI не утверждается, что такой же эффект утроения проявится на других задачах или в других продуктах, построенных на её моделях. Результаты на бенчмарках также не переносятся напрямую на реальные рабочие задачи: ARC-AGI-3 проверяет узкую категорию абстрактных логических головоломок, а не тот хаотичный, отраслевой труд, который встречается в воронках продаж или очередях обращений в поддержку.

Тем не менее более широкая закономерность, которую иллюстрирует эта публикация — что именно конфигурация, а не только выбор модели, существенно влияет на качество результата — регулярно проявляется в реальных внедрениях AI, и далеко не только в собственном бенчмарке OpenAI. Вендоры поставляют настройки по умолчанию, заточенные под широкую аудиторию и экономию затрат, а не под конкретные требования к точности той или иной компании. Мало кто пересматривает эти настройки после первоначальной установки, и ещё меньше компаний систематически проверяют альтернативные конфигурации на собственных данных и рабочих процессах.

OpenAI не уточнила, доступны ли эти две настройки (или их аналоги) разработчикам, работающим с её API, или зарезервированы только для внутреннего использования. Это различие важно для тех, кто пытается оценить, есть ли у данной находки прямая практическая применимость к инструментам, уже построенным на моделях OpenAI, — или же речь идёт преимущественно об исследовательском раскрытии, касающемся собственной методологии бенчмаркинга компании.

Источник: OpenAI