Skip to content
Ответы

Что такое ARC-AGI-3?

ARC-AGI-3 - это тест фонда ARC Prize на то, способен ли ИИ-агент освоить задачу, которую никогда не видел: его помещают в маленькую пошаговую игру без инструкций и без объявленной цели и оценивают, насколько эффективно он в ней разбирается по сравнению с человеком. На запуске в марте 2026 люди набрали 100 %, топовые модели - 0,51 %.

Что именно проверяет тест

Первые два теста ARC были статичными головоломками: несколько примеров преобразования сетки, потом новая сетка, которую надо достроить. Модели научились их решать. ARC-AGI-3, запущенный 25 марта 2026, меняет саму форму вопроса. Агента помещают в одну из сотен пошаговых сред, сделанных вручную, и не говорят ничего - ни правил, ни что считается победой, ни какие из его действий вообще что-то значат. Он должен исследовать, замечать, что меняется от его ходов, строить гипотезу, планировать на несколько шагов вперёд и исправляться, когда гипотеза не сошлась.

Оценка - не «дошёл ли до конца», а «насколько эффективно научился», и мерка - люди, которым дали те же игры без подготовки. Поэтому фонд пишет: человек - 100 %, топовые модели на запуске - 0,51 %. Модели, которые сдают юридические экзамены и пишут рабочий код, не смогли разобраться в игре, которую ребёнок решает за несколько минут. Позиция фонда прямая: пока этот разрыв есть, AGI нет, - и под закрытие разрыва выделено два миллиона долларов призовых.

Урок про настройки: как OpenAI утроила балл без обучения

В августе 2026 OpenAI сообщила, что утроила свой балл на ARC-AGI-3, изменив два параметра вывода - то, как модели разрешено думать над задачей, - без дообучения и без новой модели. База была низкой, и в посте нет утверждения, что эффект переносится на другие задачи, так что это не история про «ARC-AGI-3 решён».

Это история про настройки по умолчанию. Способность уже была внутри модели, за которую люди платили, - выключенная конфигурацией, которую никто не пересматривал. То же самое происходит в обычных внедрениях: бот первичной сортировки обращений или помощник для черновиков признаётся «недостаточно хорошим» на настройках, подобранных ради цены и скорости, и никто не проверяет альтернативы на реальной работе, прежде чем решить переделывать или отказаться.

Что балл говорит покупателю, а что нет

ARC-AGI-3 хорошо измеряет одну узкую вещь: освоение абстрактной задачи с нуля. Он ничего не говорит о том, точно ли модель читает ваши договоры, выполняет ли процедуру возврата из четырнадцати шагов и остаётся ли вежливой на четырёхсотом обращении за день. Это разные навыки, и модели, близкие на ARC, могут сильно расходиться на них.

Так что читайте новости о тестах, как результаты лаборатории для автомобиля: интересно, иногда решающе, но никогда не вместо тест-драйва. Единственный балл, который важен для покупки, - тот, что измерен на ваших задачах, на ваших данных, до и после изменения. Это и есть проверка, которую мы делаем в диагностике, - и та, которую большинство поставщиков предпочли бы, чтобы вы не делали.

Смежные вопросы

Чем ARC-AGI-3 отличается от ARC-AGI-1 и ARC-AGI-2?
Первые два статичны: горстка примеров, потом головоломка, которую надо решить одним ответом. ARC-AGI-3 интерактивен - агент действует внутри игры много ходов подряд, сам открывает правила и оценивается по тому, насколько эффективно учится, а не только по тому, дошёл ли до конца.
Кто ведёт ARC-AGI-3?
Фонд ARC Prize - некоммерческая организация, которую основали Франсуа Шолле, автор исходного ARC 2019 года, и Майк Кнуп, сооснователь Zapier. Фонд публикует тест, человеческие ориентиры и проводит призовой конкурс.
Делает ли более высокий балл ARC-AGI-3 модель лучше для моей компании?
Сам по себе - нет. Тест измеряет абстрактное обучение в незнакомых играх, а рабочая задача - это в основном знакомая работа, которую надо делать надёжно и много. Проверьте модели-кандидаты на выборке ваших реальных случаев и сравните результаты: это число переносится, балл теста - нет.
Пройти ARC-AGI-3 - это и есть AGI?
Фонд аккуратно говорит обратное: 100 % означают, что агент сравнялся с человеком по эффективности обучения в этих играх. Это необходимое условие, а не доказательство общего интеллекта.
Следующий шаг

Бесплатная диагностика

Бесплатная диагностика делает ту проверку, которая переносится: ваши случаи, ваши данные, число до и после для каждой модели-кандидата.

Пройти бесплатную диагностику

Начинается сразу в браузере.

Стоимость
Бесплатно
Срок
15 минут

Список кандидатов по порядку остаётся у вас в любом случае.