Что такое ARC-AGI-3?
ARC-AGI-3 - это тест фонда ARC Prize на то, способен ли ИИ-агент освоить задачу, которую никогда не видел: его помещают в маленькую пошаговую игру без инструкций и без объявленной цели и оценивают, насколько эффективно он в ней разбирается по сравнению с человеком. На запуске в марте 2026 люди набрали 100 %, топовые модели - 0,51 %.
Что именно проверяет тест
Первые два теста ARC были статичными головоломками: несколько примеров преобразования сетки, потом новая сетка, которую надо достроить. Модели научились их решать. ARC-AGI-3, запущенный 25 марта 2026, меняет саму форму вопроса. Агента помещают в одну из сотен пошаговых сред, сделанных вручную, и не говорят ничего - ни правил, ни что считается победой, ни какие из его действий вообще что-то значат. Он должен исследовать, замечать, что меняется от его ходов, строить гипотезу, планировать на несколько шагов вперёд и исправляться, когда гипотеза не сошлась.
Оценка - не «дошёл ли до конца», а «насколько эффективно научился», и мерка - люди, которым дали те же игры без подготовки. Поэтому фонд пишет: человек - 100 %, топовые модели на запуске - 0,51 %. Модели, которые сдают юридические экзамены и пишут рабочий код, не смогли разобраться в игре, которую ребёнок решает за несколько минут. Позиция фонда прямая: пока этот разрыв есть, AGI нет, - и под закрытие разрыва выделено два миллиона долларов призовых.
Урок про настройки: как OpenAI утроила балл без обучения
В августе 2026 OpenAI сообщила, что утроила свой балл на ARC-AGI-3, изменив два параметра вывода - то, как модели разрешено думать над задачей, - без дообучения и без новой модели. База была низкой, и в посте нет утверждения, что эффект переносится на другие задачи, так что это не история про «ARC-AGI-3 решён».
Это история про настройки по умолчанию. Способность уже была внутри модели, за которую люди платили, - выключенная конфигурацией, которую никто не пересматривал. То же самое происходит в обычных внедрениях: бот первичной сортировки обращений или помощник для черновиков признаётся «недостаточно хорошим» на настройках, подобранных ради цены и скорости, и никто не проверяет альтернативы на реальной работе, прежде чем решить переделывать или отказаться.
Что балл говорит покупателю, а что нет
ARC-AGI-3 хорошо измеряет одну узкую вещь: освоение абстрактной задачи с нуля. Он ничего не говорит о том, точно ли модель читает ваши договоры, выполняет ли процедуру возврата из четырнадцати шагов и остаётся ли вежливой на четырёхсотом обращении за день. Это разные навыки, и модели, близкие на ARC, могут сильно расходиться на них.
Так что читайте новости о тестах, как результаты лаборатории для автомобиля: интересно, иногда решающе, но никогда не вместо тест-драйва. Единственный балл, который важен для покупки, - тот, что измерен на ваших задачах, на ваших данных, до и после изменения. Это и есть проверка, которую мы делаем в диагностике, - и та, которую большинство поставщиков предпочли бы, чтобы вы не делали.
Смежные вопросы
- Чем ARC-AGI-3 отличается от ARC-AGI-1 и ARC-AGI-2?
- Первые два статичны: горстка примеров, потом головоломка, которую надо решить одним ответом. ARC-AGI-3 интерактивен - агент действует внутри игры много ходов подряд, сам открывает правила и оценивается по тому, насколько эффективно учится, а не только по тому, дошёл ли до конца.
- Кто ведёт ARC-AGI-3?
- Фонд ARC Prize - некоммерческая организация, которую основали Франсуа Шолле, автор исходного ARC 2019 года, и Майк Кнуп, сооснователь Zapier. Фонд публикует тест, человеческие ориентиры и проводит призовой конкурс.
- Делает ли более высокий балл ARC-AGI-3 модель лучше для моей компании?
- Сам по себе - нет. Тест измеряет абстрактное обучение в незнакомых играх, а рабочая задача - это в основном знакомая работа, которую надо делать надёжно и много. Проверьте модели-кандидаты на выборке ваших реальных случаев и сравните результаты: это число переносится, балл теста - нет.
- Пройти ARC-AGI-3 - это и есть AGI?
- Фонд аккуратно говорит обратное: 100 % означают, что агент сравнялся с человеком по эффективности обучения в этих играх. Это необходимое условие, а не доказательство общего интеллекта.
Смежное
Бесплатная диагностика
Бесплатная диагностика делает ту проверку, которая переносится: ваши случаи, ваши данные, число до и после для каждой модели-кандидата.
Пройти бесплатную диагностикуНачинается сразу в браузере.
- Стоимость
- Бесплатно
- Срок
- 15 минут
Список кандидатов по порядку остаётся у вас в любом случае.