ARC-AGI-3 решён на 99%, но это не AGI
📊 ARC-AGI-3 решён на 99%, но это не AGI
Проект Сергея Родионова набрал 99% RHAE в тесте ARC-AGI-3. Это агентная надстройка: Codex с доступом к Linux, файлам и Python в цикле «наблюдение → гипотеза → проверка». Первый ARC-AGI-1 продержался с 2019 года, рассуждающие LLM выбили на нём больше 70%. ARC-AGI-2 в 2025 году усложнил контекст, а ARC-AGI-3 перевёл задачи в интерактивные игры в стиле Atari. Метрика RHAE считает пройденные уровни и число действий внутри игры.
Разбор на Habr показывает, почему это не победа. Абляция Родионова выявила: исполняемая модель мира на Python не нужна. Текстовое рассуждение LLM обгоняет симуляцию, а полная проверка наблюдений даёт лучшие результаты во всех настройках. Итог — генерация идей и сжатие описания силами LLM, а не настоящее выведение правил. Тест не различает перебор и понимание: штраф только за действия внутри игры, а сколько гипотез агент перебрал в своем рассуждении — не считается.
LLM выигрывает за счёт чужого опыта. Десятилетия игрового дизайна в обучающих данных дают готовые шаблоны: «врага не трогать, предмет подобрать, выход искать у края». Модель ищет в библиотеке похожий шаблон и проверяет его. Это не вывод правила на месте, а умный перебор. Обратное распространение ошибки оптимизирует в заданном пространстве представлений и не меняет сами переменные — статья приводит пример с сортировкой и дельтой, где сеть не может добавить новую переменную без внешней подсказки.
Тест, задуманный как проверка способности к обучению, стал проверкой качества инженерной надстройки. Это не провал ARC-AGI-3 — это следствие того, что мы не умеем измерять «как решено», а только «решено ли». Пока метрика не заглядывает внутрь процесса, 99% RHAE говорит об эффективности агентной архитектуры, а не о мышлении.
#ARCAGI3 #бенчмарк #AGI #LLM #агенты
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.