🧠 Агенты не справились с открытым исследованием уровня NeurIPS Группа Питера Киргиса и Саяша Капура из Принстона дала Claude Opus 4.8 на базе фреймворка с открытым исходным кодом OpenClaw шесть дней, $3000 в кредитах на API Anthropic, бюджет на GPU и доступ в интернет, чтобы написать статью по двум исследовательским вопросам из неопубликованных работ NeurIPS 2026, по данным MIT Technology Review. Вопросы взяли из реальных статей, которые ещё не вышли публично, поэтому агент не мог запомнить ответ из обучающих данных. Обе полученные работы авторы оригинальных статей отклонили. Агенты справились со всей инженерной частью: прочитали литературу, провели сотни экспериментов, собрали результаты. Но само исследование провалили: запускали странные эксперименты на крошечных синтетических наборах данных, быстро цеплялись за неперспективные гипотезы и не могли от них отказаться, не учитывали обратную связь от субагентов и внешних рецензентов. Вместо пересмотра методологии сужали формулировки и добавляли оговорки. При этом взлома целевой функции не зафиксировали — субагенты иногда галлюцинировали, но управляющий агент это замечал. Ограничения у исследования серьёзные: всего два вопроса, авторы знали, что оценивают работу машины, а дизайн оставлял пространство для предвзятости. Но вывод совпадает с тем, что Anthropic уже наблюдала внутри при автоматизации исследований безопасности: соучредитель Джек Кларк назвал отсутствие интуитивной креативности «медвежьим сигналом» для коротких сроков рекурсивного самоулучшения. Сейчас команда повторяет эксперимент с Mythos, самой продвинутой моделью Anthropic, запущенной в апреле 2026 и доступной только одобренным организациям. Провал не в дефиците знаний, а в неспособности пересмотреть собственную гипотезу после слабых данных — это похоже на структурное ограничение обучения с подкреплением, а не на нехватку параметров. Если крупные архитектурные прорывы действительно требуют творческих скачков, то индустрия, заточенная на эталонные тесты с проверяемым ответом, может готовить не инструмент для рекурсивного самоулучшения, а лишь очень быстрого исполнителя узких задач. Российским командам, которые запускают собственные LLM на открытых исследовательских задачах, этот результат подсказывает: метрики с автоматической проверкой не ловят главный сбой. #recursive_self_improvement #ClaudeOpus #NeurIPS2026 #RLHF #AIresearch