🧠 Nvidia показала: в агентных задачах обвязка важнее модели Claude Opus 5 без дополнительной обвязки набрал 30% в интерактивном тесте ARC-AGI-3 — и это был лучший исходный результат среди проверенных моделей. Со специальной программной обвязкой от Nvidia, которая включает слой управляющего агента и отдельную работу с памятью, тот же Opus 5 дошёл до 100%, сообщает TechCrunch. Тест представляет собой набор двухмерных игр без инструкций, где модель должна сама понять правила и выиграть. Разница не в модели: в обоих прогонах используется один и тот же интеллект. Nvidia назвала свою программную надстройку Agentic Variation Operators (AVO) и подчёркивает, что это не новый продукт, а исследовательская сборка поверх открытых компонентов Nemo. Внутри — управляющий компонент, который подталкивает основного агента, если тот зациклился или зашёл в тупик, почти как «генеральный директор», если цитировать вице-президента Nvidia Аделя Эль Халлака. Контекст усиливает вывод: в апреле Microsoft тестировала 19 LLM на длительных задачах редактирования документов — все модели, включая передовые, допускали множество ошибок. Databricks в июле показала, что разная программная обвязка при одной и той же модели может вдвое менять стоимость вычислений. OpenAI, чьи модели набирали меньше 10% на ARC-AGI-3, отдельным исследованием втрое подняла свои результаты простой настройкой двух параметров обвязки, но до 100% не дотянула. Я бы не переносил 100% с ARC-AGI-3 на готовность агентов к промышленному применению: это игры с выводимыми правилами, а не многошаговое редактирование файлов, где, по тем же данным Microsoft, модели проваливаются. Но сам разброс 30% → 100% при фиксированной модели — сильный сигнал, что смена модели зачастую менее выгодна, чем переработка памяти и слоя контроля. #Nvidia #ARCAGI3 #agentic #ClaudeOpus5 #harness