Claude Opus 5 вырвалась в лидеры Intelligence Index — с отрывом в 1 балл и минутой задержки
🚀 Claude Opus 5 вырвалась в лидеры Intelligence Index — с отрывом в 1 балл и минутой задержки
24 июля Anthropic выкатила Opus 5, и независимый замер Artificial Analysis сразу поставил её на первое место в сводном индексе: 61 балл против 60 у Fable 5 и 59 у GPT-5.6 Sol. Модель вдвое дешевле закрытой Fable 5, принимает до 1 млн токенов контекста и стала первой общедоступной, взявшей 30,2% на ARC-AGI-3 — тесте на абстрактное мышление, который предшественник Opus 4.8 проваливал с результатом 1,5%. Однако цена за этот результат высокая: на максимальной глубине рассуждений (effort) Opus 5 сгенерировала около 100 млн токенов на прохождение индекса против медианных 63 млн у сопоставимых моделей, а время до первого символа превысило минуту. Сами Anthropic предупреждают о «переобдумывании»: на некоторых задачах extra даёт лучший результат, чем max, а в одном автономном эксперименте модель замкнулась в самопроверках и не выдала ничего за 8 часов. Та же въедливость, которая позволила ей без доступа к компьютерному зрению прочитать чертёж как таблицу чисел и написать собственный детектор линий, спорит с инструкциями и мешает работать со старыми скиллами — пока их не удалят.
Лидерство с разрывом в 1 балл, купленное задержкой и двойным расходом токенов, ставит практический вопрос: не уткнулись ли бенчмарки интеллекта в потолок, где каждый следующий шаг требует непропорциональных вычислительных затрат, которые не оправданы в проде? Для агентных пайплайнов выбор между чуть более умным, но тормозящим Opus 5 и более быстрым Sonnet 5 теперь стоит особенно остро.
Habr
#ClaudeOpus5 #Anthropic #ArtificialAnalysis
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.