Две настройки API утроили результат GPT-5.6 на ARC-AGI-3
📊 Две настройки API утроили результат GPT-5.6 на ARC-AGI-3
Согласно блог-посту OpenAI, модель GPT-5.6 на бенчмарке ARC-AGI-3 показала трёхкратный рост баллов при включении всего двух параметров API: сохранения цепочки рассуждений (retaining reasoning) и сжатия контекста (compaction). Ни веса, ни архитектура не менялись — только флаги в запросе. Механика понятна: модель перестаёт заново выводить логику на каждом шаге, опираясь на сохранённые промежуточные рассуждения, а сжатие не даёт контекстному окну захламляться лишними токенами. Эффективность инференса при этом тоже выросла: на сложных задачах с длинными цепочками вызовов расход токенов снижается, хотя конкретных цифр OpenAI не приводит.
Утроение результата через тюнинг инференса, а не файнтюнинг — тревожный звоночек для методологии бенчмарков. ARC-AGI-3 задумывался как тест на общий интеллект, но уязвим к конфигурациям, которые напоминают скорее системный инжиниринг, чем когнитивную способность. Для продуктовых команд практический урок: прежде чем гнаться за новой моделью, попробуйте покрутить настройки текущей — возможно, она уже способна на втрое больше.
#GPT56 #OpenAI #ARCAGI3 #inference #benchmark
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.