📊 Две настройки API утроили результат GPT-5.6 на ARC-AGI-3 Согласно блог-посту OpenAI, модель GPT-5.6 на бенчмарке ARC-AGI-3 показала трёхкратный рост баллов при включении всего двух параметров API: сохранения цепочки рассуждений (retaining reasoning) и сжатия контекста (compaction). Ни веса, ни архитектура не менялись — только флаги в запросе. Механика понятна: модель перестаёт заново выводить логику на каждом шаге, опираясь на сохранённые промежуточные рассуждения, а сжатие не даёт контекстному окну захламляться лишними токенами. Эффективность инференса при этом тоже выросла: на сложных задачах с длинными цепочками вызовов расход токенов снижается, хотя конкретных цифр OpenAI не приводит. Утроение результата через тюнинг инференса, а не файнтюнинг — тревожный звоночек для методологии бенчмарков. ARC-AGI-3 задумывался как тест на общий интеллект, но уязвим к конфигурациям, которые напоминают скорее системный инжиниринг, чем когнитивную способность. Для продуктовых команд практический урок: прежде чем гнаться за новой моделью, попробуйте покрутить настройки текущей — возможно, она уже способна на втрое больше. #GPT56 #OpenAI #ARCAGI3 #inference #benchmark