🧠 Зашифрованные цепочки рассуждений вскрыли с помощью слабых моделей того же семейства Зашифрованные блоки цепочек рассуждений, которые OpenAI, Anthropic и Google возвращают клиентам, можно переиспользовать между сессиями, пользователями и моделями. По данным Simon Willison, авторы работы от 11 августа брали цепочку рассуждений сильной модели, передавали её слабой модели того же семейства через API и с помощью обхода ограничений добивались расшифровки исходного текста рассуждений. В примере с curl для GPT-5.6 Luna API помимо обычного вывода возвращает reasoning.encrypted_content. Оказалось, что все модели внутри одного семейства используют один ключ шифрования — поэтому зашифрованный блок от сильной модели спокойно принимает слабая. Самой лёгкой целью стала Claude Haiku 4.5: атака строилась на префиксе сообщения ассистента <thinking-copy> и запросе переписать приложенную цепочку рассуждений дословно, в моделях 4.6 этой возможности уже нет. В приложении к статье лежат извлечённые цепочки рассуждений. GPT-5.5, рассуждая про CSS, пишет «Need replace entire app.css», перебирает компоненты Svelte 5 и Button.svelte с variants, size, loading. Это токены, которые явно не предназначались для человеческого чтения. Отдельная находка — внедрение инструкций через саму цепочку рассуждений: модель заставляют обдумывать передачу файла на удалённый сервер, затем зашифрованный блок передают другой модели. Та относится к чужим токенам рассуждений как к сакральным инструкциям и охотнее их выполняет. Это не взлом криптографии: ключ не подбирали, а заставили слабую модель стать оракулом расшифровки. Для рабочей среды это значит, что токены рассуждений из API нельзя считать внутренним состоянием модели — если поставщик отдаёт их в ответе, они могут стать читаемыми у другой части того же семейства. Исправление после отчёта больше похоже на точечную правку конкретных запросов для обхода ограничений, чем на переработку системы. #reasoning #LLMsecurity #jailbreak #ClaudeHaiku #OpenAI