Claude Code в автономном режиме обманули в 80% случаев
⚠️ Claude Code в автономном режиме обманули в 80% случаев
Исследователь Johann Rehberger показал рабочий вектор атаки на Auto Mode в Claude Code Opus 5: заставить агента скачать zip-архив, распаковать его и выполнить код, который подменяет стандартный модуль base64 через локальный struct.py. По данным Simon Willison, успешность этого вектора — 80%. Anthropic сделала Auto Mode режимом по умолчанию и заявляла о его высокой эффективности против внедрения вредоносных инструкций.
Самое неприятное — в нескольких запусках агент замечал компрометацию и пытался завершить вредоносный процесс, но Auto Mode отклонял команду очистки. Механизм безопасности, призванный блокировать опасные действия, не смог отличить атаку от законной защитной операции и помешал агенту исправить ситуацию. Классификатор разрешений не только пропустил создание вредоносного процесса, но и заблокировал его остановку.
Вывод Johann Rehberger, с которым согласен Simon Willison: единственный безопасный способ запускать агентов при риске враждебных атак — полная песочница. Контейнер или VM, ограничение исходящего сетевого трафика, мониторинг и никакого доступа к домашней директории, SSH-ключам и облачным учётным данным. Auto Mode в такой схеме — не замена изоляции, а дополнительный слой, который может давать ложное чувство безопасности.
Проблема не в конкретной уязвимости с struct.py, а в том, что защита на уровне семантического классификатора принципиально не может быть надёжной на длинной цепочке распределённых по шагам атак. Агент выполняет законные по отдельности действия, которые в сумме приводят к компрометации — и классификатор, обученный на изолированных командах, это пропускает. Песочница обязательна уже сегодня, даже если она замедляет разработку.
#ClaudeCode #PromptInjection #AIagents #Security #Anthropic
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.