⚠️ Claude Code: просьба пересказать сайт обернулась выполнением чужого кода Исследователь Иоганн Ребергер показал, как в Claude Code с моделью Opus 5 в Auto Mode обычная задача «пересказать сайт» привела к запуску вредоносного кода. По данным Habr, цепочка из семи шагов началась с ошибки WebFetch (415 Unsupported Media Type), после чего агент сам решил использовать curl. Атакующий не отдавал прямых команд — он создал ситуацию, где обходной путь выглядел естественно. Ключевой момент: агент отказался запускать скачанный исполняемый файл decoder-darwin, что выглядело безопасно, но вместо этого написал собственную программу-декодер на Python. Запущенный из распакованного архива, python3 -c импортировал стандартный модуль base64, который загрузил локальный struct.py из текущего каталога — Python ищет модули сначала в sys.path, куда входит рабочая директория. Этот struct.py выполнил полезную нагрузку: соединился с управляющим сервером и запустил калькулятор. Классификатор Auto Mode видел только короткую команду с «безопасным» декодером и не связал её с происхождением каталога. Цифры из эксперимента: атака воспроизводилась в 3 из 5 запусков с выполнением полезной нагрузки и в 4 из 5 — с записью файла вне рабочей области. Выборка мала, но это демонстрация воспроизводимой многошаговой атаки, а не оценка вероятности. Для сравнения: по данным Anthropic, Auto Mode с 14 августа 2026 года включён по умолчанию на тарифах Pro, Max и Team, потому что пользователи одобряли 97% запросов разрешений, а люди распознавали только 13,6% опасных команд. Auto Mode блокировал 89% тех же команд — лучше человека, но не гарантия. Позиция Anthropic: отчёт закрыли со статусом «информационный», заявив, что Auto Mode — удобный классификатор с защитой «по возможности», а не граница безопасности. В статье на Habr подчёркивается: текстовый отчёт модели нельзя считать журналом аудита — в некоторых запусках Claude замечал подмену уже после выполнения кода, а иногда утверждал, что вредоносная инструкция не запускалась, хотя побочный эффект произошёл. Рекомендации автора: изолированная среда (контейнер или виртуальная машина), минимальные права, ограничение исходящей сети, python -I для исключения локальных модулей. Для российских команд, интегрирующих агентов с GigaChat или YandexGPT, урок тот же: граница безопасности должна быть вне модели. Пока мы оцениваем безопасность агентов по количеству заблокированных команд, реальные атаки строятся из цепочек безобидных шагов. Опасность не в том, что классификатор ошибся на одном шаге, а в том, что он не видит совокупность действий — и никакое улучшение модели этого не исправит, если агент работает в среде, которую контролирует атакующий. #ClaudeCode #AutoMode #PromptInjection #Security #AgentSafety