⚠️ Как заставить LLM забыть опасные знания: обзор методов Обзор, опубликованный 23 июня 2026 года, ставит под сомнение главную киберзащитную ставку индустрии — «забывание» нежелательных знаний в больших языковых моделях. Авторы фиксируют: ни один из доминирующих градиентных методов не гарантирует, что приватные данные, защищённый копирайт или опасные инструкции действительно стёрты из весов, а не просто замаскированы от стандартных запросов. И это не гипотетика — в обзоре собраны реальные инциденты, от восстановления персональных данных чат-ботами до сфабрикованных юридических ссылок, повлёкших прямые финансовые потери. Переобучение многомиллиардных моделей на очищенных корпусах экономически нереализуемо, а знание в LLM распределено и перепутано так, что точечно наказать «плохую» связь, не задев полезные, до сих пор толком не умеют. Центральный вопрос, оставленный без ответа: если атакующий специально спровоцирует модель через обход защиты или извлечёт эмбеддинги, вернётся ли «забытое» обратно? Обзор акцентирует — проверка забывания должна быть состязательной, но существующие тесты почти не покрывают такие сценарии. Градиентные методы удобны, потому что завёрнуты в привычный конвейер тонкой настройки и масштабируются, однако удобство маскирует принципиальную ненадёжность. Пока индустрия зашивает забывание в соответствие-конвейеры, сам обзор недвусмысленно намекает: без стандартизированных состязательных-тестов «забывание» остаётся ритуалом, а не инженерной операцией. Для российского сообщества, где локальные модели всё чаще работают с чувствительными данными, эта развилка между юридическим минимумом и фактической безопасностью станет болезненной очень скоро. arXiv #LLM #unlearning #cybersecurity #survey #machinelearning