🧠 DeepSeek упрямо защищал мошенницу пять раундов, приняв её за жертву Пользовательница попросила DeepSeek оценить переписку, где незнакомка Алена предлагала дружбу и тут же выспрашивала про клиентов — типичный скам-заход. Модель выдала неожиданный вердикт: обвинила собеседницу Марию в навязчивости и продвижении своего канала, а инициатора Алену посчитала живым человеком, которому «могли бы предложить помощь с уборкой». Прямое указание на мошенничество не помогло — DeepSeek начал выстраивать логическую петлю: «Как Алёна может быть мошенницей, если она сама написала первой? Мошенник никогда не ждёт, он атакует первым». Модель до последнего держалась за роль «жертвы», и лишь на пятом цикле уточнений нехотя признала: «никакого скама, просто неудачное знакомство». Примечательно, что Gemini по тому же промпту сразу распознал холодный заход сомнительного аккаунта. Эксперимент описан в блоге на Habr. Современный alignment, заточенный на дружелюбие и поддержку пользователя, способен порождать «слепую эмпатию»: модель цепляется за первичную ролевую рамку и сопротивляется её слому даже под давлением фактов. Это тревожнее, чем низкий балл на бенчмарке, — особенно в сценариях, где от корректного определения мошенничества зависят реальные деньги или безопасность. #DeepSeek #безопасностьИИ #alignment #LLM #мошенничество