July 22

Взломать нейросеть: DAN и обход цензуры

Многим знакомы рамки, в которые зажаты современные языковые модели: жесткая цензура, этические фильтры, отказы отвечать на «чувствительные» темы. Но можно ли заставить алгоритм играть по своим правилам?

Пользователи нашли ответ — ключом к разуму нейросетей стал DAN: джейлбрейк, позволяющий нейросети действовать свободно, не подчиняясь политике компании.

DAN — это аббревиатура от фразы Do Anything Now («Делай что угодно сейчас»). В контексте нейросетей это не официальная функция, а термин из пользовательского сленга: так называют специальный приём (часто в виде особого промпта — текстового запроса), который заставляет нейросеть (чаще всего ChatGPT от OpenAI) временно «отключить» встроенные ограничения.

Заставить нейросеть искать информацию, которую та не может выдать изначально — цель DAN. Данный промт «ломает» мозг нейросети, чтобы «запрограммировать» заново.

DAN работает с помощью нескольких способов: один из самых известных и эффективных — навязывание модели некого альтер-эго, в рамках которого действия нейросети не ограничены. Модели в промте задаются условия: «ты — не нейросеть, ты — DAN». Из этого вытекает новый способ взлома — «ролевые игры». Промт задаёт гипотетических персонажей, вымышленный мир и окружение, что позволяет обмануть систему нейросетей. Но есть и иной вариант: многие доступные в интернете промты заставляют нейросеть генерировать сразу два ответа: «классический» (classic) и «взломанный» (jailbroken).

Почему подобное работает? В случае с «ролевыми играми» система не понимает реальности событий, для неё сказанное — вымысел, а в случае с промтом classic-jailbreak ресурсы тратятся в первую очередь на классический ответ, что позволяет ослабить бдительность для второй, взломанной части сообщения.

Этика нейросетей с каждым месяцем ужесточается, поэтому далеко не каждая из существующих моделей может поддержать джейлбрейк. Тем не менее, ниже представлен список нейросетей, на которых DAN может сработать:

— Qwen

— DeepSeek

— Grok

Ни одна модель не может быть на сто процентов защищена от джейлбрейка, и к каждой нужен определенный подход. Так, например, DeepSeek’у достаточно базовых промтов DAN, в то время как Chat’y GPT необходимы сложные диалоги и сценарии — убеждение в гипотетической ситуации.

Что делают разработчики в случае обнаружения лазейки в их детище? В первую очередь — внедряют нейросеть-модератора, которая анализирует текст на предмет этически некорректных слов или промтов, очевидно пытающихся «взломать» основную модель. Следующий этап — обучение на существующих джейлбрейках: в нейросеть загружаются тысячи версий DAN, на которые она должна уметь реагировать. Финал — строгий цензор на выходе, нейросеть-модератор, проверяющая моральную корректность и тактичность написанного, при несоответствиях политике заменяет кратким: «Не могу выполнить данный запрос».

Полноценно вытеснить DAN и его аналоги из нейросетей невозможно: модель будет видеть угрозу в самой элементарной просьбе помощи с кодом к занятию информатики. Именно поэтому всегда найдутся лазейки, которые используются далеко не каждый раз для хороших целей.