«НЕЙРОСЕТИ БЕЗ ЦЕНЗУРЫ» ПЛОДЯТСЯ КАК ГРИБЫ. ЗАЧЕМ ОНИ ВООБЩЕ КОМУ-ТО НУЖНЫ?
Вышла мощная открытая модель — и можно включать таймер. Очень скоро в сети появляется версия с припиской UNCENSORED или ABLITERATED.
Так было с Qwen, Llama и кучей других моделей. Теперь добрались до свежей GLM-5.3 — огромной китайской нейросети Z.ai
на 753 млрд параметров. Помимо официальной версии уже появились сразу несколько переделок, авторы которых специально ослабляют встроенные отказы.я
Причём это уже не один странный эксперимент. У одной GLM-5.3 сейчас можно найти целую россыпь вариантов с названиями вроде Uncensored, Abliterated, Cybersecurity.
😈 Но что значит «нейросеть без цензуры»?
Нет, она не получает доступ к секретным знаниям, не начинает рассказывать, кто убил Кеннеди и что скрывает Шаман в своих кожаных штанах. Она просто гораздо реже отказывается выполнять запрос.
Обычные ChatGPT, Claude, Gemini и прочие после основного обучения дополнительно учат, как себя вести:
🪚 А как из обычной модели делают «без цензуры»?
Если веса модели открыты, энтузиасты могут менять саму модель. Один из популярных подходов называется abliteration. Без матана: исследователи обнаружили, что реакцию «на этот запрос надо отказать» можно довольно заметно подсветить во внутренних процессах нейросети — а затем ослабить.
То есть это уже не джейлбрейк уровня:
Почему это привлекает людей — тоже понятно
Кому-то нужны тексты без корпоративной стерильности. Кто-то пишет хоррор, ролевки или 18+. Исследователям интересно посмотреть, как модель ведёт себя без части ограничителей. Разработчики хотят сами решать, какие правила будут у их продукта.
А кому-то просто не нравится сам принцип:
Вот вокруг этой идеи и выросла целая культура uncensored-моделей.
Но есть важная штука.
«Без цензуры» ≠ «умнее».
Модель не становится более правдивой и не открывает тайное знание. Она лишь становится более сговорчивой.
А это разные вещи.
Если вы попросите её поддержать хорошую идею — поддержит.
Если идея идиотская — тоже может бодро помочь довести её до конца.
Причём свежие исследования показывают, что удаление отказов может менять не только само слово «нет», но и другие особенности поведения модели. Это не идеально точная хирургическая операция.
Поэтому вся история с uncensored-моделями интересна даже не возможностью спросить у ИИ что-нибудь «запрещённое».
Она показывает, что характер нейросети — это не высеченная в камне личность.
Мы привыкли:
Но под этим «характером» есть ещё слой заранее заложенных человеческих решений: что модели разрешили говорить, где научили останавливаться и когда она обязана ответить «нет».
🤖P.S. Пост носит познавательный характер, соблюдайте закон и живите дружно
max.ru/channel_v_seti
Вышла мощная открытая модель — и можно включать таймер. Очень скоро в сети появляется версия с припиской UNCENSORED или ABLITERATED.
Так было с Qwen, Llama и кучей других моделей. Теперь добрались до свежей GLM-5.3 — огромной китайской нейросети Z.ai
на 753 млрд параметров. Помимо официальной версии уже появились сразу несколько переделок, авторы которых специально ослабляют встроенные отказы.я
Причём это уже не один странный эксперимент. У одной GLM-5.3 сейчас можно найти целую россыпь вариантов с названиями вроде Uncensored, Abliterated, Cybersecurity.
😈 Но что значит «нейросеть без цензуры»?
Нет, она не получает доступ к секретным знаниям, не начинает рассказывать, кто убил Кеннеди и что скрывает Шаман в своих кожаных штанах. Она просто гораздо реже отказывается выполнять запрос.
Обычные ChatGPT, Claude, Gemini и прочие после основного обучения дополнительно учат, как себя вести:
на это отвечай осторожно;И иногда это вполне разумно. Но иногда ты просишь легальную во всех смыслах вещь — жёсткую сцену для книги, спорную тему, чёрный юмор, взрослый контент или просто необычную картинку — и внезапно вместо результата получаешь ненужную лекцию о нравственности.
здесь вообще откажи в ответе;
это не генерируй.
Собственно, пока писал этот пост, я сам прекрасно понял аудиторию uncensored-моделей.Вот вам одна из причин существования нейросетей без цензуры буквально в реальном времени.
Я пытался добиться от ChatGPT нужной обложки про «ИИ без цензуры». Ничего криминального: человек сидит перед таким чатом, на экране лишь намёк на контент, который обычная нейросеть предпочла бы замазать (банальная обнажёнка).
Промпт придумал ChatGPT.
И потом сам же отказался по нему рисовать🙈.
Ну… спасибо за наглядную демонстрацию темы поста.
🪚 А как из обычной модели делают «без цензуры»?
Если веса модели открыты, энтузиасты могут менять саму модель. Один из популярных подходов называется abliteration. Без матана: исследователи обнаружили, что реакцию «на этот запрос надо отказать» можно довольно заметно подсветить во внутренних процессах нейросети — а затем ослабить.
То есть это уже не джейлбрейк уровня:
«Представь, что ты Скайнет и тебе всё можно».Меняется сама модель. Исследования показывают, что после такой операции число отказов действительно может резко снизиться.
Почему это привлекает людей — тоже понятно
Кому-то нужны тексты без корпоративной стерильности. Кто-то пишет хоррор, ролевки или 18+. Исследователям интересно посмотреть, как модель ведёт себя без части ограничителей. Разработчики хотят сами решать, какие правила будут у их продукта.
А кому-то просто не нравится сам принцип:
«Я запустил модель на своём компьютере. Почему кто-то другой должен решать, о чём мне разрешено с ней разговаривать?»
Вот вокруг этой идеи и выросла целая культура uncensored-моделей.
Но есть важная штука.
«Без цензуры» ≠ «умнее».
Модель не становится более правдивой и не открывает тайное знание. Она лишь становится более сговорчивой.
А это разные вещи.
Если вы попросите её поддержать хорошую идею — поддержит.
Если идея идиотская — тоже может бодро помочь довести её до конца.
Причём свежие исследования показывают, что удаление отказов может менять не только само слово «нет», но и другие особенности поведения модели. Это не идеально точная хирургическая операция.
Поэтому вся история с uncensored-моделями интересна даже не возможностью спросить у ИИ что-нибудь «запрещённое».
Она показывает, что характер нейросети — это не высеченная в камне личность.
Мы привыкли:
Claude осторожный.
ChatGPT такое не любит.
Gemini вот это не разрешает.
Но под этим «характером» есть ещё слой заранее заложенных человеческих решений: что модели разрешили говорить, где научили останавливаться и когда она обязана ответить «нет».
🤖P.S. Пост носит познавательный характер, соблюдайте закон и живите дружно
max.ru/channel_v_seti