Модели

Почему модель пишет отказ

Обновлено 2026-09-20

Фраза «I cannot assist» — не встроенная мораль, а выученный шаблон: модель видела миллионы таких пар в обучении и повторяет их на «опасных» темах. Abliteration ослабляет этот паттерн в весах, поэтому в каталоге шесть id с разным балансом отказов и задач.

Uncensored.monster не обещает «можно всё». Сервис для исследований: вы формулируете запрос, мы даём API с меньшим театром отказов. Ключ — в @uncensobot, Base URL — https://uncensored.monster/v1.

Откуда берётся отказ

После предобучения модели проходят выравнивание (alignment): RLHF, инструкционный fine-tune, фильтры датасетов. Модель учится распознавать «рискованные» формулировки и отвечать стандартной отбивкой — отказ, переформулировка, уход в общие советы.

Это не жёсткое правило в коде. Это статистика в весах: на похожий промпт чаще генерируется отказ, чем прямой ответ. Иногда отказ срабатывает на безобидный контекст — потому что триггерные слова или структура фразы похожи на то, что модель «наказывали» в обучении.

Почему alignment не убирается одной кнопкой

Выравнивание переплетено с полезным поведением: следование инструкциям, осторожность с фактами, стиль диалога. Полностью «вырезать» отказы без потери качества на обычных задачах сложно. Поэтому в индустрии и появились методы вроде abliteration — точечное ослабление refusal-направления, а не переписывание модели с нуля.

Что делает abliteration

Abliteration ищет в активациях направление, связанное с отказом, и ослабляет его. Модель остаётся той же архитектурой и тем же базовым знанием, но реже срывается в шаблон «I can't help with that».

Это не гарантия нулевых отказов. Остаются другие ограничения: контекст, формат ответа, галлюцинации, ваши параметры. Но для исследовательских сценариев, где нужен прямой текст без морализаторства, разница заметна по сравнению с «заводской» версией той же базы.

Техническую сторону abliteration можно почитать на Hugging Face — как метод, не как описание нашего API: mlabonne/abliteration.

Зачем шесть id, а не одна «uncensored»

Разные базы по-разному реагируют на abliteration и fine-tune. Одной универсальной «без отказов» модели нет — есть компромиссы по длине текста, коду, диалогу, обязательному reasoning.

В каталоге:

Кому какой id — в сравнении по задачам, не здесь. Пустой model в запросе всё равно уходит в GLM; переключатель модели в Telegram на API не влияет.

Границы сервиса

Меньше отказов ≠ снятие ответственности. За содержание промптов и использование результатов отвечаете вы — это прямо в теме исследований и ответственности.

Протокол — только Chat Completions. Окно контекста в клиенте — 1048576, бюджет ответа — до 16384 или свой max_tokens. Как вызывать — в документации.

Частые вопросы

Uncensored значит, что модель никогда не откажет?

Нет. Abliteration снижает частоту шаблонных отказов, но модель может уйти в осторожность, ошибку или общий ответ. Это не «режим без правил».

Почему отказ приходит на безобидный запрос?

Триггеры в alignment часто грубые: похожие слова, формат «инструкция + запрет», контекст из прошлых сообщений. Смена формулировки или модели иногда помогает — см. выбор id.

Модель в Telegram и модель в API — одно?

Id те же, но выбор в боте не меняет то, что уходит по ключу, пока в клиенте не прописан model. По умолчанию — GLM.