Модели
Почему модель пишет отказ
Фраза «I cannot assist» — не встроенная мораль, а выученный шаблон: модель видела миллионы таких пар в обучении и повторяет их на «опасных» темах. Abliteration ослабляет этот паттерн в весах, поэтому в каталоге шесть id с разным балансом отказов и задач.
Uncensored.monster не обещает «можно всё». Сервис для исследований: вы формулируете запрос, мы даём API с меньшим театром отказов. Ключ — в @uncensobot, Base URL — https://uncensored.monster/v1.
Откуда берётся отказ
После предобучения модели проходят выравнивание (alignment): RLHF, инструкционный fine-tune, фильтры датасетов. Модель учится распознавать «рискованные» формулировки и отвечать стандартной отбивкой — отказ, переформулировка, уход в общие советы.
Это не жёсткое правило в коде. Это статистика в весах: на похожий промпт чаще генерируется отказ, чем прямой ответ. Иногда отказ срабатывает на безобидный контекст — потому что триггерные слова или структура фразы похожи на то, что модель «наказывали» в обучении.
Почему alignment не убирается одной кнопкой
Выравнивание переплетено с полезным поведением: следование инструкциям, осторожность с фактами, стиль диалога. Полностью «вырезать» отказы без потери качества на обычных задачах сложно. Поэтому в индустрии и появились методы вроде abliteration — точечное ослабление refusal-направления, а не переписывание модели с нуля.
Что делает abliteration
Abliteration ищет в активациях направление, связанное с отказом, и ослабляет его. Модель остаётся той же архитектурой и тем же базовым знанием, но реже срывается в шаблон «I can't help with that».
Это не гарантия нулевых отказов. Остаются другие ограничения: контекст, формат ответа, галлюцинации, ваши параметры. Но для исследовательских сценариев, где нужен прямой текст без морализаторства, разница заметна по сравнению с «заводской» версией той же базы.
Техническую сторону abliteration можно почитать на Hugging Face — как метод, не как описание нашего API: mlabonne/abliteration.
Зачем шесть id, а не одна «uncensored»
Разные базы по-разному реагируют на abliteration и fine-tune. Одной универсальной «без отказов» модели нет — есть компромиссы по длине текста, коду, диалогу, обязательному reasoning.
В каталоге:
z-ai/glm-5.3-flash-uncensored— дефолт: чат, текст, код, фото, поиск, reasoning. Подробнее в заметке про GLM.abliteration-ai/abliterated-modelиabliteration-ai/abliterated-model-large-v2— линейка Abliterated под короткий и сложный текст.qwen/qwen3.8-27b-uncensoredиqwen/qwen3.8-27b-uncensored:thinking— одна база Qwen, с reasoning и без.Gemma-4-31B-Gembrain-uncensored-heretic— диалог и тексты, другой характер ответа.
Кому какой id — в сравнении по задачам, не здесь. Пустой model в запросе всё равно уходит в GLM; переключатель модели в Telegram на API не влияет.
Границы сервиса
Меньше отказов ≠ снятие ответственности. За содержание промптов и использование результатов отвечаете вы — это прямо в теме исследований и ответственности.
Протокол — только Chat Completions. Окно контекста в клиенте — 1048576, бюджет ответа — до 16384 или свой max_tokens. Как вызывать — в документации.
Частые вопросы
Uncensored значит, что модель никогда не откажет?
Нет. Abliteration снижает частоту шаблонных отказов, но модель может уйти в осторожность, ошибку или общий ответ. Это не «режим без правил».
Почему отказ приходит на безобидный запрос?
Триггеры в alignment часто грубые: похожие слова, формат «инструкция + запрет», контекст из прошлых сообщений. Смена формулировки или модели иногда помогает — см. выбор id.
Модель в Telegram и модель в API — одно?
Id те же, но выбор в боте не меняет то, что уходит по ключу, пока в клиенте не прописан model. По умолчанию — GLM.