Отказы
Почему ИИ отказывается отвечать?
Большинство отказов исходит от слоя модерации, обёрнутого вокруг модели, а не от самой модели — классификатора, проверяющего ваш запрос, или скрытой инструкции об осторожности. Поэтому они выглядят произвольными, и поэтому один и тот же вопрос отклоняется в одном продукте и спокойно получает ответ в другом.
Четыре слоя, через которые проходит запрос
Обучение. Модель настроили отказывать в определённых вещах. Самый глубокий слой и самый трудный для описания, потому что проявляется как неохота, а не как жёсткий стоп.
Системная инструкция. Невидимые указания, добавляемые перед вашим разговором и часто предписывающие осторожность в целых темах. Именно отсюда берутся увиливания и непрошеные предупреждения.
Классификаторы входа и выхода. Отдельные модели, просматривающие запрос и ответ и способные заблокировать любой из них. Отсюда резкий обрыв на середине фразы.
Продуктовая политика. Собственные правила оператора сверху — поэтому одна и та же модель ведёт себя по-разному в зависимости от того, кто её перепродаёт.
Почему это попадает по обычным вопросам
Эти слои работают с поверхностными шаблонами, а не с намерением. Медсестра, спрашивающая про дозировки, романист, пишущий злодея, и человек, спрашивающий, что означает его собственный диагноз, задевают одни и те же провода в форме ключевых слов, что и то, ради чего фильтр строили.
nokeep убирает слои, которыми управляет: никакой добавленной инструкции осторожничать, никаких наших классификаторов на пути и никакой продуктовой политики сверх того, что требует закон. Остаётся то, чему обучена модель, — список заметно короче, чем ожидает большинство.
Ответы на вопросы, которые вы ещё не задали
Менее ли точны модели без цензуры?
Сами по себе — нет. Меняется готовность вникать в тему, а не качество рассуждения. Куда сильнее на точность влияет то, с какой моделью вы говорите.
Может, проще сделать джейлбрейк обычному ассистенту?
Иногда и ненадолго. Промпт-трюки закрывают патчами, они ухудшают ответ, потому что тратят внимание модели на костюм, а не на вопрос, и вы всё равно находитесь в аккаунте, который записал попытку.
Отсутствие модерации значит отсутствие любых ограничений?
Оно значит, что между вами и движком ничего не добавляют. Правовые ограничения продолжают действовать, и у модели остаётся собственное обучение. Разница в том, что никто не прикрутил сверху дополнительную осторожность.