Verweigerungen
Warum verweigert KI die Antwort?
Die meisten Verweigerungen stammen aus einer Moderationsschicht um das Modell und nicht aus dem Modell selbst — ein Klassifikator, der Ihre Anfrage prüft, oder eine versteckte Anweisung zur Vorsicht. Deshalb wirken sie willkürlich, und deshalb wird dieselbe Frage im einen Produkt abgelehnt und im anderen schlicht beantwortet.
Die vier Schichten, die eine Anfrage durchläuft
Das Training. Das Modell wurde darauf abgestimmt, bestimmte Dinge abzulehnen. Die tiefste Schicht und die am schwersten zu beschreibende, weil sie als Widerwillen auftritt und nicht als harter Stopp.
Die Systemanweisung. Unsichtbare Anweisungen, die Ihrem Gespräch vorangestellt werden und dem Modell oft für ganze Themen Vorsicht auftragen. Aus dieser Schicht stammen das Herumdrucksen und die ungefragten Warnhinweise.
Eingangs- und Ausgangsklassifikatoren. Eigene Modelle, die Anfrage und Antwort prüfen und beides blockieren können. Daher der abrupte Abbruch mitten im Satz.
Die Produktrichtlinie. Die eigenen Regeln des Betreibers obendrauf — deshalb verhält sich dasselbe Modell unterschiedlich, je nachdem, wer es weiterverkauft.
Warum es gewöhnliche Fragen trifft
Diese Schichten arbeiten mit Oberflächenmustern, nicht mit Absichten. Eine Pflegekraft, die nach Dosierungen fragt, ein Autor, der einen Bösewicht schreibt, und jemand, der wissen will, was die eigene Diagnose bedeutet, lösen dieselben schlagwortförmigen Drähte aus wie das, wogegen der Filter gebaut wurde.
nokeep entfernt die Schichten, die es kontrolliert: keine zusätzliche Anweisung zur Zurückhaltung, keine eigenen Klassifikatoren im Pfad, keine Produktrichtlinie über das gesetzlich Erforderliche hinaus. Übrig bleibt, was das Modell gelernt hat — eine weit kürzere Liste, als die meisten erwarten.
Beantwortet, bevor Sie fragen
Sind unzensierte Modelle ungenauer?
Nicht von sich aus. Was sich ändert, ist die Bereitschaft, ein Thema zu behandeln, nicht die Qualität der Argumentation. Die größere Genauigkeitsvariable ist, mit welchem Modell Sie sprechen.
Kann ich stattdessen einen normalen Assistenten jailbreaken?
Manchmal, kurz. Prompt-Tricks werden gepatcht, sie verschlechtern die Antwort, weil die Aufmerksamkeit des Modells ins Kostüm statt in die Frage fließt — und Sie sind weiterhin in einem Konto, das den Versuch protokolliert hat.
Heißt keine Moderation gar keine Grenzen?
Es heißt, dass zwischen Ihnen und der Engine nichts hinzugefügt wird. Gesetzliche Grenzen gelten weiterhin, und das Modell hat sein eigenes Training. Der Unterschied ist, dass niemand zusätzliche Vorsicht obendrauf geschraubt hat.