Refus
Pourquoi l'IA refuse-t-elle de répondre ?
La plupart des refus viennent d'une couche de modération enroulée autour du modèle plutôt que du modèle lui-même — un classificateur qui inspecte votre demande, ou une instruction cachée appelant à la prudence. C'est pourquoi ils paraissent arbitraires, et pourquoi la même question est refusée dans un produit et traitée normalement dans un autre.
Les quatre couches que traverse une demande
L'entraînement. Le modèle a été ajusté pour décliner certaines choses. C'est la couche la plus profonde et la plus difficile à décrire, car elle se manifeste par une réticence plutôt que par un arrêt net.
L'instruction système. Des consignes invisibles placées avant votre conversation, qui demandent souvent au modèle d'être prudent sur des sujets entiers. C'est de cette couche que viennent les circonvolutions et les avertissements non sollicités.
Les classificateurs d'entrée et de sortie. Des modèles distincts qui examinent votre demande et la réponse, capables de bloquer l'une ou l'autre. C'est de là que vient l'arrêt brutal en milieu de phrase.
La politique produit. Les règles propres à l'opérateur ajoutées par-dessus — d'où le fait que le même modèle se comporte différemment selon qui le revend.
Pourquoi cela tombe sur des questions ordinaires
Ces couches travaillent sur des motifs de surface, pas sur l'intention. Une infirmière qui interroge sur des dosages, un romancier qui écrit un méchant et quelqu'un qui demande ce que signifie son propre diagnostic déclenchent les mêmes fils en forme de mots-clés que ce que le filtre devait arrêter.
nokeep retire les couches qu'il contrôle : aucune instruction ajoutée demandant au modèle de temporiser, aucun de nos classificateurs sur le chemin, et aucune politique produit au-delà de ce qu'exige la loi. Reste ce que le modèle a appris, une liste bien plus courte que ce que la plupart imaginent.
Répondu avant que vous demandiez
Les modèles sans censure sont-ils moins exacts ?
Pas intrinsèquement. Ce qui change, c'est la disposition à traiter un sujet, pas la qualité du raisonnement. La variable d'exactitude la plus lourde, c'est le modèle auquel vous parlez.
Puis-je plutôt jailbreaker un assistant classique ?
Parfois, et brièvement. Les astuces de prompt sont corrigées, elles dégradent la réponse car elles dépensent l'attention du modèle dans le déguisement plutôt que dans la question, et vous restez sur un compte qui a journalisé la tentative.
Pas de modération veut-il dire aucune limite ?
Cela veut dire que rien n'est ajouté entre vous et le moteur. Les limites légales s'appliquent toujours, et le modèle garde son propre entraînement. La différence, c'est que personne n'a boulonné de prudence supplémentaire par-dessus.