Rechazos
¿Por qué la IA se niega a responder?
La mayoría de los rechazos vienen de una capa de moderación envuelta alrededor del modelo y no del modelo en sí —un clasificador que inspecciona tu petición, o una instrucción oculta que le pide prudencia—, y por eso parecen arbitrarios y por eso la misma pregunta se rechaza en un producto y se responde con naturalidad en otro.
Las cuatro capas que atraviesa una petición
El entrenamiento. Al modelo se le ajustó para declinar ciertas cosas. Es la capa más profunda y la más difícil de describir, porque aparece como reticencia y no como un corte seco.
La instrucción del sistema. Órdenes invisibles añadidas al principio de tu conversación, que a menudo le piden cautela con temas enteros. De esta capa salen los rodeos y las advertencias que nadie pidió.
Los clasificadores de entrada y salida. Modelos aparte que revisan tu petición y la respuesta, capaces de bloquear cualquiera de las dos. De aquí viene el corte abrupto a mitad de frase.
La política del producto. Las reglas propias del operador puestas encima, y por eso el mismo modelo se comporta distinto según quién lo revenda.
Por qué acaba cayendo sobre preguntas normales
Estas capas trabajan sobre patrones superficiales, no sobre intenciones. Una enfermera preguntando por dosis, un novelista escribiendo a su villano y alguien preguntando qué significa su propio diagnóstico activan los mismos cables con forma de palabra clave que aquello que el filtro debía frenar.
nokeep retira las capas que controla: ninguna instrucción añadida que pida prudencia al modelo, ningún clasificador nuestro en el camino, y ninguna política de producto más allá de lo que exige la ley. Queda lo que el modelo aprendió a hacer, que es una lista bastante más corta de lo que la gente espera.
Preguntas que ya te estabas haciendo
¿Los modelos sin censura son menos precisos?
No de por sí. Lo que cambia es la disposición a tratar un tema, no la calidad del razonamiento. La variable de precisión que más pesa es con qué modelo hablas.
¿Puedo hacer un jailbreak a un asistente normal?
A veces, y por poco tiempo. Los trucos de prompt se parchean, empeoran la respuesta porque gastan la atención del modelo en el disfraz en vez de en la pregunta, y sigues estando en una cuenta que registró el intento.
¿Sin moderación significa sin ningún límite?
Significa que no se añade nada entre tú y el motor. Los límites legales siguen existiendo, y el modelo conserva su propio entrenamiento. La diferencia es que nadie ha atornillado cautela extra por encima.