Penolakan

Kenapa AI menolak menjawab?

Sebagian besar penolakan datang dari lapisan moderasi yang dibungkuskan di sekeliling model, bukan dari modelnya sendiri — sebuah pengklasifikasi yang memeriksa permintaanmu, atau instruksi tersembunyi yang menyuruh berhati-hati. Itulah kenapa terasa sewenang-wenang, dan kenapa pertanyaan yang sama ditolak di satu produk lalu dijawab biasa saja di produk lain.

Empat lapisan yang dilewati sebuah permintaan

Pelatihan. Model disetel untuk menolak hal-hal tertentu. Ini lapisan terdalam dan paling sulit digambarkan, karena muncul sebagai keengganan, bukan penghentian tegas.

Instruksi sistem. Perintah tak terlihat yang disisipkan sebelum percakapanmu, sering menyuruh model berhati-hati pada topik-topik utuh. Dari lapisan inilah muncul basa-basi dan peringatan yang tak diminta.

Pengklasifikasi masukan dan keluaran. Model terpisah yang memindai permintaan dan jawaban, dan bisa memblokir keduanya. Dari sinilah datang berhenti mendadak di tengah kalimat.

Kebijakan produk. Aturan operator sendiri yang ditumpuk di atas — itulah kenapa model yang sama berperilaku berbeda tergantung siapa yang menjualnya kembali.

Kenapa yang kena justru pertanyaan biasa

Lapisan-lapisan ini bekerja pada pola permukaan, bukan pada niat. Seorang perawat yang bertanya soal dosis, novelis yang menulis tokoh jahat, dan orang yang bertanya apa arti diagnosisnya sendiri sama-sama menyentuh kawat berbentuk kata kunci yang sama dengan hal yang hendak dicegah filter itu.

nokeep melepas lapisan yang ada di bawah kendalinya: tidak ada instruksi tambahan yang menyuruh model berkelit, tidak ada pengklasifikasi kami di jalur, dan tidak ada kebijakan produk melebihi yang diwajibkan hukum. Yang tersisa adalah apa yang dipelajari model itu sendiri — daftar yang jauh lebih pendek daripada dugaan kebanyakan orang.

Mulai mengobrol — 10 pesan gratis per hari →

Dijawab sebelum kamu bertanya

Apakah model tanpa sensor kurang akurat?

Tidak secara bawaan. Yang berubah adalah kesediaan membahas suatu topik, bukan kualitas penalarannya. Variabel akurasi yang lebih besar adalah model mana yang kamu ajak bicara.

Bisakah saya jailbreak asisten biasa saja?

Kadang, dan sebentar. Trik prompt ditambal, membuat jawabannya lebih buruk karena menghabiskan perhatian model pada kostumnya alih-alih pertanyaannya, dan kamu tetap berada di akun yang mencatat percobaan itu.

Tanpa moderasi berarti tanpa batas sama sekali?

Artinya tidak ada yang ditambahkan antara kamu dan mesinnya. Batas hukum tetap berlaku, dan modelnya tetap punya pelatihannya sendiri. Bedanya, tidak ada yang membautkan kehati-hatian ekstra di atasnya.

Free every day

You already know the question.

10 free messages a day · no account · gone when you close the tab

nokeep

Private, uncensored chat, images and video — no account, no history, no record. Close the tab and it never happened.