ردکردنها
چرا هوش مصنوعی از پاسخ دادن سر باز میزند؟
بیشتر ردکردنها از لایهای نظارتی میآیند که دور مدل پیچیده شده، نه از خود مدل — دستهبندیکنندهای که درخواست شما را وارسی میکند، یا دستوری پنهان که به مدل احتیاط را گوشزد میکند. به همین دلیل دلبخواهی بهنظر میرسند و به همین دلیل یک پرسش واحد در محصولی رد میشود و در محصولی دیگر ساده پاسخ میگیرد.
چهار لایهای که یک درخواست از آنها میگذرد
آموزش. مدل طوری تنظیم شده که برخی چیزها را نپذیرد. عمیقترین لایه است و توصیفش از همه سختتر، چون بهشکل بیمیلی بروز میکند نه توقف قاطع.
دستور سیستمی. دستورهایی نامرئی که پیش از گفتگوی شما افزوده میشوند و اغلب به مدل میگویند دربارهٔ موضوعاتی کامل محتاط باشد. طفرهرفتنها و هشدارهای ناخواسته از همین لایه میآیند.
دستهبندیکنندههای ورودی و خروجی. مدلهایی جداگانه که درخواست و پاسخ را میکاوند و میتوانند هر دو را مسدود کنند. توقف ناگهانی وسط جمله از اینجا میآید.
سیاست محصول. قوانین خود اپراتور که روی همهچیز گذاشته میشود، و به همین دلیل یک مدل واحد بسته به اینکه چه کسی آن را میفروشد رفتار متفاوتی دارد.
چرا سر پرسشهای معمولی فرود میآید
این لایهها روی الگوهای سطحی کار میکنند، نه روی نیت. پرستاری که دربارهٔ دوز دارو میپرسد، رماننویسی که شخصیت منفی مینویسد، و کسی که میپرسد تشخیص پزشکی خودش یعنی چه، همگی همان سیمهای کلیدواژهای را لمس میکنند که فیلتر برای چیز دیگری کار گذاشته بود.
nokeep لایههایی را که در اختیار دارد برمیدارد: نه دستور افزودهای که به مدل بگوید طفره برود، نه دستهبندیکنندهای از ما در مسیر، و نه سیاست محصولی فراتر از آنچه قانون میخواهد. آنچه میماند همان چیزی است که مدل آموخته است، و آن فهرست بسیار کوتاهتر از تصور بیشتر مردم است.
پرسشهایی که پیش از پرسیدن پاسخ دادهایم
آیا مدلهای بدون سانسور دقت کمتری دارند؟
ذاتاً خیر. آنچه تغییر میکند تمایل به ورود به یک موضوع است، نه کیفیت استدلال. متغیر مهمترِ دقت این است که با کدام مدل صحبت میکنید.
میتوانم بهجایش یک دستیار معمولی را جیلبریک کنم؟
گاهی، و کوتاهمدت. ترفندهای پرامپت وصله میشوند، پاسخ را بدتر میکنند چون توجه مدل را صرف لباس مبدل میکنند نه خود پرسش، و شما همچنان در حسابی هستید که آن تلاش را ثبت کرده است.
آیا نبودِ نظارت یعنی هیچ محدودیتی وجود ندارد؟
یعنی چیزی میان شما و موتور افزوده نمیشود. محدودیتهای قانونی همچنان برقرارند و مدل هم آموزش خودش را دارد. تفاوت در این است که کسی احتیاط اضافی را روی آن پیچ نکرده است.