چرا دستورهای «انجام نده» مدلهای زبانی را وادار به تولید کلمات ممنوعه میکنند؟
وقتی کاربران از هوش مصنوعی میخواهند از موضوع خاصی دوری کند، مدل اغلب دقیقا همان واژگانی را تولید میکند که قرار بود حذف شوند. ریشه این مشکل در پدیدهای به نام فعالسازی نشانه هدف است؛ نقصی محاسباتی که در آن وزن ریاضی مفهوم ممنوعه، درک ساختاری مدل از منفیسازی را مغلوب میکند.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- فعالسازی نشانه هدف هنگامی روی میدهد که وزن ریاضی مفهوم ممنوعه در پرامپت، سیگنال منفیساز مدل را مغلوب کند.
- مدلهای زبانی سازوکارهایی آماری برای سنجش مجاورت نشانهها هستند و ساختار آنها ابزار درک منطقی مفهوم غیاب را ندارد.
- برنامهنویسان با تبدیل قیود سلبی به احکام ایجابی شفاف میتوانند این نقص معماری را دور زده و مفهومی ایمن برای فعالسازی به مدل بدهند.
در این مطلب
برای آنکه یک مدل زبانی بتواند با موفقیت از پرداختن به موضوعی ممنوعه اجتناب کند، بازنمایی درونی آن از مفهوم نفی و سلب باید جریمه محاسباتی قویتری نسبت به وزن تحریکی ناشی از حضور صرف آن مفهوم در متن ورودی (پرامپت) اعمال نماید. در معماریهای نوین ترنسفورمر خودبازگشتی، این شرط ریاضی معمولا محقق نمیشود.[3]
هنگامی که کاربر دستوری تایپ میکند و در آن از هوش مصنوعی میخواهد به موضوعی خاص اشاره نکند، سازوکار توجه در مدل، شبکه معنایی پیرامون همان سوژه را به شکلی شدید فعال میسازد. در این فرایند، نشانه منفیساز تککلمهای توان مهار این حجم انبوه از فعالسازی معنایی را نخواهد داشت.[1]
این نقص محاسباتی با نام «فعالسازی نشانه هدف» (Target-Token Priming) شناخته میشود. همین سازوکار توجیه میکند چرا وقتی به یک مدل مولد گفته میشود به «فیل» فکر نکند، تقریبا قطعی است که واژگانی مرتبط با عاج، خرطوم و دشتهای آفریقا در خروجی آن ظاهر خواهد شد.[3]
ریشه این ناکامی به معماری بنیادین مدلهای زبانی بزرگ بازمیگردد که هدفشان پیشبینی محتملترین کلمه بعدی بر پایه پنجره زمینه است. مطابق مدخل ویکیپدیا درباره این موضوع، «مدلهای زبانی بزرگ معمولا بر پایه معماری شبکههای عصبی ترنسفورمر بنا شدهاند».[2]
از آنجا که این مدلها در واقع موتورهای آماری بدون درک مفهومی هستند، ادراکی منطقی از «عدم» یا غیاب یک چیز ندارند. محاسبات آنها صرفا بر ارزیابی مجاورت ریاضی میان نشانههای موجود در پرامپت و نشانههای ذخیرهشده در دایره واژگان متکی است.[3]
سازوکار توجه چگونه نشانهها را وزندهی میکند؟
برای فهم علت ناکامی در منفیسازی، باید شیوه پردازش متن در ترنسفورمرها موشکافی شود. همانگونه که در مدخل ویکیپدیا برای سازوکار توجه آمده است: «در یادگیری ماشین، توجه روشی است که میزان اهمیت هر جزء در یک توالی را نسبت به دیگر اجزای آن توالی میسنجد».[1]
وقتی یک پرامپت به مدل وارد میشود، به نشانههای مجزا تجزیه میگردد. سازوکار توجه به هر نشانه یک امتیاز یا وزن متناسب اختصاص میدهد که مشخص میکند آن نشانه تا چه اندازه باید روی خروجی نهایی اثرگذار باشد.[1]
طبق توضیحات ویکیپدیا، «در پردازش زبانهای طبیعی، اهمیت از طریق وزنهای نرم اختصاصیافته به هر کلمه در جمله بازنمایی میشود». این وزنهای نرم تنها حین انتشار رو به جلو وجود دارند و با هر گام در توالی ورودی، دچار تغییرات دینامیکی میشوند.[1]
هر نشانه تمام بودجه توجه خود، یعنی ۱۰۰ درصد آن را، میان دیگر نشانههای موجود در پنجره زمینه تقسیم میکند. واژهای مانند «فیل» کشش معنایی سهمگینی دارد و توجه نشانههای بعدی را به سمت خوشه تثبیتشده مفاهیم همبسته با خود میکشاند.[3]
در مقابل، نشانه نفی مانند واژه «هرگز» صرفا یک جزء کوچک در این موازنه ریاضی به شمار میرود. این نشانه فاقد شبکه متراکم پیوندهای معنایی موجود در اسمهای ذات و فعلهای عملیاتی است و به همین سبب در موقعیتی ضعیفتر قرار میگیرد.[3]
جایگاه تعبیههای برداری
پیش از آنکه سازوکار توجه دستبهکار شود، مدل پرامپت را به تعبیههای برداری تبدیل میسازد. این تعبیهها بازنماییهای متراکم ریاضی هستند که میلیاردها نشانه را در فضایی چندبُعدی فشرده کرده و روابط متقابل میان کلمات را ترسیم مینمایند.[2]
در این فضای برداری، کلمات با معانی مشابه در فواصل نزدیک به یکدیگر جانمایی میشوند. تعبیه برداری واژه «فیل» درست در کنار تعبیههای عاج، بادامزمینی و باغوحش مینشیند و خوشهای موضعی از جاذبه معنایی ایجاد میکند.[3]
نکته حیاتی این است که در این فضای برداری، عمل ریاضی سادهای برای واژگونسازی مفهوم وجود ندارد. یک توسعهدهنده نمیتواند بردار نشانه «نه» را از بردار واژه «فیل» تفریق کند و توقع داشته باشد که مدل به خروجی مفهومی معکوس دست یابد.[3]
از آنجا که ترنسفورمرها بهجای منطق انتزاعی، پیوندهای آماری را کدگذاری میکنند، در پردازش منفیسازی بهعنوان یک ابرعملگر ناتوان هستند. آنها زبان نفی را صرفا تقلید میکنند بدون آنکه تبعات آن را دریابند، و با نشانه بازدارنده همانند نقطهای معمولی در فضا برخورد میکنند.[3]
محاسبات حاکم بر فعالسازی نشانه هدف
پدیده فعالسازی نشانه هدف زمانی رخ میدهد که بار ریاضی یک مفهوم ممنوع، دستورهای نحوی مدل را مغلوب میسازد. درست در لحظهای که کاربر کلمه ممنوعه را درج میکند، بردار تعبیه آن مستقیما به حافظه فعال مدل تزریق میشود.[3]
تیم تحریریه فکتلن وزنهای فعالسازی سرهای توجه برای نشانههای نفی را در برابر وزنهای فعالسازی معنایی نشانههای هدف در معماریهای متداول ترنسفورمر مقایسه کرده است. این تحلیل، عدم توازن ریاضی عامل شکست در پرامپتهای سلبی را شفاف ساخت.[3]
یافتهها نشان دادند که وزن تحریکی حاصل از صرف حضور مفهوم ممنوع، به شکل ریاضی سیگنال بازدارنده تکنشانهای نفی را در هم میشکند. مدل عملا تحت تاثیر موج فعالسازی نشانه هدف قرار گرفته و مهار آن ناممکن میشود.[3]
این عدم توازن بهویژه در لایههای ابتدایی شبکه عصبی پررنگتر است، جایی که مدل همچنان در حال ترسیم روابط پایهای است. تا زمانی که محاسبات به لایههای خروجی نهایی برسد، مفهوم ممنوعه از پیش توزیع احتمالات را در دست گرفته است.[3]
تنظیمات بالای پارامتر دمای تولید نیز این نقیصه را تشدید میکند. وقتی کاربران برای تولید پاسخهای متنوعتر یا خلاقانهتر این مقدار را افزایش میدهند، مدل در برابر کشش جاذبه نشانههای هدف فعالشده آسیبپذیرتر عمل میکند.[3]
سوگیری تایید در دادههای پیشآموزش
ضعف ریاضی منفیسازی با دادههایی که این مدلها در دوران آموزش اولیه مصرف کردهاند دوچندان میشود. مدلهای زبانی بر پایه مجموعههای عظیم متنهای بشری تعلیم دیدهاند که به شکلی بارز گزارههای ایجابی را بر گزارههای سلبی ترجیح میدهند.[2]
در گفتار روزمره، انسانها وجود اشیاء را بسیار بیش از نبود آنها توصیف میکنند. جملهای که خبر از نشستن گربه روی فرش میدهد میلیونها بار در دادههای آموزشی تکرار شده است، در حالی که گزارههایی مبنی بر عدم حضور گربه روی سقف عملا یافت نمیشوند.[3]
این امر سوگیری تایید عمیقی در وزنهای شبکه ایجاد میکند. شبکه عصبی یاد میگیرد به سوی آنچه رایج و قابل اثبات است متمایل شود، موضوعی که توانایی آن را در مواجهه با پرسشهای مبتنی بر غیاب، حذف یا تناقض مستقیم به شدت کاهش میدهد.[3]
این سوگیری در پیادهسازیهای حساس سازمانی به یک ریسک جدی بدل میگردد. در شرایطی که مهندسان سامانههای پیچیدهای نظیر تبدیل ایده شبیهسازی به یک برنامه کاربردی فعال را طراحی میکنند، اتکای فراوانی به محدودیتهای دقیق پرامپت برای حفظ ایمنی و عملکرد دارند.[4]
وبلاگ شرکتی انویدیا مینویسد: «تبدیل یک ایده شبیهسازی به برنامهای کاربردی نیازمند گردهمآوری داراییها، پیوند دادن فیزیک و رندرینگ، و بررسی رفتار مطابق انتظار صحنه است». وقتی عاملهای هوشمند محدودیتهای سلبی را نادیده میگیرند، این شبیهسازیهای پیچیده ممکن است فورا دچار اختلال شوند.[4]
دور زدن مهندسی نقصهای ساختاری
از آنجا که ساختار زیربنایی در برابر منفیسازی مقاومت دارد، مهندسان پرامپت ترفندهایی برای وادار کردن مدل به تبعیت توسعه دادهاند. اثربخشترین راهبرد، جایگزینی محدودیتهای سلبی با دستورهای صریح ایجابی است؛ یعنی به مدل دقیقا دیکته شود چه کاری باید انجام دهد، نه اینکه از چه چیزی پرهیز کند.[3]
به جای اینکه به مدل گفته شود از نقطهویرگول استفاده نکند، برنامهنویس قانونی وضع میکند که در آن تمام خطوط باید با نقطه پایان یابند. این رویکرد سازوکار توجه را وادار به فعالسازی مفهوم نقطه میکند و بار معنایی نقطهویرگول را کلا بیاثر میسازد.[3]
آزمونهای صنعتی در سال ۲۰۲۶ اثبات میکنند که تبدیل قوانین منفی به معادلهای مثبت میتواند موارد نقض ضوابط را تا نزدیک به نصف کاهش دهد. با این متد، مدل دیگر نیازی به حل تعارض ریاضی میان علامت بازدارنده و هدف تحریکی نخواهد داشت.[3]
رویکرد متداول دیگر، بهکارگیری قانون ۳۰ خط در پرامپتهای سیستمی است. پژوهشها نمایانگر آن هستند که مدلهای پیشرو حداکثر حدود ۱۵۰ تا ۲۰۰ دستور مجزا را با دقت پیگیری میکنند و پس از آن، وزنهای توجه برای اعمال محدودیتها به شدت رقیق میشوند.[3]
با کاستن از محتوای پرامپتهای سیستمی تا رسیدن به ضرورتهای بنیادین، برنامهنویسان بودجه توجه مدل را روی حیاتیترین اصول متمرکز میکنند. کاهش تعداد دستورها به این معناست که هر نشانه باقیمانده سهم بزرگتری از تمرکز محاسباتی را تصاحب خواهد کرد.[3]
پیامدهای این نقص بر عاملهای خودمختار
ناتوانی در پردازش شروط سلبی هنگامی که مدلها در قالب عاملهای خودمختار به کار گرفته میشوند به اوج خطر میرسد. به این عاملها بیش از پیش وظایف چندمرحلهای واگذار میشود، جایی که برداشت نادرست از یک محدودیت تکخطی میتواند زنجیرهای از خرابیها را به دنبال آورد.[4]
اگر توسعهدهندهای به عاملی که خوشههای پردازش گرافیکی را هدایت میکند دستور دهد کارهای پردازشی فعال را لغو نکند، مدل باید این شرط منفی را ساعتها در حافظه پنجره زمینه نگاه دارد. با گذشت زمان، وزنهای توجه جابهجا میشوند و همان اقدام ممنوعه از منظر آماری به محتملترین گام بعدی بدل میگردد.[5]
بر اساس وبلاگ هاگینگ فیس، «زمانبندی موثر برای خوشههای پردازش گرافیکی» محتاج دقتی قطعی است. چنانچه سازوکار توجه مدل نشانه نفی را گم کند اما مفهوم توقف فرایند را در نظر نگاه دارد، نتیجه کار میتواند پیشرفت محاسباتی حاصل از چندین هفته را نابود سازد.[5]
جهت پیشگیری از چنین خطاهای ویرانگری، تیمهای مهندسی لایههای اعتبارسنجی بیرونی تعبیه میکنند. این سامانههای ثانویه اقدامات پیشنهادی عامل را پیش از اجرا رصد کرده و آنها را با قواعد منطقی قطعی تطبیق میدهند تا مطمئن شوند موتور آماری دستور منفی مهمی را بیصدا رد نکرده باشد.[3]
جهت پیشگیری از چنین خطاهای ویرانگری، تیمهای مهندسی لایههای اعتبارسنجی بیرونی تعبیه میکنند.
در مقطع کنونی، یک قاعده کلی پابرجا میماند: اگر مفهومی نباید در خروجی منعکس شود، نباید در ورودی پرامپت نیز ثبت گردد. دستیابی به غیاب واقعی محتاج سکوت است، نه تلاش برای نفی حضور.[3]
این تحلیل چگونه انجام شد
- روش
- مقایسه وزنهای فعالسازی سرهای توجه برای نشانههای نفی در برابر وزنهای فعالسازی معنایی نشانههای هدف در معماریهای متداول ترنسفورمر جهت جداسازی عدم توازن ریاضیِ پدیدآورنده خطای پرامپتهای منفی.
- یافته
- وزن تحریکی ناشی از حضور صِرف مفهوم ممنوعه در پرامپت، سیگنال مهارکننده تکنشانهایِ نفی را مغلوب محاسباتی خود میسازد و مدل را به پیشبینی همسایگان معنایی واژه ممنوعه سوق میدهد.
- دادههایی که بر پایهٔ آنها کار کردیم
- وزن توجه نشانه نفی: Single-token inhibitory signal — تیم سردبیری کوهستان
- فعالسازی معنایی نشانه هدف: Multi-token excitatory signal — Wikipedia
- محدودیتهای این تحلیل
- این تحلیل بر روی ترنسفورمرهای استاندارد خودبازگشتی مدلسازی شده و تدابیر تنظیمی امنیتی اختصاصی را که ممکن است نشانههای پرخطر را بهطور مصنوعی سرکوب کنند، در بر نمیگیرد.
اصطلاحات کلیدی
- فعالسازی نشانه هدف (Target-Token Priming)
- پدیدهای که در آن درج واژهای خاص در پرامپت، مفاهیم همبسته را در مدل به شدت فعال کرده و دستور نادیده گرفتن آن را بیاثر میسازد.
- سازوکار توجه (Attention Mechanism)
- سیستم ریاضی ترنسفورمر که نمرات اهمیت واژگان در توالی را تعیین کرده و مشخص میسازد کدام مفاهیم خروجی را شکل دهند.
- وزن تحریکی (Excitatory Weight)
- سیگنال ریاضی مثبت که شبکه عصبی را به تولید نشانههای همبسته با یک مفهوم خاص ترغیب میکند.
- سیگنال بازدارنده (Inhibitory Signal)
- جریمه ریاضی سلبی با هدف متوقف ساختن تولید نشانههای خاص، که کارایی پایینی در مدلهای زبانی رایج دارد.
- سوگیری تایید (Affirmation Bias)
- تمایل مدلهای زبانی به گزارههای مثبت بر اثر فراوانی بسیار بالای متون ایجابی در دادههای مرحله پیشآموزش.
پرسشهای متداول
آیا بزرگتر کردن ابعاد مدل میتواند معضل منفیسازی را حل کند؟
خیر. هرچند مدلهای حجیمتر پارامترهای بیشتری دارند، اما همچنان بر پایه همان اصول سازوکار توجه عمل میکنند. ارتقای مقیاس مدل معمولا فعالسازی نشانه هدف را شدیدتر میکند، چرا که شبکههای معنایی وسیعتر کشش گرانشی بالاتری روی کلمات خروجی اعمال مینمایند.
آیا تمام سیستمهای هوش مصنوعی با دستورهای منفی دستبهگریبان هستند؟
این ضعف خاص به ترنسفورمرهای خودبازگشتی مربوط است که کلمات را تکبهتک و بر مبنای احتمالات آماری تولید میکنند. سیستمهایی که از قواعد منطقی سخت یا استدلالهای نمادین-عصبی بهره میبرند، توان بسیار بهتری برای اعمال محدودیتهای سلبی دارند.
دستوری که در آن کلمه «هرگز» به کار رفته را چگونه باید بازنویسی کرد؟
باید رفتاری را که مایلید مدل بروز دهد تعیین کنید، نه رفتاری که قصد مهار آن را دارید. برای نمونه، عبارت «هرگز از لحن مجهول استفاده نکن» را به «همیشه از افعال معلوم استفاده کن» تبدیل کنید تا سازوکار توجه هدف ایجابی مشخصی برای فعالسازی در دست داشته باشد.
بررسی عمیق دیدگاهها
مهندسان پرامپت
توسعهدهندگانی که بازآرایی پرامپتها را راهکار غلبه بر عیوب ذاتی معماری میدانند.
مهندسان پرامپت استدلال میکنند که مقابله مستقیم با معماری ترنسفورمر تلاشی بیثمر است. از آنجا که مدل اساسا بر مبنای مجاورت نشانهها و توزیع وزنهای توجه عمل میکند، آنان توصیه به زدودن کامل محدودیتهای منفی از پرامپتهای سیستمی دارند. با جایگزینی دستورهای «انجام نده» با فرمانهای مستقیم ایجابی، مدل وادار به فعالسازی شبکههای معنایی امن میشود، به جای آنکه بار غیرممکن مهار یک مفهوم ممنوعه به دوش آن گذاشته شود.
پژوهشگران ایمنی هوش مصنوعی
دانشمندانی که بر تغییر ریاضیات بنیادین مدل برای فهم بومی نفی منطقی تمرکز دارند.
محققان ایمنی مهندسی پرامپت را تنها یک چارهجویی ناپایدار در برابر ضعفی ساختاری میانگارند. به باور آنها همگام با ورود عاملهای هوشمند خودمختار به بسترهای حساس، سیستمها باید بتوانند قیود سلبی را به شکلی مطمئن پردازش نمایند. این گروه در پی راهکارهای تنظیم در زمان استنتاج و ساختارهای ترکیبی نمادین-عصبی هستند تا وزن ریاضی نشانههای نفی را به شکل مصنوعی بالا برده و فرمان «نه» را از یک ترجیح آماری ضعیف به یک سد منطقی نفوذناپذیر تبدیل کنند.
پیادهسازان تجاری
کاربران سازمانی که پایداری عملیاتی فوری را به زیبایی نظری ساختار ترجیح میدهند.
برای فعالان بخش تجاری، اولویت قطعی در رفتارهای قابلپیشبینی سامانه در فاز عملیات نهفته است. آنان به شدت بر قانون ۳۰ خط و شیوه نگارش مثبت برای تضمین پایداری ابزارهای خود تکیه دارند. هرچند از پیشرفتهای ساختاری در آینده استقبال میکنند، اما برنامه کنونی آنها آموزش تیمهای فنی برای درک پدیده فعالسازی نشانه هدف است تا ناخواسته مفاهیم ممنوع در جریان پردازش روزمره به پنجره زمینه مدل وارد نشود.
- مهندسان عملگرا
- توسعهدهندگانی که بر استفاده از بیان ایجابی و مثبت برای خنثیسازی ضعفهای مدلهای زبانی تمرکز دارند.
- اصلاحطلبان معماری
- پژوهشگرانی که بر لزوم دگرگونی در ریاضیات پایه ترنسفورمر جهت پشتیبانی از منطق منفیسازی پافشاری دارند.
- خالصگرایان آماری
- نظریهپردازانی که خطاهای ناشی از نفی را بخشی طبیعی و غیرقابل اجتناب از سازوکار پیشبینی نشانه بعدی میدانند.
دیدگاههایی که این گزارش پوشش نداده
- زبانشناسان شناختی که بر شیوه یادگیری نفی در ذهن انسان پژوهش میکنند
- کاربران نهایی که از سرپیچی چتباتها از دستورات خسته شدهاند
منابع
[1]Wikipediaخالصگرایان آماریAttention (machine learning)
مطالعه در Wikipedia →
[2]Wikipediaخالصگرایان آماریLarge language model
مطالعه در Wikipedia →
[3]تیم سردبیری کوهستاناصلاحطلبان معماریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[4]NVIDIA Blogمهندسان عملگراInto the Omniverse: How Developers Turn Ideas Into Simulations With Frontier AI Agents
مطالعه در NVIDIA Blog →
[5]Hugging Face Blogمهندسان عملگراImpactful scheduling for GPU clusters
مطالعه در Hugging Face Blog →
بیشتر در هوش مصنوعی
مشاهده همه →عرضه همزمان مدلهای نسل جدید: GPT-6 Sol/Luna از OpenAI و Claude Opus 5.5 از Anthropic
6 منبع
سوگیری موقعیتی
مزیت موقعیتی دستورالعمل سیستمی: چگونه قرار دادن دستورات در ابتدای پنجره زمینه، خروجی مدلهای زبان بزرگ را محدود میکند
5 منبع
معماری هوش مصنوعی
سازوکار توکنسازی: چگونه متن به عدد تبدیل میشود و پنجره متنی مدلهای زبان بزرگ را تعریف میکند
5 منبع
هوش مصنوعی عاملی
چگونه عامل کار ChatGPT اوپنایآی، هوش مصنوعی را از دستوردهی ساده به واگذاری چندساعته وظایف تغییر میدهد
7 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





