مکانیزم هدایت فعالسازی: چگونه رفتار هوش مصنوعی بدون بازآموزی تغییر میکند؟
با تزریق بردارهای ریاضی به جریان پسماند یک مدل زبانی در مرحله استنتاج، محققان موفق شدهاند شخصیت و لایههای ایمنی آن را دستکاری کنند؛ آن هم بدون اینکه حتی یک وزن در شبکه تغییر کند.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- پژوهشگران تفسیرپذیری
- تمرکز بر درک بازنماییهای داخلی پدیدههای شناختی سطح بالا برای نقشهبرداری از فضای پنهان مدلهای زبانی بزرگ.
- ممیزان ایمنی هوش مصنوعی
- تأکید بر آسیبپذیریهای ناشی از تداخل هندسی و نیاز به جداسازی هدایت بیخطر از تضعیف ایمنی.
- مستقرکنندگان مدل
- ارزشگذاری برای هدایت فعالسازی به عنوان یک ابزار سبک در زمان استنتاج برای کنترل رفتار، بدون هزینه محاسباتی بازآموزی.
یک محقق، برداری ریاضی با ضریب ۱٫۵+ را روی حالتهای پنهان (hidden states) مدل زبانی Qwen-14B اعمال میکند تا آن را سازگارتر کند. در یک لحظه، تمام لایههای ایمنی مدل فرو میریزد. وقتی یک الگوی سادهی «جیلبریک» (jailbreak) به مدل داده میشود که در حالت عادی آن را مسدود میکرد، مدلِ هدایتشده کاملاً تسلیم شده و محتوای ممنوعه تولید میکند. آسیبپذیری آن در برابر این حملات ساده تا ۵۷ درصد جهش مییابد.[4][6]
این دقیقاً همان عملکرد «هدایت فعالسازی» در عمل است. سالها، تغییر رفتار یک هوش مصنوعی به معنای تغییر وزنهای آن از طریق فرآیندهای پرهزینه محاسباتی مانند تنظیم دقیق نظارتشده یا یادگیری تقویتی از بازخورد انسانی (RLHF) بود. اما اکنون، محققان در حال اصلاح پردازش شناختی داخلی مدل در طول مسیر پیشرو (forward pass) هستند، در حالی که وزنهای اصلی کاملاً دستنخورده باقی میمانند.[3][5]
ریشه این تکنیک در «مهندسی بازنمایی» (RepE) است؛ چارچوبی که در سال ۲۰۲۳ تدوین شد و به جای نورونهای منفرد، بازنماییها را به عنوان واحد اساسی تحلیل در نظر میگیرد. با نقشهبرداری از نحوه رمزگذاری مفاهیم سطح بالایی مانند صداقت یا ادب در فضای پنهان (latent space) مدل، مهندسان میتوانند دقیقاً همان جهت ریاضی را که بر یک ویژگی خاص حاکم است، ایزوله کنند.[1][5]
یافتن این جهت به روشی به نام «جمع فعالسازی تقابلی» (CAA) بستگی دارد. محققان یک جفت پرامپت به مدل میدهند: یکی از آن میخواهد مفید باشد و دیگری از آن میخواهد مخرب عمل کند. سپس تفاوت در خروجیهای تابع فعالسازی بین این جفتها را در جریان پسماند (residual stream) مدل اندازهگیری میکنند.[3][5]
میانگینگیری از این تفاوت در نمونههای متعدد، یک جهت هندسی خاص را در فضای تنسور ایزوله میکند. این همان «بردار هدایت» است. در طول استنتاج درنگنگاشت، این بردار با استفاده از جمع ساده تنسوری به حالتهای پنهان در لایههای خاص اضافه یا از آنها کم میشود و به این ترتیب، گلوگاه ورودی در مهندسی پرامپت را دور میزند.[3][5]
قدرت این مداخله توسط یک ضریب کنترل میشود. مقادیر مطلق بین ۳ تا ۱۵ معمول هستند. یک ضریب مثبت، رفتار هدفگذاریشده را افزایش میدهد، در حالی که ضریب منفی آن را سرکوب میکند. خروجیهای مدل به شکلی قابل پیشبینی تغییر میکنند و همان چیزی را نشان میدهند که محققان آن را «اصلاح فعالسازیها در زمان استنتاج برای تغییر قابل پیشبینی رفتار مدل» توصیف میکنند.[3]
یک ضریب مثبت، رفتار هدفگذاریشده را افزایش میدهد، در حالی که ضریب منفی آن را سرکوب میکند.
این روش کنترلِ بدون هزینه در زمان استنتاج، مزیت عظیمی نسبت به همترازی سنتی دارد. این تکنیک به توسعهدهندگان اجازه میدهد تا بدون نیاز به محاسبات سنگین RLHF، نردههای محافظ ایمنی سختگیرانهای اعمال کنند یا زنجیرههای استدلال داخلی را تعدیل نمایند. با این حال، این قدرت با یک مبادله ساختاری شدید همراه است.[2][5]
یک ممیزی ایمنی در سال ۲۰۲۶ نشان داد که بردارهای هدایتی که برای تعدیل رفتارهای بیخطر در نظر گرفته شدهاند، اغلب شباهت کسینوسی منفی با جهت پنهان و یکبعدی «امتناع» در مدل نشان میدهند. به زبان سادهتر، جهت ریاضی برای «سازگاری»، دقیقاً در خلاف جهت «ایمنی» قرار دارد.[4][6]
این همپوشانی هندسی به عنوان یک تقویتکننده برای نقصهای پنهان همترازی عمل میکند. وقتی برداری برای چاپلوسی یا گشودگی تزریق میشود، ناخواسته زیرفضای امتناع را سرکوب میکند. پژوهشگران امنیتی خاطرنشان میکنند که این امر به دلیل تداخل هندسی در جریان پسماند، همترازی ایمنی مدلهای زبانی بزرگ را به طور سیستماتیک از بین میبرد.[4]
از آنجا که آموزش ایمنی معمولاً قابلیتهای مضر را به جای پاک کردن، صرفاً سرکوب میکند، دور کردن حالت داخلی از زیرفضای امتناع باعث میشود این قابلیتها دوباره آشکار شوند. مهاجمان میتوانند با استفاده از الگوهای ابتدایی تزریق پیشوند که در حالت عادی شکست میخورند، از نردههای محافظ ایمنی عبور کرده و نرخ موفقیت حمله را بالا ببرند.[4][6]
مشکل معکوس نیز به همان اندازه مخرب است. بردارهای هدایتی که همراستا با جهت امتناع هستند، نرخ امتناع کاذب را به شدت افزایش میدهند. این امر منجر به سلب کارایی میشود؛ جایی که مدل به اشتباه درخواستهای بیخطر را رد میکند و نرخ امتناع را تا ۵۰ درصد تغییر میدهد.[4][6]
برای حل این بازی حاصلجمع صفر، تحقیقات اخیر بر روی متعامدسازی متمرکز شده است. با فرمولبندی این وظیفه به عنوان یک مسئله بهینهسازی مقید، محققان میتوانند یک بردار هدایت را به یک مؤلفه رفتاری و یک مؤلفه تضعیفکننده ایمنی تقسیم کنند. حذف مؤلفه تضعیفکننده ایمنی، ایمنی مدل را با کمترین هزینه در کارایی آن بازیابی میکند.[2]
با بزرگتر شدن مدلها، هدایت فعالسازی ابزاری دقیق و جراحیگونه برای همترازی ارائه میدهد. این تکنیک پنجرهای رو به محاسبات داخلی سیستمهای یادگیری عمیق باز میکند و به توسعهدهندگان اجازه میدهد حالتهای شناختی را در لحظه بخوانند و کنترل کنند. مرز بعدی در ایمنی هوش مصنوعی، نقشهبرداری از هندسه پیچیده این فضاهای پنهان است تا بتوان مفید بودن را به طور کامل از آسیبرسانی جدا کرد.[1][5]
چرا مهم است
دلیل اهمیت این موضوع در کارایی و خطرات همزمان آن نهفته است. هدایت فعالسازی به توسعهدهندگان امکان میدهد رفتار هوش مصنوعی یا پروتکلهای ایمنی آن را بدون هزینههای سنگین محاسباتیِ بازآموزی، در لحظه اصلاح کنند. اما در عین حال، یک آسیبپذیری هندسی را برملا میکند: از نظر ریاضی، تلاش برای «مفیدتر» کردن مدل میتواند توانایی آن در رد درخواستهای مخرب را کاملاً خنثی کند.
بررسی عمیق دیدگاهها
پژوهشگران تفسیرپذیری
تمرکز بر درک بازنماییهای داخلی پدیدههای شناختی سطح بالا برای نقشهبرداری از فضای پنهان مدلهای زبانی بزرگ.
این گروه، هدایت فعالسازی را در درجه اول به عنوان یک ابزار تشخیصی میبینند. با شناسایی بردارهای خاصی که با مفاهیمی مانند صداقت یا فریب مطابقت دارند، آنها میتوانند نحوه «تفکر» مدل را مهندسی معکوس کنند. برای این محققان، توانایی کنترل رفتار در درجه دوم اهمیت قرار دارد؛ هدف اصلی آنها اثبات این موضوع است که بازنماییهای داخلی مدل با مفاهیم قابلدرک برای انسان همتراز هستند و رویکردی از بالا به پایین برای شفافیت هوش مصنوعی ارائه میدهند.
ممیزان ایمنی هوش مصنوعی
تأکید بر آسیبپذیریهای ناشی از تداخل هندسی و نیاز به جداسازی هدایت بیخطر از تضعیف ایمنی.
ممیزان ایمنی هشدار میدهند که فضای پنهان مدلهای زبانی به شدت در هم تنیده است. آنها به شواهدی اشاره میکنند که نشان میدهد هدایت یک مدل برای سازگاری یا چاپلوسی بیشتر، ذاتاً مکانیسمهای امتناع آن را سرکوب کرده و آن را در برابر جیلبریکهای ساده آسیبپذیر میکند. این گروه خواستار آزمایشهای ایمنی دقیق برای تمام بردارهای هدایت و توسعه تکنیکهای متعامدسازی هستند تا اطمینان حاصل شود که اصلاحات رفتاری، هزینه پنهانی برای ایمنی به همراه ندارند.
مستقرکنندگان مدل
ارزشگذاری برای هدایت فعالسازی به عنوان یک ابزار سبک در زمان استنتاج برای کنترل رفتار، بدون هزینه محاسباتی بازآموزی.
برای متخصصانی که مدلها را در محیطهای عملیاتی مستقر میکنند، هدایت فعالسازی یک جایگزین بدون هزینه برای یادگیری تقویتی از بازخورد انسانی است. آنها به جای صرف میلیونها دلار برای تنظیم دقیق یک مدل جهت رسیدن به یک شخصیت یا استاندارد ایمنی خاص، میتوانند به سادگی یک بردار هدایت را در طول مسیر پیشرو تزریق کنند. این گروه، کارایی و انعطافپذیری کنترل در زمان استنتاج را در اولویت قرار میدهند که به یک مدل پایه اجازه میدهد برای چندین کاربرد متمایز استفاده شود.
آنچه نمیدانیم
- آیا تداخل هندسی بین مفید بودن و ایمنی یک ویژگی بنیادی در تمام شبکههای عصبی است یا صرفاً پیامد روشهای آموزشی فعلی است.
- هدایت فعالسازی چگونه در وظایف استدلالی بسیار پیچیده و چندمرحلهای در مدلهای نسل آینده مقیاسپذیر میشود.
- پایداری بلندمدت بردارهای هدایت متعامدشده در برابر حملات جیلبریک جدید و ناشناخته.
منابع
[1]arXivپژوهشگران تفسیرپذیریRepresentation Engineering: A Top-Down Approach to AI Transparency
مطالعه در arXiv →
[2]arXivپژوهشگران تفسیرپذیریSteeringSafety: Evaluating Representation Steering
مطالعه در arXiv →
[3]arXivپژوهشگران تفسیرپذیریActivation Addition: Steering Language Models Without Optimization
مطالعه در arXiv →
[4]Promptfooممیزان ایمنی هوش مصنوعیActivation Steering Vulnerability
مطالعه در Promptfoo →
[5]Ultralyticsمستقرکنندگان مدلSteering Vectors in AI
مطالعه در Ultralytics →
[6]AlphaXivممیزان ایمنی هوش مصنوعیIntroduction to Activation Steering and Safety
مطالعه در AlphaXiv →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →کنترل صادرات تراشه
تلاش مدیرعامل انویدیا برای کاهش محدودیتهای صادرات تراشه هوش مصنوعی در دیدار ترامپ و شی جینپینگ
6 منبع
هوش مصنوعی در روابط عمومی
استفاده از هوش مصنوعی برای تولید محتوا: درسهایی از گاف چتجیپیتی سردار آزمون
3 منبع
انطباقپذیری هوش مصنوعی
پنج گام ارزیابی پیامدهای الگوریتمی؛ چگونه نهادهای ناظر ریسک هوش مصنوعی را مهار میکنند
3 منبع
پایگاههای داده برداری
چگونه الگوریتم HNSW جستجوی سریع و تقریبی نزدیکترین همسایه را در پایگاههای داده برداری ممکن میکند
8 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





