رفتن به محتوای اصلی
Koohestun
توضیح کوهستانهدایت فعال‌سازیمقاله تشریحی· 4 دقیقه مطالعه· در هوش مصنوعی

مکانیزم هدایت فعال‌سازی: چگونه رفتار هوش مصنوعی بدون بازآموزی تغییر می‌کند؟

با تزریق بردارهای ریاضی به جریان پسماند یک مدل زبانی در مرحله استنتاج، محققان موفق شده‌اند شخصیت و لایه‌های ایمنی آن را دستکاری کنند؛ آن هم بدون اینکه حتی یک وزن در شبکه تغییر کند.

به قلم اِلا فرجاد

پژوهشگران تفسیرپذیری 35%ممیزان ایمنی هوش مصنوعی 35%مستقرکنندگان مدل 30%
پژوهشگران تفسیرپذیری
تمرکز بر درک بازنمایی‌های داخلی پدیده‌های شناختی سطح بالا برای نقشه‌برداری از فضای پنهان مدل‌های زبانی بزرگ.
ممیزان ایمنی هوش مصنوعی
تأکید بر آسیب‌پذیری‌های ناشی از تداخل هندسی و نیاز به جداسازی هدایت بی‌خطر از تضعیف ایمنی.
مستقرکنندگان مدل
ارزش‌گذاری برای هدایت فعال‌سازی به عنوان یک ابزار سبک در زمان استنتاج برای کنترل رفتار، بدون هزینه محاسباتی بازآموزی.

یک محقق، برداری ریاضی با ضریب ۱٫۵+ را روی حالت‌های پنهان (hidden states) مدل زبانی Qwen-14B اعمال می‌کند تا آن را سازگارتر کند. در یک لحظه، تمام لایه‌های ایمنی مدل فرو می‌ریزد. وقتی یک الگوی ساده‌ی «جیل‌بریک» (jailbreak) به مدل داده می‌شود که در حالت عادی آن را مسدود می‌کرد، مدلِ هدایت‌شده کاملاً تسلیم شده و محتوای ممنوعه تولید می‌کند. آسیب‌پذیری آن در برابر این حملات ساده تا ۵۷ درصد جهش می‌یابد.[4][6]

این دقیقاً همان عملکرد «هدایت فعال‌سازی» در عمل است. سال‌ها، تغییر رفتار یک هوش مصنوعی به معنای تغییر وزن‌های آن از طریق فرآیندهای پرهزینه محاسباتی مانند تنظیم دقیق نظارت‌شده یا یادگیری تقویتی از بازخورد انسانی (RLHF) بود. اما اکنون، محققان در حال اصلاح پردازش شناختی داخلی مدل در طول مسیر پیش‌رو (forward pass) هستند، در حالی که وزن‌های اصلی کاملاً دست‌نخورده باقی می‌مانند.[3][5]

ریشه این تکنیک در «مهندسی بازنمایی» (RepE) است؛ چارچوبی که در سال ۲۰۲۳ تدوین شد و به جای نورون‌های منفرد، بازنمایی‌ها را به عنوان واحد اساسی تحلیل در نظر می‌گیرد. با نقشه‌برداری از نحوه رمزگذاری مفاهیم سطح بالایی مانند صداقت یا ادب در فضای پنهان (latent space) مدل، مهندسان می‌توانند دقیقاً همان جهت ریاضی را که بر یک ویژگی خاص حاکم است، ایزوله کنند.[1][5]

یافتن این جهت به روشی به نام «جمع فعال‌سازی تقابلی» (CAA) بستگی دارد. محققان یک جفت پرامپت به مدل می‌دهند: یکی از آن می‌خواهد مفید باشد و دیگری از آن می‌خواهد مخرب عمل کند. سپس تفاوت در خروجی‌های تابع فعال‌سازی بین این جفت‌ها را در جریان پسماند (residual stream) مدل اندازه‌گیری می‌کنند.[3][5]

بردارهای هدایت با اندازه‌گیری تفاوت در فعال‌سازی‌های یک مدل هنگام پردازش پرامپت‌های متضاد محاسبه می‌شوند.

میانگین‌گیری از این تفاوت در نمونه‌های متعدد، یک جهت هندسی خاص را در فضای تنسور ایزوله می‌کند. این همان «بردار هدایت» است. در طول استنتاج درنگ‌نگاشت، این بردار با استفاده از جمع ساده تنسوری به حالت‌های پنهان در لایه‌های خاص اضافه یا از آن‌ها کم می‌شود و به این ترتیب، گلوگاه ورودی در مهندسی پرامپت را دور می‌زند.[3][5]

قدرت این مداخله توسط یک ضریب کنترل می‌شود. مقادیر مطلق بین ۳ تا ۱۵ معمول هستند. یک ضریب مثبت، رفتار هدف‌گذاری‌شده را افزایش می‌دهد، در حالی که ضریب منفی آن را سرکوب می‌کند. خروجی‌های مدل به شکلی قابل پیش‌بینی تغییر می‌کنند و همان چیزی را نشان می‌دهند که محققان آن را «اصلاح فعال‌سازی‌ها در زمان استنتاج برای تغییر قابل پیش‌بینی رفتار مدل» توصیف می‌کنند.[3]

یک ضریب مثبت، رفتار هدف‌گذاری‌شده را افزایش می‌دهد، در حالی که ضریب منفی آن را سرکوب می‌کند.

این روش کنترلِ بدون هزینه در زمان استنتاج، مزیت عظیمی نسبت به هم‌ترازی سنتی دارد. این تکنیک به توسعه‌دهندگان اجازه می‌دهد تا بدون نیاز به محاسبات سنگین RLHF، نرده‌های محافظ ایمنی سخت‌گیرانه‌ای اعمال کنند یا زنجیره‌های استدلال داخلی را تعدیل نمایند. با این حال، این قدرت با یک مبادله ساختاری شدید همراه است.[2][5]

یک ممیزی ایمنی در سال ۲۰۲۶ نشان داد که بردارهای هدایتی که برای تعدیل رفتارهای بی‌خطر در نظر گرفته شده‌اند، اغلب شباهت کسینوسی منفی با جهت پنهان و یک‌بعدی «امتناع» در مدل نشان می‌دهند. به زبان ساده‌تر، جهت ریاضی برای «سازگاری»، دقیقاً در خلاف جهت «ایمنی» قرار دارد.[4][6]

این هم‌پوشانی هندسی به عنوان یک تقویت‌کننده برای نقص‌های پنهان هم‌ترازی عمل می‌کند. وقتی برداری برای چاپلوسی یا گشودگی تزریق می‌شود، ناخواسته زیرفضای امتناع را سرکوب می‌کند. پژوهشگران امنیتی خاطرنشان می‌کنند که این امر به دلیل تداخل هندسی در جریان پسماند، هم‌ترازی ایمنی مدل‌های زبانی بزرگ را به طور سیستماتیک از بین می‌برد.[4]

از آنجا که آموزش ایمنی معمولاً قابلیت‌های مضر را به جای پاک کردن، صرفاً سرکوب می‌کند، دور کردن حالت داخلی از زیرفضای امتناع باعث می‌شود این قابلیت‌ها دوباره آشکار شوند. مهاجمان می‌توانند با استفاده از الگوهای ابتدایی تزریق پیشوند که در حالت عادی شکست می‌خورند، از نرده‌های محافظ ایمنی عبور کرده و نرخ موفقیت حمله را بالا ببرند.[4][6]

مشکل معکوس نیز به همان اندازه مخرب است. بردارهای هدایتی که هم‌راستا با جهت امتناع هستند، نرخ امتناع کاذب را به شدت افزایش می‌دهند. این امر منجر به سلب کارایی می‌شود؛ جایی که مدل به اشتباه درخواست‌های بی‌خطر را رد می‌کند و نرخ امتناع را تا ۵۰ درصد تغییر می‌دهد.[4][6]

برای حل این بازی حاصل‌جمع صفر، تحقیقات اخیر بر روی متعامدسازی متمرکز شده است. با فرمول‌بندی این وظیفه به عنوان یک مسئله بهینه‌سازی مقید، محققان می‌توانند یک بردار هدایت را به یک مؤلفه رفتاری و یک مؤلفه تضعیف‌کننده ایمنی تقسیم کنند. حذف مؤلفه تضعیف‌کننده ایمنی، ایمنی مدل را با کمترین هزینه در کارایی آن بازیابی می‌کند.[2]

محققان می‌توانند مؤلفه تضعیف‌کننده ایمنی در یک بردار هدایت را ایزوله و حذف کنند تا هم‌ترازی مدل حفظ شود.

با بزرگ‌تر شدن مدل‌ها، هدایت فعال‌سازی ابزاری دقیق و جراحی‌گونه برای هم‌ترازی ارائه می‌دهد. این تکنیک پنجره‌ای رو به محاسبات داخلی سیستم‌های یادگیری عمیق باز می‌کند و به توسعه‌دهندگان اجازه می‌دهد حالت‌های شناختی را در لحظه بخوانند و کنترل کنند. مرز بعدی در ایمنی هوش مصنوعی، نقشه‌برداری از هندسه پیچیده این فضاهای پنهان است تا بتوان مفید بودن را به طور کامل از آسیب‌رسانی جدا کرد.[1][5]

مهندسی بازنمایی، بازنمایی‌های داخلی مدل را به عنوان واحد اساسی تحلیل در نظر می‌گیرد.

چرا مهم است

دلیل اهمیت این موضوع در کارایی و خطرات همزمان آن نهفته است. هدایت فعال‌سازی به توسعه‌دهندگان امکان می‌دهد رفتار هوش مصنوعی یا پروتکل‌های ایمنی آن را بدون هزینه‌های سنگین محاسباتیِ بازآموزی، در لحظه اصلاح کنند. اما در عین حال، یک آسیب‌پذیری هندسی را برملا می‌کند: از نظر ریاضی، تلاش برای «مفیدتر» کردن مدل می‌تواند توانایی آن در رد درخواست‌های مخرب را کاملاً خنثی کند.

بررسی عمیق دیدگاه‌ها

پژوهشگران تفسیرپذیری

تمرکز بر درک بازنمایی‌های داخلی پدیده‌های شناختی سطح بالا برای نقشه‌برداری از فضای پنهان مدل‌های زبانی بزرگ.

این گروه، هدایت فعال‌سازی را در درجه اول به عنوان یک ابزار تشخیصی می‌بینند. با شناسایی بردارهای خاصی که با مفاهیمی مانند صداقت یا فریب مطابقت دارند، آن‌ها می‌توانند نحوه «تفکر» مدل را مهندسی معکوس کنند. برای این محققان، توانایی کنترل رفتار در درجه دوم اهمیت قرار دارد؛ هدف اصلی آن‌ها اثبات این موضوع است که بازنمایی‌های داخلی مدل با مفاهیم قابل‌درک برای انسان هم‌تراز هستند و رویکردی از بالا به پایین برای شفافیت هوش مصنوعی ارائه می‌دهند.

ممیزان ایمنی هوش مصنوعی

تأکید بر آسیب‌پذیری‌های ناشی از تداخل هندسی و نیاز به جداسازی هدایت بی‌خطر از تضعیف ایمنی.

ممیزان ایمنی هشدار می‌دهند که فضای پنهان مدل‌های زبانی به شدت در هم تنیده است. آن‌ها به شواهدی اشاره می‌کنند که نشان می‌دهد هدایت یک مدل برای سازگاری یا چاپلوسی بیشتر، ذاتاً مکانیسم‌های امتناع آن را سرکوب کرده و آن را در برابر جیل‌بریک‌های ساده آسیب‌پذیر می‌کند. این گروه خواستار آزمایش‌های ایمنی دقیق برای تمام بردارهای هدایت و توسعه تکنیک‌های متعامدسازی هستند تا اطمینان حاصل شود که اصلاحات رفتاری، هزینه پنهانی برای ایمنی به همراه ندارند.

مستقرکنندگان مدل

ارزش‌گذاری برای هدایت فعال‌سازی به عنوان یک ابزار سبک در زمان استنتاج برای کنترل رفتار، بدون هزینه محاسباتی بازآموزی.

برای متخصصانی که مدل‌ها را در محیط‌های عملیاتی مستقر می‌کنند، هدایت فعال‌سازی یک جایگزین بدون هزینه برای یادگیری تقویتی از بازخورد انسانی است. آن‌ها به جای صرف میلیون‌ها دلار برای تنظیم دقیق یک مدل جهت رسیدن به یک شخصیت یا استاندارد ایمنی خاص، می‌توانند به سادگی یک بردار هدایت را در طول مسیر پیش‌رو تزریق کنند. این گروه، کارایی و انعطاف‌پذیری کنترل در زمان استنتاج را در اولویت قرار می‌دهند که به یک مدل پایه اجازه می‌دهد برای چندین کاربرد متمایز استفاده شود.

آنچه نمی‌دانیم

  • آیا تداخل هندسی بین مفید بودن و ایمنی یک ویژگی بنیادی در تمام شبکه‌های عصبی است یا صرفاً پیامد روش‌های آموزشی فعلی است.
  • هدایت فعال‌سازی چگونه در وظایف استدلالی بسیار پیچیده و چندمرحله‌ای در مدل‌های نسل آینده مقیاس‌پذیر می‌شود.
  • پایداری بلندمدت بردارهای هدایت متعامدشده در برابر حملات جیل‌بریک جدید و ناشناخته.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران تفسیرپذیری 35%ممیزان ایمنی هوش مصنوعی 35%مستقرکنندگان مدل 30%
  1. [1]arXivپژوهشگران تفسیرپذیری

    Representation Engineering: A Top-Down Approach to AI Transparency

    مطالعه در arXiv
  2. [2]arXivپژوهشگران تفسیرپذیری

    SteeringSafety: Evaluating Representation Steering

    مطالعه در arXiv
  3. [3]arXivپژوهشگران تفسیرپذیری

    Activation Addition: Steering Language Models Without Optimization

    مطالعه در arXiv
  4. [4]Promptfooممیزان ایمنی هوش مصنوعی

    Activation Steering Vulnerability

    مطالعه در Promptfoo
  5. [5]Ultralyticsمستقرکنندگان مدل

    Steering Vectors in AI

    مطالعه در Ultralytics
  6. [6]AlphaXivممیزان ایمنی هوش مصنوعی

    Introduction to Activation Steering and Safety

    مطالعه در AlphaXiv
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.