ترجمه جعبه سیاه: «لنز لاجیت» چگونه محاسبات هوش مصنوعی را به متن قابلفهم برای انسان تبدیل میکند
پژوهشگران حوزه تفسیرپذیری مکانیسمی با استفاده از «لنز لاجیت» و روشهای پس از آن، در حال رمزگشایی از لایههای میانی مدلهای زبانی بزرگ هستند. این تکنیکها با تصویر کردن محاسبات نیمهکاره در فضای واژگان، دقیقاً نشان میدهند که هوش مصنوعی چه زمانی و در کجا تصمیم میگیرد چه بگوید.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- پژوهشگران تفسیرپذیری مکانیسمی
- لنز لاجیت را به عنوان یک ابزار بنیادین دیکامپایل برای مهندسی معکوس الگوریتمهای جهانی که مدلها در طول آموزش یاد میگیرند، در نظر میگیرند.
- حامیان ایمنی هوش مصنوعی
- بر استفاده از رمزگشایی میانی برای تشخیص فریب، توهمات و تزریقهای پرامپت پیش از نهایی شدن خروجی مدل تمرکز دارند.
- توسعهدهندگان مدل
- روشهای انتساب را مسیری برای ویرایش جراحیگونه مدل میدانند که به آنها اجازه میدهد حقایق نادرست را بدون آموزش مجدد و پرهزینه اصلاح کنند.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان سختافزار که پهنای باند حافظه را برای این کاوشگرها بهینهسازی میکنند
- حقوقدانانی که مسئولیت قانونی توهمات لایههای میانی را ارزیابی میکنند
نکات کلیدی
- لنز لاجیت وضعیتهای ریاضیاتی میانی یک مدل زبانی را به پیشبینیهای واژگانی خوانا ترجمه میکند.
- این تکنیک دقیقاً نشان میدهد که مدل از کدام لایه برای بازیابی یک حقیقت خاص یا شکلدهی به یک سوگیری استفاده میکند.
- لایههای اولیه اغلب از «رانش پایه» رنج میبرند که «لنز تنظیمشده» جدیدتر با آموزش مترجمهای ریاضیاتی مختص هر لایه، آن را اصلاح میکند.
- نظارت بر این مسیرهای پیشبینی درونی به سیستمهای امنیتی اجازه میدهد تا تزریقهای پرامپت را پیش از نهایی شدن خروجی متوقف کنند.
- مهندسان امیدوارند از این روشهای انتساب برای ویرایش جراحیگونه وزنهای مدل استفاده کرده و نیاز به آموزش مجدد و پرهزینه را دور بزنند.
دیباگ کردن نرمافزارهای سنتی بر بررسی خط به خط کدها برای مشاهده تغییر وضعیت متغیرها استوار است. اما مدلهای زبانی بزرگ اطلاعات را به جای گیتهای منطقی مجزا، از طریق فضاهای برداری پیوسته پردازش میکنند که این امر بازرسی خط به خط را غیرممکن میسازد. «لنز لاجیت» (logit lens) با وادار کردن افکار درونی و نیمهکاره مدل به تنها واژگانی که انسانها میفهمند (یعنی دیکشنری خروجی خود مدل)، این شکاف را پر میکند. با تصویر کردن وضعیتهای ریاضیاتی میانی به متن، پژوهشگران میتوانند ساخت پاسخ توسط شبکه عصبی را در لحظه تماشا کنند و دقیقاً تشخیص دهند که مدل چه زمانی یک حقیقت را بازیابی میکند، دچار سوگیری میشود یا تصمیم به توهمزنی میگیرد.[1][8]
این تکنیک که در سال ۲۰۲۰ توسط پژوهشگر مستقلی با نام مستعار nostalgebraist معرفی شد، به پرسشی به ظاهر ساده پاسخ میدهد. اگر یک مدل زبانی در میانه لایههایش متوقف شود و مجبور شود توکن بعدی را فوراً حدس بزند، چه خواهد گفت؟ پاسخ این پرسش، مسیر استدلال مدل را در لحظه نشان میدهد. لنز لاجیت به جای اینکه با شبکه عصبی مانند یک جعبه سیاه یکپارچه رفتار کند که پرامپتی را میبلعد و یک پاراگراف بیرون میدهد، با آن مانند یک خط مونتاژ برخورد کرده و محصول را در هر ایستگاه از این نوار نقاله بازرسی میکند.[1][5]
برای درک نحوه کار لنز لاجیت، ابتدا باید مفهوم «جریان پسماند» (residual stream) در هسته معماری ترانسفورمر را درک کرد. وقتی یک توکن از مدلی مانند GPT-3 عبور میکند (که دارای ۹۶ لایه مجزا و ۱۷۵ میلیارد پارامتر است)، هیچ لایهای بازنمایی قبلی را بازنویسی نمیکند. در عوض، هر لایه سهم محاسباتی خود را به یک مجموع در حال اجرا اضافه میکند. این جریان پسماند به عنوان پهنای باند حافظه مرکزی مدل عمل کرده و با نفوذ دادهها به عمق شبکه، زمینه و ظرایف را انباشته میکند.[4][6]
تا رسیدن به لایه نهایی، این بردار انباشتهشده تمام آنچه را که مدل برای پیشبینی توکن بعدی نیاز دارد، در خود جای داده است. در حالت عادی، تنها همین وضعیت پسماند نهایی رمزگشایی میشود. مدل یک نرمالسازی لایه نهایی را اعمال کرده و بردار را در یک ماتریس خروجازتعبیه (unembedding matrix) ضرب میکند تا بازنمایی پنهان و ۱۲۲۸۸-بُعدی ریاضیاتی را به «لاجیتها» (امتیازات احتمالاتی مجزا برای هر یک از حدود ۵۰ هزار توکن موجود در واژگان مدل) ترجمه کند. توکنی که بالاترین امتیاز لاجیت را داشته باشد، به پیشبینی رسمی مدل تبدیل میشود.[1][4]
لنز لاجیت یک فرض ریاضیاتی جسورانه را مطرح میکند: این تکنیک دقیقاً همان گام رمزگشایی نهایی را روی لایههای میانی اعمال میکند. با کپی کردن ماتریس خروجازتعبیه نهایی و اعمال آن بر لایه ۱۰، لایه ۲۰ یا لایه ۵۰، پژوهشگران میتوانند یک پیشبینی متنی خوانا را از میانه شبکه استخراج کنند. nostalgebraist در پست بنیادین خود در سال ۲۰۲۰ در پلتفرم LessWrong نوشت: «لنز لاجیت به جای اینکه روی نحوه بهروزرسانی باورها در درون هر مرحله تمرکز کند، بر آنچه GPT پس از هر مرحله پردازش باور دارد متمرکز است.»[1]
اگرچه لنز لاجیت اولیه پنجرهای پیشگامانه به سوی شناخت مدل گشود، اما از یک محدودیت ساختاری به نام «رانش پایه» (basis drift) رنج میبرد. لایههای اولیه، اطلاعات را در سیستمهای مختصاتی مینویسند که دیگر با ماتریس خروجازتعبیه خروجی نهایی تطابق کامل ندارند. از آنجا که شبکه انتظار دارد پیش از خروجی، دهها تبدیل دیگر را پشت سر بگذارد، رمزگشایی مستقیم در لایههای اولیه اغلب دقیقاً در همان جایی که جالبترین محاسبات بنیادین آغاز میشوند، به نویز تبدیل میشود.[2][7]
اگرچه لنز لاجیت اولیه پنجرهای پیشگامانه به سوی شناخت مدل گشود، اما از یک محدودیت ساختاری به نام «رانش پایه» (basis drift) رنج میبرد.
در سال ۲۰۲۳، پژوهشگران این رانش را با «لنز تنظیمشده» (tuned lens) برطرف کردند. لنز تنظیمشده به جای اعمال مستقیم ماتریس خروجازتعبیه نهایی، یک کاوشگر افاین (affine probe) خاص (یک مترجم ریاضیاتی آموزشدیده) را برای هر بلوک مجزا در یک مدل از پیشآموزشدیده و ثابت، آموزش میدهد. این کاوشگر یاد میگیرد که چگونه سیستم مختصات منحصربهفرد لایه ۱۵ یا لایه ۳۰ را به فضای واژگان نهایی ترجمه کند و جابهجاییهای چرخشی را که هنگام حرکت دادهها در شبکه رخ میدهد، اصلاح نماید.[2]
پژوهشگران در مقاله سال ۲۰۲۳ خود در arXiv خاطرنشان کردند: «ما ترانسفورمرها را از منظر استنتاج تکرارپذیر تحلیل میکنیم و به دنبال درک این موضوع هستیم که پیشبینیهای مدل چگونه لایه به لایه پالایش میشوند.» لنز تنظیمشده با اصلاح تغییرات پایه در هر عمق، با موفقیت پیشبینیهای قابلتفسیری را در مراحل بسیار ابتداییتر شبکه استخراج میکند. در مدلهایی با حداکثر ۲۰ میلیارد پارامتر، لنز تنظیمشده بهطور قابلتوجهی قابلاعتمادتر از لنز لاجیت خام عمل کرد و سوگیری کمتری نسبت به توکنهای پرتکرار نشان داد.[2]
با تکامل مدلها از متن خالص به معماریهای چندوجهی، این ابزارهای تفسیرپذیری نیز باید همگام با آنها مقیاسپذیر میشدند. مقالهای که در سال ۲۰۲۵ در ACL Anthology منتشر شد، روشهایی فراتر از لنز لاجیت پایه را معرفی کرد که از تعبیههای متنی برای تشخیص توهمات و پایهگذاری خروجیها در مدلهای زبانی-بصری (VLMs) استفاده میکنند. با بررسی نحوه تعامل توکنهای بصری و توکنهای متنی در جریان پسماند میانی، پژوهشگران میتوانند دقیقاً لایهای را مشخص کنند که در آن مدل تصمیم میگیرد شیئی را توصیف کند که در تصویر اصلی وجود ندارد.[3]
به طور مشابه، تکنیک «منشور لاجیت» (logit prism) که در یک پیشچاپ arXiv در سال ۲۰۲۴ شرح داده شده است، خروجیهای ترانسفورمر را حتی بیشتر تجزیه میکند. منشورهای لاجیت به جای اینکه صرفاً نشان دهند مدل در لایه ۲۰ در مقابل لایه ۴۰ چه چیزی را پیشبینی میکند، مشارکت دقیق هدهای توجه (attention heads) و پرسپترونهای چندلایه (MLPs) را در توزیع واژگان نهایی تفکیک میکنند. اگر مدل کلمه «پاریس» را پیشبینی کند، یک منشور لاجیت میتواند تشخیص دهد که هد توجه ۷ در لایه ۱۲، ۴۰ درصد از وزن ریاضیاتی محرک آن پیشبینی خاص را تامین کرده است.[7]
این پیشرفتها بخشی از یک تغییر مسیر گستردهتر به سوی «تفسیرپذیری درونی» هستند. همانطور که نیل ناندا، پژوهشگر هوش مصنوعی، در واژهنامه سال ۲۰۲۲ خود توضیح داد، تفسیرپذیری مکانیسمی «حوزه مطالعه چگونگی مهندسی معکوس شبکههای عصبی» است که از تحلیل رفتاری در سطح ظاهری فاصله گرفته و به سمت درک علی و دقیق مکانیک مدل حرکت میکند. هدف این است که وزنهای آموختهشده یک شبکه عصبی به الگوریتمهای قابلفهم برای انسان کامپایل شوند، درست مانند دیکامپایل کردن یک فایل باینری به سورسکد خوانا.[4][5]
توانایی خواندن ذهن مدل در میانه محاسبات صرفاً یک تمرین آکادمیک نیست؛ بلکه کاربردهای امنیتی فوری دارد. پژوهشگران دریافتهاند که از مسیر پیشبینیهای پنهان میتوان برای تشخیص حملات مخرب تزریق پرامپت با دقتی نزدیک به صددرصد استفاده کرد. اگر لایههای میانی یک مدل چرخش ناگهانی و غیرطبیعی در پیشبینی واژگان خود نشان دهند (مثلاً تغییر از یک متن بیخطر به یک فرمان سیستمی در لایه ۲۵)، فیلترهای امنیتی میتوانند پیش از نهایی شدن خروجی مضر، فرآیند تولید را متوقف کنند.[2][6]
علاوه بر این، درک این مسیرهای درونی به مهندسان کمک میکند تا محل ذخیره حقایق یا سوگیریهای خاص را پیدا کنند. اگر یک مدل به طور مداوم یک ارتباط جمعیتشناختی سوگیرانه را در لایه ۱۵ بازیابی کند، توسعهدهندگان از نظر تئوری میتوانند دقیقاً در همان عمق مداخله کنند. این رویکرد جراحیگونه به مهندسان اجازه میدهد تا بدون نیاز به آموزش مجدد کل سیستم چند میلیارد پارامتری از پایه، وزنهای مدل را ویرایش کرده یا فعالسازیهای آن را هدایت کنند و بدین ترتیب میلیونها دلار در هزینههای پردازشی صرفهجویی کنند.[5][8]
مرز بعدی برای این روشهای انتساب، مداخله علی به جای مشاهده صرف است. در حالی که لنز لاجیت میتواند نشان دهد که مدل در لایه ۱۲ کلمه «پاریس» را پیشبینی میکند، پژوهشگران اکنون در حال آزمایش این موضوع هستند که آیا تغییر جراحیگونه آن بردار میانی میتواند به طور قابلاعتمادی خروجی نهایی مدل را به «رم» تغییر دهد، بدون اینکه انسجام گرامری آن از بین برود. تا زمانی که این تکنیکهای ویرایش علی به رویههای مهندسی استاندارد تبدیل نشوند، لنز لاجیت عمدتاً به عنوان یک ابزار تشخیصی باقی میماند؛ راهی مطمئن برای خواندن ذهن مدل، اما نه هنوز راهی تضمینشده برای تغییر آن.[6][7][8]
اصطلاحات کلیدی
- لنز لاجیت
- تکنیکی که ماتریس رمزگشایی نهایی مدل را روی لایههای میانی آن اعمال کرده و محاسبات نیمهکاره را به پیشبینیهای متنی خوانا ترجمه میکند.
- جریان پسماند
- مسیر مرکزی در یک مدل ترانسفورمر که در آن هر لایه بهروزرسانیهای محاسبهشده خود را به یک مجموع برداری در حال اجرا اضافه کرده و زمینه را انباشته میکند.
- ماتریس خروجازتعبیه
- تبدیل ریاضیاتی در انتهای یک مدل زبانی که بازنماییهای برداری پنهان را به امتیازات احتمالاتی برای کلمات خاص تبدیل میکند.
- لنز تنظیمشده
- نسخه پیشرفتهای از لنز لاجیت که یک مترجم خاص را برای هر لایه آموزش میدهد تا جابهجاییهای سیستم مختصات را در اعماق شبکه اصلاح کند.
- تفسیرپذیری مکانیسمی
- حوزه پژوهشی در هوش مصنوعی که به مهندسی معکوس شبکههای عصبی از وزنهای خام به الگوریتمهای قابلفهم برای انسان اختصاص دارد.
منابع
[1]LessWrongپژوهشگران تفسیرپذیری مکانیسمیinterpreting GPT: the logit lens
مطالعه در LessWrong →
[2]arXivپژوهشگران تفسیرپذیری مکانیسمیEliciting Latent Predictions from Transformers with the Tuned Lens
مطالعه در arXiv →
[3]ACL Anthologyحامیان ایمنی هوش مصنوعیBeyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs
مطالعه در ACL Anthology →
[4]Neel Nanda's Blogپژوهشگران تفسیرپذیری مکانیسمیA Comprehensive Mechanistic Interpretability Explainer & Glossary
مطالعه در Neel Nanda's Blog →
[5]Mindful Modelerتوسعهدهندگان مدلWhat is Mechanistic Interpretability and where did it come from?
مطالعه در Mindful Modeler →
[6]IEEEتوسعهدهندگان مدلA Survey on Neural Network Interpretability
مطالعه در IEEE →
[7]arXivپژوهشگران تفسیرپذیری مکانیسمیLogit Prisms: Decomposing Transformer Outputs for Mechanistic Interpretability
مطالعه در arXiv →
[8]تیم سردبیری کوهستانحامیان ایمنی هوش مصنوعیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

