ترجمه جعبه سیاه: «لنز لاجیت» چگونه محاسبات هوش مصنوعی را به متن قابلفهم برای انسان تبدیل میکند
پژوهشگران حوزه تفسیرپذیری مکانیسمی با استفاده از «لنز لاجیت» و روشهای پس از آن، در حال رمزگشایی از لایههای میانی مدلهای زبانی بزرگ هستند. این تکنیکها با تصویر کردن محاسبات نیمهکاره در فضای واژگان، دقیقاً نشان میدهند که هوش مصنوعی چه زمانی و در کجا تصمیم میگیرد چه بگوید.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- لنز لاجیت وضعیتهای ریاضیاتی میانی یک مدل زبانی را به پیشبینیهای واژگانی خوانا ترجمه میکند.
- این تکنیک دقیقاً نشان میدهد که مدل از کدام لایه برای بازیابی یک حقیقت خاص یا شکلدهی به یک سوگیری استفاده میکند.
- لایههای اولیه اغلب از «رانش پایه» رنج میبرند که «لنز تنظیمشده» جدیدتر با آموزش مترجمهای ریاضیاتی مختص هر لایه، آن را اصلاح میکند.
دیباگ کردن نرمافزارهای سنتی بر بررسی خط به خط کدها برای مشاهده تغییر وضعیت متغیرها استوار است. اما مدلهای زبانی بزرگ اطلاعات را به جای گیتهای منطقی مجزا، از طریق فضاهای برداری پیوسته پردازش میکنند که این امر بازرسی خط به خط را غیرممکن میسازد.
«لنز لاجیت» (logit lens) با وادار کردن افکار درونی و نیمهکاره مدل به تنها واژگانی که انسانها میفهمند (یعنی دیکشنری خروجی خود مدل)، این شکاف را پر میکند. با تصویر کردن وضعیتهای ریاضیاتی میانی به متن، پژوهشگران میتوانند ساخت پاسخ توسط شبکه عصبی را در لحظه تماشا کنند و دقیقاً تشخیص دهند که مدل چه زمانی یک حقیقت را بازیابی میکند، دچار سوگیری میشود یا تصمیم به توهمزنی میگیرد.[1][8]
این تکنیک که در سال ۲۰۲۰ توسط پژوهشگر مستقلی با نام مستعار nostalgebraist معرفی شد، به پرسشی به ظاهر ساده پاسخ میدهد. اگر یک مدل زبانی در میانه لایههایش متوقف شود و مجبور شود توکن بعدی را فوراً حدس بزند، چه خواهد گفت؟ پاسخ این پرسش، مسیر استدلال مدل را در لحظه نشان میدهد.
لنز لاجیت به جای اینکه با شبکه عصبی مانند یک جعبه سیاه یکپارچه رفتار کند که پرامپتی را میبلعد و یک پاراگراف بیرون میدهد، با آن مانند یک خط مونتاژ برخورد کرده و محصول را در هر ایستگاه از این نوار نقاله بازرسی میکند.[1][5]
برای درک نحوه کار لنز لاجیت، ابتدا باید مفهوم «جریان پسماند» (residual stream) در هسته معماری ترانسفورمر را درک کرد. وقتی یک توکن از مدلی مانند GPT-3 عبور میکند (که دارای ۹۶ لایه مجزا و ۱۷۵ میلیارد پارامتر است)، هیچ لایهای بازنمایی قبلی را بازنویسی نمیکند. در عوض، هر لایه سهم محاسباتی خود را به یک مجموع در حال اجرا اضافه میکند. این جریان پسماند به عنوان پهنای باند حافظه مرکزی مدل عمل کرده و با نفوذ دادهها به عمق شبکه، زمینه و ظرایف را انباشته میکند.[4][6]
تا رسیدن به لایه نهایی، این بردار انباشتهشده تمام آنچه را که مدل برای پیشبینی توکن بعدی نیاز دارد، در خود جای داده است. در حالت عادی، تنها همین وضعیت پسماند نهایی رمزگشایی میشود.
مدل یک نرمالسازی لایه نهایی را اعمال کرده و بردار را در یک ماتریس خروجازتعبیه (unembedding matrix) ضرب میکند تا بازنمایی پنهان و ۱۲۲۸۸-بُعدی ریاضیاتی را به «لاجیتها» (امتیازات احتمالاتی مجزا برای هر یک از حدود ۵۰ هزار توکن موجود در واژگان مدل) ترجمه کند. توکنی که بالاترین امتیاز لاجیت را داشته باشد، به پیشبینی رسمی مدل تبدیل میشود.[1][4]
لنز لاجیت یک فرض ریاضیاتی جسورانه را مطرح میکند: این تکنیک دقیقاً همان گام رمزگشایی نهایی را روی لایههای میانی اعمال میکند. با کپی کردن ماتریس خروجازتعبیه نهایی و اعمال آن بر لایه ۱۰، لایه ۲۰ یا لایه ۵۰، پژوهشگران میتوانند یک پیشبینی متنی خوانا را از میانه شبکه استخراج کنند. nostalgebraist در پست بنیادین خود در سال ۲۰۲۰ در پلتفرم LessWrong نوشت: «لنز لاجیت به جای اینکه روی نحوه بهروزرسانی باورها در درون هر مرحله تمرکز کند، بر آنچه GPT پس از هر مرحله پردازش باور دارد متمرکز است.»[1]
اگرچه لنز لاجیت اولیه پنجرهای پیشگامانه به سوی شناخت مدل گشود، اما از یک محدودیت ساختاری به نام «رانش پایه» (basis drift) رنج میبرد. لایههای اولیه، اطلاعات را در سیستمهای مختصاتی مینویسند که دیگر با ماتریس خروجازتعبیه خروجی نهایی تطابق کامل ندارند. از آنجا که شبکه انتظار دارد پیش از خروجی، دهها تبدیل دیگر را پشت سر بگذارد، رمزگشایی مستقیم در لایههای اولیه اغلب دقیقاً در همان جایی که جالبترین محاسبات بنیادین آغاز میشوند، به نویز تبدیل میشود.[2][7]
در سال ۲۰۲۳، پژوهشگران این رانش را با «لنز تنظیمشده» (tuned lens) برطرف کردند. لنز تنظیمشده به جای اعمال مستقیم ماتریس خروجازتعبیه نهایی، یک کاوشگر افاین (affine probe) خاص (یک مترجم ریاضیاتی آموزشدیده) را برای هر بلوک مجزا در یک مدل از پیشآموزشدیده و ثابت، آموزش میدهد. این کاوشگر یاد میگیرد که چگونه سیستم مختصات منحصربهفرد لایه ۱۵ یا لایه ۳۰ را به فضای واژگان نهایی ترجمه کند و جابهجاییهای چرخشی را که هنگام حرکت دادهها در شبکه رخ میدهد، اصلاح نماید.[2]
پژوهشگران در مقاله سال ۲۰۲۳ خود در arXiv خاطرنشان کردند: «ما ترانسفورمرها را از منظر استنتاج تکرارپذیر تحلیل میکنیم و به دنبال درک این موضوع هستیم که پیشبینیهای مدل چگونه لایه به لایه پالایش میشوند.» لنز تنظیمشده با اصلاح تغییرات پایه در هر عمق، با موفقیت پیشبینیهای قابلتفسیری را در مراحل بسیار ابتداییتر شبکه استخراج میکند. در مدلهایی با حداکثر ۲۰ میلیارد پارامتر، لنز تنظیمشده بهطور قابلتوجهی قابلاعتمادتر از لنز لاجیت خام عمل کرد و سوگیری کمتری نسبت به توکنهای پرتکرار نشان داد.[2]
با تکامل مدلها از متن خالص به معماریهای چندوجهی، این ابزارهای تفسیرپذیری نیز باید همگام با آنها مقیاسپذیر میشدند. مقالهای که در سال ۲۰۲۵ در ACL Anthology منتشر شد، روشهایی فراتر از لنز لاجیت پایه را معرفی کرد که از تعبیههای متنی برای تشخیص توهمات و پایهگذاری خروجیها در مدلهای زبانی-بصری (VLMs) استفاده میکنند. با بررسی نحوه تعامل توکنهای بصری و توکنهای متنی در جریان پسماند میانی، پژوهشگران میتوانند دقیقاً لایهای را مشخص کنند که در آن مدل تصمیم میگیرد شیئی را توصیف کند که در تصویر اصلی وجود ندارد.[3]
به طور مشابه، تکنیک «منشور لاجیت» (logit prism) که در یک پیشچاپ arXiv در سال ۲۰۲۴ شرح داده شده است، خروجیهای ترانسفورمر را حتی بیشتر تجزیه میکند. منشورهای لاجیت به جای اینکه صرفاً نشان دهند مدل در لایه ۲۰ در مقابل لایه ۴۰ چه چیزی را پیشبینی میکند، مشارکت دقیق هدهای توجه (attention heads) و پرسپترونهای چندلایه (MLPs) را در توزیع واژگان نهایی تفکیک میکنند.
اگر مدل کلمه «پاریس» را پیشبینی کند، یک منشور لاجیت میتواند تشخیص دهد که هد توجه ۷ در لایه ۱۲، ۴۰ درصد از وزن ریاضیاتی محرک آن پیشبینی خاص را تامین کرده است.[7]
این پیشرفتها بخشی از یک تغییر مسیر گستردهتر به سوی «تفسیرپذیری درونی» هستند. همانطور که نیل ناندا، پژوهشگر هوش مصنوعی، در واژهنامه سال ۲۰۲۲ خود توضیح داد، تفسیرپذیری مکانیسمی «حوزه مطالعه چگونگی مهندسی معکوس شبکههای عصبی» است که از تحلیل رفتاری در سطح ظاهری فاصله گرفته و به سمت درک علی و دقیق مکانیک مدل حرکت میکند. هدف این است که وزنهای آموختهشده یک شبکه عصبی به الگوریتمهای قابلفهم برای انسان کامپایل شوند، درست مانند دیکامپایل کردن یک فایل باینری به سورسکد خوانا.[4][5]
توانایی خواندن ذهن مدل در میانه محاسبات صرفاً یک تمرین آکادمیک نیست؛ بلکه کاربردهای امنیتی فوری دارد. پژوهشگران دریافتهاند که از مسیر پیشبینیهای پنهان میتوان برای تشخیص حملات مخرب تزریق پرامپت با دقتی نزدیک به صددرصد استفاده کرد. اگر لایههای میانی یک مدل چرخش ناگهانی و غیرطبیعی در پیشبینی واژگان خود نشان دهند (مثلاً تغییر از یک متن بیخطر به یک فرمان سیستمی در لایه ۲۵)، فیلترهای امنیتی میتوانند پیش از نهایی شدن خروجی مضر، فرآیند تولید را متوقف کنند.[2][6]
علاوه بر این، درک این مسیرهای درونی به مهندسان کمک میکند تا محل ذخیره حقایق یا سوگیریهای خاص را پیدا کنند. اگر یک مدل به طور مداوم یک ارتباط جمعیتشناختی سوگیرانه را در لایه ۱۵ بازیابی کند، توسعهدهندگان از نظر تئوری میتوانند دقیقاً در همان عمق مداخله کنند. این رویکرد جراحیگونه به مهندسان اجازه میدهد تا بدون نیاز به آموزش مجدد کل سیستم چند میلیارد پارامتری از پایه، وزنهای مدل را ویرایش کرده یا فعالسازیهای آن را هدایت کنند و بدین ترتیب میلیونها دلار در هزینههای پردازشی صرفهجویی کنند.[5][8]
مرز بعدی برای این روشهای انتساب، مداخله علی به جای مشاهده صرف است. در حالی که لنز لاجیت میتواند نشان دهد که مدل در لایه ۱۲ کلمه «پاریس» را پیشبینی میکند، پژوهشگران اکنون در حال آزمایش این موضوع هستند که آیا تغییر جراحیگونه آن بردار میانی میتواند به طور قابلاعتمادی خروجی نهایی مدل را به «رم» تغییر دهد، بدون اینکه انسجام گرامری آن از بین برود.
مرز بعدی برای این روشهای انتساب، مداخله علی به جای مشاهده صرف است.
اصطلاحات کلیدی
- لنز لاجیت
- تکنیکی که ماتریس رمزگشایی نهایی مدل را روی لایههای میانی آن اعمال کرده و محاسبات نیمهکاره را به پیشبینیهای متنی خوانا ترجمه میکند.
- جریان پسماند
- مسیر مرکزی در یک مدل ترانسفورمر که در آن هر لایه بهروزرسانیهای محاسبهشده خود را به یک مجموع برداری در حال اجرا اضافه کرده و زمینه را انباشته میکند.
- ماتریس خروجازتعبیه
- تبدیل ریاضیاتی در انتهای یک مدل زبانی که بازنماییهای برداری پنهان را به امتیازات احتمالاتی برای کلمات خاص تبدیل میکند.
- لنز تنظیمشده
- نسخه پیشرفتهای از لنز لاجیت که یک مترجم خاص را برای هر لایه آموزش میدهد تا جابهجاییهای سیستم مختصات را در اعماق شبکه اصلاح کند.
- تفسیرپذیری مکانیسمی
- حوزه پژوهشی در هوش مصنوعی که به مهندسی معکوس شبکههای عصبی از وزنهای خام به الگوریتمهای قابلفهم برای انسان اختصاص دارد.
پرسشهای متداول
آیا لنز لاجیت نیازی به تغییر کدهای مدل دارد؟
خیر. لنز لاجیت پایه کاملاً مشاهدهای است و نیازی به آموزش مجدد یا پارامترهای اضافی ندارد؛ این تکنیک به سادگی لایه نهایی موجود مدل را روی لایههای میانی آن اعمال میکند.
چرا لایههای اولیه هنگام رمزگشایی اغلب کلمات بیمعنی تولید میکنند؟
لایههای اولیه از «رانش پایه» رنج میبرند، به این معنی که اطلاعات را در سیستم مختصات ریاضیاتی متفاوتی نسبت به آنچه لایه خروجی نهایی انتظار دارد، مینویسند.
لنز تنظیمشده چگونه مشکل کلمات بیمعنی را حل میکند؟
لنز تنظیمشده یک مترجم ریاضیاتی کوچک و سفارشی (یک کاوشگر افاین) را برای هر لایه خاص آموزش میدهد و جابهجایی مختصات را پیش از رمزگشایی متن اصلاح میکند.
آیا میتوان از این روش برای توقف توهمات هوش مصنوعی استفاده کرد؟
بله. پژوهشگران از تعبیههای متنی و مسیرهای پیشبینی پنهان استفاده میکنند تا تشخیص دهند چه زمانی استدلال درونی مدل به طور ناگهانی از منبع خود منحرف میشود و بدین ترتیب توهمات را پیش از خروجی دادن علامتگذاری میکنند.
بررسی عمیق دیدگاهها
دیدگاه مهندسی معکوس
پژوهشگران تفسیرپذیری مکانیسمی لنز لاجیت را به عنوان یک ابزار بنیادین دیکامپایل در نظر میگیرند.
پژوهشگران این اردوگاه استدلال میکنند که شبکههای عصبی ذاتاً غیرقابلتفسیر نیستند، بلکه صرفاً به یک زبان ریاضیاتی بیگانه نوشته شدهاند. آنها با نگاشت فضاهای برداری پیوسته به واژگان مجزا، قصد دارند الگوریتمهای جهانی را که مدلها در طول آموزش یاد میگیرند، کشف کنند. برای آنها، لنز لاجیت معادل یک دیباگر نرمافزار است که ثابت میکند جعبه سیاه میتواند به طور سیستماتیک کالبدشکافی و درک شود.
دیدگاه ایمنی هوش مصنوعی
برای پژوهشگران ایمنی، رمزگشایی میانی یک مکانیسم دفاعی حیاتی در برابر خروجیهای مخرب است.
حامیان ایمنی استدلال میکنند که منتظر ماندن برای نهایی شدن خروجی مدل، برای داشتن یک امنیت قوی بسیار دیر است. با نظارت بر مسیر پیشبینی پنهان، فیلترهای ایمنی میتوانند همراستاییهای فریبکارانه یا تزریقهای پرامپت را در میانه تفکر مدل شناسایی کنند. اگر وضعیت درونی یک مدل در لایه ۲۰ به طور ناگهانی به سمت تولید کدهای مضر یا لفاظیهای سوگیرانه چرخش کند، میتوان سیستم را پیش از آنکه کاربر نتیجه را ببیند، متوقف کرد.
دیدگاه مهندسی
توسعهدهندگان کاربردی مدل، روشهای انتساب را مسیری برای ویرایش جراحیگونه مدل و کاهش هزینهها میدانند.
مهندسان به جای صرف میلیونها دلار برای آموزش مجدد مدلی که یک حقیقت نادرست یا آمار منسوخ را یاد گرفته است، میخواهند از لنز لاجیت برای یافتن لایه و هد توجه دقیقی که آن حقیقت در آن ذخیره شده، استفاده کنند. این انتساب دقیق، بهروزرسانی هدفمند وزنها را امکانپذیر میسازد و به توسعهدهندگان اجازه میدهد تا یک مدل چند میلیارد پارامتری را به همان آسانی بهروزرسانی یک ردیف در یک پایگاه داده سنتی، وصله کنند.
- پژوهشگران تفسیرپذیری مکانیسمی
- لنز لاجیت را به عنوان یک ابزار بنیادین دیکامپایل برای مهندسی معکوس الگوریتمهای جهانی که مدلها در طول آموزش یاد میگیرند، در نظر میگیرند.
- حامیان ایمنی هوش مصنوعی
- بر استفاده از رمزگشایی میانی برای تشخیص فریب، توهمات و تزریقهای پرامپت پیش از نهایی شدن خروجی مدل تمرکز دارند.
- توسعهدهندگان مدل
- روشهای انتساب را مسیری برای ویرایش جراحیگونه مدل میدانند که به آنها اجازه میدهد حقایق نادرست را بدون آموزش مجدد و پرهزینه اصلاح کنند.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان سختافزار که پهنای باند حافظه را برای این کاوشگرها بهینهسازی میکنند
- حقوقدانانی که مسئولیت قانونی توهمات لایههای میانی را ارزیابی میکنند
منابع
[1]LessWrongپژوهشگران تفسیرپذیری مکانیسمیinterpreting GPT: the logit lens
مطالعه در LessWrong →
[2]arXivپژوهشگران تفسیرپذیری مکانیسمیEliciting Latent Predictions from Transformers with the Tuned Lens
مطالعه در arXiv →
[3]ACL Anthologyحامیان ایمنی هوش مصنوعیBeyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs
مطالعه در ACL Anthology →
[4]Neel Nanda's Blogپژوهشگران تفسیرپذیری مکانیسمیA Comprehensive Mechanistic Interpretability Explainer & Glossary
مطالعه در Neel Nanda's Blog →
[5]Mindful Modelerتوسعهدهندگان مدلWhat is Mechanistic Interpretability and where did it come from?
مطالعه در Mindful Modeler →
[6]IEEEتوسعهدهندگان مدلA Survey on Neural Network Interpretability
مطالعه در IEEE →
[7]arXivپژوهشگران تفسیرپذیری مکانیسمیLogit Prisms: Decomposing Transformer Outputs for Mechanistic Interpretability
مطالعه در arXiv →
[8]تیم سردبیری کوهستانحامیان ایمنی هوش مصنوعیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →سلولهای مجازی
شرکت «جنبایو اِیآی» مدل بنیادی مجازی «آیدو سل» را برای شبیهسازی زیستشناسی انسان معرفی کرد
6 منبع
هوش مصنوعی عاملی
آنتروپیک «کلود اپوس ۵» را با پنجره متنی ۱ میلیون توکنی برای کدنویسی عاملی (Agentic) منتشر کرد
3 منبع
زیرساخت هوش مصنوعی
متا با عرضه سرویس ابری ارزانقیمت هوش مصنوعی، ظرفیت مازاد خود را به پول تبدیل کرده و هایپراسکالرها را به چالش میکشد
4 منبع
مدلهای فضای حالت
توضیح: چگونه «مدلهای فضای حالت» انحصار ترنسفورمرها را میشکنند و حافظه نامحدود هوش مصنوعی را فعال میکنند
5 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





