چگونه «تثبیت وزن الاستیک» از فراموشی شبکههای عصبی جلوگیری میکند
مدلهای هوش مصنوعی معمولاً هنگام یادگیری مهارتهای جدید، دانش قبلی خود را بازنویسی میکنند؛ نقصی که به «فراموشی فاجعهبار» (Catastrophic Forgetting) معروف است. تثبیت وزن الاستیک (EWC) این مشکل را با قفل کردن ریاضیاتی اتصالات عصبی خاصی که برای وظایف گذشته حیاتی هستند، حل میکند و یادگیری متوالی را ممکن میسازد.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
- محققان هوش مصنوعی بیولوژیکی
- استدلال میکنند که تقلید از انعطافپذیری سیناپسی پستانداران، عملیترین مسیر برای دستیابی به هوش عمومی مصنوعی است.
- مهندسان با محدودیت محاسباتی
- بر سربار حافظه ماتریس فیشر تمرکز میکنند و EWC را به عنوان یک مصالحه میبینند که مقیاسپذیری ضعیفی برای مدلهای تریلیون پارامتری دارد.
- متخصصان یادگیری پیوسته
- معتقدند EWC یک گام اولیه بنیادی است، اما به تنهایی و بدون گسترش معماری پویا برای جلوگیری از اشباع ظرفیت، کافی نیست.
نکات کلیدی
- شبکههای عصبی استاندارد دچار فراموشی فاجعهبار میشوند و دانش گذشته را هنگام یادگیری وظایف جدید بازنویسی میکنند.
- تثبیت وزن الاستیک (EWC) این مشکل را با قفل کردن ریاضیاتی وزنهایی که برای وظایف قبلی مهمتر هستند، حل میکند.
- این الگوریتم از ماتریس اطلاعات فیشر برای محاسبه اهمیت هر اتصال استفاده میکند.
- در حالی که EWC با اجتناب از آموزش مجدد، در محاسبات صرفهجویی میکند، اما حافظه مورد نیاز برای پارامترها را در طول آموزش دو برابر میکند.
- دیپمایند در ابتدا این مفهوم را با آموزش یک شبکه واحد برای انجام متوالی ۱۰ بازی آتاری اثبات کرد.
چرا مهم است
هوش عمومی مصنوعی واقعی نیازمند سیستمهایی است که بتوانند در طول عمر خود به طور پیوسته یاد بگیرند و مجبور نباشند از ابتدا شروع کنند. این الگوریتم با تقلید از انعطافپذیری مغز پستانداران، مانع بزرگی را از سر راه هوش مصنوعی برمیدارد تا بتواند به جای جایگزینی دانش، آن را انباشته کند.
مهندسان یادگیری ماشین دقیقاً تعیین میکنند که یک شبکه عصبی چه زمانی پارامترهای داخلی خود را بهروزرسانی کند، اما تا همین اواخر، آنها با یک انتخاب با حاصل جمع صفر روبرو بودند: یا مدل را با مجموعه داده جدید آموزش دهند و شاهد بازنویسی فوری تمام دانش قبلی آن باشند، یا مدل را به طور کامل فریز کنند. این پدیده که «فراموشی فاجعهبار» نامیده میشود، توسعهدهندگان را مجبور میکند هر بار که میخواهند یک قابلیت جدید اضافه کنند، مدلها را از ابتدا و با ترکیب دادههای قدیمی و جدید، دوباره آموزش دهند. خود شبکه هیچ سازوکاری برای محافظت از دانش گذشتهاش ندارد؛ بلکه صرفاً گرادیان ریاضی دادههای جدید را دنبال میکند و تعادلهای عددی ظریفی را که مهارتهای قبلی آن را پشتیبانی میکردند، از بین میبرد.[4][5]
در سال ۲۰۱۷، محققان گوگل دیپمایند (Google DeepMind) مقالهای را در مجموعه مقالات آکادمی ملی علوم منتشر کردند که یک راهحل ریاضیاتی را تشریح میکرد. این تیم به رهبری جیمز کرکپاتریک، بررسی کرد که مغز پستانداران چگونه دقیقاً این مشکل را حل میکند. تیم دیپمایند در انتشار سال ۲۰۱۷ خود نوشت: «اگر میخواهیم برنامههای هوش مصنوعی انعطافپذیرتری طراحی کنیم... آنها باید بتوانند وظایف را به صورت متوالی یاد بگیرند.» این نکته شکاف بین هوش بیولوژیکی و سیستمهای مصنوعی را برجسته میکرد.[1][2]
در علوم اعصاب، فرآیندی به نام «تثبیت سیناپسی» (Synaptic Consolidation) از خاطرات مهم محافظت میکند. هنگامی که یک موش یاد میگیرد در یک ماز حرکت کند، سیناپسهای خاصی که برای پردازش آن اطلاعات فضایی استفاده میشوند، انعطافپذیری کمتری پیدا میکنند—آنها به طور فیزیکی در برابر بازنویسی شدن توسط یادگیریهای بعدی مقاومت میکنند. تثبیت وزن الاستیک (EWC) این مکانیسم دفاعی بیولوژیکی را به حساب دیفرانسیل و انتگرال ترجمه میکند و به شبکههای عصبی مصنوعی اجازه میدهد باارزشترین اتصالات خود را قفل کنند.[1][4]
این مکانیسم به محض اتمام آموزش شبکه بر روی اولین هدف خود، که به عنوان «وظیفه الف» (Task A) شناخته میشود، فعال میشود. قبل از ادامه کار، الگوریتم EWC تک تک وزنها—یعنی قدرت عددی اتصالات بین نورونهای مصنوعی—را ارزیابی میکند تا مشخص کند چقدر برای به حداقل رساندن خطا در آن وظیفه خاص حیاتی بودهاند. همه وزنها به یک اندازه مهم نیستند؛ برخی به عنوان ستونهای تحملکننده بار برای منطق شبکه عمل میکنند، در حالی که برخی دیگر تا حد زیادی اضافی هستند.[4]
برای کمیسازی این اهمیت ساختاری، EWC به ابزاری آماری به نام «ماتریس اطلاعات فیشر» (Fisher Information Matrix) متکی است. همانطور که در یک بررسی جامع در سال ۲۰۱۹ که توسط جرمن آی. پاریسی و همکارانش در arXiv منتشر شد، توضیح داده شده است، ماتریس فیشر میزان حساسیت خروجی شبکه را نسبت به تغییرات جزئی در هر وزن خاص اندازهگیری میکند. اگر تغییر اندکی در یک وزن باعث افزایش شدید نرخ خطای شبکه در «وظیفه الف» شود، ماتریس فیشر نمره اهمیت بالایی به آن وزن اختصاص میدهد.[5]
برای کمیسازی این اهمیت ساختاری، EWC به ابزاری آماری به نام «ماتریس اطلاعات فیشر» (Fisher Information Matrix) متکی است.
هنگامی که این نمرات اهمیت محاسبه شدند، EWC یک «فنر» ریاضیاتی را به هر وزن متصل میکند. وقتی مهندس متعاقباً شبکه را برای «وظیفه ب» (Task B) آموزش میدهد، الگوریتم برای تغییر هر وزن، جریمهای را به تابع زیان (Loss Function) اعمال میکند. سختی این فنر مستقیماً با نمره اهمیت فیشر متناسب است: وزنهای حیاتی برای جابجایی به شدت جریمه میشوند، در حالی که وزنهای کماهمیت آزاد گذاشته میشوند تا با دادههای جدید تنظیم شوند.[4]
محققان دیپمایند با استفاده از معیار کلاسیک یادگیری تقویتی آتاری ۲۶۰۰، قابلیت اجرای این مکانیسم را اثبات کردند. شبکههای عصبی استاندارد زمانی که از آنها خواسته شد بازیها را به صورت متوالی یاد بگیرند، کاملاً شکست خوردند؛ یادگیری بازی دوم مانند «مهاجمان فضایی» (Space Invaders) توانایی مدل برای بازی «پونگ» (Pong) را به طور کامل از بین میبرد. با اعمال EWC، شبکه با موفقیت یاد گرفت ۱۰ بازی مختلف آتاری را به صورت متوالی انجام دهد و عملکردی در سطح انسان را در تمام آنها حفظ کرد، بدون اینکه هرگز به دادههای آموزشی بازیهای قدیمیتر بازگردد.[1][2]
تا سال ۲۰۲۶، ردپای این الگوریتم بسیار فراتر از محیطهای یادگیری تقویتی گسترش یافته است. مقالهای که اخیراً در کنفرانس NeurIPS ۲۰۲۶ ارائه شد، EWC را برای یادگیری پیوسته گراف دانش (Knowledge Graph Continual Learning) ارزیابی کرد و نشان داد که این تکنیک برای معماریهای داده ساختاریافته و کاربردهای سازمانی مدرن که در آنها آموزش مجدد از ابتدا بسیار پرهزینه است، همچنان بسیار مرتبط باقی میماند.[3]
اما سختی فنر ریاضیاتی محدودیتهای محاسباتی شدیدی را به وجود میآورد. محاسبه دقیق ماتریس اطلاعات فیشر برای یک شبکه مدرن با میلیاردها پارامتر، نیازمند معکوس کردن ماتریسی است که آنقدر بزرگ است که از ظرفیت حافظه هر ابررایانه موجود فراتر میرود. برای دور زدن این مشکل، مهندسان از یک تقریب قطری استفاده میکنند و فرض میکنند که وزنها کاملاً مستقل از یکدیگر هستند.[5]
حتی با وجود این میانبر ریاضیاتی، ذخیره مقادیر اهمیت عملاً نیاز حافظه برای پارامترهای مدل را در طول فاز آموزش دو برابر میکند. برای هر وزن در شبکه، سیستم باید مقدار پایه آن از «وظیفه الف» و نمره اهمیت فیشر آن را نیز ذخیره کند. این امر EWC را از نظر محاسبات خام بسیار کارآمد میسازد—زیرا هزینه آموزش مجدد را کاهش میدهد—اما برای استقرار در دستگاههای لبهای (Edge Deployments) با محدودیت حافظه، پرهزینه است.[5]
علاوه بر این، همانطور که شبکه «وظیفه ج»، «وظیفه د» و «وظیفه ه» را یاد میگیرد، فنرهای ریاضیاتی روی هم انباشته میشوند. شبکه به طور فزایندهای سخت و غیرقابل انعطاف میشود، وضعیتی که محققان از آن به عنوان «اشباع ظرفیت» (Capacity Saturation) یاد میکنند. در نهایت، مهندس باید تصمیم بگیرد که آیا شبکه را هرس کند، تعداد پارامترهای آن را به صورت پویا گسترش دهد، یا یک سقف سخت را در توانایی سیستم برای جذب اطلاعات جدید بپذیرد.[1][5]
این الگوریتم نشاندهنده یک تغییر اساسی در نحوه رویکرد صنعت به مدیریت چرخه عمر مدل است. به جای در نظر گرفتن آموزش به عنوان یک رویداد ایزوله و یکباره که یک مصنوع ایستا تولید میکند، EWC یادگیری را به عنوان یک مسیر پیوسته در نظر میگیرد. اگرچه این الگوریتم مشکل اشباع ظرفیت را به طور کامل حل نمیکند، اما زیربنای ریاضیاتی را برای سیستمهایی فراهم میآورد که به جای صرفاً جابجایی دانش، آن را انباشته میکنند.[2][6]
اصطلاحات کلیدی
- فراموشی فاجعهبار
- تمایل یک شبکه عصبی مصنوعی به بازنویسی کامل اطلاعاتی که قبلاً آموخته است، هنگام آموزش بر روی دادههای جدید.
- ماتریس اطلاعات فیشر
- ابزاری آماری که در EWC برای اندازهگیری میزان حساسیت خروجی شبکه نسبت به تغییرات در وزنهای داخلی خاص استفاده میشود.
- تثبیت سیناپسی
- فرآیند بیولوژیکی که در آن اتصالات عصبی مهم در مغز برای محافظت از خاطرات، انعطافپذیری کمتری پیدا میکنند.
- یادگیری پیوسته
- توانایی یک مدل هوش مصنوعی برای یادگیری متوالی چندین وظیفه در طول زمان بدون نیاز به آموزش مجدد از ابتدا.
آنچه نمیدانیم
- اینکه EWC تا چه حد میتواند به طور مؤثر برای معماریهای ترانسفورمر مدرن با تریلیونها پارامتر بدون ایجاد گلوگاههای شدید حافظه مقیاسپذیر باشد.
- نقطه دقیق اشباع ظرفیت—اینکه یک شبکه با اندازه مشخص، چند وظیفه متوالی را میتواند یاد بگیرد قبل از اینکه فنرهای ریاضیاتی بیش از حد سخت شوند.
- اینکه آیا گسترش پویا شبکه میتواند به طور یکپارچه با EWC ادغام شود تا مشکل اشباع حل شود.
منابع
[1]PNASمحققان هوش مصنوعی بیولوژیکیOvercoming catastrophic forgetting in neural networks
مطالعه در PNAS →
[2]Google DeepMindمحققان هوش مصنوعی بیولوژیکیEnabling Continual Learning in Neural Networks
مطالعه در Google DeepMind →
[3]NeurIPSمتخصصان یادگیری پیوستهElastic Weight Consolidation for Knowledge Graph Continual Learning: An Empirical Evaluation
مطالعه در NeurIPS →
[4]Towards AIمتخصصان یادگیری پیوستهOvercoming Catastrophic Forgetting: A Simple Guide to Elastic Weight Consolidation
مطالعه در Towards AI →
[5]arXivمهندسان با محدودیت محاسباتیContinual Learning in Neural Networks
مطالعه در arXiv →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.
