رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعماری مدلمقاله تشریحی· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه مقداردهی اولیه خاویر از محو شدن و انفجار گرادیان‌ها در شبکه‌های عصبی عمیق جلوگیری می‌کند

روش گلوروت با مقیاس‌بندی وزن‌های اولیه شبکه بر اساس واریانس گره‌های ورودی و خروجی، جریان گرادیان را در لایه‌های عمیق تثبیت می‌کند. این پایه ریاضی نیاز به پیش‌آموزش‌های پیچیده را از بین برد و عصر مدرن یادگیری عمیق را پایه‌گذاری کرد.

به قلم ندا وزیری

پژوهشگران نظری یادگیری ماشین 50%مهندسان کاربردی هوش مصنوعی 50%
پژوهشگران نظری یادگیری ماشین
تمرکز بر تضمین‌های ریاضی و مکانیک آماری انتشار سیگنال.
مهندسان کاربردی هوش مصنوعی
تمرکز بر پایداری عملی آموزش و پیاده‌سازی معماری.

دیدگاه‌هایی که این گزارش پوشش نداده

  • طراحان سخت‌افزاری که فرمت‌های ممیز شناور با دقت پایین را برای مقداردهی‌های اولیه بهینه‌سازی می‌کنند.

هنگام ساخت یک مدل ساده یادگیری ماشین، تخصیص اعداد تصادفی به وزن‌های اولیه به‌خوبی کار می‌کند، زیرا سیگنال خطا پیش از به‌روزرسانی سیستم تنها باید از یک یا دو لایه به عقب برگردد. اما شبکه‌های عصبی عمیق در یک جنبه فاجعه‌بار متفاوت هستند: آن‌ها این وزن‌های تصادفی را در ده‌ها یا صدها لایه ضرب می‌کنند و عدم تعادل‌های جزئی اولیه را به خطاهای مرکب نمایی تبدیل می‌کنند. اگر شبکه‌ای با وزن‌هایی شروع به کار کند که به‌درستی مقیاس‌بندی نشده‌اند، پایه ریاضی فرآیند آموزش پیش از آنکه مدل بتواند حتی یک ویژگی را یاد بگیرد، فرو می‌ریزد. این آسیب‌پذیری ساختاری در گذشته عمق و قابلیت سیستم‌های اولیه هوش مصنوعی را به‌شدت محدود می‌کرد و پژوهشگران را مجبور می‌ساخت تا به معماری‌های کم‌عمقی تکیه کنند که قادر به درک الگوهای پیچیده در داده‌های با ابعاد بالا مانند تصاویر یا زبان انسان نبودند.[2][6]

مکانیسم این نوع خرابی در طول مسیر پس‌رو در آموزش شبکه عصبی به دو شکل متمایز بروز می‌کند. اگر وزن‌های اولیه از توزیعی انتخاب شوند که اندکی بیش از حد کوچک باشد، سیگنال خطا با عبور از هر لایه کسری از مقدار خود را از دست می‌دهد. تا زمانی که این سیگنال به لایه‌های اولیه یک شبکه ۱۰ لایه‌ای برسد، کاملاً به صفر محو می‌شود و گره‌های پایه‌ای را بدون هیچ راهنمای ریاضی برای بهبود رها می‌کند. در مقابل، اگر وزن‌های شروع اندکی بیش از حد بزرگ باشند، سیگنال به‌طور نمایی تقویت می‌شود تا جایی که از محدودیت‌های عددی رایانه فراتر می‌رود؛ یک خرابی فاجعه‌بار که به عنوان انفجار گرادیان‌ها شناخته می‌شود و فرآیند آموزش را فوراً متوقف می‌کند.[3][5]

پیش از سال ۲۰۱۰، این گلوگاه ریاضی شبکه‌های عصبی استاندارد را به عمق تقریباً پنج لایه محدود می‌کرد. پژوهشگران با استفاده از روش‌های پیچیده پیش‌آموزش بدون نظارت، مانند ماشین‌های بولتزمن محدود، این مشکل را دور می‌زدند تا پیش از شروع آموزش واقعی و سرتاسری، وزن‌های هر لایه را به‌دقت تنظیم کنند. این مقداردهی اولیه لایه‌به‌لایه به‌شدت کند، از نظر محاسباتی پرهزینه و بسیار شکننده بود و عملاً پیشرفت یادگیری عمیق را متوقف کرده و مانع از توسعه مدل‌های عظیم و چندلایه‌ای می‌شد که برای بینایی ماشین و پردازش زبان طبیعی مدرن ضروری هستند.[1]

پژوهشگران، خاویر گلوروت و یوشوا بنجیو، این گلوگاه را با در نظر گرفتن مسیرهای پیش‌رو و پس‌روی شبکه عصبی به‌عنوان یک مسئله دقیق واریانس حل کردند. آن‌ها در مقاله تأثیرگذار خود در سال ۲۰۱۰ نشان دادند که برای ثابت نگه‌داشتن سیگنال خطا در تعداد دلخواهی از لایه‌ها، واریانس آماری باید حفظ شود. همان‌طور که این پژوهشگران نوشتند، هدف این است که واریانس‌های فعال‌سازی و واریانس گرادیان‌های پس‌انتشاریافته در حین حرکت به بالا یا پایین شبکه حفظ شوند. اگر این نسبت واریانس ۱٫۰ حفظ شود، گرادیان می‌تواند بدون محو شدن در نیستی یا انفجار تا بی‌نهایت، به‌طور نامحدود در شبکه به عقب جریان یابد.[1][6]

فرمول واریانس گلوروت وزن‌های اولیه را بر اساس تعداد اتصالات ورودی و خروجی یک لایه مقیاس‌بندی می‌کند.
پژوهشگران، خاویر گلوروت و یوشوا بنجیو، این گلوگاه را با در نظر گرفتن مسیرهای پیش‌رو و پس‌روی شبکه عصبی به‌عنوان یک مسئله دقیق واریانس حل کردند.

فرمول ریاضی حاصل که اکنون در سطح جهانی با نام مقداردهی اولیه خاویر یا مقداردهی اولیه گلوروت شناخته می‌شود، وزن‌های شروع را از یک توزیع یکنواخت یا نرمال با یک واریانس محاسبه‌شده و مشخص استخراج می‌کند. این روش به‌جای استفاده از اعداد کوچک دلخواه، واریانس را دقیقاً برابر با ۲ تقسیم بر مجموع گره‌های ورودی و گره‌های خروجی برای همان لایه خاص تنظیم می‌کند. این الگوریتم با مقیاس‌بندی پویای وزن‌های اولیه نسبت به عرض هندسی دقیق لایه، تضمین می‌کند که لایه‌های عریض با هزاران اتصال، شبکه را با سیگنال‌های انبوه و عظیم تحت‌الشعاع قرار ندهند.[2][5]

تحلیل‌های نقطه ثابت اخیر روی شبکه‌هایی که از توابع فعال‌سازی Tanh استفاده می‌کنند، تأیید می‌کند که این مقداردهی اولیه یک ناحیه بسیار پایدار ایجاد می‌کند که در آن گرادیان‌ها می‌توانند به‌طور مؤثری منتشر شوند. پژوهشگران با نقشه‌برداری از مرزهای دقیق این منطقه پایداری، از نظر ریاضی ثابت کرده‌اند که چرا فرمول تجربی گلوروت در توپولوژی‌های مختلف شبکه تا این حد قابل‌اعتماد عمل می‌کند. این رویکرد دقیق مکانیک آماری به مهندسان اجازه می‌دهد تا دقیقاً پیش‌بینی کنند که چه زمانی یک معماری خاص شبکه در آموزش شکست می‌خورد و در نتیجه وابستگی به آزمایش‌های پرهزینه آزمون و خطا در هنگام طراحی سیستم‌های جدید هوش مصنوعی کاهش می‌یابد.[4]

بدون مقداردهی اولیه مناسب، گرادیان‌ها در حین انتشار به عقب یا به صفر محو می‌شوند یا به‌طور نمایی منفجر می‌گردند.

اگرچه توابع فعال‌سازی جدیدتر مانند واحد خطی یکسو شده (ReLU) در نهایت به اصلاحاتی در این فرمول خاص نیاز داشتند که منجر به توسعه مقداردهی اولیه He توسط کایمینگ هه و همکارانش در سال ۲۰۱۵ شد، اصل بنیادین تطبیق واریانس که توسط گلوروت پایه‌گذاری شد، همچنان بستر اصلی یادگیری عمیق است. این درک که مقداردهی اولیه شبکه می‌تواند از طریق آمار تحلیلی به‌جای پیش‌آموزش اکتشافی حل شود، کل مسیر پژوهش‌های هوش مصنوعی را تغییر داد. این امر مستقیماً معماری‌های ۵۰ لایه‌ای ResNet و مدل‌های عظیم ترانسفورمر را که پلتفرم‌های هوش مصنوعی مولد امروزی را هدایت می‌کنند، امکان‌پذیر ساخت و ثابت کرد که اگر شرایط اولیه از نظر ریاضی منطقی باشند، شبکه‌های عمیق می‌توانند از صفر آموزش داده شوند.[2][6]

امروزه، در حالی که تکنیک‌هایی مانند نرمال‌سازی دسته‌ای و نرمال‌سازی لایه‌ای پایداری بیشتری را در طول فاز فعال آموزش فراهم می‌کنند، مقداردهی اولیه خاویر همچنان نقطه شروع پیش‌فرض در چارچوب‌های اصلی هوش مصنوعی مانند PyTorch و TensorFlow است. چالش مداوم برای طراحان سخت‌افزار و الگوریتم، حفظ این پایداری عددی دقیق در زمانی است که مدل‌ها از میلیاردها به تریلیون‌ها پارامتر گسترش می‌یابند. با حرکت صنعت به سمت معماری‌های پیچیده‌تر و غیراستاندارد، نیاز بنیادین به تعادل واریانس سیگنال از همان اولین چرخه محاسباتی، به همان اندازه سال ۲۰۱۰ حیاتی باقی مانده است.[6]

نکات کلیدی

  • مقداردهی اولیه تصادفی وزن‌ها در شبکه‌های عمیق باعث می‌شود گرادیان‌ها یا به صفر میل کنند یا به‌طور نمایی منفجر شوند.
  • مقداردهی اولیه خاویر وزن‌های شروع را بر اساس تعداد گره‌های ورودی و خروجی در هر لایه مقیاس‌بندی می‌کند.
  • این مقیاس‌بندی ریاضی تضمین می‌کند که واریانس فعال‌سازی‌ها در سراسر شبکه ثابت باقی بماند.
  • این تکنیک نیاز به پیش‌آموزش‌های پیچیده را از بین برد و عصر مدرن یادگیری عمیق را امکان‌پذیر ساخت.

اصطلاحات کلیدی

گرادیان
سیگنال خطایی که در طول آموزش محاسبه می‌شود و به شبکه عصبی می‌گوید چگونه وزن‌های خود را برای بهبود دقت تنظیم کند.
واریانس
معیاری آماری که نشان می‌دهد یک مجموعه از اعداد چقدر از مقدار میانگین خود پراکنده شده‌اند.
تابع فعال‌سازی
یک معادله ریاضی متصل به هر گره در شبکه که تعیین می‌کند آیا آن گره باید سیگنال خود را به لایه بعدی منتقل کند یا خیر و با چه قدرتی.
شبکه پیش‌خور
یک معماری استاندارد شبکه عصبی که در آن داده‌ها تنها در یک جهت، از گره‌های ورودی از طریق لایه‌های پنهان به گره‌های خروجی حرکت می‌کنند.

منابع

پوشش منابع

6 منبع

2 دیدگاه شناسایی‌شده

پژوهشگران نظری یادگیری ماشین 50%مهندسان کاربردی هوش مصنوعی 50%
  1. [1]Proceedings of Machine Learning Researchپژوهشگران نظری یادگیری ماشین

    Understanding the difficulty of training deep feedforward neural networks

    مطالعه در Proceedings of Machine Learning Research
  2. [2]Dive into Deep Learningمهندسان کاربردی هوش مصنوعی

    5.4. Numerical Stability and Initialization

    مطالعه در Dive into Deep Learning
  3. [3]Stanford Universityپژوهشگران نظری یادگیری ماشین

    Xavier Initialization and Regularization

    مطالعه در Stanford University
  4. [4]arXivپژوهشگران نظری یادگیری ماشین

    Robust Weight Initialization for Tanh Neural Networks with Fixed Point Analysis

    مطالعه در arXiv
  5. [5]Machine Learning Masteryمهندسان کاربردی هوش مصنوعی

    Weight Initialization for Deep Learning Neural Networks

    مطالعه در Machine Learning Mastery
  6. [6]تیم سردبیری کوهستانمهندسان کاربردی هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.