رفتن به محتوای اصلی
Koohestun
توضیح کوهستانشبکه‌های عصبیتشریح مکانیزم· 6 دقیقه مطالعه· در هوش مصنوعی

چگونه نرمال‌سازی دسته‌ای (Batch Normalization) همگرایی شبکه‌های عمیق را شتاب می‌بخشد

نرمال‌سازی دسته‌ای که در سال ۲۰۱۵ برای حل مشکل جابه‌جایی متغیرهای کمکی داخلی معرفی شد، به استانداردی برای آموزش شبکه‌های عصبی عمیق تبدیل گشت. تحقیقات بعدی نشان داد که قدرت واقعی آن در هموارسازی چشم‌انداز بهینه‌سازی نهفته است که امکان استفاده از نرخ‌های یادگیری بزرگ‌تر و همگرایی سریع‌تر را فراهم می‌کند.

به قلم الوین شادمهر

پژوهشگران نظری 40%مهندسان کاربردی یادگیری عمیق 40%توسعه‌دهندگان فریم‌ورک 20%
پژوهشگران نظری
تمرکز بر درک مکانیزم‌های دقیق ریاضیاتی و دینامیک چشم‌انداز زیان در شبکه‌های عصبی.
مهندسان کاربردی یادگیری عمیق
اولویت دادن به عملکرد تجربی، زمان‌های همگرایی سریع‌تر و خطوط لوله آموزشی پایدار نسبت به خلوص نظری.
توسعه‌دهندگان فریم‌ورک
تمرکز بر پیاده‌سازی کارآمد و طراحی رابط برنامه‌نویسی (API) لایه‌های نرمال‌سازی در ابزارهایی مانند TensorFlow و PyTorch.

دیدگاه‌هایی که این گزارش پوشش نداده

  • معماران شتاب‌دهنده‌های سخت‌افزاری
  • توسعه‌دهندگان رایانش مرزی (Edge Computing)

نکات کلیدی

  • نرمال‌سازی دسته‌ای یک تکنیک بنیادین در یادگیری عمیق است که در سال ۲۰۱۵ برای تثبیت و تسریع آموزش شبکه‌های عصبی معرفی شد.
  • این الگوریتم ورودی‌های یک لایه را در سراسر یک «دسته کوچک» (mini-batch) نرمال می‌کند و آن‌ها را حول میانگین صفر و واریانس یک، دوباره متمرکز می‌سازد.
  • در ابتدا تصور می‌شد که این روش با کاهش جابه‌جایی متغیرهای کمکی داخلی کار می‌کند، اما تحقیقات سال ۲۰۱۸ ثابت کرد که این مکانیزم نادرست بوده است.
  • این تکنیک در واقع با هموار کردن چشم‌انداز بهینه‌سازی عمل می‌کند و اجازه می‌دهد نرخ‌های یادگیری بزرگ‌تری بدون انفجار گرادیان اعمال شوند.
  • با وجود این اصلاح نظری، نرمال‌سازی دسته‌ای همچنان یکی از اجزای استاندارد در معماری‌های مدرن بینایی ماشین به شمار می‌رود.

در ماه مه ۲۰۱۸، تیمی از پژوهشگران موسسه فناوری ماساچوست (MIT) مقاله‌ای منتشر کردند که نظریه بنیادینِ پشت یکی از مهم‌ترین الگوریتم‌های هوش مصنوعی را اساساً زیر و رو کرد. از سال ۲۰۱۵، تکنیکی به نام «نرمال‌سازی دسته‌ای» (Batch Normalization) به ابزار استانداردی تبدیل شده بود که به مهندسان اجازه می‌داد شبکه‌های عصبی عمیق با صدها لایه را بدون فروپاشی سیستم آموزش دهند. سازندگان اولیه این روش، سرگئی ایوف (Sergey Ioffe) و کریستین سگدی (Christian Szegedy)، ادعا می‌کردند که تکنیک آن‌ها با کاهش «جابه‌جایی متغیرهای کمکی داخلی» (internal covariate shift) کار می‌کند؛ پدیده‌ای که در آن توزیع آماری داده‌ها با عبور از شبکه تغییر می‌کند. اما یافته‌های سال ۲۰۱۸ ثابت کرد که مکانیزم کار اصلاً این نبوده است.[1][3]

با وجود این دگرگونی نظری، خود این تکنیک همچنان ضروری باقی ماند. امروزه، نرمال‌سازی دسته‌ای در تقریباً تمام مدل‌های بزرگ بینایی ماشین گنجانده شده و یک لایه استاندارد در فریم‌ورک‌هایی مانند TensorFlow و PyTorch است. این روش با استانداردسازی ورودی‌های یک لایه در سراسر یک «دسته کوچک» (mini-batch) از داده‌ها عمل می‌کند؛ به این صورت که مقادیر را حول میانگین صفر دوباره متمرکز کرده و آن‌ها را به انحراف معیار یک مقیاس‌بندی می‌کند.[5][6]

برای درک اینکه چرا این عملیات ریاضی تا این حد حیاتی است، باید به مکانیک یادگیری عمیق نگاه کرد. شبکه‌های عصبی با تنظیم میلیون‌ها پارامتر - وزن‌ها و سوگیری‌ها - با استفاده از یک الگوریتم بهینه‌سازی به نام نزول گرادیان (gradient descent) یاد می‌گیرند. در طول آموزش، داده‌ها به یکباره وارد شبکه نمی‌شوند، بلکه در قطعات کوچک یا دسته‌های کوچک (mini-batches) که معمولاً شامل ۳۲ تا ۲۵۶ نمونه هستند، تغذیه می‌شوند.[6]

پیش از معرفی نرمال‌سازی دسته‌ای، آموزش شبکه‌های عمیق به شدت ناپایدار بود. اگر ورودی‌های یک لایه خاص بیش از حد بزرگ یا کوچک می‌شدند، گرادیان‌های مورد استفاده برای به‌روزرسانی وزن‌ها یا به نزدیک صفر محو می‌شدند یا تا بی‌نهایت منفجر می‌گشتند. این امر پژوهشگران را مجبور می‌کرد تا از نرخ‌های یادگیری بسیار کوچکی استفاده کنند که فرآیند آموزش را به شدت کند و از نظر محاسباتی پرهزینه می‌کرد.[1]

فرآیند نرمال‌سازی دسته‌ای، ورودی‌های لایه را پیش از اعمال پارامترهای مقیاس‌پذیری و جابه‌جاییِ قابل یادگیری، استاندارد می‌کند.

مقاله سال ۲۰۱۵ یک راه‌حل به ظاهر ساده را معرفی کرد. این الگوریتم با محاسبه میانگین و واریانسِ فعال‌سازی‌ها برای هر دسته کوچک، داده‌ها را پیش از انتقال به لایه بعدی نرمال می‌کند. نکته حیاتی این است که سپس دو پارامتر قابل یادگیری - که اغلب با گاما برای مقیاس‌بندی و بتا برای جابه‌جایی نشان داده می‌شوند - را اعمال می‌کند؛ این پارامترها به شبکه اجازه می‌دهند تا اگر مرحله نرمال‌سازی اطلاعات مفیدی را حذف کرده باشد، قدرت بازنمایی اولیه را بازیابی کند.[1][5]

همان‌طور که مستندات رسمی TensorFlow این عملیات را توضیح می‌دهد، این لایه عبارت «گاما * (دسته - میانگین(دسته)) / جذر(واریانس(دسته) + اپسیلون) + بتا» را برمی‌گرداند، که در آن اپسیلون یک ثابت بسیار کوچک است که برای جلوگیری از تقسیم بر صفر اضافه می‌شود. این تضمین می‌کند که اگر یک توزیع متفاوت پیش‌بینی‌های بهتری به همراه داشته باشد، شبکه به طور سفت و سخت مجبور به پذیرش یک توزیع نرمال استاندارد نشود.[5]

ایوف و سگدی نظریه‌پردازی کردند که این فرآیند مشکل جابه‌جایی متغیرهای کمکی داخلی را حل می‌کند. با به‌روزرسانی پارامترهای لایه‌های اولیه در طول آموزش، توزیع ورودی‌ها به لایه‌های بعدی به شدت نوسان می‌کرد. آن‌ها استدلال کردند که با وادار کردن این توزیع‌ها به پایدار ماندن، لایه‌های بعدی دیگر مجبور نخواهند بود دائماً خود را با یک هدف متحرک تطبیق دهند و در نتیجه همگرایی تسریع می‌شود.[1][6]

ایوف و سگدی نظریه‌پردازی کردند که این فرآیند مشکل جابه‌جایی متغیرهای کمکی داخلی را حل می‌کند.

این توضیح به مدت سه سال به عنوان یک اصل مسلم پذیرفته شد و ده‌ها هزار استناد دانشگاهی را به خود اختصاص داد. اما تحقیقات سال ۲۰۱۸، به رهبری شیبانی سانتورکار، دیمیتریس تسیپراس، اندرو ایلیاس و الکساندر مدری، نشان داد که نرمال‌سازی دسته‌ای در واقع جابه‌جایی متغیرهای کمکی داخلی را به هیچ وجه به شکل معناداری کاهش نمی‌دهد.[3]

در مجموعه‌ای از آزمایش‌ها، تیم MIT نشان داد که حتی اگر شما به طور مصنوعی جابه‌جایی متغیرهای کمکی شدیدی را به شبکه‌ای مجهز به نرمال‌سازی دسته‌ای تزریق کنید - با افزودن نویز تصادفی به توزیع‌ها پس از مرحله نرمال‌سازی - شبکه همچنان به سرعت و با ثبات آموزش می‌بیند. موفقیت این الگوریتم هیچ ارتباطی با تثبیت توزیع‌های ورودی نداشت.[3]

تحقیقات سال ۲۰۱۸ نشان داد که نرمال‌سازی دسته‌ای با هموار کردن چشم‌انداز بهینه‌سازی کار می‌کند، نه با کاهش جابه‌جایی متغیرهای کمکی داخلی.

در عوض، مقاله ۲۰۱۸ فاش کرد که نرمال‌سازی دسته‌ای با هموار کردن «چشم‌انداز زیان» (loss landscape) کار می‌کند. در بهینه‌سازی، چشم‌انداز زیان یک زمین ریاضیاتی است که الگوریتم برای یافتن کمترین خطای ممکن در آن حرکت می‌کند. بدون نرمال‌سازی، این زمین به شدت ناهموار و پر از صخره‌های شیب‌دار و فلات‌های مسطح است که باعث توقف یا واگرایی فرآیند آموزش می‌شود.[2][3]

این تکنیک با نرمال کردن فعال‌سازی‌ها، اساساً این چشم‌انداز را بازسازی می‌کند. این کار پیوستگی لیپشیتس (Lipschitz continuity) گرادیان‌ها را بهبود می‌بخشد، به این معنی که گرادیان‌ها با نرخی بسیار قابل پیش‌بینی‌تر و محدودتر تغییر می‌کنند. این زمین هموارتر به پژوهشگران اجازه می‌دهد تا از نرخ‌های یادگیری بسیار بزرگ‌تری استفاده کنند، بدون اینکه خطر سقوط مدل از یک صخره ریاضیاتی وجود داشته باشد.[3][4]

پیامدهای عملی این اثر هموارسازی بسیار عظیم است. بر اساس کتاب مرجع Dive into Deep Learning، نرمال‌سازی دسته‌ای دلیل اصلی این است که متخصصان اکنون می‌توانند «به طور معمول شبکه‌هایی با بیش از ۱۰۰ لایه را آموزش دهند». این روش همچنین یک اثر تنظیم‌کنندگی (regularization) تصادفی نیز به همراه دارد؛ از آنجا که میانگین و واریانس روی یک دسته کوچک تصادفی محاسبه می‌شوند، مقدار کمی نویز به فرآیند آموزش تزریق می‌شود که به جلوگیری از بیش‌برازش (overfitting) مدل روی داده‌های آموزشی کمک می‌کند.[6]

با این حال، این تکنیک بدون نقص نیست. از آنجا که نرمال‌سازی دسته‌ای به آمار دسته‌ها متکی است، زمانی که اندازه دسته کوچک بسیار کم باشد، عملکرد ضعیفی از خود نشان می‌دهد. اگر یک دسته تنها شامل یک یا دو نمونه باشد، میانگین و واریانس محاسبه شده بازنمایی‌های بسیار نادقیقی از کل مجموعه داده خواهند بود که منجر به دینامیک آموزشی ناپایدار می‌شود.[4][6]

عملیات ریاضیاتی هسته‌ای که در طول فرآیند آموزش روی هر دسته کوچک (mini-batch) اعمال می‌شود.

علاوه بر این، نرمال‌سازی دسته‌ای در طول آموزش و استنتاج (inference) رفتار متفاوتی دارد. در طول آموزش، از آمار دسته کوچک فعلی استفاده می‌کند. اما زمانی که مدل برای استنتاج جهت پیش‌بینی روی داده‌های جدید مستقر می‌شود، باید از میانگین متحرکِ میانگین و واریانس محاسبه شده در طول آموزش استفاده کند. عدم مدیریت صحیح این انتقال حالت، همچنان یکی از منابع رایج بروز باگ در خطوط لوله یادگیری ماشین است.[5]

این محدودیت‌ها منجر به توسعه تکنیک‌های جایگزینی مانند نرمال‌سازی لایه (Layer Normalization) شده است که در مدل‌های توالی مانند ترانسفورمرها ترجیح داده می‌شود. با این وجود، برای شبکه‌های عصبی کانولوشنی (CNN) و بسیاری از معماری‌های دیگر، نرمال‌سازی دسته‌ای همچنان استاندارد بلامنازع باقی مانده است و ثابت می‌کند که در هوش مصنوعی، موفقیت تجربی اغلب از درک نظری پیشی می‌گیرد.[4][7]

اصطلاحات کلیدی

جابه‌جایی متغیرهای کمکی داخلی (Internal Covariate Shift)
پدیده‌ای که در آن توزیع آماری ورودی‌ها به یک لایه شبکه عصبی با به‌روزرسانی پارامترهای لایه‌های قبلی در طول آموزش تغییر می‌کند.
چشم‌انداز زیان (Loss Landscape)
یک بازنمایی ریاضیاتی از تمام خطاهای ممکنی که یک شبکه عصبی می‌تواند مرتکب شود و الگوریتم بهینه‌سازی برای یافتن کمترین خطای ممکن در آن حرکت می‌کند.
نزول گرادیان (Gradient Descent)
الگوریتم بهینه‌سازی اصلی که برای آموزش شبکه‌های عصبی از طریق تنظیم مکرر پارامترها جهت به حداقل رساندن تابع زیان استفاده می‌شود.
پیوستگی لیپشیتس (Lipschitz Continuity)
یک ویژگی ریاضیاتی که نشان می‌دهد یک تابع (یا گرادیان‌های آن) با سرعت دلخواه و نامحدود تغییر نمی‌کند و منجر به یک چشم‌انداز بهینه‌سازی هموارتر و قابل پیش‌بینی‌تر می‌شود.
دسته کوچک (Mini-batch)
یک زیرمجموعه کوچک و تصادفی از مجموعه داده‌های آموزشی که برای محاسبه به‌روزرسانی‌های گرادیان در یک تکرار واحد استفاده می‌شود.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران نظری 40%مهندسان کاربردی یادگیری عمیق 40%توسعه‌دهندگان فریم‌ورک 20%
  1. [1]arXivپژوهشگران نظری

    Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift

    مطالعه در arXiv
  2. [2]Microsoft Researchپژوهشگران نظری

    How does Batch Normalization Help Optimization?

    مطالعه در Microsoft Research
  3. [3]arXivپژوهشگران نظری

    How Does Batch Normalization Help Optimization? (No, It Is Not About Internal Covariate Shift)

    مطالعه در arXiv
  4. [4]arXivپژوهشگران نظری

    Normalization Techniques in Training DNNs: Methodology, Analysis and Application

    مطالعه در arXiv
  5. [5]TensorFlowتوسعه‌دهندگان فریم‌ورک

    tf.keras.layers.BatchNormalization

    مطالعه در TensorFlow
  6. [6]Dive into Deep Learningمهندسان کاربردی یادگیری عمیق

    Batch Normalization

    مطالعه در Dive into Deep Learning
  7. [7]تیم سردبیری کوهستانمهندسان کاربردی یادگیری عمیق

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.