رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعماری مولدمقاله تشریحی· 4 دقیقه مطالعه· در هوش مصنوعی

ترفند پارامترسازی مجدد چگونه امکان پس‌انتشار در فضای پنهان رمزگذار خودکار متغیر را فراهم می‌کند؟

ترفند پارامترسازی مجدد با جداسازی نویز تصادفی از پارامترهای آموخته‌شده‌ی شبکه عصبی، به گرادیان‌های خطا اجازه می‌دهد تا در طول آموزش از گره‌های تصادفی عبور کنند. این راهکار ریاضیاتی همچنان مکانیزم بنیادینی است که آموزش رمزگذارهای خودکار متغیر (VAE) را ممکن می‌سازد.

به قلم کوروش پاکزاد

یادگیری ماشین نظری 40%مهندسی کاربردی هوش مصنوعی 40%رباتیک و کنترل 20%
یادگیری ماشین نظری
این ترفند را به عنوان یک پیشرفت بزرگ در استنتاج متغیر می‌بیند که پلی بین یادگیری عمیق و آمار بیزی ایجاد کرد.
مهندسی کاربردی هوش مصنوعی
بر پیاده‌سازی عملی این ترفند در کد تمرکز دارد تا مشتق‌گیری خودکار را در چارچوب‌هایی مانند PyTorch فعال کند.
رباتیک و کنترل
برای این مکانیزم به دلیل فراهم کردن امکان مدل‌سازی احتمالی محیط‌های نامطمئن در سیستم‌های فیزیکی ارزش قائل است.

دیدگاه‌هایی که این گزارش پوشش نداده

  • معماران سخت‌افزار که در حال بهینه‌سازی عملیات‌های تصادفی هستند

اصطلاحات کلیدی

پس‌انتشار (Backpropagation)
الگوریتمی که شبکه‌های عصبی برای یادگیری از آن استفاده می‌کنند؛ این الگوریتم محاسبه می‌کند که هر وزن داخلی چقدر در ایجاد یک خطا نقش داشته است تا بتوان آن را تنظیم کرد.
فضای پنهان (Latent Space)
یک نمایش فشرده و ریاضیاتی از داده‌ها که در آن ورودی‌های مشابه در نزدیکی یکدیگر نگاشت می‌شوند.
رمزگذار خودکار متغیر (VAE)
نوعی مدل هوش مصنوعی مولد که یاد می‌گیرد داده‌ها را به جای نقاط ثابت، در یک توزیع احتمال فشرده کند و به آن اجازه می‌دهد داده‌های جدید و مشابهی تولید کند.
توزیع نرمال استاندارد
یک توزیع احتمال کلاسیک به شکل زنگوله که مرکز آن دقیقاً روی صفر قرار دارد و واریانس آن یک است.

نکات کلیدی

  1. رمزگذارهای خودکار متغیر نیازمند نمونه‌برداری از یک توزیع تصادفی هستند، عملی که در حالت عادی محاسبات گرادیان مورد نیاز برای آموزش را مسدود می‌کند.
  2. ترفند پارامترسازی مجدد این مشکل را با تقسیم متغیر تصادفی به پارامترهای قطعی (میانگین و واریانس) و یک نویز مستقل حل می‌کند.
  3. از آنجا که نویز به عنوان یک ثابت خارجی تزریق می‌شود، شبکه می‌تواند مشتقات را برای میانگین و واریانس محاسبه کند.
  4. این تکنیک که در سال ۲۰۱۳ معرفی شد، همچنان روش استاندارد برای آموزش شبکه‌های عصبی احتمالی در چارچوب‌های مدرن هوش مصنوعی است.

در دسامبر ۲۰۱۳، پژوهشگرانی به نام‌های دیدریک پی. کینگما (Diederik P. Kingma) و مکس ولینگ (Max Welling) مقاله‌ای را در سرور پیش‌چاپ arXiv با عنوان «بیز متغیر رمزگذار خودکار» منتشر کردند. این مقاله یک راهکار ریاضیاتی را معرفی کرد که مسیر هوش مصنوعی مولد را به طور بنیادین تغییر داد. در هسته معماری آن‌ها، مکانیزمی طراحی شده بود تا یک نقص مهلک در نحوه پردازش متغیرهای تصادفی توسط شبکه‌های عصبی در طول آموزش را برطرف کند.[1]

شبکه‌های عصبی از طریق فرآیندی به نام پس‌انتشار (Backpropagation) یاد می‌گیرند. وقتی یک مدل پیش‌بینی انجام می‌دهد، الگوریتمی میزان خطا را محاسبه کرده و با استفاده از قاعده زنجیره‌ای در حساب دیفرانسیل، گرادیان‌ها را به دست می‌آورد؛ گرادیان‌ها همان جهت‌های ریاضیاتی هستند که برای تنظیم وزن‌های داخلی شبکه به آن‌ها نیاز داریم. این امر ایجاب می‌کند که هر گام در گراف محاسباتی مشتق‌پذیر باشد، به این معنی که بتوان برای آن مشتق محاسبه کرد.[7]

رمزگذارهای خودکار متغیر یا VAEها، داده‌های ورودی را در یک نمایش ریاضی به نام فضای پنهان (Latent Space) فشرده می‌کنند. برخلاف رمزگذارهای خودکار استاندارد که داده‌ها را به نقاط ثابت و صلب نگاشت می‌کنند، VAEها داده‌ها را به یک توزیع احتمال نگاشت می‌کنند. خروجی شبکه برای این توزیع، دو پارامتر مشخص است: یک میانگین و یک انحراف معیار.[3][4]

برای تولید یک خروجی جدید، مدل باید یک نقطه تصادفی را از آن توزیع خاص نمونه‌برداری کند. این کار یک «گره تصادفی» در وسط شبکه ایجاد می‌کند. همان‌طور که گرگوری گاندرسن (Gregory Gundersen)، مهندس نرم‌افزار، در تحلیل آوریل ۲۰۱۸ خود از این معماری اشاره کرد، شما نمی‌توانید مشتق یک عملیات نمونه‌برداری تصادفی را محاسبه کنید. گرادیان به گره تصادفی برخورد کرده و متوقف می‌شود؛ در نتیجه قاعده زنجیره‌ای قطع شده و شبکه نمی‌تواند وزن‌های خود را به‌روزرسانی کند.[2]

بدون پارامترسازی مجدد، گرادیان پس‌انتشار نمی‌تواند از یک عملیات نمونه‌برداری تصادفی عبور کند.

راه‌حلی که کینگما و ولینگ پیشنهاد دادند، تصادفی بودن را به صورت فیزیکی به خارج از مسیر اصلی محاسباتی منتقل می‌کند. به جای نمونه‌برداری مستقیم متغیر پنهان از توزیع آموخته‌شده، شبکه یک متغیر نویز جداگانه را از یک توزیع نرمال استاندارد نمونه‌برداری می‌کند؛ توزیعی که میانگین آن دقیقاً صفر و واریانس آن یک است.[1]

این متغیر نویز مستقل به عنوان یک ورودی خارجی عمل می‌کند. سپس شبکه این نویز را با ضرب کردن در انحراف معیار آموخته‌شده مقیاس‌دهی کرده و با افزودن میانگین آموخته‌شده، آن را جابه‌جا می‌کند. نتیجه کار، نمونه‌ای است که از نظر ریاضی کاملاً یکسان است، اما از طریق گام‌های قطعی ساخته شده است.[3][6]

سپس شبکه این نویز را با ضرب کردن در انحراف معیار آموخته‌شده مقیاس‌دهی کرده و با افزودن میانگین آموخته‌شده، آن را جابه‌جا می‌کند.

همان‌طور که اما بنجامینسون (Emma Benjaminson)، پژوهشگر رباتیک، در تشریح این مکانیزم در می ۲۰۲۰ توضیح داد، این جایگزینی ساده جبری در واقع «متغیر تصادفی را به گونه‌ای بازنویسی می‌کند که پارامترهای توزیع از بخش تصادفی جدا شوند.» با این کار، تصادفی بودن به منتهی‌الیه لبه‌ی گراف محاسباتی رانده می‌شود.

این ترفند، متغیر تصادفی را به عنوان یک معادله قطعی با ورودی نویز مستقل بازنویسی می‌کند.

از آنجا که جمع و ضرب عملیات‌های پایه‌ای و مشتق‌پذیر هستند، اکنون گرادیان می‌تواند از خروجی به سمت عقب جریان یابد، از مراحل مقیاس‌دهی و جابه‌جایی عبور کند و مستقیماً وارد گره‌های میانگین و انحراف معیار شود. متغیر نویز خارجی در طول مسیر برگشت صرفاً به عنوان یک عدد ثابت در نظر گرفته می‌شود.[4][7]

این مکانیزم مسیریابی به VAE اجازه می‌دهد تا پارامترهای خود را با استفاده از روش استاندارد کاهش گرادیان بهینه‌سازی کند، در حالی که همچنان یک فضای پنهان احتمالی را حفظ می‌کند. شبکه یاد می‌گیرد که توزیع را به گونه‌ای شکل دهد که خطای بازسازی داده‌های تولیدشده به حداقل برسد و بین دقت و همواری فضای پنهان تعادل برقرار کند.[1][3]

این تکنیک صرفاً به توزیع‌های گوسی محدود نمی‌شود. اگرچه توزیع نرمال استاندارد رایج‌ترین پیاده‌سازی در چارچوب‌هایی مانند PyTorch و TensorFlow است، اما این ترفند را می‌توان برای هر خانواده توزیع مکان-مقیاس که در آن یک متغیر بتواند به عنوان یک تبدیل قطعی از یک توزیع پایه بیان شود، به کار برد.[2][6]

با انتقال نویز به خارج از گراف اصلی، گرادیان‌ها می‌توانند آزادانه برای به‌روزرسانی وزن‌های شبکه جریان یابند.

در یک آموزش فنی در ژوئیه ۲۰۲۳، مهندس یادگیری ماشین، سناور حسین (Snawar Hussain)، نشان داد که این مفهوم چگونه به کدهای مدرن ترجمه می‌شود. یک تابع نمونه‌برداری که در حالت عادی گرادیان‌ها را مسدود می‌کند، با چند خط عملیات تنسوری جایگزین می‌شود و به موتورهای مشتق‌گیری خودکار اجازه می‌دهد تا مسیر دقیق سیگنال خطا را بدون نیاز به محاسبات دستی دیفرانسیل ردیابی کنند.[5]

تأثیر این جایگزینی ریاضی بسیار فراتر از تولید ساده تصویر است. ترفند پارامترسازی مجدد با فراهم کردن امکان آموزش پایدار مدل‌های احتمالی، زمینه را برای یادگیری بازنمایی پیشرفته، تشخیص ناهنجاری و حوزه گسترده‌تر استنتاج متغیر در یادگیری عمیق فراهم کرد.[4][6]

در حالی که مدل‌های مولد همچنان در حال گسترش و پیچیده‌تر شدن هستند، نیاز بنیادین به گراف‌های محاسباتی مشتق‌پذیر همچنان یک اصل مطلق باقی می‌ماند. راهکار سال ۲۰۱۳ گلوگاهی را برطرف کرد که در غیر این صورت شبکه‌های عصبی احتمالی را در حد پژوهش‌های نظری محبوس می‌کرد، و آن‌ها را به ابزارهای مهندسی قابل استقرار تبدیل کرد.[1][7]

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

یادگیری ماشین نظری 40%مهندسی کاربردی هوش مصنوعی 40%رباتیک و کنترل 20%
  1. [1]arXivیادگیری ماشین نظری

    Auto-Encoding Variational Bayes

    مطالعه در arXiv
  2. [2]Gregory Gundersenمهندسی کاربردی هوش مصنوعی

    The Reparameterization Trick

    مطالعه در Gregory Gundersen
  3. [3]Stats StackExchangeیادگیری ماشین نظری

    How does the reparameterization trick for VAEs work and why is it important?

    مطالعه در Stats StackExchange
  4. [4]ApX Machine Learningمهندسی کاربردی هوش مصنوعی

    The Reparameterization Trick in VAEs Explained

    مطالعه در ApX Machine Learning
  5. [5]Snawar Hussainمهندسی کاربردی هوش مصنوعی

    Understanding the Reparameterization Trick in Variational Autoencoders

    مطالعه در Snawar Hussain
  6. [6]Olewavesرباتیک و کنترل

    Variational Autoencoder (VAE) and Reparameterization Trick - Revisiting the Classic Generative Model

    مطالعه در Olewaves
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.