رفتن به محتوای اصلی
Koohestun
توضیح کوهستانشبکه‌های متخاصم مولدمقاله تشریحی· 6 دقیقه مطالعه· در هوش مصنوعی

چگونه یک مولد و یک متمایزگر برای خلق خروجی‌های واقع‌گرایانه هوش مصنوعی رقابت می‌کنند

شبکه‌های متخاصم مولد (GAN)، دو شبکه عصبی را در یک بازی ریاضی با حاصل‌جمع صفر در برابر هم قرار می‌دهند. این معماری با وادار کردن مداوم شبکه مولد به فریب دادن شبکه متمایزگر، داده‌های مصنوعی بسیار واقع‌گرایانه‌ای تولید می‌کند، بدون اینکه نیازی به برنامه‌نویسی صریح انسانی داشته باشد.

به قلم آرش رضایی

طرفداران معماری متخاصم 40%محققان کارایی داده 30%مربیان کاربردی یادگیری ماشین 30%
طرفداران معماری متخاصم
استدلال می‌کنند که بازی مینی‌ماکس کارآمدترین استنتاج تک‌مرحله‌ای را برای وظایف مولد درنگ‌زمان (real-time) فراهم می‌کند.
محققان کارایی داده
بر اصلاح متمایزگر برای یادگیری از نمونه‌های برچسب‌دار کمتر تمرکز می‌کنند و نیازهای عظیم داده‌ای مدل‌های استاندارد را کاهش می‌دهند.
مربیان کاربردی یادگیری ماشین
بر ظرافت مفهومی تشبیه جاعل-پلیس تأکید می‌کنند، در حالی که به متخصصان در مورد بی‌ثباتی شدید و خطرات فروپاشی حالت در طول آموزش هشدار می‌دهند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • هنرمندان و خالقانی که آثار دارای حق نشر آن‌ها اغلب بدون رضایت در داده‌های آموزشی گنجانده می‌شود.
  • متخصصان امنیت سایبری که در برابر دیپ‌فیک‌های تولید شده توسط GAN دفاع می‌کنند.

شبکه مولد یک جعل انجام می‌دهد؛ شبکه متمایزگر تلاش می‌کند مچ آن را بگیرد. در سال ۲۰۱۴، ایان گودفلو (Ian Goodfellow) و همکارانش در دانشگاه مونترال این پویایی را در چارچوبی به نام شبکه‌های متخاصم مولد (GAN) فرمول‌بندی کردند. آن‌ها به جای آموزش یک شبکه عصبی واحد برای درک یک مجموعه داده، دو شبکه ساختند و آن‌ها را مجبور به مبارزه کردند. گودفلو در مقاله بنیادین سال ۲۰۱۴ نوشت: «ما چارچوب جدیدی را برای تخمین مدل‌های مولد از طریق یک فرآیند متخاصم پیشنهاد می‌کنیم.» او سیستمی را توصیف کرد که در آن یک مدل توزیع داده‌ها را به دست می‌آورد، در حالی که مدل دیگر احتمال اینکه یک نمونه از داده‌های آموزشی آمده باشد نه از شبکه مولد را تخمین می‌زند.[1]

این معماری به عنوان یک بازی دونفره مینی‌ماکس (minimax) عمل می‌کند. شبکه اول، یعنی مولد، با برداری از اعداد تصادفی - اغلب یک بردار نویز ۱۰۰ بعدی - شروع می‌کند و آن را از نظر ریاضی به یک خروجی مصنوعی، مانند یک تصویر، تبدیل می‌کند. شبکه دوم، یعنی متمایزگر، هم خروجی مصنوعی مولد و هم نمونه‌های واقعی را از یک مجموعه داده آموزشی دریافت می‌کند. تنها هدف آن طبقه‌بندی این است که کدام واقعی و کدام جعلی است، و احتمالی بین ۰ و ۱ را خروجی می‌دهد.[1][4]

مقاله سال ۲۰۱۴ در arXiv توضیح می‌دهد: «مدل مولد را می‌توان مشابه تیمی از جاعلان در نظر گرفت که سعی در تولید ارز تقلبی و استفاده از آن بدون شناسایی دارند، در حالی که مدل متمایزگر مشابه پلیس است که سعی در کشف ارز تقلبی دارد.» رقابت، هر دو تیم را سوق می‌دهد تا روش‌های خود را تا زمانی که نمونه‌های تقلبی از نمونه‌های اصلی غیرقابل تشخیص شوند، بهبود بخشند.[1]

شبکه مولد نویز تصادفی را به داده‌های مصنوعی نگاشت می‌کند، در حالی که شبکه متمایزگر تلاش می‌کند آن را در برابر نمونه‌های واقعی طبقه‌بندی کند.

در طول فرآیند آموزش، شبکه‌ها وزن‌های خود را با استفاده از پس‌انتشار (backpropagation) به‌روز می‌کنند، اما اهداف آن‌ها کاملاً متضاد است. متمایزگر به دنبال به حداکثر رساندن دقت خود است و نرخ خطای خود را به سمت ۰٪ سوق می‌دهد. به طور همزمان، مولد به دنبال به حداکثر رساندن نرخ خطای متمایزگر است. اگر متمایزگر به درستی یک تصویر جعلی را شناسایی کند، مولد جریمه می‌شود و پارامترهای داخلی خود را تنظیم می‌کند تا در تکرار بعدی، جعل قانع‌کننده‌تری تولید کند.[4][6]

این پویایی با حاصل‌جمع صفر نیازمند تعادلی ظریف است. بر اساس یک بررسی در سال ۲۰۲۴ که در MDPI با تمرکز بر وظایف بینایی ماشین منتشر شد، اگر متمایزگر خیلی سریع بیش از حد دقیق شود، هیچ بازخورد مفیدی به مولد ارائه نمی‌دهد. در این حالت گرادیان ریاضی محو می‌شود و یادگیری مولد متوقف می‌گردد. برعکس، اگر مولد بر متمایزگر غلبه کند، می‌تواند دچار «فروپاشی حالت» (mode collapse) شود، جایی که تنها یک خروجی قانع‌کننده را کشف می‌کند و آن را بی‌وقفه تولید می‌کند و تنوع مجموعه داده اصلی را نادیده می‌گیرد.[2]

برای تثبیت این آموزش، محققان از سال ۲۰۱۴ تغییرات معماری متعددی را توسعه داده‌اند. شبکه DCGAN (شبکه متخاصم مولد کانولوشنال عمیق) که در سال ۲۰۱۵ معرفی شد، لایه‌های کانولوشنال را جایگزین شبکه‌های عصبی کاملاً متصل کرد و سنتز تصویر را به طرز چشمگیری بهبود بخشید. تا سال ۲۰۱۸، محققان انویدیا (NVIDIA) مدل StyleGAN را معرفی کردند که با تزریق نویز در مقیاس‌های مختلف، امکان کنترل بی‌سابقه‌ای بر تصاویر تولید شده را فراهم کرد و منجر به خلق چهره‌های انسانی فوق‌واقع‌گرایانه‌ای شد که در واقعیت وجود ندارند.[2][7]

برای تثبیت این آموزش، محققان از سال ۲۰۱۴ تغییرات معماری متعددی را توسعه داده‌اند.

نیازهای داده‌ای برای این مدل‌ها عظیم است. یک GAN استاندارد ممکن است به بیش از ۱۰۰,۰۰۰ تصویر برچسب‌دار برای یادگیری یک توزیع پیچیده نیاز داشته باشد. با این حال، در مارس ۲۰۱۹، محققان هوش مصنوعی گوگل یافته‌هایی را در مورد کاهش نیاز به داده‌های برچسب‌دار منتشر کردند. وبلاگ هوش مصنوعی گوگل با برجسته کردن تکنیک‌هایی مانند یادگیری خودنظارتی برای بهبود قابلیت‌های استخراج ویژگی متمایزگر، گزارش داد: «ما نشان می‌دهیم که می‌توان با استفاده از تنها ۱۰٪ از برچسب‌ها، با عملکرد یک GAN استاندارد آموزش دیده روی کل مجموعه داده ImageNet برابری کرد.»[3]

آموزش موفقیت‌آمیز GAN مستلزم آن است که هر دو شبکه بدون غلبه یکی بر دیگری، به تعادل نش برسند.

جیسون براونلی (Jason Brownlee)، در مقاله‌ای برای MachineLearningMastery در ژوئن ۲۰۱۹، تأکید کرد که مولد مستقیماً داده‌های آموزشی را مشاهده نمی‌کند. براونلی خاطرنشان کرد: «مولد هرگز نمونه‌هایی از دامنه را نمی‌بیند. تنها اطلاعاتی که دریافت می‌کند، گرادیان خروجی متمایزگر نسبت به نمونه‌های تولید شده خودش است.» این یادگیری غیرمستقیم، مولد را مجبور می‌کند تا فضای پنهان (latent space) - یک نمایش ریاضی فشرده از داده‌ها - را صرفاً از طریق آزمون و خطا با هدایت بازخورد متمایزگر نگاشت کند.[6]

موسسه هوش مصنوعی انسان‌محور استنفورد (HAI) خاطرنشان می‌کند که GANها در دامنه‌هایی که تعریف ریاضی تابع هدف دشوار است، برتری دارند. به عنوان مثال، تعریف دقیق مقادیر پیکسلی که باعث می‌شود یک تصویر شبیه یک «گربه» به نظر برسد، برای یک برنامه‌نویس انسانی تقریباً غیرممکن است. با واگذاری این ارزیابی به متمایزگر، GAN قوانین ضمنی مجموعه داده را به طور مستقل یاد می‌گیرد.[5]

فراتر از تولید تصویر، این چارچوب متخاصم در کشف دارو، سنتز صدا و افزایش داده‌ها (data augmentation) به کار گرفته شده است. در تصویربرداری پزشکی، جایی که قوانین حفظ حریم خصوصی بیماران به اشتراک‌گذاری اشعه ایکس یا اسکن‌های MRI واقعی را محدود می‌کند، GANها می‌توانند مجموعه‌داده‌های مصنوعی تولید کنند که ویژگی‌های آماری داده‌های اصلی را بدون افشای اطلاعات حساس حفظ می‌کنند. یک مطالعه در سال ۲۰۲۱ نشان داد که تصاویر پزشکی مصنوعی تولید شده توسط GANها می‌توانند مدل‌های تشخیصی را با افت دقت کمتر از ۵٪ در مقایسه با مدل‌های آموزش دیده روی داده‌های واقعی بیماران، آموزش دهند.[2][7]

با وجود قدرت بالا، آموزش GANها به طرز مشهوری دشوار است. کتاب درسی «شیرجه در یادگیری عمیق» (D2L) تأکید می‌کند که بهینه‌سازی GANها یک مسئله غیرمحدب (non-convex) است. برخلاف شبکه‌های عصبی استاندارد که برای یافتن یک نقطه حداقل در یک چشم‌انداز خطای واحد پایین می‌روند، GANها نیازمند یافتن یک تعادل نش در یک فضای با ابعاد بالا هستند، جایی که احتمال خروجی متمایزگر برای همه ورودی‌ها دقیقاً به ۰.۵ می‌رسد. اگر نرخ‌های یادگیری دو شبکه کاملاً هماهنگ نباشند، سیستم به شدت نوسان می‌کند و به جای خروجی‌های منسجم، نویز بصری تولید می‌کند.[4]

آموزش شبکه‌های متخاصم برای پردازش صدها هزار تصویر برچسب‌دار، به قدرت محاسباتی عظیمی نیاز دارد.

ظهور مدل‌های انتشار (diffusion models) در سال ۲۰۲۲ - معماری پشت سیستم‌هایی مانند Midjourney و DALL-E - تا حد زیادی GANها را برای تولید تصویر از متن تحت‌الشعاع قرار داده است. مدل‌های انتشار، که با حذف تدریجی نویز از یک تصویر یاد می‌گیرند، آموزش پایدارتر و پوشش حالت بهتری را ارائه می‌دهند. با این حال، GANها همچنان در سرعت استنتاج برتری دارند. از آنجایی که یک مولد GAN تصویر را در یک عبور رو به جلو (forward pass) تولید می‌کند، می‌تواند خروجی‌ها را در چند میلی‌ثانیه ایجاد کند، در حالی که مدل‌های انتشار به ده‌ها مرحله تکراری نیاز دارند.[7][8]

این مزیت سرعت، تداوم ارتباط چارچوب متخاصم را در کاربردهای درنگ‌زمان (real-time)، مانند رندر بازی‌های ویدیویی و ترجمه زنده ویدیو تضمین می‌کند. بینش بنیادین معماری سال ۲۰۱۴ - مبنی بر اینکه دو شبکه رقیب می‌توانند به یکدیگر مدل‌سازی واقعیت پیچیده را آموزش دهند - همچنان یکی از مهم‌ترین پیشرفت‌های مفهومی در تاریخ یادگیری ماشین باقی مانده است.[1][8]

نکات کلیدی

  1. شبکه‌های متخاصم مولد (GAN) از دو شبکه عصبی رقیب تشکیل شده‌اند: یک مولد (Generator) و یک متمایزگر (Discriminator).
  2. شبکه مولد داده‌های مصنوعی می‌سازد، در حالی که شبکه متمایزگر تلاش می‌کند این داده‌های مصنوعی را از نمونه‌های واقعی تشخیص دهد.
  3. آموزش این شبکه‌ها نیازمند ایجاد تعادل در نرخ یادگیری هر دو شبکه برای رسیدن به تعادل نش (Nash equilibrium) است.
  4. اگرچه مدل‌های انتشار (Diffusion) تا حد زیادی جایگزین GANها برای تولید تصویر از متن شده‌اند، اما GANها همچنان برای استنتاج‌های پرسرعت و درنگ‌زمان (Real-time) برتری دارند.

اصطلاحات کلیدی

شبکه متخاصم مولد (GAN)
یک چارچوب یادگیری ماشین که در آن دو شبکه عصبی با یکدیگر رقابت می‌کنند تا نمونه‌های جدید و مصنوعی از داده‌ها تولید کنند که بتوانند به عنوان داده‌های واقعی پذیرفته شوند.
مولد
شبکه عصبی در یک GAN که مسئول ایجاد خروجی‌های داده مصنوعی از نویز تصادفی است.
متمایزگر
شبکه عصبی در یک GAN که مسئول تشخیص بین داده‌های واقعی از مجموعه آموزشی و داده‌های جعلی تولید شده توسط مولد است.
فروپاشی حالت
یک وضعیت شکست در آموزش GAN که در آن مولد تنوع بسیار محدودی از خروجی‌ها را تولید می‌کند زیرا ترفند خاصی برای فریب متمایزگر پیدا کرده است.
بازی مینی‌ماکس
یک چارچوب تصمیم‌گیری که در آن یک بازیکن سعی می‌کند حداکثر ضرر ممکن را به حداقل برساند، که به طور کامل اهداف متضاد مولد و متمایزگر را توصیف می‌کند.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

طرفداران معماری متخاصم 40%محققان کارایی داده 30%مربیان کاربردی یادگیری ماشین 30%
  1. [1]arXivطرفداران معماری متخاصم

    Generative Adversarial Networks

    مطالعه در arXiv
  2. [2]MDPIطرفداران معماری متخاصم

    A Review of Generative Adversarial Networks for Computer Vision Tasks

    مطالعه در MDPI
  3. [3]Google AI Blogمحققان کارایی داده

    Reducing the Need for Labeled Data in Generative Adversarial Networks

    مطالعه در Google AI Blog
  4. [4]Dive into Deep Learningطرفداران معماری متخاصم

    20.1. Generative Adversarial Networks

    مطالعه در Dive into Deep Learning
  5. [5]Stanford HAIمربیان کاربردی یادگیری ماشین

    What are Generative Adversarial Networks (GANs)?

    مطالعه در Stanford HAI
  6. [6]MachineLearningMastery.comمربیان کاربردی یادگیری ماشین

    A Gentle Introduction to Generative Adversarial Networks (GANs)

    مطالعه در MachineLearningMastery.com
  7. [7]Wikipediaمربیان کاربردی یادگیری ماشین

    Generative adversarial network

    مطالعه در Wikipedia
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.