چگونه یک مولد و یک متمایزگر برای خلق خروجیهای واقعگرایانه هوش مصنوعی رقابت میکنند
شبکههای متخاصم مولد (GAN)، دو شبکه عصبی را در یک بازی ریاضی با حاصلجمع صفر در برابر هم قرار میدهند. این معماری با وادار کردن مداوم شبکه مولد به فریب دادن شبکه متمایزگر، دادههای مصنوعی بسیار واقعگرایانهای تولید میکند، بدون اینکه نیازی به برنامهنویسی صریح انسانی داشته باشد.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- طرفداران معماری متخاصم
- استدلال میکنند که بازی مینیماکس کارآمدترین استنتاج تکمرحلهای را برای وظایف مولد درنگزمان (real-time) فراهم میکند.
- محققان کارایی داده
- بر اصلاح متمایزگر برای یادگیری از نمونههای برچسبدار کمتر تمرکز میکنند و نیازهای عظیم دادهای مدلهای استاندارد را کاهش میدهند.
- مربیان کاربردی یادگیری ماشین
- بر ظرافت مفهومی تشبیه جاعل-پلیس تأکید میکنند، در حالی که به متخصصان در مورد بیثباتی شدید و خطرات فروپاشی حالت در طول آموزش هشدار میدهند.
دیدگاههایی که این گزارش پوشش نداده
- هنرمندان و خالقانی که آثار دارای حق نشر آنها اغلب بدون رضایت در دادههای آموزشی گنجانده میشود.
- متخصصان امنیت سایبری که در برابر دیپفیکهای تولید شده توسط GAN دفاع میکنند.
شبکه مولد یک جعل انجام میدهد؛ شبکه متمایزگر تلاش میکند مچ آن را بگیرد. در سال ۲۰۱۴، ایان گودفلو (Ian Goodfellow) و همکارانش در دانشگاه مونترال این پویایی را در چارچوبی به نام شبکههای متخاصم مولد (GAN) فرمولبندی کردند. آنها به جای آموزش یک شبکه عصبی واحد برای درک یک مجموعه داده، دو شبکه ساختند و آنها را مجبور به مبارزه کردند. گودفلو در مقاله بنیادین سال ۲۰۱۴ نوشت: «ما چارچوب جدیدی را برای تخمین مدلهای مولد از طریق یک فرآیند متخاصم پیشنهاد میکنیم.» او سیستمی را توصیف کرد که در آن یک مدل توزیع دادهها را به دست میآورد، در حالی که مدل دیگر احتمال اینکه یک نمونه از دادههای آموزشی آمده باشد نه از شبکه مولد را تخمین میزند.[1]
این معماری به عنوان یک بازی دونفره مینیماکس (minimax) عمل میکند. شبکه اول، یعنی مولد، با برداری از اعداد تصادفی - اغلب یک بردار نویز ۱۰۰ بعدی - شروع میکند و آن را از نظر ریاضی به یک خروجی مصنوعی، مانند یک تصویر، تبدیل میکند. شبکه دوم، یعنی متمایزگر، هم خروجی مصنوعی مولد و هم نمونههای واقعی را از یک مجموعه داده آموزشی دریافت میکند. تنها هدف آن طبقهبندی این است که کدام واقعی و کدام جعلی است، و احتمالی بین ۰ و ۱ را خروجی میدهد.[1][4]
مقاله سال ۲۰۱۴ در arXiv توضیح میدهد: «مدل مولد را میتوان مشابه تیمی از جاعلان در نظر گرفت که سعی در تولید ارز تقلبی و استفاده از آن بدون شناسایی دارند، در حالی که مدل متمایزگر مشابه پلیس است که سعی در کشف ارز تقلبی دارد.» رقابت، هر دو تیم را سوق میدهد تا روشهای خود را تا زمانی که نمونههای تقلبی از نمونههای اصلی غیرقابل تشخیص شوند، بهبود بخشند.[1]
در طول فرآیند آموزش، شبکهها وزنهای خود را با استفاده از پسانتشار (backpropagation) بهروز میکنند، اما اهداف آنها کاملاً متضاد است. متمایزگر به دنبال به حداکثر رساندن دقت خود است و نرخ خطای خود را به سمت ۰٪ سوق میدهد. به طور همزمان، مولد به دنبال به حداکثر رساندن نرخ خطای متمایزگر است. اگر متمایزگر به درستی یک تصویر جعلی را شناسایی کند، مولد جریمه میشود و پارامترهای داخلی خود را تنظیم میکند تا در تکرار بعدی، جعل قانعکنندهتری تولید کند.[4][6]
این پویایی با حاصلجمع صفر نیازمند تعادلی ظریف است. بر اساس یک بررسی در سال ۲۰۲۴ که در MDPI با تمرکز بر وظایف بینایی ماشین منتشر شد، اگر متمایزگر خیلی سریع بیش از حد دقیق شود، هیچ بازخورد مفیدی به مولد ارائه نمیدهد. در این حالت گرادیان ریاضی محو میشود و یادگیری مولد متوقف میگردد. برعکس، اگر مولد بر متمایزگر غلبه کند، میتواند دچار «فروپاشی حالت» (mode collapse) شود، جایی که تنها یک خروجی قانعکننده را کشف میکند و آن را بیوقفه تولید میکند و تنوع مجموعه داده اصلی را نادیده میگیرد.[2]
برای تثبیت این آموزش، محققان از سال ۲۰۱۴ تغییرات معماری متعددی را توسعه دادهاند. شبکه DCGAN (شبکه متخاصم مولد کانولوشنال عمیق) که در سال ۲۰۱۵ معرفی شد، لایههای کانولوشنال را جایگزین شبکههای عصبی کاملاً متصل کرد و سنتز تصویر را به طرز چشمگیری بهبود بخشید. تا سال ۲۰۱۸، محققان انویدیا (NVIDIA) مدل StyleGAN را معرفی کردند که با تزریق نویز در مقیاسهای مختلف، امکان کنترل بیسابقهای بر تصاویر تولید شده را فراهم کرد و منجر به خلق چهرههای انسانی فوقواقعگرایانهای شد که در واقعیت وجود ندارند.[2][7]
برای تثبیت این آموزش، محققان از سال ۲۰۱۴ تغییرات معماری متعددی را توسعه دادهاند.
نیازهای دادهای برای این مدلها عظیم است. یک GAN استاندارد ممکن است به بیش از ۱۰۰,۰۰۰ تصویر برچسبدار برای یادگیری یک توزیع پیچیده نیاز داشته باشد. با این حال، در مارس ۲۰۱۹، محققان هوش مصنوعی گوگل یافتههایی را در مورد کاهش نیاز به دادههای برچسبدار منتشر کردند. وبلاگ هوش مصنوعی گوگل با برجسته کردن تکنیکهایی مانند یادگیری خودنظارتی برای بهبود قابلیتهای استخراج ویژگی متمایزگر، گزارش داد: «ما نشان میدهیم که میتوان با استفاده از تنها ۱۰٪ از برچسبها، با عملکرد یک GAN استاندارد آموزش دیده روی کل مجموعه داده ImageNet برابری کرد.»[3]
جیسون براونلی (Jason Brownlee)، در مقالهای برای MachineLearningMastery در ژوئن ۲۰۱۹، تأکید کرد که مولد مستقیماً دادههای آموزشی را مشاهده نمیکند. براونلی خاطرنشان کرد: «مولد هرگز نمونههایی از دامنه را نمیبیند. تنها اطلاعاتی که دریافت میکند، گرادیان خروجی متمایزگر نسبت به نمونههای تولید شده خودش است.» این یادگیری غیرمستقیم، مولد را مجبور میکند تا فضای پنهان (latent space) - یک نمایش ریاضی فشرده از دادهها - را صرفاً از طریق آزمون و خطا با هدایت بازخورد متمایزگر نگاشت کند.[6]
موسسه هوش مصنوعی انسانمحور استنفورد (HAI) خاطرنشان میکند که GANها در دامنههایی که تعریف ریاضی تابع هدف دشوار است، برتری دارند. به عنوان مثال، تعریف دقیق مقادیر پیکسلی که باعث میشود یک تصویر شبیه یک «گربه» به نظر برسد، برای یک برنامهنویس انسانی تقریباً غیرممکن است. با واگذاری این ارزیابی به متمایزگر، GAN قوانین ضمنی مجموعه داده را به طور مستقل یاد میگیرد.[5]
فراتر از تولید تصویر، این چارچوب متخاصم در کشف دارو، سنتز صدا و افزایش دادهها (data augmentation) به کار گرفته شده است. در تصویربرداری پزشکی، جایی که قوانین حفظ حریم خصوصی بیماران به اشتراکگذاری اشعه ایکس یا اسکنهای MRI واقعی را محدود میکند، GANها میتوانند مجموعهدادههای مصنوعی تولید کنند که ویژگیهای آماری دادههای اصلی را بدون افشای اطلاعات حساس حفظ میکنند. یک مطالعه در سال ۲۰۲۱ نشان داد که تصاویر پزشکی مصنوعی تولید شده توسط GANها میتوانند مدلهای تشخیصی را با افت دقت کمتر از ۵٪ در مقایسه با مدلهای آموزش دیده روی دادههای واقعی بیماران، آموزش دهند.[2][7]
با وجود قدرت بالا، آموزش GANها به طرز مشهوری دشوار است. کتاب درسی «شیرجه در یادگیری عمیق» (D2L) تأکید میکند که بهینهسازی GANها یک مسئله غیرمحدب (non-convex) است. برخلاف شبکههای عصبی استاندارد که برای یافتن یک نقطه حداقل در یک چشمانداز خطای واحد پایین میروند، GANها نیازمند یافتن یک تعادل نش در یک فضای با ابعاد بالا هستند، جایی که احتمال خروجی متمایزگر برای همه ورودیها دقیقاً به ۰.۵ میرسد. اگر نرخهای یادگیری دو شبکه کاملاً هماهنگ نباشند، سیستم به شدت نوسان میکند و به جای خروجیهای منسجم، نویز بصری تولید میکند.[4]
ظهور مدلهای انتشار (diffusion models) در سال ۲۰۲۲ - معماری پشت سیستمهایی مانند Midjourney و DALL-E - تا حد زیادی GANها را برای تولید تصویر از متن تحتالشعاع قرار داده است. مدلهای انتشار، که با حذف تدریجی نویز از یک تصویر یاد میگیرند، آموزش پایدارتر و پوشش حالت بهتری را ارائه میدهند. با این حال، GANها همچنان در سرعت استنتاج برتری دارند. از آنجایی که یک مولد GAN تصویر را در یک عبور رو به جلو (forward pass) تولید میکند، میتواند خروجیها را در چند میلیثانیه ایجاد کند، در حالی که مدلهای انتشار به دهها مرحله تکراری نیاز دارند.[7][8]
این مزیت سرعت، تداوم ارتباط چارچوب متخاصم را در کاربردهای درنگزمان (real-time)، مانند رندر بازیهای ویدیویی و ترجمه زنده ویدیو تضمین میکند. بینش بنیادین معماری سال ۲۰۱۴ - مبنی بر اینکه دو شبکه رقیب میتوانند به یکدیگر مدلسازی واقعیت پیچیده را آموزش دهند - همچنان یکی از مهمترین پیشرفتهای مفهومی در تاریخ یادگیری ماشین باقی مانده است.[1][8]
نکات کلیدی
- شبکههای متخاصم مولد (GAN) از دو شبکه عصبی رقیب تشکیل شدهاند: یک مولد (Generator) و یک متمایزگر (Discriminator).
- شبکه مولد دادههای مصنوعی میسازد، در حالی که شبکه متمایزگر تلاش میکند این دادههای مصنوعی را از نمونههای واقعی تشخیص دهد.
- آموزش این شبکهها نیازمند ایجاد تعادل در نرخ یادگیری هر دو شبکه برای رسیدن به تعادل نش (Nash equilibrium) است.
- اگرچه مدلهای انتشار (Diffusion) تا حد زیادی جایگزین GANها برای تولید تصویر از متن شدهاند، اما GANها همچنان برای استنتاجهای پرسرعت و درنگزمان (Real-time) برتری دارند.
اصطلاحات کلیدی
- شبکه متخاصم مولد (GAN)
- یک چارچوب یادگیری ماشین که در آن دو شبکه عصبی با یکدیگر رقابت میکنند تا نمونههای جدید و مصنوعی از دادهها تولید کنند که بتوانند به عنوان دادههای واقعی پذیرفته شوند.
- مولد
- شبکه عصبی در یک GAN که مسئول ایجاد خروجیهای داده مصنوعی از نویز تصادفی است.
- متمایزگر
- شبکه عصبی در یک GAN که مسئول تشخیص بین دادههای واقعی از مجموعه آموزشی و دادههای جعلی تولید شده توسط مولد است.
- فروپاشی حالت
- یک وضعیت شکست در آموزش GAN که در آن مولد تنوع بسیار محدودی از خروجیها را تولید میکند زیرا ترفند خاصی برای فریب متمایزگر پیدا کرده است.
- بازی مینیماکس
- یک چارچوب تصمیمگیری که در آن یک بازیکن سعی میکند حداکثر ضرر ممکن را به حداقل برساند، که به طور کامل اهداف متضاد مولد و متمایزگر را توصیف میکند.
منابع
[1]arXivطرفداران معماری متخاصمGenerative Adversarial Networks
مطالعه در arXiv →
[2]MDPIطرفداران معماری متخاصمA Review of Generative Adversarial Networks for Computer Vision Tasks
مطالعه در MDPI →
[3]Google AI Blogمحققان کارایی دادهReducing the Need for Labeled Data in Generative Adversarial Networks
مطالعه در Google AI Blog →
[4]Dive into Deep Learningطرفداران معماری متخاصم20.1. Generative Adversarial Networks
مطالعه در Dive into Deep Learning →
[5]Stanford HAIمربیان کاربردی یادگیری ماشینWhat are Generative Adversarial Networks (GANs)?
مطالعه در Stanford HAI →
[6]MachineLearningMastery.comمربیان کاربردی یادگیری ماشینA Gentle Introduction to Generative Adversarial Networks (GANs)
مطالعه در MachineLearningMastery.com →
[7]Wikipediaمربیان کاربردی یادگیری ماشینGenerative adversarial network
مطالعه در Wikipedia →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →عملیات نفوذ سایبری
گزارش نیویورکتایمز: استفاده ایران، چین و شرکتهای اسرائیلی از ایجنتهای هوش مصنوعی برای عملیات نفوذ خودکار
4 منبع
معماری عامل
مرز معماری میان عاملهای واکنشی ساده و مبتنی بر مدل
9 منبع
معماری سیستمها
انواع عوامل هوش مصنوعی (AI Agents) و کاربردهای آنها در دنیای واقعی
3 منبع
AI Architecture
هوش مصنوعی عامل (AI Agent) چیست؟ تفاوت آن با مدلهای زبانی استاندارد
4 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





