سازوکار مدلهای انتشار (Diffusion): نویز، فضای نهفته و شبکههای U-Net چگونه تصاویر باکیفیت تولید میکنند؟
تولید تصویر توسط هوش مصنوعی مدرن متکی بر فرآیندی به نام «انتشار» (Diffusion) است که یاد میگیرد با حذف سیستماتیک نویز دیجیتال، تصاویر فوتورئالیستی خلق کند. این مدلها با فعالیت در یک قلمرو ریاضی فشرده به نام «فضای نهفته» (Latent Space)، میتوانند به جای ابررایانههای عظیم، روی سختافزار مصرفکننده اجرا شوند.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- محققان الگوریتمی
- پایداری ریاضی و مقیاسپذیری هدف انتشار را ارزشمند میدانند.
- مهندسان هوش مصنوعی کاربردی
- بر دستاوردهای کارایی و دسترسی سختافزاری که توسط فضای نهفته فراهم شده، تمرکز دارند.
کاربر عبارت «یک شهر آیندهنگر در غروب آفتاب» را تایپ کرده و دکمه اینتر را میزند. پشت صحنه، سیستم نه به دنبال جستجو در پایگاه داده یا کلاژ کردن عکسهای موجود است؛ بلکه کار خود را با یک بوم از نویز دیجیتال کاملاً تصادفی (مانند برفک تلویزیون) آغاز میکند. طی چند ثانیه بعد، این نویز به صورت سیستماتیک، پیکسل به پیکسل، تراشیده میشود تا یک خط افق فوتورئالیستی پدیدار گردد.[7]
این فرآیند توسط مدلهای انتشار (Diffusion Models) هدایت میشود، معماریای که سیستمهایی مانند میدجرنی (Midjourney)، دال-ای (DALL-E) و استیبل دیفیوژن (Stable Diffusion) را قدرت میبخشد. برای درک نحوه عملکرد آنها، باید فراتر از فرمان متنی (prompt) نگاه کرد و ریاضیات زیربنایی الهام گرفته از فیزیک را بررسی نمود.[7]
مفهوم اصلی از ترمودینامیک غیرتعادلی وام گرفته شده است. در فیزیک، انتشار توصیف میکند که چگونه یک قطره جوهر به آرامی در یک لیوان آب پخش میشود تا زمانی که آب به طور یکنواخت خاکستری شود. اطلاعات—یعنی شکل متمایز قطره جوهر—توسط آنتروپی از بین میرود.[1]
محققان هوش مصنوعی دریافتند که اگر بتوانند این تخریب اطلاعات را به صورت ریاضی مدلسازی کنند، میتوانند یک شبکه عصبی را برای معکوس کردن آن آموزش دهند. این اساس مدل احتمالی انتشار رفع نویز (DDPM) است.[1]
فرآیند آموزش با فاز «انتشار رو به جلو» (Forward Diffusion) آغاز میشود. سیستم یک تصویر تمیز و با وضوح بالا را میگیرد و به تدریج طی صدها یا هزاران مرحله، نویز گوسی (Gaussian noise) به آن اضافه میکند. در مرحله نهایی، تصویر اصلی کاملاً محو شده و تنها نویز تصادفی باقی میماند.[1]
از آنجا که سیستم این فرآیند رو به جلو را کنترل میکند، دقیقاً میداند که در هر مرحله خاص چه مقدار نویز اضافه شده است. این امر یک مجموعه داده آموزشی عالی برای فرآیند معکوس ایجاد میکند و به مدل میآموزد که نویز در مراحل مختلف تخریب چگونه به نظر میرسد.[1]
فاز «انتشار معکوس» (Reverse Diffusion) جایی است که تولید واقعی رخ میدهد. یک فریم نویز خالص به مدل داده میشود و از آن خواسته میشود نویزی را که در آخرین مرحله فرآیند رو به جلو اضافه شده بود، پیشبینی کند. مدل آن نویز پیشبینی شده را کم میکند و یک گام به تصویر تمیز نزدیکتر میشود.[1]
تکرار این عمل تفریق برای صدها بار به تدریج یک تصویر منسجم را آشکار میسازد. اما پیشبینی الگوی دقیق نویز در میلیونها پیکسل، نیازمند یک معماری شبکه عصبی بسیار تخصصی است که به نام «یو-نت» (U-Net) شناخته میشود.[3]
شبکههای U-Net که در اصل برای بخشبندی تصاویر زیستپزشکی توسعه یافته بودند، نام خود را از معماری U شکل خود گرفتهاند. این شبکه ابتدا تصویر را «نمونهبرداری کاهشی» (downsamples) میکند و آن را به یک نمایش کوچکتر و متراکمتر فشرده میسازد تا زمینه کلی—مانند شکل کلی یک چهره یا ساختمان—را درک کند.[3]
شبکههای U-Net که در اصل برای بخشبندی تصاویر زیستپزشکی توسعه یافته بودند، نام خود را از معماری U شکل خود گرفتهاند.
سپس تصویر را به وضوح اصلی خود «نمونهبرداری افزایشی» (upsamples) میکند تا جزئیات دقیق را پر کند. نکته حیاتی این است که U-Net از «اتصالات پرشی» (skip connections) استفاده میکند که اطلاعات با وضوح بالا را مستقیماً از سمت نمونهبرداری کاهشی به سمت نمونهبرداری افزایشی منتقل میکند و از دست رفتن جزئیات ظریف در طول فشردهسازی جلوگیری مینماید.[3]
با وجود کارایی، مدلهای انتشار اولیه که مستقیماً روی پیکسلها کار میکردند، از نظر محاسباتی بسیار پرهزینه بودند. محاسبه پیشبینی نویز برای تکتک پیکسلهای یک تصویر با وضوح بالا، نیازمند پردازندههای گرافیکی عظیم مراکز داده و صرف دقایق زمان پردازش برای هر تصویر بود.[5]
پیشرفتی که تولید تصویر توسط هوش مصنوعی را دموکراتیزه کرد، «مدل انتشار نهفته» (Latent Diffusion Model یا LDM) بود که توسط محققان دانشگاه LMU مونیخ و Runway معرفی شد. به جای اجرای فرآیند انتشار در «فضای پیکسل»، مدلهای LDM آن را در «فضای نهفته» اجرا میکنند.[2][4][6]
فضای نهفته یک نمایش ریاضی بسیار فشرده از تصویر است. یک شبکه «رمزگذار» (encoder) تصویر با وضوح بالا را تحلیل کرده و آن را با ضریبی معادل ۴۸ یا بیشتر فشرده میکند، دادههای پیکسلی اضافی را دور میریزد در حالی که معنای اصلی معنایی—یعنی «مفهوم» تصویر—را حفظ میکند.[2]
سپس کل فرآیند انتشار رو به جلو و معکوس روی این نمایش نهفته کوچک و فشرده انجام میشود. از آنجا که ناحیه محاسباتی به شدت کوچکتر است، فرآیند به صورت تصاعدی سریعتر شده و کسری از حافظه را نیاز دارد.[4]
هنگامی که انتشار معکوس در فضای نهفته کامل شد، یک شبکه «رمزگشای» (decoder) جداگانه، نمایش ریاضی فشرده را دوباره به یک تصویر پیکسلی با وضوح کامل ترجمه میکند. به همین دلیل است که مدلهایی مانند Stable Diffusion میتوانند روی لپتاپهای مصرفکننده اجرا شوند.[4][6]
اما حذف نویز تنها نیمی از معادله است؛ مدل باید بداند که چه چیزی را تولید کند. این امر از طریق «شرطیسازی» (conditioning) حاصل میشود، که معمولاً با استفاده از فرمانهای متنی انجام میگیرد تا مسیر حذف نویز را هدایت کند.[7]
هنگامی که کاربر یک فرمان متنی وارد میکند، یک مدل زبان، متن را به «تعبیههای ریاضی» (mathematical embeddings) ترجمه میکند. این تعبیههای متنی با استفاده از سازوکاری به نام «توجه متقاطع» (cross-attention) در طول فرآیند انتشار معکوس به شبکه U-Net تزریق میشوند.[2]
توجه متقاطع مانند یک فرمان عمل میکند. هنگامی که U-Net پیشبینی میکند کدام نویز را حذف کند، تعبیههای متنی آن را هدایت میکنند تا نویز را به شکلی حذف کند که با فرمان متنی همسو باشد. اگر فرمان «سگ» باشد، شبکه به طور انتخابی فضای نهفته را رفع نویز میکند تا ویژگیهای شبیه به سگ آشکار شود.[5]
با وجود تسلط، مدلهای انتشار محدودیتهای شناخته شدهای دارند. آنها با انسجام فضایی مشکل دارند، به همین دلیل است که مدلهای اولیه اغلب دستهایی با شش انگشت یا متنی شبیه به هیروگلیفهای بیگانه تولید میکردند. مدل بافت یک دست یا یک حرف را درک میکند، اما قوانین آناتومیک یا زبانی زیربنایی را نمیفهمد.[5]
علاوه بر این، ماهیت تکراری انتشار معکوس، آن را ذاتاً کندتر از معماریهای مولد قدیمیتر مانند شبکههای مولد رقابتی (GANs) میکند که تصاویر را در یک گذر رو به جلو تولید میکردند. با این حال، مدلهای انتشار پایداری بسیار بیشتری در طول آموزش و تنوع خروجی گستردهتری ارائه میدهند، که آنها را به استاندارد فعلی صنعت تبدیل کرده است.[1][5]
بررسی عمیق دیدگاهها
محققان هوش مصنوعی مولد
بر ظرافت ریاضی و پایداری انتشار نسبت به روشهای قبلی تمرکز دارند.
از نظر محققان، پیروزی مدلهای انتشار در پایداری آموزش آنها نهفته است. آموزش شبکههای مولد رقابتی قدیمیتر (GANs) به طرز بدنامی دشوار بود و اغلب دچار «فروپاشی حالت» (mode collapse) میشدند که در آن تنها چند نوع محدود از یک تصویر را تولید میکردند. مدلهای انتشار، که ریشه در ترمودینامیک غیرتعادلی دارند، یک هدف پایدار و دقیق ریاضی ارائه میدهند: صرفاً پیشبینی نویز. این امر به آنها اجازه میدهد تا با افزایش قدرت محاسباتی و دادهها، به طور قابل پیشبینی مقیاسپذیر باشند.
طرفداران کارایی محاسباتی
بر دموکراتیزه شدن هوش مصنوعی از طریق فشردهسازی فضای نهفته تأکید میکنند.
این گروه مدل انتشار نهفته (LDM) را پیشرفت واقعی میدانند. با انتقال فرآیند پرهزینه حذف نویز به یک فضای ریاضی فشرده، LDMها تولید تصویر با کیفیت بالا را از ابررایانهها جدا کردند. این تغییر معماری همان چیزی است که به مدلهای متنباز اجازه داد تا به صورت محلی روی کارتهای گرافیک مصرفکننده اجرا شوند و انحصار شرکتهای بزرگ فناوری بر هوش مصنوعی مولد پیشرو را بشکنند.
آنچه نمیدانیم
- اینکه آیا مدلهای انتشار همچنان معماری غالب برای تولید ویدئو باقی خواهند ماند، یا اینکه مدلهای خودرگرسیو (autoregressive) در نهایت از آنها پیشی خواهند گرفت.
- حداقل مطلق توان محاسباتی مورد نیاز برای اجرای انتشار نهفته با کیفیت بالا، با بهبود تکنیکهای بهینهسازی.
چرا مهم است
درک فرآیند انتشار، «جادوی» هنر هوش مصنوعی را رمزگشایی میکند و نشان میدهد که این فرآیند، یک عملیات ریاضی دقیق برای پیشبینی نویز است، نه صرفاً یک پایگاه داده از تصاویر سرقت شده. این سازوکار اکنون پایه و اساس همه چیز، از رندرینگ معماری گرفته تا کشف دارو، شده است.
منابع
[1]arXivمحققان الگوریتمیDenoising Diffusion Probabilistic Models
مطالعه در arXiv →
[2]arXivمحققان الگوریتمیHigh-Resolution Image Synthesis with Latent Diffusion Models
مطالعه در arXiv →
[3]arXivمحققان الگوریتمیU-Net: Convolutional Networks for Biomedical Image Segmentation
مطالعه در arXiv →
[4]Computer Vision & Learning Group - Ommer-Labمهندسان هوش مصنوعی کاربردیHigh-Resolution Image Synthesis with Latent Diffusion Models (A.K.A. LDM & Stable Diffusion)
مطالعه در Computer Vision & Learning Group - Ommer-Lab →
[5]MDPI (Electronics)مهندسان هوش مصنوعی کاربردیDiffusion Models: Unlocking the “4 Secrets” of High-Quality Image Generation
مطالعه در MDPI (Electronics) →
[6]Wikipediaمهندسان هوش مصنوعی کاربردیLatent diffusion model
مطالعه در Wikipedia →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

