رفتن به محتوای اصلی
Koohestun
توضیح کوهستانهوش مصنوعی مولدکالبدشکافی فناوری· 5 دقیقه مطالعه· در فناوری

کالبدشکافی مدل‌های انتشار: هوش مصنوعی واقعاً چگونه از میان برفک و نویز، تصاویر خیره‌کننده می‌سازد؟

مدل‌های تولید تصویر مانند میدجرنی و استیبل دیفیوژن، برخلاف تصور عمومی، نقاشی نمی‌کشند؛ آن‌ها یاد گرفته‌اند که چگونه فرایند تخریب یک تصویر به برفک تصادفی را به صورت ریاضیاتی معکوس کنند.

به قلم دلناز نورانی

پژوهشگران هوش مصنوعی 45%توسعه‌دهندگان متن‌باز 40%تحلیل‌گران فناوری 15%
پژوهشگران هوش مصنوعی
تمرکز بر ظرافت ریاضیاتی معکوس کردن آنتروپی و کارایی فضای پنهان.
توسعه‌دهندگان متن‌باز
تاکید بر دموکراتیزه شدن خلاقیت و دسترسی عمومی به ابزارهای تولید تصویر.
تحلیل‌گران فناوری
بررسی واقع‌بینانه مکانیسم‌ها و عبور از هیاهوی بازاریابی شرکت‌ها.

دیدگاه‌هایی که این گزارش پوشش نداده

  • قانون‌گذاران مالکیت معنوی
  • عکاسان خبری و مستند

پرسش‌های متداول

آیا هوش مصنوعی در حال کپی کردن عکس‌های دیگران است؟

خیر. مدل‌های انتشار تصاویر را کپی و پیست نمی‌کنند. آن‌ها الگوهای آماری نویز و پیکسل‌ها را یاد می‌گیرند و تصویر جدیدی را از یک صفحه برفک تصادفی تولید می‌کنند.

چرا این مدل‌ها در کشیدن دست انسان مشکل دارند؟

چون آن‌ها ساختار اسکلتی و منطق فیزیکی دست را درک نمی‌کنند؛ آن‌ها فقط می‌دانند که در عکس‌های آموزشی، دست‌ها مجموعه‌ای از خطوط رنگی (انگشتان) در زوایای مختلف هستند.

تفاوت استیبل دیفیوژن با مدل‌های قدیمی‌تر چیست؟

استیبل دیفیوژن از «فضای پنهان» استفاده می‌کند؛ یعنی تصویر را قبل از پردازش ۴۸ برابر فشرده می‌کند که باعث می‌شود روی کامپیوترهای خانگی قابل اجرا باشد.

نکات کلیدی

  • مدل‌های انتشار بر پایه یک ایده از فیزیک ترمودینامیک در سال ۲۰۱۵ بنا شده‌اند.
  • این مدل‌ها ابتدا تصویر را با نویز تخریب کرده و سپس یاد می‌گیرند این فرایند را معکوس کنند.
  • معماری «انتشار پنهان» با فشرده‌سازی ۴۸ برابری تصویر، امکان اجرای این مدل‌ها را روی کامپیوترهای خانگی فراهم کرد.
  • متن‌های ورودی کاربران از طریق مدل‌هایی مانند CLIP به عنوان قطب‌نمایی برای هدایت فرایند حذف نویز عمل می‌کنند.
  • این سیستم‌ها درک فیزیکی از جهان ندارند و صرفاً ماشین‌های آماری پیش‌بینی نویز هستند.

در بهار سال ۲۰۱۵، در آزمایشگاهی در دانشگاه استنفورد، یک محقق فوق‌دکتری به نام یاشا سول-دیکستاین (Jascha Sohl-Dickstein) در حال بررسی یک ایده عجیب بود که از فیزیک ترمودینامیک غیرتعادلی الهام گرفته شده بود. در آن زمان، شبکه‌های عصبی برای تولید تصویر تلاش می‌کردند تا پیکسل‌ها را مستقیماً از روی الگوهای پیچیده یاد بگیرند؛ کاری که بسیار کند و پرخطا بود. سول-دیکستاین به جای تلاش برای ساختن مستقیم یک تصویر، یک سوال کاملاً متفاوت پرسید: چه می‌شود اگر ابتدا داده‌ها را با افزودن تدریجی نویز (برفک) نابود کنیم، و سپس به یک مدل یاد بدهیم که چگونه این فرایند تخریب را معکوس کند؟ این لحظه، نقطه تولد مفهومی بود که امروز آن را با نام «مدل‌های انتشار» (Diffusion Models) می‌شناسیم؛ همان موتور محرکی که اکنون در قلب ابزارهایی مانند میدجرنی (Midjourney) و استیبل دیفیوژن (Stable Diffusion) می‌تپد.[1]

مقاله بنیادین او با عنوان «یادگیری عمیق بدون نظارت با استفاده از ترمودینامیک غیرتعادلی» در مارس ۲۰۱۵ منتشر شد. در چکیده این مقاله، سول-دیکستاین و همکارانش ایده اصلی خود را این‌گونه بیان کردند: «ایده اساسی، که از فیزیک آماری غیرتعادلی الهام گرفته شده، این است که ساختار در یک توزیع داده را از طریق یک فرایند انتشار پیش‌روی تکرارشونده، به طور سیستماتیک و آهسته از بین ببریم.» به عبارت ساده‌تر، آن‌ها یک عکس واضح را می‌گرفتند و در صدها مرحله متوالی، به آن نویز گاوسی (Gaussian noise) اضافه می‌کردند تا جایی که تصویر به یک صفحه پر از برفک تصادفی، شبیه به صفحه تلویزیون‌های قدیمی بدون سیگنال، تبدیل می‌شد.[1]

جادوی واقعی در مرحله دوم یا «انتشار معکوس» (Reverse Diffusion) رخ می‌داد. اگر شما دقیقاً بدانید که در هر مرحله چه مقدار نویز به تصویر اضافه شده است، می‌توانید یک شبکه عصبی را آموزش دهید تا آن نویز را پیش‌بینی کرده و از تصویر کم کند. این فرایند، یک مسئله غیرممکن (خلق یک تصویر کامل از هیچ) را به هزاران مسئله بسیار کوچک و قابل حل (حذف مقدار کمی برفک از یک تصویر نویزی) تبدیل کرد. با این حال، این روش در سال ۲۰۱۵ به دلیل نیاز به قدرت محاسباتی عظیم، در حد یک دستاورد آکادمیک باقی ماند. پردازش مستقیم روی پیکسل‌های یک تصویر با وضوح بالا، نیازمند صدها روز پردازش روی پردازنده‌های قدرتمند بود.[3][4]

جهش بزرگ بعدی که این فناوری را به دست کاربران خانگی رساند، در سال ۲۰۲۲ و با معرفی «مدل‌های انتشار پنهان» (Latent Diffusion Models) توسط محققان دانشگاه لودویگ ماکسیمیلیان مونیخ (LMU) و شرکت RunwayML رخ داد. آن‌ها متوجه شدند که اعمال فرایند انتشار روی تک‌تک پیکسل‌های یک تصویر ۵۱۲ در ۵۱۲ پیکسلی، به شدت ناکارآمد است. راهکار آن‌ها استفاده از یک «رمزگذار خودکار» (Autoencoder) بود که تصویر را پیش از شروع فرایند نویزگذاری، فشرده می‌کرد.[2][3]

آن‌ها متوجه شدند که اعمال فرایند انتشار روی تک‌تک پیکسل‌های یک تصویر ۵۱۲ در ۵۱۲ پیکسلی، به شدت ناکارآمد است.

این فشرده‌سازی، تصویر را به یک «فضای پنهان» (Latent Space) منتقل می‌کند. در معماری استیبل دیفیوژن، این فضا دارای ابعاد ۶۴ در ۶۴ در ۴ است؛ یعنی دقیقاً ۴۸ برابر کوچک‌تر از فضای پیکسلی تصویر اصلی. تمام فرایند افزودن نویز و حذف آن، در این فضای فشرده و ریاضیاتی انجام می‌شود، نه روی پیکسل‌های واقعی. پس از اینکه شبکه عصبی (که معمولاً یک معماری U-Net است) نویز را در این فضای کوچک حذف کرد، یک رمزگشا (Decoder) نتیجه را دوباره به یک تصویر ۵۱۲ در ۵۱۲ پیکسلی تبدیل می‌کند. این کاهش ۴۸ برابری در حجم محاسبات، همان دلیلی است که به شما اجازه می‌دهد روی یک کارت گرافیک معمولی در عرض چند ثانیه تصویر تولید کنید.[2]

اما چگونه کلماتی که تایپ می‌کنید، این فرایند حذف برفک را هدایت می‌کنند؟ در اینجا پای مدل‌های زبانی مانند CLIP (توسعه‌یافته توسط OpenAI) به میان می‌آید. وقتی شما عبارت «یک گربه فضانورد روی مریخ» را تایپ می‌کنید، این متن به مجموعه‌ای از اعداد (بردارها) تبدیل می‌شود که معنای کلمات را در خود جای داده‌اند. در طول فرایند انتشار معکوس، این بردارهای متنی به عنوان یک «قطب‌نما» عمل می‌کنند. شبکه عصبی در هر مرحله از حذف نویز، به این قطب‌نما نگاه می‌کند و می‌پرسد: «کدام الگوهای پنهان در این برفک، بیشتر شبیه به یک گربه فضانورد هستند؟» و سپس نویزها را به گونه‌ای حذف می‌کند که آن الگوها تقویت شوند.[2][5]

با وجود تمام این شگفتی‌ها، نگاهی بدبینانه به بازاریابی شرکت‌های هوش مصنوعی ضروری است. بسیاری از این شرکت‌ها ادعا می‌کنند که مدل‌هایشان در حال «تخیل» یا «درک» جهان هستند. اما واقعیت مکانیکی این سیستم‌ها بسیار خشک‌تر است: آن‌ها صرفاً ماشین‌های پیش‌بینی نویز هستند که بر روی میلیاردها جفت عکس و متن (مانند مجموعه داده عظیم LAION-5B) آموزش دیده‌اند. آن‌ها نمی‌دانند گربه چیست؛ آن‌ها فقط توزیع آماری پیکسل‌هایی را که در داده‌های آموزشی با کلمه «گربه» برچسب خورده‌اند، بازتولید می‌کنند. به همین دلیل است که این مدل‌ها اغلب در کشیدن دست انسان (که دارای ساختار هندسی پیچیده و متغیری در عکس‌هاست) دچار اشتباه می‌شوند و دست‌هایی با شش انگشت یا مفاصل درهم‌تنیده تولید می‌کنند.[4][6]

این فناوری، با وجود تمام محدودیت‌هایش در درک منطق فیزیکی جهان، ثابت کرده است که گاهی اوقات بهترین راه برای ساختن چیزی جدید، این است که ابتدا یاد بگیریم چگونه آن را به طور کامل ویران کنیم. ما دیگر به کامپیوترها نمی‌گوییم که چگونه یک تصویر را رسم کنند؛ ما یک فضای پر از آشوب (نویز) ایجاد می‌کنیم و سپس با استفاده از ریاضیات و آمار، نظم مورد نظرمان را از دل آن آشوب بیرون می‌کشیم.[6]

چرا مهم است

درک نحوه کار مدل‌های انتشار به ما کمک می‌کند تا از هیاهوی بازاریابی شرکت‌های فناوری عبور کنیم. وقتی بدانیم این سیستم‌ها صرفاً ماشین‌های آماری پیش‌بینی نویز هستند و نه موجوداتی خلاق، می‌توانیم نقاط قوت آن‌ها را بهتر به کار بگیریم و از خطاهای ساختاری آن‌ها شگفت‌زده نشویم.

اصطلاحات کلیدی

نویز گاوسی (Gaussian Noise)
نوعی برفک تصادفی و یکنواخت که در پردازش سیگنال برای تخریب تدریجی داده‌ها استفاده می‌شود.
فضای پنهان (Latent Space)
یک نمایش فشرده و ریاضیاتی از داده‌ها که ابعاد بسیار کمتری نسبت به تصویر اصلی دارد و پردازش را سریع‌تر می‌کند.
انتشار پیش‌رو (Forward Diffusion)
فرایند افزودن تدریجی و مرحله‌به‌مرحله نویز به یک تصویر تا زمانی که کاملاً به برفک تبدیل شود.
رمزگذار خودکار (Autoencoder)
یک شبکه عصبی که وظیفه فشرده‌سازی تصویر به فضای پنهان و سپس بازگرداندن آن به حالت پیکسلی را بر عهده دارد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران هوش مصنوعی 45%توسعه‌دهندگان متن‌باز 40%تحلیل‌گران فناوری 15%
  1. [1]arXivپژوهشگران هوش مصنوعی

    Deep Unsupervised Learning using Nonequilibrium Thermodynamics

    مطالعه در arXiv
  2. [2]Stable Diffusion Artتوسعه‌دهندگان متن‌باز

    How Stable Diffusion works (under the hood)

    مطالعه در Stable Diffusion Art
  3. [3]IBMپژوهشگران هوش مصنوعی

    What are diffusion models?

    مطالعه در IBM
  4. [4]Towards AIتوسعه‌دهندگان متن‌باز

    How do Diffusion Models Work?

    مطالعه در Towards AI
  5. [5]Scale AIپژوهشگران هوش مصنوعی

    Diffusion Models: A Comprehensive Guide

    مطالعه در Scale AI
  6. [6]تیم سردبیری کوهستانتحلیل‌گران فناوری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.