رفتن به محتوای اصلی
توضیح کوهستانمدل‌های انتشارکالبدشکافی فناوری۲۱ مرداد ۱۴۰۵، ۱:۱۷· 4 دقیقه مطالعه· #3 از 3 در فناوری

کالبدشکافی مدل‌های انتشار: هوش مصنوعی واقعاً چگونه از هیچ، تصویر خلق می‌کند؟

برخلاف تصور عمومی، هوش مصنوعی تصاویر را از اینترنت کپی نمی‌کند. مدل‌های انتشار (Diffusion Models) با یادگیری نحوه حذف تدریجی نویز از یک صفحه برفکی، تصاویر را از پایه و بر اساس احتمالات آماری خلق می‌کنند.

به قلم کیان راد

پژوهشگران یادگیری ماشین 40%هنرمندان و منتقدان 35%توسعه‌دهندگان متن‌باز 25%
پژوهشگران یادگیری ماشین
این فناوری را یک دستاورد بزرگ در مدل‌سازی آماری و فشرده‌سازی داده‌ها می‌دانند.
هنرمندان و منتقدان
معتقدند اگرچه کپی‌پیست مستقیمی در کار نیست، اما الگوهای آماری کاملاً از آثار بدون مجوز آن‌ها استخراج شده است.
توسعه‌دهندگان متن‌باز
انتقال این فناوری به سخت‌افزارهای خانگی را گامی بزرگ در دموکراتیزه کردن هوش مصنوعی می‌دانند.

وقتی یک تصویر خیره‌کننده از میدجورنی (Midjourney) یا استیبل دیفیوژن (Stable Diffusion) می‌بینید، اولین غریزه انسانی این است که بپرسیم: «این را از کجا کپی کرده است؟» بسیاری تصور می‌کنند این ابزارها موتورهای جستجوی پیشرفته‌ای هستند که میلیون‌ها عکس را از اینترنت می‌بلعند و بخش‌هایی از آن‌ها را مانند یک کلاژ به هم می‌چسبانند. اما واقعیتِ پشت پرده، بسیار عجیب‌تر و از نظر ریاضیاتی، شگفت‌انگیزتر از یک کپی‌پیست ساده است.[1]

این مدل‌ها هیچ پایگاه داده‌ای از تصاویر را درون خود ذخیره نمی‌کنند. فایل چند گیگابایتی یک مدل هوش مصنوعی، تنها حاوی مجموعه‌ای از اعداد و وزن‌های آماری است. فرآیند خلق تصویر، نه با جستجو در یک آرشیو، بلکه با یک صفحه پر از برفک و نویز تصادفی — شبیه به صفحه تلویزیون‌های قدیمی بدون سیگنال — آغاز می‌شود.[1]

برای درک این جادو، باید به مرحله آموزش (Training) برگردیم؛ جایی که پژوهشگران فرآیندی به نام «تخریب عمدی» را اجرا می‌کنند. آن‌ها میلیون‌ها تصویر واقعی را به مدل نشان می‌دهند و در طی ده‌ها مرحله، به تدریج به آن‌ها «نویز گاوسی» (Gaussian Noise) اضافه می‌کنند. در نهایت، تصویر یک گربه به یک صفحه کاملاً برفکی تبدیل می‌شود. مدل در این مرحله یاد می‌گیرد که چگونه داده‌ها تخریب می‌شوند.[2]

سپس، بخش اصلی ماجرا که «فرآیند معکوس» (Reverse Process) نام دارد، آغاز می‌شود. یک شبکه عصبی عمیق — معمولاً با معماری U-Net — آموزش می‌بیند تا دقیقاً برعکس عمل کند. وظیفه این شبکه این نیست که حدس بزند تصویر نهایی چیست؛ بلکه تنها باید پیش‌بینی کند که در این لحظه، چه مقدار نویز به تصویر اضافه شده است تا آن را حذف کند.[3]

این فرآیند یک‌باره اتفاق نمی‌افتد. هوش مصنوعی در هر گام، کسر کوچکی از نویز را شناسایی و کم می‌کند، نتیجه را بررسی می‌کند و دوباره نویز بیشتری را حذف می‌کند. پس از تکرار این چرخه برای ۲۰ تا ۵۰ بار، از دل آن برفک‌های تصادفی، یک تصویر کاملاً جدید و واضح پدیدار می‌شود که قبلاً هرگز در جهان فیزیکی وجود نداشته است.[3]

هوش مصنوعی در هر گام، کسر کوچکی از نویز را شناسایی و کم می‌کند، نتیجه را بررسی می‌کند و دوباره نویز بیشتری را حذف می‌کند.

اما اگر قرار بود این محاسبات سنگین روی تک‌تک پیکسل‌های یک تصویر باکیفیت انجام شود، به ابررایانه‌های غول‌پیکر نیاز داشتیم. اینجا بود که نوآوری بزرگ استیبل دیفیوژن وارد میدان شد: «فضای پنهان» (Latent Space). این تکنیک، نیاز به پردازش مستقیم پیکسل‌ها را دور زد و بازی را برای همیشه تغییر داد.[2]

به جای کار روی یک تصویر بزرگ، یک شبکه عصبی دیگر به نام VAE (رمزگذار خودکار متغیر)، تصویر را فشرده کرده و به یک آرایه ریاضیاتی بسیار کوچک‌تر در فضای پنهان تبدیل می‌کند. فرآیند نویزگذاری و نویزگیری تماماً در این فضای فشرده انجام می‌شود. پس از پایان کار، نتیجه دوباره به فضای پیکسلی بازگردانده می‌شود. به همین دلیل است که امروزه می‌توانید این مدل‌ها را روی یک لپ‌تاپ گیمینگ معمولی اجرا کنید.[2]

اما کلمات چگونه این فرآیند را هدایت می‌کنند؟ وقتی شما عبارت «یک شهر سایبرپانک» را تایپ می‌کنید، یک مدل زبانی (مانند CLIP) این کلمات را به بردارهای ریاضی تبدیل می‌کند. این بردارها به عنوان یک قطب‌نما برای شبکه U-Net عمل می‌کنند تا مسیر حذف نویز را مشخص کنند.[3]

از طریق مکانیزمی به نام «توجه متقاطع» (Cross-Attention)، شبکه عصبی در هر مرحله از حذف نویز، به این بردارهای متنی نگاه می‌کند. این مکانیزم تضمین می‌کند که نویزهای حذف‌شده، الگوهایی را به جا بگذارند که از نظر آماری با مفهوم «سایبرپانک» و «شهر» همخوانی دارند. مدل نمی‌داند شهر چیست، اما می‌داند پیکسل‌های مرتبط با این کلمه معمولاً چه آرایشی دارند.[2]

این رویکرد آماری، دقیقاً دلیل ضعف‌های خنده‌دار هوش مصنوعی را نیز توضیح می‌دهد. چرا این مدل‌ها در کشیدن دست انسان مشکل دارند؟ چون مدل هیچ درکی از آناتومی استخوان‌ها و مفاصل ندارد. او تنها می‌داند که در تصاویر آموزشی، الگوهای رنگی خاصی (انگشتان) معمولاً در کنار هم ظاهر می‌شوند. اگر فرآیند حذف نویز کمی خطا کند، نتیجه یک دست با هفت انگشت خواهد بود.[1]

در نهایت، کالبدشکافی مدل‌های انتشار نشان می‌دهد که ما با یک «هنرمند خلاق» روبه‌رو نیستیم، بلکه با یک مجسمه‌ساز آماری طرفیم که یاد گرفته است چگونه الگوهای معنادار را از دل آشوب و نویز بیرون بکشد. درک این مکانیزم، هیاهوی بازاریابی پیرامون «هوش مصنوعی خلاق» را کنار می‌زند و زیبایی واقعی و ریاضیاتی این فناوری را نمایان می‌کند.[1]

نکات کلیدی

  • مدل‌های تولید تصویر مانند استیبل دیفیوژن، تصاویر را کپی نمی‌کنند، بلکه آن‌ها را از طریق فرآیند حذف نویز خلق می‌کنند.
  • در مرحله آموزش، مدل یاد می‌گیرد که چگونه تصاویر واقعی با افزودن نویز تخریب می‌شوند.
  • در مرحله تولید، شبکه عصبی U-Net پیش‌بینی می‌کند که چگونه باید نویز را از یک صفحه برفکی حذف کند تا به یک تصویر برسد.
  • استفاده از «فضای پنهان» (Latent Space) باعث فشرده‌سازی محاسبات شده و اجرای این مدل‌ها را روی رایانه‌های شخصی ممکن کرده است.
  • خطاهای هوش مصنوعی در رسم دست یا متن، ناشی از ماهیت آماری این مدل‌هاست که درک فیزیکی یا معنایی از جهان ندارند.

اصطلاحات کلیدی

مدل انتشار (Diffusion Model)
نوعی مدل هوش مصنوعی که با یادگیری فرآیند تخریب داده‌ها (افزودن نویز) و سپس معکوس کردن آن، داده‌های جدیدی مانند تصویر یا صدا تولید می‌کند.
فضای پنهان (Latent Space)
یک فضای ریاضیاتی فشرده که داده‌های پیچیده (مانند یک تصویر بزرگ) در آن به شکل ساده‌تر و کم‌حجم‌تری نمایش داده می‌شوند تا پردازش آن‌ها سریع‌تر شود.
نویز گاوسی (Gaussian Noise)
نوعی آشفتگی تصادفی و آماری (شبیه به برفک تلویزیون) که در مرحله آموزش به تدریج به تصاویر اضافه می‌شود.
معماری U-Net
نوعی شبکه عصبی که در مدل‌های انتشار وظیفه دارد مقدار نویز موجود در تصویر را در هر مرحله پیش‌بینی کند.
توجه متقاطع (Cross-Attention)
مکانیزمی که به شبکه عصبی اجازه می‌دهد در حین حذف نویز، به دستورات متنی کاربر توجه کند و تصویر را بر اساس آن شکل دهد.

پرسش‌های متداول

آیا هوش مصنوعی تصاویر را از اینترنت کپی می‌کند؟

خیر. مدل‌های انتشار هیچ پایگاه داده‌ای از تصاویر ندارند. آن‌ها تصاویر را از طریق حذف تدریجی نویز تصادفی و بر اساس الگوهای آماری که در مرحله آموزش یاد گرفته‌اند، از پایه خلق می‌کنند.

چرا استیبل دیفیوژن روی لپ‌تاپ‌های معمولی اجرا می‌شود؟

زیرا این مدل از تکنیک «فضای پنهان» (Latent Space) استفاده می‌کند. به جای پردازش میلیون‌ها پیکسل، تصویر را به یک آرایه کوچک فشرده کرده و محاسبات سنگین را در آن فضای کوچک انجام می‌دهد.

چرا هوش مصنوعی در نوشتن متن روی عکس مشکل دارد؟

این مدل‌ها درک معنایی از حروف و کلمات ندارند. آن‌ها تنها می‌دانند که خطوط و منحنی‌های خاصی معمولاً در کنار هم قرار می‌گیرند، بنابراین شکل‌هایی شبیه به حروف تولید می‌کنند که از نظر املایی بی‌معنی هستند.

منابع

پوشش منابع

3 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران یادگیری ماشین 40%هنرمندان و منتقدان 35%توسعه‌دهندگان متن‌باز 25%
  1. [1]تیم سردبیری کوهستانهنرمندان و منتقدان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان
  2. [2]arXivپژوهشگران یادگیری ماشین

    High-Resolution Image Synthesis with Latent Diffusion Models

    مطالعه در arXiv
  3. [3]Hugging Faceپژوهشگران یادگیری ماشین

    The Annotated Diffusion Model

    مطالعه در Hugging Face

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.