چگونه معماری یو-نت (U-Net) نویز را در فرآیند دیفیوژن معکوس پیشبینی میکند
مدلهای هوش مصنوعی مولد تصاویر را از صفر نقاشی نمیکنند؛ آنها از یک الگوریتم زیستپزشکی متعلق به سال ۲۰۱۵ به نام یو-نت (U-Net) استفاده میکنند تا برفکها را بهصورت مرحلهای از روی بوم پاک کنند. یو-نت با فشردهسازی و بسط دادن تصویر و در عین حال حفظ جزئیات دقیق از طریق اتصالات پرشی، الگوی دقیق نویز مورد نیاز برای رسیدن به یک تصویر شفاف را پیشبینی میکند.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
بهطور خلاصه
- مدلهای دیفیوژن تصاویر را نقاشی نمیکنند؛ آنها بهطور مکرر نویز پیشبینیشده را از بومی از برفک خالص کم میکنند.
- پیشبینی نویز توسط یو-نت انجام میشود؛ معماریای که در اصل در سال ۲۰۱۵ برای ردیابی سلولهای زیستپزشکی توسعه یافت.
- یو-نت تصویر را فشرده میکند تا زمینه کلی آن را درک کند، سپس آن را به وضوح اصلی خود بسط میدهد.
وقتی کاربران دستوری را در یک پلتفرم هوش مصنوعی مولد تایپ میکنند، فرض شهودی - که اغلب توسط مفسران فناوری و ناظران عادی تکرار میشود - این است که هوش مصنوعی در حال نقاشی یک تصویر از صفر است و پیکسلها را یکییکی کنار هم میچیند تا با متن مطابقت داشته باشد. واقعیت ریاضی هوش مصنوعی مولد کاملاً با این موضوع در تضاد است. این مدلها تصویر تولید نمیکنند؛ بلکه نویز تولید میکنند.
بر اساس مقاله بنیادین «مدلهای احتمالی دیفیوژن نویززدا» که در سال ۲۰۲۰ در کنفرانس NeurIPS منتشر شد، سیستم کار خود را با بومی از برفکهای کاملاً تصادفی گاوسی آغاز میکند. موتوری که در واقع تصویر را خلق میکند، یک شبکه عصبی تخصصی است که به آن برفک نگاه کرده و دقیقاً پیشبینی میکند کدام پیکسلها نویز هستند، و آنها را گامبهگام کم میکند تا تنها تصویر مورد نظر باقی بماند.[1]
معماریای که این پیشبینی نویز را انجام میدهد، اختراع اخیر دوران شکوفایی هوش مصنوعی مولد نیست. این معماری «یو-نت» (U-Net) نام دارد؛ یک ساختار شبکه عصبی کانولوشنال که اولین بار در سال ۲۰۱۵ توسط اولاف رونهبرگر، فیلیپ فیشر و توماس بروکس در دانشگاه فرایبورگ توسعه یافت.
یو-نت که در اصل برای بخشبندی تصاویر زیستپزشکی - بهطور خاص، ردیابی سلولها در میکروسکوپ نوری - طراحی شده بود، برای حل یک مشکل مشخص ساخته شد: چگونه میتوان زمینه کلی یک تصویر را بدون از دست دادن جزئیات میکروسکوپی آن درک کرد. تیم رونهبرگر در مقاله سال ۲۰۱۵ خود نوشتند: «این معماری از یک مسیر منقبضشونده برای ثبت زمینه و یک مسیر بسطدهنده متقارن که امکان مکانیابی دقیق را فراهم میکند، تشکیل شده است.»[2]
برای درک اینکه چرا یک الگوریتم ردیابی سلول از سال ۲۰۱۵ به موتور محرک هنر هوش مصنوعی مدرن تبدیل شد، باید به مکانیسم فرآیند دیفیوژن معکوس نگاه کرد. در یک مدل دیفیوژن، یک تصویر با افزودن نویز گاوسی طی مجموعهای از مراحل - اغلب ۱۰۰۰ بازه مجزا - بهطور سیستماتیک تخریب میشود تا جایی که به برفکی غیرقابل تشخیص تبدیل گردد.
هوش مصنوعی آموزش میبیند تا این فرآیند را معکوس کند. با این حال، پیشبینی مستقیم تصویر اصلی از نویز خالص از نظر محاسباتی غیرممکن است. در عوض، همانطور که محققانی چون جاناتان هو، آجی جین و پیتر آبیل در سال ۲۰۲۰ نشان دادند، مدل آموزش میبیند تا نویزی را که در آخرین مرحله اضافه شده است، پیشبینی کند.[1][5]
اینجاست که شکل منحصربهفرد یو-نت ضروری میشود. این شبکه دقیقاً به شکل حرف انگلیسی یو است. وقتی یک تصویر نویزدار ۲۵۶ در ۲۵۶ پیکسل وارد شبکه میشود، از سمت چپ شبکه پایین میرود و از لایههای کانولوشنالی عبور میکند که ابعاد فضایی را فشرده کرده و در عین حال کانالهای ویژگی را گسترش میدهند.
یک پیادهسازی استاندارد ممکن است تصویر را تا یک گلوگاه ۱۶ در ۱۶ پیکسل فشرده کند. در این عمق، شبکه تمام جزئیات ظریف را از دست میدهد اما به درک ریاضی عمیقی از ساختار کلی تصویر - یعنی زمینه گسترده الگوی نویز - دست مییابد.[7][8]
اگر شبکه در همین نقطه متوقف میشد، برای تولید تصویر بیفایده بود، زیرا تنها یک نقشه با وضوح پایین خروجی میداد. سمت راست شبکه این مشکل را با نمونهبرداری افزایشی دادهها و بازگرداندن آنها به وضوح اصلی ۲۵۶ در ۲۵۶ حل میکند.
با این حال، نمونهبرداری افزایشی بهتنهایی نتایج تاری به همراه دارد. نوآوری تعیینکننده یو-نت، «اتصالات پرشی» آن است. اینها پلهای دادهای مستقیمی هستند که گلوگاه را کاملاً دور میزنند و جزئیات با وضوح بالا را از مسیر روبهپایین کپی کرده و مستقیماً روی لایههای مربوطه در مسیر روبهبالا میچسبانند.[2][5]
تیم علوم داده در دانشگاه واشنگتن توضیح میدهد: «با الحاق ویژگیهای نمونهبرداریافزایشیشده با ویژگیهای متناظر با وضوح بالا از مسیر منقبضشونده، شبکه میتواند خروجی دقیقی را بر اساس این اطلاعات مونتاژ کند.» در زمینه مدلهای دیفیوژن، این اتصالات پرشی به یو-نت اجازه میدهند تا درک کلی از الگوی نویز در گلوگاه را با تراز فضایی بینقصِ پیکسلها از اتصالات پرشی ترکیب کند تا یک نقشه پیشبینی نویز ارائه دهد که کاملاً با ابعاد ورودی مطابقت دارد.[8]
پیادهسازیهای مدرن، طراحی سال ۲۰۱۵ را برای پردازش دستورات متنی تغییر دادهاند. در سال ۲۰۲۳، محققانی که دینامیک زمانی یو-نتها را در مدلهای دیفیوژن تجزیه و تحلیل میکردند، دریافتند که لایههای توجه متقاطع به گلوگاه یو-نت تزریق شدهاند.
این مکانیسمهای توجه مانند یک فرمان عمل میکنند و به دستور متنی اجازه میدهند تا بر پیشبینی نویز در عمیقترین سطح شبکه تأثیر بگذارد. این محققان در پیشچاپ دسامبر ۲۰۲۳ خود خاطرنشان کردند: «ما مشاهده میکنیم که لایههای رمزگشای یو-نت در مراحل اولیه نویززدایی بر فرآیند تولید تسلط دارند، در حالی که لایههای رمزگذار در مراحل بعدی تأثیرگذارتر میشوند.»[3]
کارایی این معماری حیرتانگیز است. در طول یک فرآیند استنتاج استاندارد ۵۰ مرحلهای، یو-نت ۵۰ بار مجزا فراخوانی میشود. در مرحله ۵۰، به برفک خالص نگاه میکند و یک نقشه نویز متراکم را پیشبینی میکند. آن نویز کم میشود و تصویری با نویز کمی کمتر باقی میماند.
در مرحله ۴۹، یو-نت به تصویر جدید نگاه میکند و نقشه نویز بعدی را پیشبینی میکند. این حلقه تا مرحله صفر تکرار میشود. از آنجا که ابعاد ورودی و خروجی یو-نت یکسان است، میتواند بهطور یکپارچه دوباره به خودش خورانده شود و آن را به موتور کاملی برای نویززدایی تکرارشونده تبدیل کند.[6][7]
تحقیقات اخیر همچنان به اصلاح این فرآیند ادامه میدهند. مقالهای در ژوئیه ۲۰۲۳ یک «یو-نت فرکانس-فضایی» را معرفی کرد که نویز را هم در دامنه فضایی پیکسلها و هم در دامنه فرکانسی الگوهای موج پردازش میکند. با جداسازی نویز فرکانس بالا که نشاندهنده دانههای ریز است از نویز فرکانس پایین که نشاندهنده تغییرات رنگی گسترده است، این یو-نت اصلاحشده به بهبود ۱۵ درصدی در نمرات فاصله آغازین فرشه - یک معیار استاندارد برای کیفیت تصویر - دست یافت.[4]
یو-نت نمایانگر یک بازیافت عمیق در معماری ریاضی است. الگوریتمی که در سال ۲۰۱۵ برای کمک به پزشکان در ردیابی مرزهای سلولهای هلا زیر میکروسکوپ طراحی شده بود، اکنون هندسه بنیادینی است که به هوش مصنوعی اجازه میدهد جهانهای واقعگرایانه را توهم کند.
با چارچوببندی تولید تصویر نه بهعنوان یک عمل نقاشی، بلکه بهعنوان عمل حذف هدفمند نویز، یو-نت از محدودیتهای شبکههای مولد پیشین عبور کرد. مرز بعدی برای محققان این است که تعیین کنند آیا فشردهسازی فضایی یو-نت کاملاً ضروری است، یا اینکه معماریهای جدیدتری مانند ترانسفورمرهای بینایی میتوانند نویز را بدون نیاز به گلوگاه پیشبینی کنند.[2][6][9]
اصطلاحات کلیدی
- نویز گاوسی
- نوعی برفک بصری آماری که در آن مقادیر پیکسلها کاملاً تصادفی هستند و بهعنوان بوم اولیه برای مدلهای دیفیوژن عمل میکنند.
- کاهش وضوح
- فرآیند کاهش وضوح فضایی یک تصویر برای استخراج ویژگیهای کلی و سطح بالا در حالی که جزئیات ظریف دور ریخته میشوند.
- اتصال پرشی
- یک میانبر ساختاری در یک شبکه عصبی که دادهها را مستقیماً از یک لایه اولیه به یک لایه بعدی منتقل کرده و گلوگاه را دور میزند.
- گلوگاه
- عمیقترین بخش معماری یو-نت که در آن تصویر به پایینترین وضوح خود فشرده میشود تا زمینه کلی دادهها را ثبت کند.
پرسشهای متداول
آیا یو-نت تصویر نهایی را تولید میکند؟
خیر. یو-نت تنها الگوی نویز را پیشبینی میکند. مدل دیفیوژن آن نویز پیشبینیشده را از بوم کم میکند تا تصویر آشکار شود.
چرا به آن یو-نت میگویند؟
این معماری از نظر بصری شبیه به حرف انگلیسی یو نشان داده میشود، با یک مسیر منقبضشونده در سمت چپ که وضوح تصویر را کاهش میدهد و یک مسیر بسطدهنده در سمت راست که وضوح آن را افزایش میدهد.
اتصالات پرشی چیستند؟
اتصالات پرشی مسیرهای دادهای هستند که جزئیات با وضوح بالا را از لایههای اولیه شبکه کپی کرده و در لایههای بعدی میچسبانند تا از تار شدن تصویر جلوگیری کنند.
آیا یو-نت میتواند دستورات متنی را درک کند؟
یو-نت اصلی در سال ۲۰۱۵ نمیتوانست. مدلهای دیفیوژن مدرن لایههای توجه متقاطع را به گلوگاه یو-نت تزریق میکنند و به دستورات متنی اجازه میدهند تا پیشبینی نویز را هدایت کنند.
بررسی عمیق دیدگاهها
سنتگرایان بینایی ماشین
بر ریشههای یو-نت بهعنوان یک ابزار بخشبندی تمرکز دارند و استدلال میکنند که کارایی آن ناشی از سلسلهمراتب فضایی است.
این گروه یو-نت را در درجه اول از دریچه هدف اصلی آن در سال ۲۰۱۵ یعنی بخشبندی تصاویر زیستپزشکی میبینند. آنها استدلال میکنند که موفقیت ماندگار این معماری در هوش مصنوعی مولد، گواهی بر قدرت بنیادین سلسلهمراتب فضایی در بینایی ماشین است. با فشردهسازی یک تصویر در یک گلوگاه و بسط دادن دوباره آن، یو-نت بهطور طبیعی زمینه کلی را از جزئیات محلی جدا میکند. سنتگرایان تأکید میکنند که اتصالات پرشی قهرمان واقعی این معماری هستند، زیرا مشکل افت کیفیتی را که شبکههای کانولوشنال قبلی با آن دستبهگریبان بودند، حل میکنند. برای این گروه، یو-نت دلیلی بر این است که ساختارهای هندسی ظریف و هدفمند اغلب از مقیاسپذیری پارامترهای مبتنی بر نیروی خام بهتر عمل میکنند.
محققان هوش مصنوعی مولد
بر مکانیسمهای توجه متقاطع تزریقشده به یو-نت تمرکز دارند و معتقدند شرطیسازی متنی همان چیزی است که این معماری را برای دیفیوژن مدرن کارآمد میکند.
محققانی که بر مدلهای مولد مدرن تمرکز دارند، یو-نت سال ۲۰۱۵ را صرفاً یک شاسی میدانند. آنها استدلال میکنند که این معماری تنها زمانی قادر به توهم تصاویر پیچیده و مبتنی بر دستور شد که لایههای توجه متقاطع به گلوگاه آن تزریق شدند. این گروه بر دینامیک زمانی فرآیند نویززدایی تأکید کرده و خاطرنشان میکنند که رفتار یو-نت در مرحله ۱۰۰۰ با رفتار آن در مرحله ۱ متفاوت است. آنها به مطالعات اخیری اشاره میکنند که نشان میدهد لایههای رمزگشا در مراحل اولیه تولید تسلط دارند، در حالی که لایههای رمزگذار خروجی نهایی را اصلاح میکنند. برای این محققان، ارزش یو-نت در توانایی آن برای هدایت شدن توسط تعبیههای متنی خارجی بدون از دست دادن انسجام فضایی نهفته است.
مدافعان ترانسفورمر
استدلال میکنند که یو-نت یک گلوگاه کانولوشنال قدیمی است و ترانسفورمرهای بینایی در نهایت جایگزین آن برای پیشبینی نویز خواهند شد.
جناح رو به رشدی در جامعه هوش مصنوعی، یو-نت را یک معماری قدیمی میدانند که در نهایت کنار گذاشته خواهد شد. آنها استدلال میکنند که شبکههای عصبی کانولوشنال، با وجود کارایی بالا، اساساً توسط مفروضات فضایی سفتوسخت خود محدود شدهاند. این گروه مدافع جایگزینی یو-نت با ترانسفورمرهای بینایی هستند که تصاویر را بهجای شبکههای کاهشوضوحیافته، بهعنوان دنبالهای از تکهها پردازش میکنند. آنها به مدلهایی مانند سورا و تولیدکنندگان تصویر جدیدتری اشاره میکنند که از قبل شروع به جایگزینی یو-نت با ستون فقرات دیفیوژن مبتنی بر ترانسفورمر کردهاند و استدلال میکنند که ترانسفورمرها با بودجههای محاسباتی عظیم بهتر مقیاسپذیر میشوند و مکانیسمهای توجه انعطافپذیرتری را در کل بوم تصویر ارائه میدهند.
- محققان هوش مصنوعی مولد
- بر مکانیسمهای توجه متقاطع تزریقشده به یو-نت تمرکز دارند و معتقدند شرطیسازی متنی همان چیزی است که این معماری را برای دیفیوژن مدرن کارآمد میکند.
- سنتگرایان بینایی ماشین
- بر ریشههای یو-نت بهعنوان یک ابزار بخشبندی تمرکز دارند و استدلال میکنند که کارایی آن ناشی از سلسلهمراتب فضایی است.
- مدافعان ترانسفورمر
- استدلال میکنند که یو-نت یک گلوگاه کانولوشنال قدیمی است و ترانسفورمرهای بینایی در نهایت جایگزین آن برای پیشبینی نویز خواهند شد.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان سختافزار در حال بهینهسازی استنتاج
- محققان زیستپزشکی در حال تطبیق دیفیوژن برای بازگشت به پزشکی
منابع
[1]NeurIPSمحققان هوش مصنوعی مولدDenoising Diffusion Probabilistic Models
مطالعه در NeurIPS →
[2]University of Freiburgسنتگرایان بینایی ماشینU-Net: Convolutional Networks for Biomedical Image Segmentation
مطالعه در University of Freiburg →
[3]arXivمحققان هوش مصنوعی مولد[2312.14965] Unraveling the Temporal Dynamics of the Unet in Diffusion Models
مطالعه در arXiv →
[4]arXivمحققان هوش مصنوعی مولد[2307.14648] Spatial-Frequency U-Net for Denoising Diffusion Probabilistic Models
مطالعه در arXiv →
[5]ApX Machine LearningThe U-Net Architecture for Noise Prediction
مطالعه در ApX Machine Learning →
[6]Emergent Mindمحققان هوش مصنوعی مولدDiffusion UNet: Integrating Diffusion & U-Net
مطالعه در Emergent Mind →
[7]labml.aiU-Net model for Denoising Diffusion Probabilistic Models (DDPM)
مطالعه در labml.ai →
[8]Data Science @ UWسنتگرایان بینایی ماشینU-Net: Convolutional Networks for Biomedical Image Segmentation
مطالعه در Data Science @ UW →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →حکمرانی ایمنی هوش مصنوعی
اخراج سه پژوهشگر ایمنی از اوپنایآی به اتهام افشای اطلاعات محرمانه زیرساخت
6 منبع
هوش مصنوعی مولد
هوش مصنوعی مولد چیست و چگونه کار میکند؟ راهنمای جامع برای مبتدیان
4 منبع
هماهنگسازی مدل
شرکت Sakana AI مدل هماهنگساز Fugu Max را منتشر کرد؛ کاهش ۶۰ درصدی هزینههای مسیریابی چندعاملی
7 منبع
تفسیرپذیری مدل
چگونه مخروطهای مفهومی و پاکسازی درونپارامتری، از امتناع بیشازحد مدلهای هوش مصنوعی در برابر پرامپتهای ایمن جلوگیری میکنند
5 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





