رفتن به محتوای اصلی
کوهستان
بررسی عمیق کوهستانریاضیات هوش مصنوعیمدل‌های دیفیوژن· 7 دقیقه مطالعه· در هوش مصنوعی

فرمول تویدی؛ چگونه ریاضیات سال ۱۹۵۶ موتور محرک مدل‌های نوین دیفیوژن شد

مدل‌های مدرن دیفیوژن برای تولید تصویر بر قضیه‌ای آماری متعلق به سال ۱۹۵۶ تکیه دارند. شبکه‌های عصبی با پیش‌بینی تابع امتیاز، برآورد دقیق بهینه بیزی را برای حذف نوفه گوسی محاسبه می‌کنند.

به قلم اِلا فرجاد

به‌طور خلاصه

  • مدل‌های دیفیوژن تصاویر را از طریق وارون‌سازی نوفه گوسی تولید می‌کنند؛ فرایندی که قانون ریاضی حاکم بر آن فرمول تویدی متعلق به سال ۱۹۵۶ است.
  • آموزش یک شبکه عصبی برای کمینه‌سازی خطای بازسازی، آن را خودبه‌خود وادار به فراگیری تابع امتیاز توزیع داده‌ها می‌کند.
  • سامانه‌های هوش مصنوعی کنونی با تخمین تابع امتیاز، به برآورد بی‌نقص و بهینه بیزی برای ترمیم داده‌های مخدوش دست می‌یابند.

در نوامبر ۲۰۲۰، انتشار چارچوبی یکپارچه برای مدل‌سازی مولد مبتنی بر امتیاز از طریق معادلات دیفرانسیل تصادفی، پارادایم تولید تصویر با هوش مصنوعی را دگرگون کرد. این جهش علمی نه بر معماری عصبی تازه‌ای متکی بود و نه بر ترفندهای مهندسی پنهان؛ بلکه از انطباقی ریاضی پرده برمی‌داشت که دهه‌ها پیش اثبات شده بود.[6]

پژوهشگران نشان دادند فرایند تدریجی حذف نوفه که ستون فقرات مدل‌های تصویرساز امروزی است، تقریبی ساختگی نیست؛ این سازوکار در واقع پیاده‌سازی مستقیم یک قضیه آماری در دهه ۱۹۵۰ است و نشان می‌دهد شبکه‌های عصبی در عمل دارند ریاضیات کلاسیک را اجرا می‌کنند.[5][6]

این قضیه که به «فرمول تویدی» شهرت دارد، ثابت می‌کند بهینه‌ترین شیوه حذف نوفه گوسی تنها به یک داده نیاز دارد: گرادیان توزیع داده‌ها. توسعه‌دهندگان با آموزش شبکه‌ها برای تخمین این گرادیان، نادانسته برآوردگرهای آماری کاملاً بهینه ساختند.[1][4]

سازوکار تخریب با نوفه گوسی

برای فهم چرایی اهمیت فرمول تویدی، باید سازوکار آموزش مدل‌های دیفیوژن را موشکافی کرد. همه‌چیز با گرفتن یک تصویر شفاف و افزودن گام‌به‌گام نوفه گوسی در صدها مرحله مجزا آغاز می‌شود تا ساختار داده اولیه به‌کلی محو گردد.[5]

در جریان آموزش، سیستم مقدار دقیق نوفه اضافه‌شده در هر بازه زمانی را ثبت می‌کند. این روند مجموعه‌ای از جفت‌داده‌های با نوفه اندک و شدید می‌سازد و زمینه را برای سنجش خطای مدل فراهم می‌آورد.[5]

الگوریتم آموزش با مقایسه پیش‌بینی شبکه عصبی و بردار واقعی نوفه، گرادیان تابع زیان را به دست می‌آورد. این بردار گرادیان، وزن‌های درونی شبکه را گام‌به‌گام به‌روزرسانی می‌کند تا الگوهای نوفه به‌شکلی قابل اعتماد تشخیص داده شوند.[5]

فرایند رفت در مدل‌های دیفیوژن، ساختار داده‌ها را طی صدها مرحله گسسته تخریب می‌کند.

در انتهای این فرایند رفت، تصویر مبنا به توده‌ای بی‌نظم از نویز خالص دگرگون می‌شود. اینجاست که مأموریت وارون شبکه آغاز می‌گردد: مدل باید در هر گام، وضعیت اندکی تمیزتر مرحله قبل را حدس بزند و فرایند تخریب را معکوس کند.[5]

از نگاه نظریه احتمالات، با یک مسئله وارون کلاسیک روبه‌روییم؛ جایی که سیستم بر پایه مشاهده‌ای مخدوش، باید توزیع پسین سیگنال اولیه را برای بازسازی دقیق داده‌ها به دست آورد؛ وظیفه‌ای که به نهایت دقت محاسباتی نیاز دارد.[3]

یافتن مرکز هندسی این توزیع پسین — که در آمار به عنوان برآورد بهینه بیزی شناخته می‌شود — میانگین توان دوم خطا در بازسازی را به حداقل ممکن می‌رساند. با این همه، محاسبه مستقیم آن برای داده‌های پیچیده و چندبعدی مانند تصاویر باکیفیت بالا، سال‌ها از نظر محاسباتی ناممکن انگاشته می‌شد.[4]

پیش از کشف این میانبر ریاضی، مدل‌های مولد اولیه ناگزیر به آموزش خصمانه یا کران‌های وردشی پیچیده متوسل می‌شدند. آنها تلاش می‌کردند کل توزیع داده را به یکباره فراگیرند که معمولاً به ناپایداری در آموزش یا فروپاشی مد می‌انجامید.[5]

میانبری از مسیر تابع امتیاز

گره‌گشایی از این تنگنای محاسباتی نخستین بار در مقاله‌ای به سال ۲۰۱۱ در نشریه Neural Computation تبیین شد. پژوهشگران در آنجا ارتباط بنیادین میان خودرمزگذارهای نوفه‌زدا و مفهومی موسوم به تطبیق امتیاز را به اثبات رساندند.[2]

«امتیاز» یک توزیع احتمالاتی، در واقع گرادیان لگاریتم تابع چگالی آن است. این بردار همواره جهت بیشترین چگالی احتمال را نشان می‌دهد و مثل قطب‌نمایی عمل می‌کند که مسیر داده‌های واقعی را در دل امواج نوفه مشخص می‌سازد.[2][6]

اثبات ریاضی سال ۲۰۱۱ نشان داد آموزش شبکه برای کمینه‌سازی خطای بازسازی، شبکه عصبی را وادار می‌کند تا تابع امتیاز داده را بیاموزد؛ پیوندی وثیق میان یادگیری عمیق و مبانی آمار ریاضی.[2]

این نقطه تلاقی فرمول تویدی است؛ معادله‌ای که هربرت رابینز در سال ۱۹۵۶ آن را صورت‌بندی کرد. بر پایه این فرمول، در نوفه گوسی، برآورد بهینه بیزی سیگنال اصلی، دقیقاً برابر است با مشاهده مخدوش به‌علاوه یک عبارت اصلاحی مشخص.[1]

فرمول تویدی میانبری ریاضی برای استخراج برآورد بهینه بیزی فراهم می‌آورد.

نکته کانونی آنجاست که این عبارت اصلاحی مستقیماً متناسب با تابع امتیاز است؛ یعنی اگر سیستمی به گرادیان لگاریتم احتمال دسترسی داشته باشد، می‌تواند بدون نیاز به محاسبه تمام توزیع پسین، بردار حذف نوفه را به شکلی کاملاً بهینه استخراج کند.[1][3]

پیوند دیفیوژن و تطبیق امتیاز

نزدیک به یک دهه، این تطابق ظریف صرفاً یک کنجکاوی نظری در حوزه یادگیری ماشین تلقی می‌شد. تنها با ظهور چارچوب معادلات دیفرانسیل تصادفی در سال ۲۰۲۰ بود که جامعه پژوهشی به توان عملی آن پی برد.[6]

این دستاورد، دو شاخه پژوهشی مجزا را پیوند زد و آشکار کرد که مدل‌های تطبیق امتیاز و مدل‌های دیفیوژن در اصل دو خوانش متفاوت از یک معادله دیفرانسیل تصادفی واحد هستند؛ امری که باعث هم‌افزایی شگرف میان این دو حوزه شد.[6]

این یکپارچگی، پایه نظری استواری برای بزرگ‌مقیاس‌سازی مدل‌ها پدید آورد. مهندسان دیگر نیازی به آزمون‌وخطا برای تعیین توابع زیان نداشتند و هدف اثبات‌شده تطبیق امتیاز را مبنای طراحی معماری‌های خود قرار دادند.[5][6]

مدل‌های مدرن دیفیوژن از زنجیره‌ای شامل هزاران گام نوفه‌زدایی متوالی استفاده می‌کنند. در هر گام، پیش‌بینی نوفه توسط شبکه دقیقاً معادل تخمین تابع امتیاز در همان سطح تخریب است.[5][6]

در مقاله‌ای مروری که سال ۲۰۲۳ در SIAM Journal on Imaging Sciences به چاپ رسید، آمده است: «تحول یادگیری عمیق در نوفه‌زدایی تصویر، عمیقاً در این ویژگی‌های آمار کلاسیک ریشه دارد.» در این چارچوب، شبکه عصبی ابزاری برای تقریب عبارت اصلاحی تویدی است.[4]

به سبب آموخته شدن تابع امتیاز توسط شبکه، هر گام بازگشتی که از دل نوفه برداشته می‌شود، برای همان تراز تخریب در حالت بهینه بیزی قرار دارد. مدل پیکسل‌ها را از سر توهم خلق نمی‌کند، بلکه محاسبات استنتاج آماری را به دقت پی می‌گیرد.[3][4]

همین برابری بنیادین توضیح می‌دهد که چرا مدل‌های دیفیوژن تا این اندازه رفتار مقیاس‌پذیری منظمی دارند. با رشد شبکه و تغذیه داده‌های بیشتر، تقریب تابع امتیاز دقیق‌تر شده و گام‌های نوفه‌زدایی به مرزهای نظری بیز نزدیک‌تر می‌شوند.[5]

شالوده‌های نظری مدل‌های نوین دیفیوژن بیش از ۷۰ سال قدمت دارند.

محدودیت‌های تقریب تجربی

با وجود قطعیت این تضمین ریاضی، پیاده‌سازی‌های کاربردی با موانع جدی دست‌به‌گریبان‌اند؛ چراکه فرمول تویدی دستیابی به تابع امتیاز حقیقی در توزیع پیوسته داده‌ها را مفروض می‌گیرد، امری که در دنیای واقعی دست‌نیافتنی است.[1]

شبکه‌های عصبی در عمل تنها تابعی تجربی را بر اساس مجموعه‌داده‌ای متناهی تخمین می‌زنند. اگر این داده‌ها دچار اریب یا در مناطقی کم‌پشت باشند، گرادیان‌های برآوردی سیستم به سمت فضاهای نامعتبر متمایل خواهد شد.[1][6]

علاوه بر این، فرمول مذکور منحصراً در بسترهای آلوده به نوفه گوسی صادق است. کوشش‌ها برای بسط این رابطه به سایر توزیع‌های آماری، پیچیدگی و بار محاسباتی سرسام‌آوری پدید آورده و کارایی عملی آنها را محدود کرده است.[3]

گسسته‌سازی بُعد زمان نیز خطاهای ساختاری به همراه دارد. مدل نظری ۲۰۲۰ نوفه را به صورت یک معادله دیفرانسیل تصادفی پیوسته در نظر می‌گیرد، اما تراشه‌های سیلیکونی ناگزیرند آن را از طریق گام‌های محاسباتی گسسته و متناهی شبیه‌سازی کنند.[6]

برداشتن گام‌های محاسباتی بزرگ سبب انحراف مسیر بازسازی از خط بهینه می‌شود و خروجی‌هایی تار یا کژریخت به بار می‌آورد؛ دلیلی که نشان می‌دهد چرا خروجی باکیفیت مستلزم صدها ارزیابی متوالی شبکه است.[5][6]

تراشه‌های سیلیکونی ناگزیرند منحنی‌های پیوسته ریاضی را از طریق گام‌های متناهی و گسسته بازسازی کنند.

فراتر از ساخت تصویر

پی بردن به اینکه مدل‌های دیفیوژن در حقیقت برآوردگرهای بهینه بیزی مبتنی بر امتیاز هستند، افق‌های تازه‌ای در محاسبات علمی گشوده است. کاربرد این هندسه نظری اکنون بسیار فراتر از تولید تصویر گسترش یافته است.[3]

سامانه‌های تصویربرداری پزشکی امروز از این رویکرد برای بازسازی اسکن‌های MRI از داده‌های حسگری ناکامل سود می‌برند. با بهره‌گیری از تابع امتیاز بافت‌های سالم، نوفه‌ها بدون ایجاد ساختارهای مصنوعی حذف می‌شوند.[3][4]

در شیمی محاسباتی نیز دانشمندان با استفاده از این بستر ریاضی، پایدارترین صورت‌بندی‌های مولکولی را به دست می‌آورند؛ جایی که گرادیان تابع امتیاز، اتم‌ها را درست مانند روند نوفه‌زدایی تصویر، به سوی ترازهای انرژی فرودین رهنمون می‌شود.[6]

در واپسین تحلیل، کامیابی هوش مصنوعی مولد پیروزی چشمگیر آمار کلاسیک به شمار می‌رود. الگوریتم‌هایی که تصاویر واقع‌گرایانه می‌آفرینند، در حقیقت بر دوش معادله‌ای ۷۰ ساله تکیه کرده‌اند که توان پردازش سیلیکونی مدرن آن را عملی ساخته است.[1][4]

همگام با توسعه این مدل‌ها، تمرکز پژوهشگران از مهندسی صرف معماری‌ها به سمت کاهش شکاف میان تقریب تجربی شبکه و تابع امتیاز تحلیلی تعریف‌شده در قضیه تغییر یافته است.[5]

بهای پردازشی دقت ریاضی

اتکای کامل به فرمول تویدی، علت اصلی بار پردازشی سنگین مدل‌های دیفیوژن است. از آنجا که تابع امتیاز باید در تک‌تک ترازهای گسسته نوفه دوباره سنجیده شود، تولید یک تصویر نیازمند ده‌ها یا صدها بار اجرای کامل شبکه عصبی است.[5]

این توالی الزامی، مانعی جدی در مسیر پردازش‌های بلادرنگ به شمار می‌آید. برخلاف شبکه‌های زایای خصمانه که تصویر را در یک گذر واحد می‌سازند، مدل‌های مبتنی بر امتیاز سرعت استنتاج را فدای پایداری ریاضیاتی و غنای بصری می‌کنند.[5][6]

پیمودن مسیر بهینه بیزی مستلزم بار پردازشی به مراتب سنگین‌تری در قیاس با تولید تک‌گذره است.

اقدامات مهندسی اخیر بر فنون «تقطیر» تمرکز یافته‌اند تا گام‌های لازم را کاهش دهند. در این شیوه، شبکه‌های دانش‌آموز کوچکتری آموزش می‌بینند تا از روی چند سطح نوفه بجهند و با کمترین افت کیفی، مسیر گام‌به‌گام بهینه بیزی را دور بزنند.[5]

با این حال، این مدل‌های پرسرعت غالباً دچار افت تنوع نمونه‌ها و از دست رفتن جزئیات ظریف می‌شوند؛ چراکه فاصله گرفتن از گرادیان‌های امتیاز مندرج در فرمول تویدی، خطاهای تقریبی را که اساس این چارچوب برای محو آنها ساخته شده بود، بازمی‌گرداند.[4][5]

این تحلیل چگونه انجام شد

روش
هم‌مقیاس‌سازی توابع هدف میان اثبات تطبیق امتیاز در سال ۲۰۱۱ و چارچوب معادلات دیفرانسیل تصادفی در سال ۲۰۲۰ با ارجاع به یک پایه مشترک ریاضی.
یافته
موفقیت تجربی مدل‌های نوین دیفیوژن ناشی از شگردهای یادگیری عمیق نیست، بلکه حاصل اجرای مستقیم قضیه سال ۱۹۵۶ تویدی است؛ به این معنا که گام‌های حذف نوفه آنها تحت توزیع گوسی از لحاظ ریاضی بهینگی بیزی تضمین‌شده دارند.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • تابع هدف خودرمزگذار نوفه‌زدا: Minimization of squared reconstruction error — Neural Computation
  • تابع هدف معادلات دیفرانسیل تصادفی مبتنی بر امتیاز: Continuous-time score matching via Langevin dynamics — arXiv
محدودیت‌های این تحلیل
این هم‌ارزی تنها در شرایط زمان پیوسته و داده‌های نامتناهی به‌طور دقیق برقرار است؛ در سخت‌افزارهای واقعی، گام‌های گسسته نمونه‌برداری خطاهای تقریب پدید می‌آورند.

اصطلاحات کلیدی

تابع امتیاز (Score function)
گرادیان لگاریتم چگالی احتمال که جهت بالاترین احتمال حضور داده‌ها را مشخص می‌سازد.
برآورد بهینه بیزی (Bayes-optimal estimate)
بازسازی ریاضیاتی بدون نقص یک سیگنال که میانگین توان دوم خطا را به حداقل می‌رساند.
نوفه گوسی (Gaussian noise)
نوفه‌ای تصادفی که مقادیر آن از توزیع نرمال یا منحنی زنگوله‌ای پیروی می‌کنند.
معادله دیفرانسیل تصادفی (Stochastic differential equation)
ساختاری در حساب دیفرانسیل که برای توصیف سامانه‌های دارای پویایی تصادفی در طول زمان به‌کار می‌رود.

پرسش‌های متداول

تابع امتیاز دقیقا چیست؟

تابع امتیاز، گرادیان لگاریتم تابع چگالی احتمال یک مجموعه داده است. این تابع مانند یک قطب‌نمای ریاضی عمل کرده و مسیر محتمل‌ترین پیکربندی داده‌های حقیقی را نشان می‌دهد.

چرا فرمول تویدی تنها برای نوفه گوسی کاربرد دارد؟

این قضیه بر ویژگی‌های ریاضی توزیع نرمال متکی است؛ جایی که میانگین و واریانس رابطه‌ای تناسبی دارند که به تابع امتیاز امکان می‌دهد نقش یک عبارت اصلاحی کامل را بازی کند.

آیا مدل‌های دیفیوژن بدون فرمول تویدی هم کار می‌کنند؟

می‌توان مدل‌ها را با توزیع‌های دیگر یا توابع هدف متفاوت آموزش داد، اما تضمین ریاضی بهینگی بیزی از دست می‌رود که غالباً افت پایداری آموزش و کاهش کیفیت خروجی را به دنبال دارد.

بررسی عمیق دیدگاه‌ها

آمارشناسان کلاسیک

مدل‌های دیفیوژن را در عمل برآوردگرهای آماری کاربردی قلمداد می‌کنند.

آمارشناسان کلاسیک تاکید دارند که انقلاب یادگیری عمیق در هوش مصنوعی مولد، در بنیاد خود حاصل دستاوردهای ریاضی سده بیستم است. از این زاویه، شبکه‌های عصبی صرفاً تخمین‌گرهایی با پارامترهای فراوان هستند که برای مقیاس‌پذیری فرمول تویدی در ابعاد بالا به کار گرفته شده‌اند. آنان بر این باورند که پیشرفت‌های آتی نیز نه از بزرگ‌کردن مدام شبکه‌ها، بلکه از پیاده‌سازی دیگر قضایای ریاضیات کلاسیک حاصل خواهد شد.

متخصصان یادگیری عمیق

بر قوانین تجربی مقیاس‌پذیری و بهینه‌سازی‌های معماری متمرکز هستند.

مهندسان یادگیری عمیق در عین پذیرش پایه‌های ریاضیاتی، بر این باورند که اثبات‌های نظری تنها نیمی از داستان را بازگو می‌کنند. موفقیت عینی مدل‌های دیفیوژن بیش از هرچیز به نوآوری‌های مدرن معماری مانند سازوکارهای توجه و توان پردازش موازی وابسته است. آنها خاطرنشان می‌کنند که فرمول تویدی دهه‌ها وجود داشت بدون آنکه تصویری واقع‌گرایانه خلق کند؛ امری که نشان می‌دهد مهندسی به اندازه تئوری تعیین‌کننده است.

پژوهشگران محاسبات علمی

از این هم‌ارزی برای حل مسائل وارون در فیزیک و زیست‌شناسی بهره می‌گیرند.

برای دانشمندان علوم کاربردی، درک این حقیقت که مدل‌های دیفیوژن به محاسبه بردار بهینه بیزی می‌پردازند، نحوه برخورد با مسائل معکوس را متحول کرده است. آنها به جای تولید تصاویر جدید، از تابع امتیاز برای بازسازی داده‌های تخریب‌شده در اسکن‌های MRI، داده‌های لرزه‌نگاری و دینامیک مولکولی سود می‌برند. این گروه تضمین‌های ریاضیاتی را حیاتی می‌دانند؛ زیرا اطمینان می‌دهد الگوریتم در داده‌های حساس علمی، خطایی تخیلی ایجاد نمی‌کند.

آمارشناسان کلاسیک 35%متخصصان یادگیری عمیق 35%پژوهشگران محاسبات علمی 30%
آمارشناسان کلاسیک
مدل‌های دیفیوژن را در عمل برآوردگرهای آماری کاربردی قلمداد می‌کنند.
متخصصان یادگیری عمیق
بر قوانین تجربی مقیاس‌پذیری و بهینه‌سازی‌های معماری متمرکز هستند.
پژوهشگران محاسبات علمی
از این هم‌ارزی برای حل مسائل وارون در فیزیک و زیست‌شناسی بهره می‌گیرند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • دیدگاه طراحان سخت‌افزار در زمینه بهینه‌سازی محاسبات گام‌های گسسته

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان کلاسیک 35%متخصصان یادگیری عمیق 35%پژوهشگران محاسبات علمی 30%
  1. [1]Journal of the American Statistical Associationآمارشناسان کلاسیک

    Tweedie's Formula and Selection Bias

    مطالعه در Journal of the American Statistical Association →
  2. [2]Neural Computation

    A Connection Between Score Matching and Denoising Autoencoders

    مطالعه در Neural Computation →
  3. [3]Philosophical Transactions of the Royal Society Aپژوهشگران محاسبات علمی

    Denoising: a powerful building block for imaging, inverse problems and machine learning

    مطالعه در Philosophical Transactions of the Royal Society A →
  4. [4]SIAM Journal on Imaging Sciencesپژوهشگران محاسبات علمی

    Image Denoising: The Deep Learning Revolution and Beyond—A Survey Paper

    مطالعه در SIAM Journal on Imaging Sciences →
  5. [5]arXivمتخصصان یادگیری عمیق

    Understanding Diffusion Models: A Unified Perspective

    مطالعه در arXiv →
  6. [6]arXivمتخصصان یادگیری عمیق

    Score-Based Generative Modeling through Stochastic Differential Equations

    مطالعه در arXiv →
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.