فرمول تویدی؛ چگونه ریاضیات سال ۱۹۵۶ موتور محرک مدلهای نوین دیفیوژن شد
مدلهای مدرن دیفیوژن برای تولید تصویر بر قضیهای آماری متعلق به سال ۱۹۵۶ تکیه دارند. شبکههای عصبی با پیشبینی تابع امتیاز، برآورد دقیق بهینه بیزی را برای حذف نوفه گوسی محاسبه میکنند.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- مدلهای دیفیوژن تصاویر را از طریق وارونسازی نوفه گوسی تولید میکنند؛ فرایندی که قانون ریاضی حاکم بر آن فرمول تویدی متعلق به سال ۱۹۵۶ است.
- آموزش یک شبکه عصبی برای کمینهسازی خطای بازسازی، آن را خودبهخود وادار به فراگیری تابع امتیاز توزیع دادهها میکند.
- سامانههای هوش مصنوعی کنونی با تخمین تابع امتیاز، به برآورد بینقص و بهینه بیزی برای ترمیم دادههای مخدوش دست مییابند.
در این مطلب
در نوامبر ۲۰۲۰، انتشار چارچوبی یکپارچه برای مدلسازی مولد مبتنی بر امتیاز از طریق معادلات دیفرانسیل تصادفی، پارادایم تولید تصویر با هوش مصنوعی را دگرگون کرد. این جهش علمی نه بر معماری عصبی تازهای متکی بود و نه بر ترفندهای مهندسی پنهان؛ بلکه از انطباقی ریاضی پرده برمیداشت که دههها پیش اثبات شده بود.[6]
پژوهشگران نشان دادند فرایند تدریجی حذف نوفه که ستون فقرات مدلهای تصویرساز امروزی است، تقریبی ساختگی نیست؛ این سازوکار در واقع پیادهسازی مستقیم یک قضیه آماری در دهه ۱۹۵۰ است و نشان میدهد شبکههای عصبی در عمل دارند ریاضیات کلاسیک را اجرا میکنند.[5][6]
این قضیه که به «فرمول تویدی» شهرت دارد، ثابت میکند بهینهترین شیوه حذف نوفه گوسی تنها به یک داده نیاز دارد: گرادیان توزیع دادهها. توسعهدهندگان با آموزش شبکهها برای تخمین این گرادیان، نادانسته برآوردگرهای آماری کاملاً بهینه ساختند.[1][4]
سازوکار تخریب با نوفه گوسی
برای فهم چرایی اهمیت فرمول تویدی، باید سازوکار آموزش مدلهای دیفیوژن را موشکافی کرد. همهچیز با گرفتن یک تصویر شفاف و افزودن گامبهگام نوفه گوسی در صدها مرحله مجزا آغاز میشود تا ساختار داده اولیه بهکلی محو گردد.[5]
در جریان آموزش، سیستم مقدار دقیق نوفه اضافهشده در هر بازه زمانی را ثبت میکند. این روند مجموعهای از جفتدادههای با نوفه اندک و شدید میسازد و زمینه را برای سنجش خطای مدل فراهم میآورد.[5]
الگوریتم آموزش با مقایسه پیشبینی شبکه عصبی و بردار واقعی نوفه، گرادیان تابع زیان را به دست میآورد. این بردار گرادیان، وزنهای درونی شبکه را گامبهگام بهروزرسانی میکند تا الگوهای نوفه بهشکلی قابل اعتماد تشخیص داده شوند.[5]
در انتهای این فرایند رفت، تصویر مبنا به تودهای بینظم از نویز خالص دگرگون میشود. اینجاست که مأموریت وارون شبکه آغاز میگردد: مدل باید در هر گام، وضعیت اندکی تمیزتر مرحله قبل را حدس بزند و فرایند تخریب را معکوس کند.[5]
از نگاه نظریه احتمالات، با یک مسئله وارون کلاسیک روبهروییم؛ جایی که سیستم بر پایه مشاهدهای مخدوش، باید توزیع پسین سیگنال اولیه را برای بازسازی دقیق دادهها به دست آورد؛ وظیفهای که به نهایت دقت محاسباتی نیاز دارد.[3]
یافتن مرکز هندسی این توزیع پسین — که در آمار به عنوان برآورد بهینه بیزی شناخته میشود — میانگین توان دوم خطا در بازسازی را به حداقل ممکن میرساند. با این همه، محاسبه مستقیم آن برای دادههای پیچیده و چندبعدی مانند تصاویر باکیفیت بالا، سالها از نظر محاسباتی ناممکن انگاشته میشد.[4]
پیش از کشف این میانبر ریاضی، مدلهای مولد اولیه ناگزیر به آموزش خصمانه یا کرانهای وردشی پیچیده متوسل میشدند. آنها تلاش میکردند کل توزیع داده را به یکباره فراگیرند که معمولاً به ناپایداری در آموزش یا فروپاشی مد میانجامید.[5]
میانبری از مسیر تابع امتیاز
گرهگشایی از این تنگنای محاسباتی نخستین بار در مقالهای به سال ۲۰۱۱ در نشریه Neural Computation تبیین شد. پژوهشگران در آنجا ارتباط بنیادین میان خودرمزگذارهای نوفهزدا و مفهومی موسوم به تطبیق امتیاز را به اثبات رساندند.[2]
«امتیاز» یک توزیع احتمالاتی، در واقع گرادیان لگاریتم تابع چگالی آن است. این بردار همواره جهت بیشترین چگالی احتمال را نشان میدهد و مثل قطبنمایی عمل میکند که مسیر دادههای واقعی را در دل امواج نوفه مشخص میسازد.[2][6]
اثبات ریاضی سال ۲۰۱۱ نشان داد آموزش شبکه برای کمینهسازی خطای بازسازی، شبکه عصبی را وادار میکند تا تابع امتیاز داده را بیاموزد؛ پیوندی وثیق میان یادگیری عمیق و مبانی آمار ریاضی.[2]
این نقطه تلاقی فرمول تویدی است؛ معادلهای که هربرت رابینز در سال ۱۹۵۶ آن را صورتبندی کرد. بر پایه این فرمول، در نوفه گوسی، برآورد بهینه بیزی سیگنال اصلی، دقیقاً برابر است با مشاهده مخدوش بهعلاوه یک عبارت اصلاحی مشخص.[1]
نکته کانونی آنجاست که این عبارت اصلاحی مستقیماً متناسب با تابع امتیاز است؛ یعنی اگر سیستمی به گرادیان لگاریتم احتمال دسترسی داشته باشد، میتواند بدون نیاز به محاسبه تمام توزیع پسین، بردار حذف نوفه را به شکلی کاملاً بهینه استخراج کند.[1][3]
پیوند دیفیوژن و تطبیق امتیاز
نزدیک به یک دهه، این تطابق ظریف صرفاً یک کنجکاوی نظری در حوزه یادگیری ماشین تلقی میشد. تنها با ظهور چارچوب معادلات دیفرانسیل تصادفی در سال ۲۰۲۰ بود که جامعه پژوهشی به توان عملی آن پی برد.[6]
این دستاورد، دو شاخه پژوهشی مجزا را پیوند زد و آشکار کرد که مدلهای تطبیق امتیاز و مدلهای دیفیوژن در اصل دو خوانش متفاوت از یک معادله دیفرانسیل تصادفی واحد هستند؛ امری که باعث همافزایی شگرف میان این دو حوزه شد.[6]
این یکپارچگی، پایه نظری استواری برای بزرگمقیاسسازی مدلها پدید آورد. مهندسان دیگر نیازی به آزمونوخطا برای تعیین توابع زیان نداشتند و هدف اثباتشده تطبیق امتیاز را مبنای طراحی معماریهای خود قرار دادند.[5][6]
مدلهای مدرن دیفیوژن از زنجیرهای شامل هزاران گام نوفهزدایی متوالی استفاده میکنند. در هر گام، پیشبینی نوفه توسط شبکه دقیقاً معادل تخمین تابع امتیاز در همان سطح تخریب است.[5][6]
در مقالهای مروری که سال ۲۰۲۳ در SIAM Journal on Imaging Sciences به چاپ رسید، آمده است: «تحول یادگیری عمیق در نوفهزدایی تصویر، عمیقاً در این ویژگیهای آمار کلاسیک ریشه دارد.» در این چارچوب، شبکه عصبی ابزاری برای تقریب عبارت اصلاحی تویدی است.[4]
به سبب آموخته شدن تابع امتیاز توسط شبکه، هر گام بازگشتی که از دل نوفه برداشته میشود، برای همان تراز تخریب در حالت بهینه بیزی قرار دارد. مدل پیکسلها را از سر توهم خلق نمیکند، بلکه محاسبات استنتاج آماری را به دقت پی میگیرد.[3][4]
همین برابری بنیادین توضیح میدهد که چرا مدلهای دیفیوژن تا این اندازه رفتار مقیاسپذیری منظمی دارند. با رشد شبکه و تغذیه دادههای بیشتر، تقریب تابع امتیاز دقیقتر شده و گامهای نوفهزدایی به مرزهای نظری بیز نزدیکتر میشوند.[5]
محدودیتهای تقریب تجربی
با وجود قطعیت این تضمین ریاضی، پیادهسازیهای کاربردی با موانع جدی دستبهگریباناند؛ چراکه فرمول تویدی دستیابی به تابع امتیاز حقیقی در توزیع پیوسته دادهها را مفروض میگیرد، امری که در دنیای واقعی دستنیافتنی است.[1]
شبکههای عصبی در عمل تنها تابعی تجربی را بر اساس مجموعهدادهای متناهی تخمین میزنند. اگر این دادهها دچار اریب یا در مناطقی کمپشت باشند، گرادیانهای برآوردی سیستم به سمت فضاهای نامعتبر متمایل خواهد شد.[1][6]
علاوه بر این، فرمول مذکور منحصراً در بسترهای آلوده به نوفه گوسی صادق است. کوششها برای بسط این رابطه به سایر توزیعهای آماری، پیچیدگی و بار محاسباتی سرسامآوری پدید آورده و کارایی عملی آنها را محدود کرده است.[3]
گسستهسازی بُعد زمان نیز خطاهای ساختاری به همراه دارد. مدل نظری ۲۰۲۰ نوفه را به صورت یک معادله دیفرانسیل تصادفی پیوسته در نظر میگیرد، اما تراشههای سیلیکونی ناگزیرند آن را از طریق گامهای محاسباتی گسسته و متناهی شبیهسازی کنند.[6]
برداشتن گامهای محاسباتی بزرگ سبب انحراف مسیر بازسازی از خط بهینه میشود و خروجیهایی تار یا کژریخت به بار میآورد؛ دلیلی که نشان میدهد چرا خروجی باکیفیت مستلزم صدها ارزیابی متوالی شبکه است.[5][6]
فراتر از ساخت تصویر
پی بردن به اینکه مدلهای دیفیوژن در حقیقت برآوردگرهای بهینه بیزی مبتنی بر امتیاز هستند، افقهای تازهای در محاسبات علمی گشوده است. کاربرد این هندسه نظری اکنون بسیار فراتر از تولید تصویر گسترش یافته است.[3]
سامانههای تصویربرداری پزشکی امروز از این رویکرد برای بازسازی اسکنهای MRI از دادههای حسگری ناکامل سود میبرند. با بهرهگیری از تابع امتیاز بافتهای سالم، نوفهها بدون ایجاد ساختارهای مصنوعی حذف میشوند.[3][4]
در شیمی محاسباتی نیز دانشمندان با استفاده از این بستر ریاضی، پایدارترین صورتبندیهای مولکولی را به دست میآورند؛ جایی که گرادیان تابع امتیاز، اتمها را درست مانند روند نوفهزدایی تصویر، به سوی ترازهای انرژی فرودین رهنمون میشود.[6]
در واپسین تحلیل، کامیابی هوش مصنوعی مولد پیروزی چشمگیر آمار کلاسیک به شمار میرود. الگوریتمهایی که تصاویر واقعگرایانه میآفرینند، در حقیقت بر دوش معادلهای ۷۰ ساله تکیه کردهاند که توان پردازش سیلیکونی مدرن آن را عملی ساخته است.[1][4]
همگام با توسعه این مدلها، تمرکز پژوهشگران از مهندسی صرف معماریها به سمت کاهش شکاف میان تقریب تجربی شبکه و تابع امتیاز تحلیلی تعریفشده در قضیه تغییر یافته است.[5]
بهای پردازشی دقت ریاضی
اتکای کامل به فرمول تویدی، علت اصلی بار پردازشی سنگین مدلهای دیفیوژن است. از آنجا که تابع امتیاز باید در تکتک ترازهای گسسته نوفه دوباره سنجیده شود، تولید یک تصویر نیازمند دهها یا صدها بار اجرای کامل شبکه عصبی است.[5]
این توالی الزامی، مانعی جدی در مسیر پردازشهای بلادرنگ به شمار میآید. برخلاف شبکههای زایای خصمانه که تصویر را در یک گذر واحد میسازند، مدلهای مبتنی بر امتیاز سرعت استنتاج را فدای پایداری ریاضیاتی و غنای بصری میکنند.[5][6]
اقدامات مهندسی اخیر بر فنون «تقطیر» تمرکز یافتهاند تا گامهای لازم را کاهش دهند. در این شیوه، شبکههای دانشآموز کوچکتری آموزش میبینند تا از روی چند سطح نوفه بجهند و با کمترین افت کیفی، مسیر گامبهگام بهینه بیزی را دور بزنند.[5]
این تحلیل چگونه انجام شد
- روش
- هممقیاسسازی توابع هدف میان اثبات تطبیق امتیاز در سال ۲۰۱۱ و چارچوب معادلات دیفرانسیل تصادفی در سال ۲۰۲۰ با ارجاع به یک پایه مشترک ریاضی.
- یافته
- موفقیت تجربی مدلهای نوین دیفیوژن ناشی از شگردهای یادگیری عمیق نیست، بلکه حاصل اجرای مستقیم قضیه سال ۱۹۵۶ تویدی است؛ به این معنا که گامهای حذف نوفه آنها تحت توزیع گوسی از لحاظ ریاضی بهینگی بیزی تضمینشده دارند.
- دادههایی که بر پایهٔ آنها کار کردیم
- تابع هدف خودرمزگذار نوفهزدا: Minimization of squared reconstruction error — Neural Computation
- تابع هدف معادلات دیفرانسیل تصادفی مبتنی بر امتیاز: Continuous-time score matching via Langevin dynamics — arXiv
- محدودیتهای این تحلیل
- این همارزی تنها در شرایط زمان پیوسته و دادههای نامتناهی بهطور دقیق برقرار است؛ در سختافزارهای واقعی، گامهای گسسته نمونهبرداری خطاهای تقریب پدید میآورند.
اصطلاحات کلیدی
- تابع امتیاز (Score function)
- گرادیان لگاریتم چگالی احتمال که جهت بالاترین احتمال حضور دادهها را مشخص میسازد.
- برآورد بهینه بیزی (Bayes-optimal estimate)
- بازسازی ریاضیاتی بدون نقص یک سیگنال که میانگین توان دوم خطا را به حداقل میرساند.
- نوفه گوسی (Gaussian noise)
- نوفهای تصادفی که مقادیر آن از توزیع نرمال یا منحنی زنگولهای پیروی میکنند.
- معادله دیفرانسیل تصادفی (Stochastic differential equation)
- ساختاری در حساب دیفرانسیل که برای توصیف سامانههای دارای پویایی تصادفی در طول زمان بهکار میرود.
پرسشهای متداول
تابع امتیاز دقیقا چیست؟
تابع امتیاز، گرادیان لگاریتم تابع چگالی احتمال یک مجموعه داده است. این تابع مانند یک قطبنمای ریاضی عمل کرده و مسیر محتملترین پیکربندی دادههای حقیقی را نشان میدهد.
چرا فرمول تویدی تنها برای نوفه گوسی کاربرد دارد؟
این قضیه بر ویژگیهای ریاضی توزیع نرمال متکی است؛ جایی که میانگین و واریانس رابطهای تناسبی دارند که به تابع امتیاز امکان میدهد نقش یک عبارت اصلاحی کامل را بازی کند.
آیا مدلهای دیفیوژن بدون فرمول تویدی هم کار میکنند؟
میتوان مدلها را با توزیعهای دیگر یا توابع هدف متفاوت آموزش داد، اما تضمین ریاضی بهینگی بیزی از دست میرود که غالباً افت پایداری آموزش و کاهش کیفیت خروجی را به دنبال دارد.
بررسی عمیق دیدگاهها
آمارشناسان کلاسیک
مدلهای دیفیوژن را در عمل برآوردگرهای آماری کاربردی قلمداد میکنند.
آمارشناسان کلاسیک تاکید دارند که انقلاب یادگیری عمیق در هوش مصنوعی مولد، در بنیاد خود حاصل دستاوردهای ریاضی سده بیستم است. از این زاویه، شبکههای عصبی صرفاً تخمینگرهایی با پارامترهای فراوان هستند که برای مقیاسپذیری فرمول تویدی در ابعاد بالا به کار گرفته شدهاند. آنان بر این باورند که پیشرفتهای آتی نیز نه از بزرگکردن مدام شبکهها، بلکه از پیادهسازی دیگر قضایای ریاضیات کلاسیک حاصل خواهد شد.
متخصصان یادگیری عمیق
بر قوانین تجربی مقیاسپذیری و بهینهسازیهای معماری متمرکز هستند.
مهندسان یادگیری عمیق در عین پذیرش پایههای ریاضیاتی، بر این باورند که اثباتهای نظری تنها نیمی از داستان را بازگو میکنند. موفقیت عینی مدلهای دیفیوژن بیش از هرچیز به نوآوریهای مدرن معماری مانند سازوکارهای توجه و توان پردازش موازی وابسته است. آنها خاطرنشان میکنند که فرمول تویدی دههها وجود داشت بدون آنکه تصویری واقعگرایانه خلق کند؛ امری که نشان میدهد مهندسی به اندازه تئوری تعیینکننده است.
پژوهشگران محاسبات علمی
از این همارزی برای حل مسائل وارون در فیزیک و زیستشناسی بهره میگیرند.
برای دانشمندان علوم کاربردی، درک این حقیقت که مدلهای دیفیوژن به محاسبه بردار بهینه بیزی میپردازند، نحوه برخورد با مسائل معکوس را متحول کرده است. آنها به جای تولید تصاویر جدید، از تابع امتیاز برای بازسازی دادههای تخریبشده در اسکنهای MRI، دادههای لرزهنگاری و دینامیک مولکولی سود میبرند. این گروه تضمینهای ریاضیاتی را حیاتی میدانند؛ زیرا اطمینان میدهد الگوریتم در دادههای حساس علمی، خطایی تخیلی ایجاد نمیکند.
- آمارشناسان کلاسیک
- مدلهای دیفیوژن را در عمل برآوردگرهای آماری کاربردی قلمداد میکنند.
- متخصصان یادگیری عمیق
- بر قوانین تجربی مقیاسپذیری و بهینهسازیهای معماری متمرکز هستند.
- پژوهشگران محاسبات علمی
- از این همارزی برای حل مسائل وارون در فیزیک و زیستشناسی بهره میگیرند.
دیدگاههایی که این گزارش پوشش نداده
- دیدگاه طراحان سختافزار در زمینه بهینهسازی محاسبات گامهای گسسته
منابع
[1]Journal of the American Statistical Associationآمارشناسان کلاسیکTweedie's Formula and Selection Bias
مطالعه در Journal of the American Statistical Association →
[2]Neural ComputationA Connection Between Score Matching and Denoising Autoencoders
مطالعه در Neural Computation →
[3]Philosophical Transactions of the Royal Society Aپژوهشگران محاسبات علمیDenoising: a powerful building block for imaging, inverse problems and machine learning
مطالعه در Philosophical Transactions of the Royal Society A →
[4]SIAM Journal on Imaging Sciencesپژوهشگران محاسبات علمیImage Denoising: The Deep Learning Revolution and Beyond—A Survey Paper
مطالعه در SIAM Journal on Imaging Sciences →
[5]arXivمتخصصان یادگیری عمیقUnderstanding Diffusion Models: A Unified Perspective
مطالعه در arXiv →
[6]arXivمتخصصان یادگیری عمیقScore-Based Generative Modeling through Stochastic Differential Equations
مطالعه در arXiv →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →ریاضیات و هوش مصنوعی
تشکیل گروه مشورتی مستقل ریاضیات توسط OpenAI پس از ادعای حل بیش از ۱۰۰ مسئله حلنشده با هوش مصنوعی
4 منبع
یادگیری ماشین
چگونه ترفند کرنل دادهها را بهطور ضمنی به فضایی با ابعاد بالاتر میبرد تا تفکیکپذیری خطی ممکن شود
7 منبع
خودتوجهی
چگونه مکانیزم «خودتوجهی» موازی بر گلوگاه پردازش ترتیبی در شبکههای عصبی بازگشتی غلبه کرد
7 منبع
معماریهای عصبی
چگونه فیلترهای کانولوشنی و لایههای پولینگ ویژگیهای سلسلهمراتبی را در بینایی ماشین استخراج میکنند
6 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





