چگونه «برآورد بیشینهنمایی» پارامترهایی را مییابد که تابع درستنمایی را به حداکثر میرسانند؟
برآورد بیشینهنمایی (MLE) دقیقاً همان پارامترهای آماری را محاسبه میکند که احتمال وقوع یک مجموعه داده مشاهدهشده را به بالاترین حد ممکن میرسانند. این روش با تبدیل ضربهای پیچیده احتمالات به جمعهای قابلمدیریت، پلی میان آمار نظری و یادگیری ماشین کاربردی میسازد.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- آماردانان نظری
- تمرکز بر ویژگیهای مجانبی و اثباتهای ریاضی سازگاری و کارایی در برآورد بیشینهنمایی.
- دانشمندان داده کاربردی
- ارزشگذاری برای MLE عمدتاً به دلیل پیادهسازی محاسباتی آن در آموزش مدلهای یادگیری ماشین و رگرسیون لجستیک.
- تحلیلگران کمی
- استفاده از MLE برای برآورد پارامترهای مدلهای مالی و توزیعهای ریسک بر اساس دادههای تاریخی بازار.
در سال ۱۹۲۲، رونالد ای. فیشر، آماردان بریتانیایی، مقالهای منتشر کرد که پرسشی بنیادین در هسته علم داده مدرن را فرمولبندی میکرد: اگر پژوهشگری مجموعه مشخصی از نقاط داده را مشاهده کند، دقیقاً چه پارامترهای ریاضیاتی باعث میشوند تا احتمال وقوع آن مشاهدات خاص به بیشترین حد خود برسد؟ [3] پاسخی که او تدوین کرد، یعنی «برآورد بیشینهنمایی» (MLE)، همچنان روش غالب برای برازش مدلهای آماری بر دادههاست. این روش به جای حدس زدن پارامترها یا تکیه بر باورهای پیشین، یک چارچوب ریاضی قطعی ارائه میدهد تا منطقیترین پارامترها را مستقیماً از شواهد موجود استخراج کند. [2][2][3]
این فرآیند با یک فرض ساختاری درباره شکل دادهها آغاز میشود. اگر به نظر برسد که مجموعه دادهای شامل ۱۰ هزار قد انسان از یک منحنی زنگولهای پیروی میکند، تحلیلگر فرض را بر توزیع نرمال میگذارد که توسط دو پارامتر ناشناخته کنترل میشود: میانگین و واریانس. [4] تابع درستنمایی، با در نظر گرفتن یک مجموعه فرضی از پارامترها، احتمال توام (مشترک) مشاهده دقیق همان نقاط داده جمعآوریشده را محاسبه میکند. [5] از آنجا که فرض بر این است که نقاط داده مستقل و دارای توزیع یکسان هستند، احتمال توام آنها برابر با حاصلضرب ریاضی احتمالات تکتک آنهاست. [1][1][4][5]
هدف اصلی برآورد بیشینهنمایی این است که مقادیر مختلفی را برای میانگین و واریانس آزمایش کند تا در نهایت به ترکیب خاصی برسد که بالاترین حاصلضرب ممکن — یعنی بیشینه درستنمایی — را تولید کند. [2] در یک سناریوی فرضی با تنها ۳ نقطه داده، این محاسبه بسیار ساده است. تحلیلگر صرفاً سه احتمال را برای مجموعههای مختلف پارامترها در هم ضرب کرده و بالاترین نتیجه را انتخاب میکند. [5] پارامترهایی که این مقدار اوج را تولید میکنند، رسماً به عنوان برآوردهای بیشینهنمایی شناخته میشوند. [3][2][3][5]
با این حال، مقیاسپذیر کردن این حاصلضرب ریاضی برای دادههای دنیای واقعی، یک محدودیت سختافزاری جدی ایجاد میکند. ضرب کردن هزاران احتمال — که هر کدام یک عدد اعشاری بین صفر و یک هستند — به سرعت عددی چنان بینهایت کوچک تولید میکند که پردازندههای استاندارد کامپیوتری آن را به صفر گرد میکنند. [6] این پدیده که به عنوان «سرریز به پایین ممیز شناور» شناخته میشود، به حداکثر رساندن تابع درستنمایی خام را برای هر مجموعه دادهای بزرگتر از ۳۰۰ مشاهده، از نظر محاسباتی غیرممکن میسازد. [4] ریاضیات نظری روی کاغذ بینقص عمل میکند، اما در تراشههای سیلیکونی فوراً با شکست مواجه میشود. [7][4][6][7]
با این حال، مقیاسپذیر کردن این حاصلضرب ریاضی برای دادههای دنیای واقعی، یک محدودیت سختافزاری جدی ایجاد میکند.
برای دور زدن این محدودیت سختافزاری، دانشمندان داده یک لگاریتم طبیعی را بر تابع درستنمایی اعمال میکنند که محاسبات را به طور بنیادین تغییر میدهد، بیآنکه نتیجه بهینه را عوض کند. [4] از آنجا که لگاریتم یک تابع یکنواخت صعودی است، هر پارامتری که لگاریتم درستنمایی را به حداکثر برساند، دقیقاً با پارامترهایی که تابع درستنمایی اصلی را به حداکثر میرسانند، مطابقت خواهد داشت. [1] قله منحنی دقیقاً در همان مکان باقی میماند، حتی اگر مقیاس محور عمودی به شدت تغییر کند. [5] این امر تضمین میکند که یکپارچگی آماری برآورد در طول این ترجمه محاسباتی کاملاً دستنخورده باقی بماند. [7][1][4][5][7]
نکته کلیدی اینجاست که لگاریتم، ضرب احتمالات میکروسکوپی را به جمع لگاریتم احتمالات تبدیل میکند. [5] جمع کردن اعداد منفی به طور کامل از تله سرریز به پایین جلوگیری میکند و به پردازندههای مدرن اجازه میدهد تا مدلهای پیچیده یادگیری ماشین با میلیونها نقطه داده را بدون از دست دادن دقت ریاضی بهینهسازی کنند. [6] همین ترفند جبری ساده است که به MLE اجازه میدهد تا به عنوان موتور آموزش برای رگرسیون لجستیک مدرن عمل کند، جایی که وزنهای دقیقی را محاسبه میکند که احتمال پیامدهای دودویی مشاهدهشده را به حداکثر میرسانند. [3] بدون تبدیل لگاریتمی، کل حوزه تحلیلهای پیشبینیکننده درگیر محدودیتهای پایه حساب میشد. [7][3][5][6][7]
به محض اینکه تابع لگاریتم درستنمایی تثبیت شد، یافتن نقطه بیشینه به تمرینی در حساب دیفرانسیل تبدیل میشود. الگوریتم مشتق اول تابع را نسبت به هر پارامتر میگیرد و آن را دقیقاً برابر با صفر قرار میدهد. [5] این کار قله منحنی را پیدا میکند که نشاندهنده مقادیر بهینه پارامتر در جایی است که شیب خط مماس صفر میشود. [2] برای توزیعهای ساده، این مشتق را میتوان به صورت تحلیلی با یک معادله فرم بسته حل کرد. اما برای شبکههای عصبی پیچیده، الگوریتمهایی مانند گرادیان کاهشی به صورت تکرارشونده به سمت قلهای با مشتق صفر گام برمیدارند. [3][2][3][5]
برآورد بیشینهنمایی، با وجود ظرافت ریاضیاتیاش، محدودیتهای سختگیرانهای دارد که میزان اتکاپذیری آن را در پژوهشهای کاربردی تعیین میکند. این روش فرض میکند که توزیع احتمال انتخابشده کاملاً درست است؛ اگر تحلیلگری توزیع نرمال را روی دادههایی اعمال کند که در واقع از توزیع پواسون پیروی میکنند، پارامترهای بهدستآمده دقیق اما کاملاً اشتباه خواهند بود. [3] علاوه بر این، MLE برای قابلاعتماد بودن به حجم نمونه بزرگی نیاز دارد، زیرا برآوردهای آن در صورت محاسبه روی مجموعه دادههای کوچک میتوانند به شدت سوگیری داشته باشند. [6] مستندات فنی بررسیشده برای این تحلیل، به جای نقلقولهای مستقیم از پژوهشگران، کاملاً بر اثباتهای ریاضی تکیه دارند که بازتابدهنده ماهیت صرفاً کمی این حوزه است. [7] این روش تضمین نمیکند که پارامترهای برآوردشده، پارامترهای واقعی جهان باشند. بلکه تنها تضمین میکند که تحت مرزهای ریاضی سختگیرانهای که تحلیلگر تعیین کرده، هیچ پارامتر دیگری نمیتواند احتمال وجود دادههای مشاهدهشده را از این بیشتر کند. [1][1][3][6][7]
چرا مهم است
برآورد بیشینهنمایی موتور محرک ریاضی در پسزمینه تقریباً تمام مدلسازیهای پیشبینیکننده مدرن است. درک سازوکار آن به ما نشان میدهد که چرا الگوریتمهای یادگیری ماشین هنگام تطبیق مدلها با دادههای دنیای واقعی، دقیقاً چنین تصمیماتی میگیرند.
آنچه نمیدانیم
- عملکرد MLE زمانی که فرآیند تولید دادههای زیربنایی به طور بنیادین فرض متغیرهای مستقل و دارای توزیع یکسان را نقض میکند، چگونه است.
- آستانه دقیق حجم نمونه مورد نیاز برای اینکه MLE به کارایی مجانبی خود در مدلهای بسیار پیچیده و چندبعدی برسد، چقدر است.
منابع
[1]reliability 0.9.0 documentationآماردانان نظریHow does Maximum Likelihood Estimation work
مطالعه در reliability 0.9.0 documentation →
[2]CQFتحلیلگران کمیWhat is Maximum Likelihood Estimation?
مطالعه در CQF →
[3]Built Inدانشمندان داده کاربردیUnderstanding Maximum Likelihood Estimation (MLE)
مطالعه در Built In →
[4]DataCampدانشمندان داده کاربردیIntroduction to Maximum Likelihood Estimation (MLE)
مطالعه در DataCamp →
[5]Probability Courseآماردانان نظریMaximum Likelihood Estimation
مطالعه در Probability Course →
[6]Mediumدانشمندان داده کاربردیUnderstanding Maximum Likelihood Estimation
مطالعه در Medium →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.
