بسته شواهد: بدهبستانهای ریاضیاتی میان آزمونهای والد، اسکور و نسبت درستنمایی
در برآورد بیشینه درستنمایی، سه آزمون بنیادین با اندازهگیری تابع درستنمایی در نقاط مختلف، فرضیهها را ارزیابی میکنند. اگرچه این آزمونها در نمونههای بزرگ به نتایج یکسانی همگرا میشوند، اما رویکردهای هندسی متفاوت آنها تعیین میکند که در زمان کمبود داده یا پرهزینه بودن محاسبات، کدامیک باید مورد استفاده قرار گیرد.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- آمارشناسان نظری
- آزمون نسبت درستنمایی را به دلیل ناوردایی ریاضیاتی و دقت برتر آن در نمونههای کوچک یا چوله در اولویت قرار میدهند.
- دانشمندان داده کاربردی
- به دلیل حضور همهجانبه آزمون والد در خروجیهای نرمافزاری استاندارد و کارایی آن در تولید همزمان مقادیر پی، به آن تکیه میکنند.
- اقتصادسنجیدانان
- از آزمون اسکور (ضریب لاگرانژ) برای ارزیابی بسطهای پیچیده مدل بدون هزینه محاسباتی برازش آنها استفاده میکنند.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان یادگیری ماشین که با مدلهای ناپارامتری سروکار دارند
- آمارشناسان بیزی که آزمون فرض فراوانیگرا را به طور کامل رد میکنند
نکات کلیدی
- آزمونهای نسبت درستنمایی، والد و اسکور همگی فرضیهها را ارزیابی میکنند، اما از اندازهگیریهای هندسی متفاوتی از منحنی درستنمایی بهره میبرند.
- آزمون نسبت درستنمایی دقیقترین روش است، اما به برازش دو مدل مجزا نیاز دارد.
- آزمون والد پیشفرض نرمافزارهاست زیرا تنها به یک مدل نیاز دارد، اما در نمونههای کوچک میتواند نادرست باشد.
- آزمون اسکور گرادیان منحنی را اندازه میگیرد، که آن را برای آزمایش بسطهای مدل بدون برازش آنها ایدهآل میسازد.
- در نمونههای بینهایت بزرگ، هر سه آزمون همگرا میشوند تا دقیقاً مقدار پی (p-value) یکسانی را ارائه دهند.
چرا مهم است
هر یافته علمی، کارآزمایی پزشکی و سیاست اقتصادی برای تفکیک اثرهای واقعی از نویزهای تصادفی، به آزمون فرض متکی است. درک اینکه یک بسته نرمافزاری بهطور پیشفرض از کدام آزمون ریاضیاتی استفاده میکند، نشان میدهد که آیا مقدار پی (p-value) منتشرشده یک اثبات دقیق است یا صرفاً یک میانبر محاسباتی.
در مدلسازی آماری، اعتبار یک فرضیه در نهایت توسط شکل تابع درستنمایی تعیین میشود؛ یک منحنی ریاضیاتی که نشان میدهد دادههای مشاهدهشده در مقادیر مختلف و بالقوه پارامترها چقدر محتمل هستند. تصمیمگیری برای پذیرش یا رد یک ادعا، کاملاً به نحوه اندازهگیری فاصله میان قله این منحنی و محدودیت پیشنهادی فرضیه بستگی دارد. این ارزیابی هندسی مشخص میکند که آیا یک اثر مشاهدهشده واقعی است یا صرفاً یک نویز آماری.[1][4]
آمارشناسان از نظر تاریخی برای اندازهگیری این فاصله به سه روش بنیادین تکیه کردهاند: آزمون نسبت درستنمایی (Likelihood Ratio)، آزمون والد (Wald) و آزمون اسکور (Score). این سه آزمون که در مجموع به عنوان «تثلیث مقدس» برآورد بیشینه درستنمایی شناخته میشوند، بین سالهای ۱۹۲۸ تا ۱۹۴۸ برای حل یک مشکل کاملاً یکسان توسعه یافتند. با این حال، آنها از منظرهای هندسی کاملاً متفاوتی به منحنی درستنمایی نزدیک میشوند و پژوهشگران را وادار میکنند تا بین کارایی محاسباتی و دقت ریاضیاتی یکی را انتخاب کنند.[1][3]
سازوکار اصلی هر سه آزمون بر پایه برآورد بیشینه درستنمایی (MLE) استوار است. هنگامی که یک مدل روی دادهها برازش میشود، MLE مقادیر پارامتری را پیدا میکند که تابع درستنمایی را به حداکثر میرسانند و نمایانگر قله مطلق منحنی هستند. سپس یک آزمون فرض، محدودیتی را اعمال میکند؛ مانند این ادعا که اندازه اثر یک متغیر خاص دقیقاً صفر است. این آزمونها ارزیابی میکنند که وقتی از قله به سمت این مقدار محدودشده رانده میشویم، میزان درستنمایی چقدر افت میکند.[4][6]
آزمون نسبت درستنمایی (LR) که توسط یرژی نیمن (Jerzy Neyman) و ایگون پیرسون (Egon Pearson) در سال ۱۹۲۸ معرفی شد، مستقیمترین روش اندازهگیری است. این آزمون نیازمند آن است که پژوهشگر دو مدل مجزا را برازش کند: یک مدل نامحدود که قله مطلق را پیدا میکند، و یک مدل محدودشده که پارامتر را به مقدار فرضی وادار میسازد. آماره آزمون در اینجا، صرفاً فاصله عمودی بین این دو نقطه روی منحنی درستنمایی است.[4][6]
از آنجا که آزمون LR افت واقعی در درستنمایی را اندازه میگیرد، بهطور گسترده به عنوان استاندارد طلایی دقت شناخته میشود. همانطور که مستندات مشاوره آماری UCLA OARC به صراحت اشاره میکند: «آزمون نسبت درستنمایی ایجاب میکند که شما هم مدل نامحدود و هم مدل محدودشده را برآورد کنید.» این برآورد دوگانه، آن را بهویژه در نمونههای کوچک بسیار دقیق میسازد، اما از نظر تاریخی استفاده از آن را برای مجموعه دادههای پیچیده از نظر محاسباتی بازدارنده کرده بود.[4]
برای دور زدن این بار محاسباتی، آبراهام والد (Abraham Wald) آزمون والد را در سال ۱۹۴۳ معرفی کرد. آزمون والد به جای برازش دو مدل، تنها به مدل نامحدود نیاز دارد. این آزمون فاصله افقی بین پارامتر برآوردشده و مقدار فرضی را اندازه میگیرد و آن فاصله را با انحنای تابع درستنمایی در نقطه قله مقیاسبندی میکند. اگر منحنی پرشیب باشد، حتی یک فاصله افقی کوچک نشان میدهد که محدودیت اعمالشده بسیار نامحتمل است.[1][5]
برای دور زدن این بار محاسباتی، آبراهام والد (Abraham Wald) آزمون والد را در سال ۱۹۴۳ معرفی کرد.
این نیاز به تنها یک مدل، آزمون والد را به خروجی پیشفرض در تقریباً تمام بستههای نرمافزاری آماری تبدیل کرد. هنگامی که یک پژوهشگر یک رگرسیون استاندارد را اجرا میکند، نرمافزار بهطور خودکار مدل نامحدود را محاسبه کرده و از آزمون والد برای تولید همزمان مقادیر پی (p-values) برای هر ضریب استفاده میکند. همانطور که مستندات مرکز راهنمای SAS توضیح میدهد: «آزمون والد بر اساس فاصله بین برآورد پارامتر و مقدار فرضی استوار است.»[5]
با این حال، آزمون والد یک آسیبپذیری ریاضیاتی قابلتوجه به همراه دارد: این آزمون نسبت به پارامترسازی ناوردا (invariant) نیست. اگر یک پژوهشگر فرضیهای را با استفاده از مقیاس خطی آزمایش کند و پژوهشگر دیگری دقیقاً همان فرضیه را با مقیاس لگاریتمی بسنجد، آزمون والد میتواند صرفاً به دلیل این تبدیل ریاضیاتی، مقادیر پی با اختلاف بیش از ۰.۰۵ تولید کند. علاوه بر این، از آنجا که این آزمون برای برآورد بقیه منحنی به انحنای قله متکی است، در نمونههای کوچکی که تابع درستنمایی نامتقارن است، میتواند به شدت نادرست عمل کند.[1][3]
آزمون اسکور که توسط سی.آر. رائو (C.R. Rao) در سال ۱۹۴۸ معرفی شد و بعدها به عنوان آزمون ضریب لاگرانژ (Lagrange Multiplier) تعمیم یافت، رویکرد محاسباتی متضادی را در پیش میگیرد. این آزمون تنها نیازمند برازش مدل محدودشده است. سپس شیب، یا گرادیان، تابع درستنمایی را در آن نقطه محدودشده اندازه میگیرد. اگر محدودیت به قله واقعی نزدیک باشد، شیب باید تقریباً صفر باشد. اگر شیب تند باشد، محدودیت به احتمال زیاد نادرست است.[1][4]
آزمون اسکور در اقتصادسنجی و ژنتیک، جایی که برازش یک مدل نامحدود عظیم با هزاران پارامتر از نظر محاسباتی غیرممکن است، بهطور منحصربهفردی قدرتمند عمل میکند. با برازش تنها یک مدل پایه ساده، پژوهشگران میتوانند از آزمون اسکور استفاده کنند تا ارزیابی کنند که آیا افزودن ۵۰۰ متغیر جدید، برازش را بهطور معناداری بهبود میبخشد یا خیر؛ و این کار را صرفاً با بررسی گرادیان در خط پایه محدودشده انجام میدهند.[3][4]
از نظر ریاضیاتی، رابطه بین این سه آزمون توسط همارزی مجانبی (asymptotic equivalence) اداره میشود. در نمونههای بینهایت، تابع درستنمایی کاملاً متقارن و درجه دوم میشود. تحت این شرایط ایدهآل، افت عمودی آزمون LR، فاصله افقی مقیاسبندیشده آزمون والد، و شیب در نقطه محدودیت آزمون اسکور، همگی همگرا میشوند تا دقیقاً یک آماره آزمون یکسان را به دست دهند.[2][3]
اما دادههای دنیای واقعی به ندرت بینهایت هستند. در نمونههای متناهی - که در مطالعات شبیهسازی اغلب به عنوان کمتر از ۵۰۰ مشاهده تعریف میشوند - منحنی درستنمایی مکرراً دچار چولگی میشود و باعث واگرایی این سه آزمون میگردد. آزمون والد تمایل دارد عدم قطعیت واقعی را کمتر از حد برآورد کند که منجر به مثبتهای کاذب میشود، در حالی که آزمون اسکور گاهی میتواند بیش از حد محافظهکارانه عمل کند. آزمون نسبت درستنمایی همچنان قویترین روش باقی میماند، زیرا به تقریبهای درجه دوم متکی نیست.[2][6]
تداوم استفاده از آزمون والد به عنوان پیشفرض نرمافزارها، تا حد زیادی بازماندهای از محدودیتهای محاسباتی قرن بیستم است. در سال ۱۹۸۵، زمانی که برازش یک رگرسیون لجستیک منفرد ۱۲ ساعت از زمان یک رایانه بزرگ (mainframe) را میگرفت، اجتناب از برازش مدل دوم یک ضرورت عملی بود. امروزه، یک پردازنده استاندارد رومیزی ۳.۲ گیگاهرتزی میتواند مدلهای پیچیده را در کمتر از ۵۰ میلیثانیه برازش کند، که این امر مزیت اصلی آزمونهای والد و اسکور را برای مجموعه دادههای استاندارد از بین میبرد.[1][7]
بنابراین، انتخاب میان این تثلیث مقدس دیگر توسط سختافزار دیکته نمیشود، بلکه به محدودیتهای خاص دادهها بستگی دارد. مرز بعدی در این بحث ریاضیاتی در یادگیری ماشین با ابعاد بالا نهفته است، جایی که مدلهایی با میلیاردها پارامتر، حتی یک برازش نامحدود منفرد را از نظر محاسباتی ویرانگر میسازند و پژوهشگران را مجبور میکنند تا تقریبهای کاملاً جدیدی توسعه دهند که به کلی از این تثلیث کلاسیک عبور کنند.[7]
منابع
[1]MetricGateدانشمندان داده کاربردیWald vs Score vs Likelihood-Ratio Tests
مطالعه در MetricGate →
[2]PMCاقتصادسنجیدانانApproximations of the power functions for Wald, likelihood ratio, and score tests and their applications to linear and logistic regressions
مطالعه در PMC →
[3]Cross ValidatedاقتصادسنجیدانانLikelihood ratio vs. score vs. Wald test: Different p values, which to use?
مطالعه در Cross Validated →
[4]UCLA OARC Statistical Consultingآمارشناسان نظریFAQ: How are the likelihood ratio, Wald, and Lagrange multiplier (score) tests different and/or similar?
مطالعه در UCLA OARC Statistical Consulting →
[5]SAS Help Centerدانشمندان داده کاربردیWald Versus Likelihood Ratio Tests
مطالعه در SAS Help Center →
[6]CD Genomicsآمارشناسان نظریThe Wald Test vs The Likelihood Ratio Test
مطالعه در CD Genomics →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →طراحی آزمایش
چگونه حداقل اثر قابلتشخیص، توان آماری و آلفا، حجم نمونه مورد نیاز برای تست A/B را تعیین میکنند
6 منبع
دادههای نامتوازن
بسته شواهد: دقت و سبکسنگین کردن SMOTE در برابر وزندهی کلاسها در دادههای نامتوازن
6 منبع
روشهای تجمعی
پرونده شواهد: چگونه در مدلهای تجمعی، «بگینگ» واریانس را کاهش میدهد و «بوستینگ» سوگیری را
7 منبع
استنتاج علّی
مکانیسم علیت: مقایسه همبستگی، کارآزماییهای کنترلشده تصادفی، و طرحهای شبهآزمایشی
10 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





