چگونه آماره F واریانس تبیینشده را با واریانس پسماند تبییننشده مقایسه میکند
آماره F معناداری یک مدل آماری را با محاسبه نسبت واریانسی که با موفقیت تبیین میکند به نویز تصادفی که باقی میگذارد، ارزیابی میکند. نسبت بالاتر نشان میدهد که مدل به جای نوسانات تصادفی، یک سیگنال واقعی را ثبت کرده است.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
- استنتاج کلاسیک
- ارزش آزمون F را به عنوان اثبات قطعی ریاضیاتی برای قدرت تبیینکنندگی یک مدل در برابر فرض صفر میداند.
- مدلسازی پیشبینانه
- آزمونهای F دروننمونهای را در مقایسه با معیارهای اعتبارسنجی بروننمونهای مانند اعتبارسنجی متقاطع برای تعیین کاربرد واقعی مدل، در درجه دوم اهمیت میبیند.
- کنترل فرآیند
- از آماره F در درجه اول به عنوان نسبت سیگنال به نویز برای بهینهسازی فرآیندهای تولیدی و صنعتی استفاده میکند.
دیدگاههایی که این گزارش پوشش نداده
- آمارشناسان بیزی
در سال ۱۹۲۵، رونالد فیشر، آمارشناس بریتانیایی، تحلیل واریانس (ANOVA) را در کتاب برجسته خود با عنوان «روشهای آماری برای پژوهشگران» معرفی کرد و یک روش ریاضیاتی را برای جداسازی سیگنال واقعی از نویز تصادفی پایهگذاری نمود. هسته اصلی این روش، آماره F است که در سال ۱۹۳۴ توسط جورج دبلیو. اسندکور به افتخار فیشر نامگذاری شد. این آماره بر اساس یک فرض ظاهراً ساده عمل میکند: مقایسه واریانسی که یک مدل آماری تبیین میکند با واریانسی که تبییننشده باقی میگذارد.[6]
برای درک این سازوکار، باید به نحوه تقسیمبندی واریانس نگاه کرد. وقتی یک پژوهشگر مدلی میسازد — چه در حال آزمایش ۳ داروی مختلف فشار خون باشد و چه در حال پیشبینی قیمت مسکن با استفاده از ۴ متغیر مجزا — کل تغییرات موجود در دادهها به دو دسته جداگانه تقسیم میشود. دسته اول «واریانس تبیینشده» است که به طور رسمی با عنوان میانگین مربعات مدل (MSM) شناخته میشود. این بخش نشاندهنده تفاوتهایی است که میتوان مستقیماً به متغیرهای مورد آزمایش پژوهشگر نسبت داد.[1][3]
دسته دوم «واریانس تبییننشده» یا میانگین مربعات خطا (MSE) است. این همان نویز پسماند است — یعنی نوسان طبیعی و تصادفی نقاط دادههای منفرد در اطراف پیشبینیهای مدل. آماره F با تقسیم دسته اول بر دسته دوم محاسبه میشود: MSM تقسیم بر MSE. اگر متغیرهای مورد آزمایش هیچ اثر واقعی نداشته باشند، واریانس تبیینشده توسط مدل تقریباً برابر با نویز تصادفی خواهد بود.[2][3]
کتابچه الکترونیکی روشهای آماری NIST/SEMATECH خاطرنشان میکند: «مقدار F برابر با ۱ نشان میدهد که مدل، واریانسی بیشتر از آنچه بر اساس شانس تصادفی انتظار داریم را تبیین نمیکند.» با این حال، اگر مدل یک رابطه واقعی را ثبت کند، واریانس تبیینشده بر نویز پسماند غلبه خواهد کرد. در این حالت، صورت کسر بزرگتر از مخرج آن میشود و آماره F را به مراتب بالاتر از ۱٫۰ میبرد.[5]
آستانه دقیق برای معناداری آماری به درجات آزادی بستگی دارد که به عنوان یک جریمه ریاضیاتی برای پیچیدگی عمل میکنند. درجات آزادی نشاندهنده تعداد قطعات مستقل اطلاعاتی هستند که برای تخمین یک قطعه اطلاعاتی دیگر در دسترس قرار دارند. صورت کسر (واریانس تبیینشده) به ازای هر پارامتری که به مدل اضافه میشود، یک درجه آزادی را از دست میدهد.[1][2]
آستانه دقیق برای معناداری آماری به درجات آزادی بستگی دارد که به عنوان یک جریمه ریاضیاتی برای پیچیدگی عمل میکنند.
به عنوان مثال، در یک مجموعه داده با ۱۰۰ مشاهده که ۴ متغیر را آزمایش میکند، صورت کسر دارای ۴ درجه آزادی است، در حالی که مخرج کسر ۹۵ درجه آزادی دارد (۱۰۰ مشاهده کل منهای ۴ پارامتر منهای ۱ برای عرض از مبدأ). این جریمه دوگانه تضمین میکند که پژوهشگران نمیتوانند صرفاً با ریختن دهها متغیر بیفایده در یک مدل رگرسیون، آماره F را به طور مصنوعی متورم کنند.[3]
اگر یک متغیر جدید واریانس اضافی کافی برای توجیه حضور خود در مدل را تبیین نکند، آماره F در واقع کاهش مییابد. در عمل، نرمافزارهای آماری آماره F را محاسبه کرده و آن را به یک مقدار پی (p-value) ترجمه میکنند. یک آستانه رایج، آلفای ۰٫۰۵ است؛ به این معنی که اگر فرض صفر درست باشد، تنها ۵٪ احتمال مشاهده آماره F به آن بزرگی وجود دارد.[1][4]
آزمون F به عنوان یک آزمون همهگیر عمل میکند. در رگرسیون چندگانه، این آزمون ارزیابی میکند که آیا کل مدل — یعنی ترکیب همه پیشبینها — به طور معناداری بهتر از مدلی بدون پیشبین است یا خیر؛ مدلی که صرفاً یک خط صاف و نشاندهنده میانگین دادههاست. وبسایت Statistics By Jim توضیح میدهد: «آزمون F برای معناداری کلی نشان میدهد که آیا مدل رگرسیون خطی شما برازش بهتری نسبت به مدلی که فاقد متغیرهای مستقل است، برای دادهها فراهم میکند یا خیر.»[1]
اگر آزمون F کلی معنادار باشد، پژوهشگران میتوانند به بررسی آزمونهای t منفرد برای هر متغیر خاص بپردازند. اگر آزمون F رد شود، آزمونهای t منفرد عموماً نامعتبر در نظر گرفته میشوند. این اصل سلسلهمراتبی مشخصاً برای جلوگیری از نتایج مثبت کاذبی طراحی شده است که از اجرای همزمان مقایسههای چندگانه ناشی میشوند.[2][3]
قابلیت اطمینان آماره F به شدت به سه فرض اساسی بستگی دارد: پسماندها باید دارای توزیع نرمال باشند، واریانس باید در تمام سطوح متغیرهای مستقل برابر باشد (همگنی واریانس)، و مشاهدات باید مستقل باشند. زمانی که این مفروضات نقض شوند، نسبت میانگین مربعات دچار اعوجاج میشود.[4][5]
برای نمونه، ناهمگنی واریانس شدید میتواند آماره F را به طور مصنوعی متورم کند و پژوهشگران را به این نتیجه برساند که یک مدل معنادار است، در حالی که مدل صرفاً در حال ثبت واریانس نابرابر است. برای اصلاح این موضوع، نرمافزارهای آماری مدرن اغلب از خطاهای استاندارد استوار استفاده میکنند که مخرج آزمون F را برای در نظر گرفتن واریانس نابرابر تعدیل کرده و تضمین میکنند که این نسبت همچنان معیار معتبری برای سیگنال به نویز باقی بماند.[1][6]
آماره F با تقلیل تعامل پیچیده متغیرهای متعدد و خطای تصادفی به یک نسبت واحد و قابلتفسیر، اثبات ریاضیاتی لازم برای جداسازی کشف واقعی از تصادف آماری را فراهم میکند. این آماره همچنان به عنوان معیار بنیادین برای ارزیابی مدل در سراسر علوم باقی مانده است.[6]
نکات کلیدی
- آماره F با تقسیم واریانس تبیینشده توسط یک مدل بر واریانس پسماند تبییننشده محاسبه میشود.
- مقدار F نزدیک به ۱٫۰ نشان میدهد که مدل تنها نویز تصادفی را ثبت کرده است، در حالی که مقادیر بالاتر نشاندهنده یک سیگنال واقعی هستند.
- درجات آزادی به لحاظ ریاضیاتی افزودن متغیرهای بیفایده را جریمه کرده و از تورم مصنوعی این آماره جلوگیری میکنند.
- آزمون F به عنوان یک آزمون همهگیر عمل میکند و پیش از ارزیابی متغیرهای منفرد، مشخص میکند که آیا کل مدل به لحاظ آماری معنادار است یا خیر.
- اعتبار آماره F به مفروضات نرمال بودن، همگنی واریانس و استقلال پسماندها بستگی دارد.
چرا مهم است
بدون آماره F، پژوهشگران نمیتوانند به شکلی قابلاعتماد بین مدلی که واقعاً یک پیامد را پیشبینی میکند و مدلی که صرفاً نویزهای تصادفی را حفظ میکند، تمایز قائل شوند. این آماره به عنوان یک دروازهبان ریاضیاتی عمل میکند تا مشخص کند آیا مجموعهای از متغیرها در حوزههای مختلف، از کارآزماییهای بالینی گرفته تا پیشبینیهای مالی، واقعاً اهمیت دارند یا خیر.
منابع
[1]Statistics By Jimاستنتاج کلاسیکHow F-tests work in Analysis of Variance (ANOVA)
مطالعه در Statistics By Jim →
[2]DataCampمدلسازی پیشبینانهF-Statistic Explained: A Beginner's Guide
مطالعه در DataCamp →
[3]STAT 462 - Statistics Onlineاستنتاج کلاسیک3.5 - The Analysis of Variance (ANOVA) table and the F-test
مطالعه در STAT 462 - Statistics Online →
[4]6Sigma.usکنترل فرآیندANOVA F Value: Mastering Signal-to-Noise Ratio for Data Analysis
مطالعه در 6Sigma.us →
[5]NIST/SEMATECH e-Handbook of Statistical Methodsکنترل فرآیندWhat is an F-test?
مطالعه در NIST/SEMATECH e-Handbook of Statistical Methods →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →مدلسازی آماری
فاکتور بیز: چگونه نسبت درستنماییهای حاشیهای شواهد فرضیههای رقیب را کمیتسنجی میکند
8 منبع
گزارش حقوق بشر
عفو بینالملل سرکوب اعتراضات «زن، زندگی، آزادی» را جنایت علیه بشریت خواند؛ درخواست پیگرد ۸۷ مقام ایرانی
8 منبع
مصورسازی دادهها
تبدیل ریشه دوم: چرا شعاع در نمودارهای حبابی باید با جذر دادهها متناسب باشد؟
8 منبع
دادههای سلامت جهانی
دادههای سازمان جهانی بهداشت: پیشرفت سلامت جهانی متوقف شد؛ جهان از اهداف ۲۰۳۰ عقب ماند، در حالی که مالاریا و کمخونی معکوس شدهاند
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





