ریاضیات سوگیری تضعیف: چگونه متغیرهای پیشبینِ نویزدار، شیبهای رگرسیون را مسطح میکنند
وقتی متغیر مستقل در یک مدل رگرسیون با خطا اندازهگیری میشود، رابطه برآورد شده بهطور سیستماتیک به سمت صفر سوگیری پیدا میکند. این پدیده ریاضی که به عنوان رقیقشدگی رگرسیون شناخته میشود، پژوهشگران را ناچار میکند تا اثرات واقعی را دستکم بگیرند، مگر اینکه اصلاحات خاصی اعمال شود.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- روششناسی اپیدمیولوژیک
- بر این موضوع تمرکز دارد که چگونه خطای اندازهگیری در خوانشهای بالینی، خطرات بلندمدت بیماری را دستکم میگیرد.
- نظریه اقتصادسنجی
- بر این موضوع تمرکز دارد که چگونه خطا در یک متغیر، کل ماتریس واریانس-کوواریانس را در رگرسیون چندگانه مخدوش میکند.
- استنتاج آماری
- بر کرانهای ریاضی مدل خطاهای متغیرها و تأثیر آن بر مقادیر p تمرکز دارد.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان یادگیری ماشین
- طراحان کارآزماییهای بالینی
برای اینکه رگرسیون حداقل مربعات معمولی بتواند رابطه بین دو متغیر را بهدقت برآورد کند، متغیر مستقل باید با دقت کامل اندازهگیری شود. در پژوهشهای مشاهدهای، این شرط تقریباً هرگز محقق نمیشود.[1]
وقتی یک متغیر پیشبین حاوی نویز تصادفی باشد، مدل رگرسیون صرفاً دقت خود را از دست نمیدهد؛ بلکه بهطور سیستماتیک اشتباه میکند. شیب برآورد شده مسطح میشود و از اثر واقعی فاصله گرفته و به سمت صفر میل میکند.[1][4]
این پدیده از نظر ریاضی به عنوان سوگیری تضعیف یا رقیقشدگی رگرسیون شناخته میشود. دلیل بروز آن این است که فرمول آماری برای ضریب رگرسیون، کوواریانس دو متغیر را بر واریانس متغیر پیشبین تقسیم میکند.[2][6]
تحت مدل کلاسیک خطاهای متغیرها، دادههای مشاهدهشده شامل مقدار واقعی به علاوه یک جمله خطای کاملاً تصادفی است. از آنجا که این خطا مستقل است، واریانس دادههای مشاهدهشده اکیداً بزرگتر از واریانس دادههای واقعی است.[1]
متورم شدن مخرج کسرِ ضریب، از نظر ریاضی نتیجه کوچکتری را تضمین میکند. اگر واریانس واقعی یک مجموعه داده ۸۰ و واریانس خطای اندازهگیری ۲۰ باشد، کل واریانس مشاهدهشده به ۱۰۰ میرسد و ضریب حاصل را دقیقاً به ۸۰ درصد اندازه واقعیاش کاهش میدهد.[6]
دپارتمان آمار دانشگاه Penn State این موضوع را در برنامه درسی خود پیرامون آنچه هنگام وجود «پیشبینهای اشتباه» در یک مدل رخ میدهد، فرمولبندی کرده و خاطرنشان میکند که جایگزینی یک شاخص نویزدار به جای متغیر واقعی، ناگزیر شیب را مسطح میکند.[4]
این قطعیت ریاضی یک تله جدی برای دانشمندان داده ایجاد میکند: افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را برطرف نمیکند. این کار صرفاً فاصله اطمینان را در اطراف عدد اشتباه و تضعیفشده تنگتر میکند و مدل را به شکلی دقیق اما نادرست درمیآورد.[3][6]
این قطعیت ریاضی یک تله جدی برای دانشمندان داده ایجاد میکند: افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را برطرف نمیکند.
در اپیدمیولوژی، این سازوکار سوگیری رقیقشدگی رگرسیون نامیده میشود. یک مقاله روششناسی در سال ۲۰۱۲ در نشریه BMC Medical Research Methodology توضیح میدهد که چگونه اندازهگیریهای پایه و منفرد از عواملی مانند فشار خون، در ثبت میانگینهای بلندمدت ناکام میمانند.[2]
از آنجا که فشار خون بیمار بهطور طبیعی در یک چرخه ۲۴ ساعته در نوسان است، یک بار خوانش در کلینیک در مقایسه با خطر پایه واقعی او، حاوی خطای تصادفی قابلتوجهی است.[2]
اگر پژوهشگران خطر سکته مغزی را بر اساس همان یک خوانش نویزدار رگرسیون کنند، ضریب بهدستآمده خطر واقعی فشار خون بالا را بهشدت دستکم میگیرد و در صورت عدم اصلاح سوگیری، میتواند دستورالعملهای بهداشت عمومی را تغییر دهد.[2]
وقتی مدلها شامل چندین متغیر پیشبین باشند، این مشکل بهطور تصاعدی پیچیدهتر میشود. یک مقاله کاری در سال ۲۰۱۸ از پلتفرم هیئت علمی Wharton نشان میدهد که خطای اندازهگیری کلاسیک در یک متغیر، فقط ضریب خودش را تضعیف نمیکند.
در عوض، این خطا در سراسر ماتریس واریانس-کوواریانس نشت میکند. این امر میتواند متغیرهای کمکی را که در همان مدل بهطور کامل و دقیق اندازهگیری شدهاند، متورم یا کوچک کند و یا حتی علامت آنها را معکوس سازد و در نتیجه کل خروجی را غیرقابلاعتماد کند.
پژوهشگران در دانشگاه Charles Sturt با تأکید بر نحوه تأثیر این موضوع بر استنتاج آماری، خاطرنشان میکنند که خطای اندازهگیری، خطاهای استاندارد و مقادیر p را مخدوش میکند و به منفیهای کاذب منجر میشود؛ جایی که اثرات واقعی به عنوان موارد فاقد اهمیت آماری نادیده گرفته میشوند.[3]
اصلاح این وضعیت نیازمند اطلاعات خارجی است. مدل استاندارد خطاهای متغیرها، برای معکوس کردن این کوچکشدگی ریاضی و بازیابی شیب واقعی، بر متغیرهای ابزاری یا نسبتهای پایاییِ شناختهشده تکیه دارد.[1]
در ژنتیک آماری، پژوهشگران از نمرات خطر چندژنی برای پیشبینی استعداد ابتلا به بیماری استفاده میکنند. چارچوبی که در نشریه Genetic Epidemiology منتشر شده، یک رویکرد بیزی را برای اصلاح سوگیری تضعیف در زمانی که این نمرات با خطا اندازهگیری میشوند، شرح میدهد و برآوردهای وراثتپذیری واقعی را با موفقیت بازیابی میکند.[5]
با این حال، این اصلاحات فرض میکنند که خطا از نوع کلاسیک است. یک تحلیل در سال ۲۰۲۱ که در econometrics.blog منتشر شده، هشدار میدهد که وقتی فراتر از خطای اندازهگیری کلاسیک حرکت میکنیم - جایی که نویز با مقدار واقعی همبستگی دارد - سوگیری لزوماً به سمت صفر کوچک نمیشود و در واقع میتواند ضریب را متورم کند.
چرا مهم است
هر حوزهای که بر دادههای مشاهدهای تکیه دارد - از اپیدمیولوژی گرفته تا اقتصاد - باید با اندازهگیریهای ناقص دستوپنجه نرم کند. عدم اصلاح این خطای ریاضی به این معناست که روابط واقعی و قوی بین متغیرها، ضعیف یا ناموجود به نظر میرسند و این امر به رد شدن فرضیهها و اتخاذ تصمیمات سیاستیِ نادرست میانجامد.
نکات کلیدی
- خطای اندازهگیری در یک متغیر مستقل بهطور سیستماتیک ضرایب رگرسیون را به سمت صفر سوگیری میدهد.
- این تضعیف به این دلیل رخ میدهد که نویز تصادفی، واریانس کل متغیر پیشبین را متورم میکند.
- افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را اصلاح نمیکند؛ بلکه تنها اطمینان به برآورد اشتباه را افزایش میدهد.
- در رگرسیون چندگانه، خطا در یک متغیر منفرد میتواند ضرایب متغیرهای کمکی را که کاملاً دقیق اندازهگیری شدهاند، مخدوش کند.
- اصلاح سوگیری تضعیف نیازمند دادههای خارجی، مانند متغیرهای ابزاری یا نسبتهای پایایی شناختهشده است.
منابع
[1]Wikipediaاستنتاج آماریErrors-in-variables model
مطالعه در Wikipedia →
[2]BMC Medical Research Methodologyروششناسی اپیدمیولوژیکRegression dilution bias: Tools for correction methods and sample size calculation
مطالعه در BMC Medical Research Methodology →
[3]Charles Sturt University Research OutputHow measurement error affects inference in linear regression
مطالعه در Charles Sturt University Research Output →
[4]Penn State Universityاستنتاج آماری11.1 - What if the Regression Equation Contains "Wrong" Predictors?
مطالعه در Penn State University →
[5]Genetic Epidemiologyروششناسی اپیدمیولوژیکA Bayesian approach to correcting the attenuation bias of regression using polygenic risk score
مطالعه در Genetic Epidemiology →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →هوش مصنوعی در زلزلهشناسی
دقت یادگیری عمیق در برابر مدل ETAS در پیشبینی پسلرزهها
6 منبع
روششناسی نظرسنجی
چگونه برازش متناسب تکرارشونده، نمونههای نظرسنجی را با آمارهای جمعیتی همسو میکند
5 منبع
مدلسازی آماری
چگونه تابع پیوند، پیشبین خطی را به برآمد مورد انتظار در مدلهای خطی تعمیمیافته متصل میکند
8 منبع
تحلیل دادههای بصری
چگونه ۱۰۰ میلیون نقاشی کودکان، دو دهه از روندهای فرهنگی را آشکار میکند
4 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





