ریاضیات سوگیری تضعیف: چگونه متغیرهای پیشبینِ نویزدار، شیبهای رگرسیون را مسطح میکنند
وقتی متغیر مستقل در یک مدل رگرسیون با خطا اندازهگیری میشود، رابطه برآورد شده بهطور سیستماتیک به سمت صفر سوگیری پیدا میکند. این پدیده ریاضی که به عنوان رقیقشدگی رگرسیون شناخته میشود، پژوهشگران را ناچار میکند تا اثرات واقعی را دستکم بگیرند، مگر اینکه اصلاحات خاصی اعمال شود.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- خطای اندازهگیری در یک متغیر مستقل بهطور سیستماتیک ضرایب رگرسیون را به سمت صفر سوگیری میدهد.
- این تضعیف به این دلیل رخ میدهد که نویز تصادفی، واریانس کل متغیر پیشبین را متورم میکند.
- افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را اصلاح نمیکند؛ بلکه تنها اطمینان به برآورد اشتباه را افزایش میدهد.
برای اینکه رگرسیون حداقل مربعات معمولی بتواند رابطه بین دو متغیر را بهدقت برآورد کند، متغیر مستقل باید با دقت کامل اندازهگیری شود. در پژوهشهای مشاهدهای، این شرط تقریباً هرگز محقق نمیشود.[1]
وقتی یک متغیر پیشبین حاوی نویز تصادفی باشد، مدل رگرسیون صرفاً دقت خود را از دست نمیدهد؛ بلکه بهطور سیستماتیک اشتباه میکند. شیب برآورد شده مسطح میشود و از اثر واقعی فاصله گرفته و به سمت صفر میل میکند.[1][4]
این پدیده از نظر ریاضی به عنوان سوگیری تضعیف یا رقیقشدگی رگرسیون شناخته میشود. دلیل بروز آن این است که فرمول آماری برای ضریب رگرسیون، کوواریانس دو متغیر را بر واریانس متغیر پیشبین تقسیم میکند.[2][6]
تحت مدل کلاسیک خطاهای متغیرها، دادههای مشاهدهشده شامل مقدار واقعی به علاوه یک جمله خطای کاملاً تصادفی است. از آنجا که این خطا مستقل است، واریانس دادههای مشاهدهشده اکیداً بزرگتر از واریانس دادههای واقعی است.[1]
متورم شدن مخرج کسرِ ضریب، از نظر ریاضی نتیجه کوچکتری را تضمین میکند. اگر واریانس واقعی یک مجموعه داده ۸۰ و واریانس خطای اندازهگیری ۲۰ باشد، کل واریانس مشاهدهشده به ۱۰۰ میرسد و ضریب حاصل را دقیقاً به ۸۰ درصد اندازه واقعیاش کاهش میدهد.[6]
دپارتمان آمار دانشگاه Penn State این موضوع را در برنامه درسی خود پیرامون آنچه هنگام وجود «پیشبینهای اشتباه» در یک مدل رخ میدهد، فرمولبندی کرده و خاطرنشان میکند که جایگزینی یک شاخص نویزدار به جای متغیر واقعی، ناگزیر شیب را مسطح میکند.[4]
این قطعیت ریاضی یک تله جدی برای دانشمندان داده ایجاد میکند: افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را برطرف نمیکند. این کار صرفاً فاصله اطمینان را در اطراف عدد اشتباه و تضعیفشده تنگتر میکند و مدل را به شکلی دقیق اما نادرست درمیآورد.[3][6]
در اپیدمیولوژی، این سازوکار سوگیری رقیقشدگی رگرسیون نامیده میشود. یک مقاله روششناسی در سال ۲۰۱۲ در نشریه BMC Medical Research Methodology توضیح میدهد که چگونه اندازهگیریهای پایه و منفرد از عواملی مانند فشار خون، در ثبت میانگینهای بلندمدت ناکام میمانند.[2]
از آنجا که فشار خون بیمار بهطور طبیعی در یک چرخه ۲۴ ساعته در نوسان است، یک بار خوانش در کلینیک در مقایسه با خطر پایه واقعی او، حاوی خطای تصادفی قابلتوجهی است.[2]
اگر پژوهشگران خطر سکته مغزی را بر اساس همان یک خوانش نویزدار رگرسیون کنند، ضریب بهدستآمده خطر واقعی فشار خون بالا را بهشدت دستکم میگیرد و در صورت عدم اصلاح سوگیری، میتواند دستورالعملهای بهداشت عمومی را تغییر دهد.[2]
وقتی مدلها شامل چندین متغیر پیشبین باشند، این مشکل بهطور تصاعدی پیچیدهتر میشود. یک مقاله کاری در سال ۲۰۱۸ از پلتفرم هیئت علمی Wharton نشان میدهد که خطای اندازهگیری کلاسیک در یک متغیر، فقط ضریب خودش را تضعیف نمیکند.
در عوض، این خطا در سراسر ماتریس واریانس-کوواریانس نشت میکند. این امر میتواند متغیرهای کمکی را که در همان مدل بهطور کامل و دقیق اندازهگیری شدهاند، متورم یا کوچک کند و یا حتی علامت آنها را معکوس سازد و در نتیجه کل خروجی را غیرقابلاعتماد کند.
پژوهشگران در دانشگاه Charles Sturt با تأکید بر نحوه تأثیر این موضوع بر استنتاج آماری، خاطرنشان میکنند که خطای اندازهگیری، خطاهای استاندارد و مقادیر p را مخدوش میکند و به منفیهای کاذب منجر میشود؛ جایی که اثرات واقعی به عنوان موارد فاقد اهمیت آماری نادیده گرفته میشوند.[3]
اصلاح این وضعیت نیازمند اطلاعات خارجی است. مدل استاندارد خطاهای متغیرها، برای معکوس کردن این کوچکشدگی ریاضی و بازیابی شیب واقعی، بر متغیرهای ابزاری یا نسبتهای پایاییِ شناختهشده تکیه دارد.[1]
در ژنتیک آماری، پژوهشگران از نمرات خطر چندژنی برای پیشبینی استعداد ابتلا به بیماری استفاده میکنند. چارچوبی که در نشریه Genetic Epidemiology منتشر شده، یک رویکرد بیزی را برای اصلاح سوگیری تضعیف در زمانی که این نمرات با خطا اندازهگیری میشوند، شرح میدهد و برآوردهای وراثتپذیری واقعی را با موفقیت بازیابی میکند.[5]
با این حال، این اصلاحات فرض میکنند که خطا از نوع کلاسیک است. یک تحلیل در سال ۲۰۲۱ که در econometrics.blog منتشر شده، هشدار میدهد که وقتی فراتر از خطای اندازهگیری کلاسیک حرکت میکنیم - جایی که نویز با مقدار واقعی همبستگی دارد - سوگیری لزوماً به سمت صفر کوچک نمیشود و در واقع میتواند ضریب را متورم کند.
اصطلاحات کلیدی
- خطای اندازهگیری کلاسیک
- نویز تصادفی در یک متغیر که کاملاً مستقل از مقدار واقعی و جمله خطای رگرسیون است.
- سوگیری تضعیف
- پدیده ریاضی که در آن خطای اندازهگیری در یک متغیر پیشبین، ضریب رگرسیون برآورد شده را به صفر نزدیکتر میکند.
- نسبت پایایی
- نسبتی از کل واریانس مشاهدهشده که به جای نویز اندازهگیری، از سیگنال واقعی ناشی میشود.
- مدل خطاهای متغیرها
- دستهای از مدلهای آماری که برای در نظر گرفتن خطای اندازهگیری در متغیرهای مستقل طراحی شدهاند.
بررسی عمیق دیدگاهها
روششناسی اپیدمیولوژیک
بر این موضوع تمرکز دارد که چگونه خطای اندازهگیری در خوانشهای بالینی، خطرات بلندمدت بیماری را دستکم میگیرد.
اپیدمیولوژیستها در درجه اول نگران سوگیری رقیقشدگی رگرسیون در مطالعات طولی هستند. وقتی یک اندازهگیری پایه منفرد - مانند فشار خون یا کلسترول - برای پیشبینی پیامدهای بلندمدت مانند سکته مغزی یا بیماری قلبی استفاده میشود، نوسانات بیولوژیکی طبیعی خطای تصادفی ایجاد میکنند. این خطا شیب رگرسیون را مسطح میکند و باعث میشود مقامات بهداشت عمومی بهطور سیستماتیک خطر واقعی این عوامل خطر را دستکم بگیرند، مگر اینکه اندازهگیریهای مکرر برای محاسبه نسبت پایایی انجام شود.
نظریه اقتصادسنجی
بر این موضوع تمرکز دارد که چگونه خطا در یک متغیر، کل ماتریس واریانس-کوواریانس را در رگرسیون چندگانه مخدوش میکند.
اقتصادسنجیدانان سیستمهای پیچیدهای را با چندین متغیر در حال تعامل مدلسازی میکنند که این امر سوگیری تضعیف را بسیار مخربتر میسازد. اگر یک پیشبین منفرد در یک مدل رگرسیون چندگانه با خطا اندازهگیری شود، سوگیری فقط آن ضریب خاص را کوچک نمیکند. بلکه در سراسر مدل نشت میکند و بهطور بالقوه متغیرهای کمکی را که کاملاً دقیق اندازهگیری شدهاند، متورم کرده یا علامت آنها را معکوس میکند. برای مقابله با این موضوع، اقتصادسنجیدانان بهشدت به متغیرهای ابزاری تکیه میکنند - نقاط داده خارجی که با سیگنال واقعی همبستگی دارند اما مستقل از نویز هستند.
ژنتیک آماری
بر بازیابی برآوردهای وراثتپذیری واقعی از نمرات خطر چندژنی نویزدار تمرکز دارد.
در ژنتیک آماری، پژوهشگران از نمرات خطر چندژنی برای پیشبینی استعداد یک فرد برای ابتلا به بیماریهای پیچیده استفاده میکنند. با این حال، از آنجا که این نمرات از مطالعات ارتباط سراسر ژنومِ محدود برآورد میشوند، ذاتاً حاوی خطای اندازهگیری هستند. ژنتیکدانان از چارچوبهای اصلاحی بیزی برای تعدیل این تضعیف استفاده میکنند تا اطمینان حاصل کنند که وراثتپذیری برآورد شده یک صفت، بهطور مصنوعی توسط نویز در فرآیند توالییابی و نمرهگذاری سرکوب نمیشود.
- روششناسی اپیدمیولوژیک
- بر این موضوع تمرکز دارد که چگونه خطای اندازهگیری در خوانشهای بالینی، خطرات بلندمدت بیماری را دستکم میگیرد.
- نظریه اقتصادسنجی
- بر این موضوع تمرکز دارد که چگونه خطا در یک متغیر، کل ماتریس واریانس-کوواریانس را در رگرسیون چندگانه مخدوش میکند.
- استنتاج آماری
- بر کرانهای ریاضی مدل خطاهای متغیرها و تأثیر آن بر مقادیر p تمرکز دارد.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان یادگیری ماشین
- طراحان کارآزماییهای بالینی
منابع
[1]Wikipediaاستنتاج آماریErrors-in-variables model
مطالعه در Wikipedia →
[2]BMC Medical Research Methodologyروششناسی اپیدمیولوژیکRegression dilution bias: Tools for correction methods and sample size calculation
مطالعه در BMC Medical Research Methodology →
[3]Charles Sturt University Research OutputHow measurement error affects inference in linear regression
مطالعه در Charles Sturt University Research Output →
[4]Penn State Universityاستنتاج آماری11.1 - What if the Regression Equation Contains "Wrong" Predictors?
مطالعه در Penn State University →
[5]Genetic Epidemiologyروششناسی اپیدمیولوژیکA Bayesian approach to correcting the attenuation bias of regression using polygenic risk score
مطالعه در Genetic Epidemiology →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →روششناسی نظرسنجی
سازوکار افت قدرت آماری در نظرسنجیهای پیچیده: درون جریمه «اثر طراحی»
9 منبع
نظریه آماری
چگونه قضیه حد مرکزی آشوب را مجبور به تبعیت از منحنی زنگولهای میکند
6 منبع
هوش مصنوعی سازمانی
تحلیلگران داده هفتهای ۶ ساعت را صرف اعتبارسنجی و اصلاح خروجیهای هوش مصنوعی میکنند
8 منبع
ارتباط اجتماعی
نگاهی به دادههای رند: محققان چگونه مکانیسم تنهایی آمریکاییها را اندازهگیری میکنند
3 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





