فرمول ریاضی که جهت و بزرگی سوگیری متغیر حذفشده در رگرسیون را تعیین میکند
وقتی یک مدل رگرسیون یک متغیر مخدوشکننده حیاتی را جا میاندازد، فقط دقت آن کاهش نمییابد. یک فرمول ریاضی خاص دقیقاً تعیین میکند که چگونه متغیرهای باقیمانده به اشتباه تأثیر دادههای ازدسترفته را به نام خود ثبت میکنند.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- اقتصادسنجیدانان
- تمرکز بر شناسایی روابط علی و استفاده از متغیرهای ابزاری برای دور زدن سوگیری.
- دانشمندان دادههای پیشبینیکننده
- تمرکز بر دقت کلی مدل، جایی که اگر هدف صرفاً پیشبینی باشد، متغیرهای حذفشده اهمیت کمتری دارند.
- مدلسازان ریسک مالی
- تمرکز بر اینکه چگونه متغیرهای حذفشده بتاهای عاملی را مخدوش کرده و ریسک بازار را اشتباه قیمتگذاری میکنند.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان یادگیری ماشین که به مدلهای جعبه سیاه متکی هستند، جایی که سوگیری متغیرهای فردی توسط ابعاد بالا پنهان میشود.
- سیاستگذارانی که از تحقیقات مشاهدهای سوگیرانه استفاده میکنند بدون اینکه اعوجاجهای ریاضی زیربنایی آن را درک کنند.
چرا مهم است
وقتی یک مدل رگرسیون متغیر مهمی را حذف میکند، فقط دقتش کم نمیشود، بلکه از نظر ریاضی یک رابطه کاذب میسازد. درک این فرمول برای هر کسی که به دادههای مشاهدهای متکی است ضروری است، زیرا ثابت میکند که هیچ مقدار داده اضافی نمیتواند مدلی را که از اساس اشتباه طراحی شده، اصلاح کند.
یک متغیر گمشده در مدل رگرسیون صرفاً نتایج را مبهم نمیکند؛ بلکه از نظر ریاضی متغیرهای باقیمانده را مجبور میکند تا تأثیر دادههای ازدسترفته را به نام خود ثبت کنند. وقتی یک تحلیلگر عامل مهمی را از مجموعه دادهها کنار میگذارد، فرمول سوگیری متغیر حذفشده تضمین میکند که مدل با اطمینان اندازه اثر کاذبی را گزارش دهد. این خطا یک نوسان تصادفی نیست، بلکه یک نقص ساختاری است که مستقیماً در دل محاسبات تعبیه شده است.[6]
توهم مجموعه دادههای بزرگ اغلب این خطر را پنهان میکند. در علم داده مدرن، این تصور غلط و رایج وجود دارد که جمعآوری میلیونها سطر داده در نهایت نویزهای آماری را از بین میبرد. اما سوگیری متغیر حذفشده یک نویز تصادفی نیست؛ بلکه یک جریمه ریاضی قطعی است. همانطور که کتاب درسی «مقدمهای بر اقتصادسنجی با R» صراحتاً هشدار میدهد: «سوگیری متغیر حذفشده مانع از همگرایی برآوردگر در احتمال به مقدار واقعی پارامتر میشود.» از آنجا که این سوگیری در ساختار برآوردگر حداقل مربعات معمولی (OLS) تنیده شده است، با افزایش اندازه نمونه، این خطا با کاهش ۰ درصدی سوگیری همراه خواهد بود.[1]
مکانیسم این اعوجاج زمانی روشن میشود که یک مدل واقعی جمعیت را با یک رگرسیون کوتاه مقایسه کنیم. همانطور که در مطالب درسی اقتصادسنجی دانشگاهی تعریف شده است: «فرض کنید متغیری را که در واقع متعلق به مدل واقعی (یا جمعیت) است، حذف کنیم. این اغلب مشکل حذف یک متغیر مرتبط یا تعیین ناقص مدل نامیده میشود.» اگر یک رابطه اقتصادی واقعی به ۲ متغیر متکی باشد - مانند تحصیلات و توانایی ذاتی که دستمزد یک کارگر را تعیین میکنند - اما محقق فقط دادههای مربوط به تحصیلات را در اختیار داشته باشد، مجبور است یک رگرسیون کوتاه اجرا کند. متغیر گمشده، یعنی توانایی، به سادگی از ریاضیات ناپدید نمیشود. در عوض، جذب جمله خطای مدل میشود.[2][5]
برای اینکه این جذب مدل را خراب کند، باید ۲ شرط دقیق ریاضی بهطور همزمان برآورده شوند. اول، متغیر حذفشده باید یک تعیینکننده واقعی برای متغیر وابسته باشد. اگر عامل گمشده هیچ تأثیر واقعی بر نتیجه نداشته باشد، کنار گذاشتن آن صرفاً قدرت تبیین مدل را کاهش میدهد بدون اینکه ضرایب باقیمانده را دچار سوگیری کند. در این حالت مدل ضعیفتر است، اما از نظر ریاضی دروغ نمیگوید.[1][5]
دوم، متغیر حذفشده باید با متغیر مستقلی که در رگرسیون گنجانده شده است، همبستگی داشته باشد. این همان پیوند کشنده است. از آنجا که متغیر موجود و متغیر گمشده در دنیای واقعی با هم حرکت میکنند، الگوریتم رگرسیون نمیتواند آنها را از هم تشخیص دهد. الگوریتم تغییر نتیجه را میبیند و ۱۰۰ درصد اعتبار ریاضی را به تنها متغیری که میتواند ببیند اختصاص میدهد.[1][5][6]
این پویایی، فرض اصلی رگرسیون OLS را نقض میکند: فرض برونزایی. برای معتبر بودن یک رگرسیون، جمله خطا باید دارای ارزش مورد انتظار ۰، مشروط بر رگرسورهای موجود باشد. وقتی یک متغیر حذفشده در جمله خطا به دام میافتد و با یک متغیر موجود همبستگی پیدا میکند، آن میانگین شرطی دیگر صفر نیست و مدل در هم میشکند.[1]
این پویایی، فرض اصلی رگرسیون OLS را نقض میکند: فرض برونزایی.
بزرگی و جهت دقیق این شکست توسط فرمول سوگیری متغیر حذفشده تعریف میشود. مقدار مورد انتظار ضریب سوگیرانه برابر است با اثر واقعی به علاوه یک جمله سوگیری خاص. آن جمله سوگیری، ضریب واقعی متغیر حذفشده ضرب در همبستگی بین متغیرهای حذفشده و موجود است.[3]
در نمادگذاری رسمی اقتصادسنجی، سوگیری به صورت β2 × δ1 بیان میشود، که در آن β2 اثر واقعی متغیر گمشده بر نتیجه است و δ1 شیب رابطه بین متغیر گمشده و متغیر موجود است. این معادله فشرده، پلی بین آمار محض و استدلال علی است که تحلیلگران را مجبور میکند تا آنچه را که نمیتوانند ببینند، در نظر بگیرند.[3][6]
با بررسی علامتهای β2 و δ1، محققان میتوانند جهت سوگیری را تعیین کنند، حتی اگر نتوانند اندازه دقیق آن را محاسبه کنند. اگر متغیر حذفشده تأثیر مثبتی بر نتیجه داشته باشد و همبستگی مثبتی با متغیر موجود داشته باشد، هر دو جمله مثبت هستند. ضرب دو عدد مثبت منجر به یک سوگیری مثبت میشود، به این معنی که مدل اثر واقعی را بیش از حد برآورد میکند و یک مثبت کاذب یا یک ضریب متورم ایجاد میکند.[3][5]
برعکس، اگر علامتها متضاد باشند - برای مثال، اگر متغیر حذفشده تأثیر مثبتی بر نتیجه بگذارد اما همبستگی منفی با متغیر موجود داشته باشد - سوگیری منفی خواهد بود. این امر میتواند به طور مصنوعی یک ضریب را کاهش داده و تأثیر واقعی آن را پنهان کند. به عنوان مثال، هنگام اندازهگیری تأثیر تغییر ۱ واحدی در نسبت دانشآموز به معلم بر نمرات آزمون، حذف متغیر مخدوشکننده ثروت منطقه، به طور مصنوعی اثر اندازه کلاس را دچار سوگیری میکند، زیرا ثروت بر نمرات تأثیر میگذارد و با اندازه کلاسها همبستگی دارد.[1][5]
بزرگی این اعوجاج میتواند برای مدلهای ساده فاجعهبار باشد. در سیستمی با یک بردار ستونی p × ۱ از پارامترها، حذف تنها ۱ متغیر اسکالر مرتبط، رگرسیون را مجبور میکند تا اثر ترکیبی هر دو متغیر را به ۱ متغیر موجود منفرد نسبت دهد. ضریب حاصل در واقع تخمینی از مشتق کل است تا مشتق جزئی، به این معنی که مدل با اطمینان رابطهای را گزارش میدهد که بیشتر یک مصنوع ریاضی ناشی از دادههای ازدسترفته است.[5][6]
از آنجا که متغیر حذفشده مشاهده نمیشود، بزرگی دقیق سوگیری در عمل قابل محاسبه نیست. این فرمول وجود و جهت خطا را از نظر تئوری ثابت میکند، اما بار اثبات بر دوش محقق باقی میماند تا با استفاده از نظریه اقتصادی یا علمی استدلال کند که هیچ مخدوشکننده مهمی کنار گذاشته نشده است. دادهها هرگز به تنهایی این اطلاعات را داوطلبانه ارائه نمیدهند.[5][6]
برای دور زدن این تله ریاضی، محققان باید به روششناسیهای جایگزین تکیه کنند. کارآزماییهای تصادفی کنترلشده، همبستگی بین متغیر موجود (درمان) و هر متغیر حذفشدهای را قطع میکنند و شرط دوم فرمول سوگیری را خنثی میسازند. زمانی که انجام آزمایشها غیرممکن است، اقتصادسنجیدانان از متغیرهای ابزاری یا متغیرهای جایگزین استفاده میکنند تا اثر علی واقعی را از جمله خطای آلوده جدا کنند و اطمینان حاصل کنند که ریاضیات واقعیت را منعکس میکند.[4][5]
بررسی عمیق دیدگاهها
اقتصادسنجیدانان
تمرکز بر شناسایی روابط علی و استفاده از متغیرهای ابزاری برای دور زدن سوگیری.
برای اقتصادسنجیدانان، سوگیری متغیر حذفشده تهدید اصلی برای استنتاج علی است. روششناسی آنها فرض میکند که دادههای مشاهدهای ذاتاً توسط مخدوشکنندههای اندازهگیرینشده دارای نقص هستند. برای حل این مشکل، آنها از طرحهای شبهآزمایشی - مانند متغیرهای ابزاری یا تفاوت در تفاوتها - استفاده میکنند تا از نظر ریاضی تغییرات متغیر موجود را که کاملاً با جمله خطا همبستگی ندارد، جدا کنند و در نتیجه فرمول سوگیری را خنثی سازند.
دانشمندان دادههای پیشبینیکننده
تمرکز بر دقت کلی مدل، جایی که اگر هدف صرفاً پیشبینی باشد، متغیرهای حذفشده اهمیت کمتری دارند.
در حوزه یادگیری ماشین و مدلسازی پیشبینیکننده، سوگیری متغیر حذفشده اغلب به عنوان یک نگرانی ثانویه در نظر گرفته میشود. اگر هدف صرفاً پیشبینی یک نتیجه (به حداکثر رساندن R-squared) باشد تا درک مکانیسم علی، یک ضریب سوگیرانه قابل قبول است تا زمانی که متغیرهای موجود بهطور قابل اعتمادی جایگزین دادههای ازدسترفته شوند. مدل همچنان با دقت پیشبینی میکند، حتی اگر قدرت پیشبینی را به متغیرهای اشتباه نسبت دهد.
مدلسازان ریسک مالی
تمرکز بر اینکه چگونه متغیرهای حذفشده بتاهای عاملی را مخدوش کرده و ریسک بازار را اشتباه قیمتگذاری میکنند.
مالیه کمی برای قیمتگذاری ریسک به شدت به مدلهای عاملی متکی است. برای این تحلیلگران، سوگیری متغیر حذفشده یک آسیبپذیری حیاتی است که میتواند در معرض خطر بودن واقعی یک سبد سرمایهگذاری را پنهان کند. اگر یک مدل ریسک یک عامل کلان اقتصادی حیاتی را که با بتای بازار موجود همبستگی دارد حذف کند، فرمول تضمین میکند که بتای محاسبهشده بهطور مصنوعی متورم یا کاهش مییابد که منجر به قیمتگذاری اشتباه داراییها و قرار گرفتن در معرض بازار بدون پوشش ریسک میشود.
نکات کلیدی
- سوگیری متغیر حذفشده زمانی رخ میدهد که یک مدل رگرسیون عاملی را که تعیینکننده نتیجه است و با یک متغیر موجود همبستگی دارد، کنار بگذارد.
- این سوگیری با افزایش اندازه نمونه کاهش نمییابد؛ بلکه یک اعوجاج ریاضی دائمی در برآوردگر است.
- جهت سوگیری را میتوان با ضرب اثر واقعی متغیر حذفشده در همبستگی آن با متغیر موجود محاسبه کرد.
- اگر هر دو رابطه علامت یکسانی داشته باشند، مدل اثر را بیش از حد برآورد میکند؛ اگر متفاوت باشند، آن را کمتر از حد واقعی تخمین میزند.
اصطلاحات کلیدی
- برونزایی
- این فرض که جمله خطا در یک مدل رگرسیون با هیچیک از متغیرهای مستقل موجود همبستگی ندارد.
- درونزایی
- نقض برونزایی، که اغلب به دلیل متغیرهای حذفشده ایجاد میشود، جایی که یک متغیر مستقل با جمله خطا همبستگی دارد.
- حداقل مربعات معمولی (OLS)
- یک روش آماری رایج که رابطه بین متغیرها را با به حداقل رساندن مجموع مجذور تفاوتهای بین مقادیر مشاهدهشده و پیشبینیشده تخمین میزند.
- مخدوشکننده
- یک متغیر سوم اندازهگیرینشده که هم بر علت فرضی و هم بر معلول فرضی تأثیر میگذارد و یک ارتباط کاذب ایجاد میکند.
- جمله خطا
- بخشی از یک مدل آماری که نشاندهنده تغییرات در متغیر وابسته است که توسط متغیرهای مستقل موجود قابل توضیح نیست.
منابع
[1]Introduction to Econometrics with Rاقتصادسنجیدانان6.1 Omitted Variable Bias
مطالعه در Introduction to Econometrics with R →
[2]Econometrics Course MaterialاقتصادسنجیدانانOmitted Variable Bias: The Simple Case
مطالعه در Econometrics Course Material →
[3]Tamma Carleton (EDS 222)اقتصادسنجیدانانSimple derivation of omitted variables bias
مطالعه در Tamma Carleton (EDS 222) →
[4]MIT OpenCourseWareاقتصادسنجیدانانWeek 9
مطالعه در MIT OpenCourseWare →
[5]Wikipediaدانشمندان دادههای پیشبینیکنندهOmitted-variable bias
مطالعه در Wikipedia →
[6]تیم سردبیری کوهستانمدلسازان ریسک مالیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





