رفتن به محتوای اصلی
Koohestun
توضیح کوهستانسوگیری متغیر حذف‌شدهتشریح متدولوژی· 5 دقیقه مطالعه· در تحلیل داده

فرمول ریاضی که جهت و بزرگی سوگیری متغیر حذف‌شده در رگرسیون را تعیین می‌کند

وقتی یک مدل رگرسیون یک متغیر مخدوش‌کننده حیاتی را جا می‌اندازد، فقط دقت آن کاهش نمی‌یابد. یک فرمول ریاضی خاص دقیقاً تعیین می‌کند که چگونه متغیرهای باقی‌مانده به اشتباه تأثیر داده‌های ازدست‌رفته را به نام خود ثبت می‌کنند.

به قلم ندا وزیری

اقتصادسنجی‌دانان 40%دانشمندان داده‌های پیش‌بینی‌کننده 30%مدل‌سازان ریسک مالی 30%
اقتصادسنجی‌دانان
تمرکز بر شناسایی روابط علی و استفاده از متغیرهای ابزاری برای دور زدن سوگیری.
دانشمندان داده‌های پیش‌بینی‌کننده
تمرکز بر دقت کلی مدل، جایی که اگر هدف صرفاً پیش‌بینی باشد، متغیرهای حذف‌شده اهمیت کمتری دارند.
مدل‌سازان ریسک مالی
تمرکز بر اینکه چگونه متغیرهای حذف‌شده بتاهای عاملی را مخدوش کرده و ریسک بازار را اشتباه قیمت‌گذاری می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مهندسان یادگیری ماشین که به مدل‌های جعبه سیاه متکی هستند، جایی که سوگیری متغیرهای فردی توسط ابعاد بالا پنهان می‌شود.
  • سیاست‌گذارانی که از تحقیقات مشاهده‌ای سوگیرانه استفاده می‌کنند بدون اینکه اعوجاج‌های ریاضی زیربنایی آن را درک کنند.

چرا مهم است

وقتی یک مدل رگرسیون متغیر مهمی را حذف می‌کند، فقط دقتش کم نمی‌شود، بلکه از نظر ریاضی یک رابطه کاذب می‌سازد. درک این فرمول برای هر کسی که به داده‌های مشاهده‌ای متکی است ضروری است، زیرا ثابت می‌کند که هیچ مقدار داده اضافی نمی‌تواند مدلی را که از اساس اشتباه طراحی شده، اصلاح کند.

یک متغیر گمشده در مدل رگرسیون صرفاً نتایج را مبهم نمی‌کند؛ بلکه از نظر ریاضی متغیرهای باقی‌مانده را مجبور می‌کند تا تأثیر داده‌های ازدست‌رفته را به نام خود ثبت کنند. وقتی یک تحلیلگر عامل مهمی را از مجموعه داده‌ها کنار می‌گذارد، فرمول سوگیری متغیر حذف‌شده تضمین می‌کند که مدل با اطمینان اندازه اثر کاذبی را گزارش دهد. این خطا یک نوسان تصادفی نیست، بلکه یک نقص ساختاری است که مستقیماً در دل محاسبات تعبیه شده است.[6]

توهم مجموعه داده‌های بزرگ اغلب این خطر را پنهان می‌کند. در علم داده مدرن، این تصور غلط و رایج وجود دارد که جمع‌آوری میلیون‌ها سطر داده در نهایت نویزهای آماری را از بین می‌برد. اما سوگیری متغیر حذف‌شده یک نویز تصادفی نیست؛ بلکه یک جریمه ریاضی قطعی است. همان‌طور که کتاب درسی «مقدمه‌ای بر اقتصادسنجی با R» صراحتاً هشدار می‌دهد: «سوگیری متغیر حذف‌شده مانع از همگرایی برآوردگر در احتمال به مقدار واقعی پارامتر می‌شود.» از آنجا که این سوگیری در ساختار برآوردگر حداقل مربعات معمولی (OLS) تنیده شده است، با افزایش اندازه نمونه، این خطا با کاهش ۰ درصدی سوگیری همراه خواهد بود.[1]

مکانیسم این اعوجاج زمانی روشن می‌شود که یک مدل واقعی جمعیت را با یک رگرسیون کوتاه مقایسه کنیم. همان‌طور که در مطالب درسی اقتصادسنجی دانشگاهی تعریف شده است: «فرض کنید متغیری را که در واقع متعلق به مدل واقعی (یا جمعیت) است، حذف کنیم. این اغلب مشکل حذف یک متغیر مرتبط یا تعیین ناقص مدل نامیده می‌شود.» اگر یک رابطه اقتصادی واقعی به ۲ متغیر متکی باشد - مانند تحصیلات و توانایی ذاتی که دستمزد یک کارگر را تعیین می‌کنند - اما محقق فقط داده‌های مربوط به تحصیلات را در اختیار داشته باشد، مجبور است یک رگرسیون کوتاه اجرا کند. متغیر گمشده، یعنی توانایی، به سادگی از ریاضیات ناپدید نمی‌شود. در عوض، جذب جمله خطای مدل می‌شود.[2][5]

دو شرط ریاضی لازم برای اینکه سوگیری متغیر حذف‌شده یک رگرسیون را مخدوش کند.

برای اینکه این جذب مدل را خراب کند، باید ۲ شرط دقیق ریاضی به‌طور همزمان برآورده شوند. اول، متغیر حذف‌شده باید یک تعیین‌کننده واقعی برای متغیر وابسته باشد. اگر عامل گمشده هیچ تأثیر واقعی بر نتیجه نداشته باشد، کنار گذاشتن آن صرفاً قدرت تبیین مدل را کاهش می‌دهد بدون اینکه ضرایب باقی‌مانده را دچار سوگیری کند. در این حالت مدل ضعیف‌تر است، اما از نظر ریاضی دروغ نمی‌گوید.[1][5]

دوم، متغیر حذف‌شده باید با متغیر مستقلی که در رگرسیون گنجانده شده است، همبستگی داشته باشد. این همان پیوند کشنده است. از آنجا که متغیر موجود و متغیر گمشده در دنیای واقعی با هم حرکت می‌کنند، الگوریتم رگرسیون نمی‌تواند آن‌ها را از هم تشخیص دهد. الگوریتم تغییر نتیجه را می‌بیند و ۱۰۰ درصد اعتبار ریاضی را به تنها متغیری که می‌تواند ببیند اختصاص می‌دهد.[1][5][6]

این پویایی، فرض اصلی رگرسیون OLS را نقض می‌کند: فرض برون‌زایی. برای معتبر بودن یک رگرسیون، جمله خطا باید دارای ارزش مورد انتظار ۰، مشروط بر رگرسورهای موجود باشد. وقتی یک متغیر حذف‌شده در جمله خطا به دام می‌افتد و با یک متغیر موجود همبستگی پیدا می‌کند، آن میانگین شرطی دیگر صفر نیست و مدل در هم می‌شکند.[1]

این پویایی، فرض اصلی رگرسیون OLS را نقض می‌کند: فرض برون‌زایی.

بزرگی و جهت دقیق این شکست توسط فرمول سوگیری متغیر حذف‌شده تعریف می‌شود. مقدار مورد انتظار ضریب سوگیرانه برابر است با اثر واقعی به علاوه یک جمله سوگیری خاص. آن جمله سوگیری، ضریب واقعی متغیر حذف‌شده ضرب در همبستگی بین متغیرهای حذف‌شده و موجود است.[3]

چگونه حذف یک عامل مخدوش‌کننده باعث سوگیری رو به پایین یک ضریب می‌شود.

در نمادگذاری رسمی اقتصادسنجی، سوگیری به صورت β2 × δ1 بیان می‌شود، که در آن β2 اثر واقعی متغیر گمشده بر نتیجه است و δ1 شیب رابطه بین متغیر گمشده و متغیر موجود است. این معادله فشرده، پلی بین آمار محض و استدلال علی است که تحلیلگران را مجبور می‌کند تا آنچه را که نمی‌توانند ببینند، در نظر بگیرند.[3][6]

با بررسی علامت‌های β2 و δ1، محققان می‌توانند جهت سوگیری را تعیین کنند، حتی اگر نتوانند اندازه دقیق آن را محاسبه کنند. اگر متغیر حذف‌شده تأثیر مثبتی بر نتیجه داشته باشد و همبستگی مثبتی با متغیر موجود داشته باشد، هر دو جمله مثبت هستند. ضرب دو عدد مثبت منجر به یک سوگیری مثبت می‌شود، به این معنی که مدل اثر واقعی را بیش از حد برآورد می‌کند و یک مثبت کاذب یا یک ضریب متورم ایجاد می‌کند.[3][5]

برعکس، اگر علامت‌ها متضاد باشند - برای مثال، اگر متغیر حذف‌شده تأثیر مثبتی بر نتیجه بگذارد اما همبستگی منفی با متغیر موجود داشته باشد - سوگیری منفی خواهد بود. این امر می‌تواند به طور مصنوعی یک ضریب را کاهش داده و تأثیر واقعی آن را پنهان کند. به عنوان مثال، هنگام اندازه‌گیری تأثیر تغییر ۱ واحدی در نسبت دانش‌آموز به معلم بر نمرات آزمون، حذف متغیر مخدوش‌کننده ثروت منطقه، به طور مصنوعی اثر اندازه کلاس را دچار سوگیری می‌کند، زیرا ثروت بر نمرات تأثیر می‌گذارد و با اندازه کلاس‌ها همبستگی دارد.[1][5]

بزرگی این اعوجاج می‌تواند برای مدل‌های ساده فاجعه‌بار باشد. در سیستمی با یک بردار ستونی p × ۱ از پارامترها، حذف تنها ۱ متغیر اسکالر مرتبط، رگرسیون را مجبور می‌کند تا اثر ترکیبی هر دو متغیر را به ۱ متغیر موجود منفرد نسبت دهد. ضریب حاصل در واقع تخمینی از مشتق کل است تا مشتق جزئی، به این معنی که مدل با اطمینان رابطه‌ای را گزارش می‌دهد که بیشتر یک مصنوع ریاضی ناشی از داده‌های ازدست‌رفته است.[5][6]

فرمول ریاضی که جهت و بزرگی سوگیری را تعیین می‌کند.

از آنجا که متغیر حذف‌شده مشاهده نمی‌شود، بزرگی دقیق سوگیری در عمل قابل محاسبه نیست. این فرمول وجود و جهت خطا را از نظر تئوری ثابت می‌کند، اما بار اثبات بر دوش محقق باقی می‌ماند تا با استفاده از نظریه اقتصادی یا علمی استدلال کند که هیچ مخدوش‌کننده مهمی کنار گذاشته نشده است. داده‌ها هرگز به تنهایی این اطلاعات را داوطلبانه ارائه نمی‌دهند.[5][6]

برای دور زدن این تله ریاضی، محققان باید به روش‌شناسی‌های جایگزین تکیه کنند. کارآزمایی‌های تصادفی کنترل‌شده، همبستگی بین متغیر موجود (درمان) و هر متغیر حذف‌شده‌ای را قطع می‌کنند و شرط دوم فرمول سوگیری را خنثی می‌سازند. زمانی که انجام آزمایش‌ها غیرممکن است، اقتصادسنجی‌دانان از متغیرهای ابزاری یا متغیرهای جایگزین استفاده می‌کنند تا اثر علی واقعی را از جمله خطای آلوده جدا کنند و اطمینان حاصل کنند که ریاضیات واقعیت را منعکس می‌کند.[4][5]

بررسی عمیق دیدگاه‌ها

اقتصادسنجی‌دانان

تمرکز بر شناسایی روابط علی و استفاده از متغیرهای ابزاری برای دور زدن سوگیری.

برای اقتصادسنجی‌دانان، سوگیری متغیر حذف‌شده تهدید اصلی برای استنتاج علی است. روش‌شناسی آن‌ها فرض می‌کند که داده‌های مشاهده‌ای ذاتاً توسط مخدوش‌کننده‌های اندازه‌گیری‌نشده دارای نقص هستند. برای حل این مشکل، آن‌ها از طرح‌های شبه‌آزمایشی - مانند متغیرهای ابزاری یا تفاوت در تفاوت‌ها - استفاده می‌کنند تا از نظر ریاضی تغییرات متغیر موجود را که کاملاً با جمله خطا همبستگی ندارد، جدا کنند و در نتیجه فرمول سوگیری را خنثی سازند.

دانشمندان داده‌های پیش‌بینی‌کننده

تمرکز بر دقت کلی مدل، جایی که اگر هدف صرفاً پیش‌بینی باشد، متغیرهای حذف‌شده اهمیت کمتری دارند.

در حوزه یادگیری ماشین و مدل‌سازی پیش‌بینی‌کننده، سوگیری متغیر حذف‌شده اغلب به عنوان یک نگرانی ثانویه در نظر گرفته می‌شود. اگر هدف صرفاً پیش‌بینی یک نتیجه (به حداکثر رساندن R-squared) باشد تا درک مکانیسم علی، یک ضریب سوگیرانه قابل قبول است تا زمانی که متغیرهای موجود به‌طور قابل اعتمادی جایگزین داده‌های ازدست‌رفته شوند. مدل همچنان با دقت پیش‌بینی می‌کند، حتی اگر قدرت پیش‌بینی را به متغیرهای اشتباه نسبت دهد.

مدل‌سازان ریسک مالی

تمرکز بر اینکه چگونه متغیرهای حذف‌شده بتاهای عاملی را مخدوش کرده و ریسک بازار را اشتباه قیمت‌گذاری می‌کنند.

مالیه کمی برای قیمت‌گذاری ریسک به شدت به مدل‌های عاملی متکی است. برای این تحلیلگران، سوگیری متغیر حذف‌شده یک آسیب‌پذیری حیاتی است که می‌تواند در معرض خطر بودن واقعی یک سبد سرمایه‌گذاری را پنهان کند. اگر یک مدل ریسک یک عامل کلان اقتصادی حیاتی را که با بتای بازار موجود همبستگی دارد حذف کند، فرمول تضمین می‌کند که بتای محاسبه‌شده به‌طور مصنوعی متورم یا کاهش می‌یابد که منجر به قیمت‌گذاری اشتباه دارایی‌ها و قرار گرفتن در معرض بازار بدون پوشش ریسک می‌شود.

نکات کلیدی

  • سوگیری متغیر حذف‌شده زمانی رخ می‌دهد که یک مدل رگرسیون عاملی را که تعیین‌کننده نتیجه است و با یک متغیر موجود همبستگی دارد، کنار بگذارد.
  • این سوگیری با افزایش اندازه نمونه کاهش نمی‌یابد؛ بلکه یک اعوجاج ریاضی دائمی در برآوردگر است.
  • جهت سوگیری را می‌توان با ضرب اثر واقعی متغیر حذف‌شده در همبستگی آن با متغیر موجود محاسبه کرد.
  • اگر هر دو رابطه علامت یکسانی داشته باشند، مدل اثر را بیش از حد برآورد می‌کند؛ اگر متفاوت باشند، آن را کمتر از حد واقعی تخمین می‌زند.

اصطلاحات کلیدی

برون‌زایی
این فرض که جمله خطا در یک مدل رگرسیون با هیچ‌یک از متغیرهای مستقل موجود همبستگی ندارد.
درون‌زایی
نقض برون‌زایی، که اغلب به دلیل متغیرهای حذف‌شده ایجاد می‌شود، جایی که یک متغیر مستقل با جمله خطا همبستگی دارد.
حداقل مربعات معمولی (OLS)
یک روش آماری رایج که رابطه بین متغیرها را با به حداقل رساندن مجموع مجذور تفاوت‌های بین مقادیر مشاهده‌شده و پیش‌بینی‌شده تخمین می‌زند.
مخدوش‌کننده
یک متغیر سوم اندازه‌گیری‌نشده که هم بر علت فرضی و هم بر معلول فرضی تأثیر می‌گذارد و یک ارتباط کاذب ایجاد می‌کند.
جمله خطا
بخشی از یک مدل آماری که نشان‌دهنده تغییرات در متغیر وابسته است که توسط متغیرهای مستقل موجود قابل توضیح نیست.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

اقتصادسنجی‌دانان 40%دانشمندان داده‌های پیش‌بینی‌کننده 30%مدل‌سازان ریسک مالی 30%
  1. [1]Introduction to Econometrics with Rاقتصادسنجی‌دانان

    6.1 Omitted Variable Bias

    مطالعه در Introduction to Econometrics with R
  2. [2]Econometrics Course Materialاقتصادسنجی‌دانان

    Omitted Variable Bias: The Simple Case

    مطالعه در Econometrics Course Material
  3. [3]Tamma Carleton (EDS 222)اقتصادسنجی‌دانان

    Simple derivation of omitted variables bias

    مطالعه در Tamma Carleton (EDS 222)
  4. [4]MIT OpenCourseWareاقتصادسنجی‌دانان

    Week 9

    مطالعه در MIT OpenCourseWare
  5. [5]Wikipediaدانشمندان داده‌های پیش‌بینی‌کننده

    Omitted-variable bias

    مطالعه در Wikipedia
  6. [6]تیم سردبیری کوهستانمدل‌سازان ریسک مالی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.