رفتن به محتوای اصلی
Koohestun
توضیح کوهستانسوگیری آماریبسته شواهد· 4 دقیقه مطالعه· در تحلیل داده

ریاضیات سوگیری تضعیف: چگونه متغیرهای پیش‌بینِ نویزدار، شیب‌های رگرسیون را مسطح می‌کنند

وقتی متغیر مستقل در یک مدل رگرسیون با خطا اندازه‌گیری می‌شود، رابطه برآورد شده به‌طور سیستماتیک به سمت صفر سوگیری پیدا می‌کند. این پدیده ریاضی که به عنوان رقیق‌شدگی رگرسیون شناخته می‌شود، پژوهشگران را ناچار می‌کند تا اثرات واقعی را دست‌کم بگیرند، مگر اینکه اصلاحات خاصی اعمال شود.

به قلم آرش رضایی

روش‌شناسی اپیدمیولوژیک 35%نظریه اقتصادسنجی 35%استنتاج آماری 30%
روش‌شناسی اپیدمیولوژیک
بر این موضوع تمرکز دارد که چگونه خطای اندازه‌گیری در خوانش‌های بالینی، خطرات بلندمدت بیماری را دست‌کم می‌گیرد.
نظریه اقتصادسنجی
بر این موضوع تمرکز دارد که چگونه خطا در یک متغیر، کل ماتریس واریانس-کوواریانس را در رگرسیون چندگانه مخدوش می‌کند.
استنتاج آماری
بر کران‌های ریاضی مدل خطاهای متغیرها و تأثیر آن بر مقادیر p تمرکز دارد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • متخصصان یادگیری ماشین
  • طراحان کارآزمایی‌های بالینی

برای اینکه رگرسیون حداقل مربعات معمولی بتواند رابطه بین دو متغیر را به‌دقت برآورد کند، متغیر مستقل باید با دقت کامل اندازه‌گیری شود. در پژوهش‌های مشاهده‌ای، این شرط تقریباً هرگز محقق نمی‌شود.[1]

وقتی یک متغیر پیش‌بین حاوی نویز تصادفی باشد، مدل رگرسیون صرفاً دقت خود را از دست نمی‌دهد؛ بلکه به‌طور سیستماتیک اشتباه می‌کند. شیب برآورد شده مسطح می‌شود و از اثر واقعی فاصله گرفته و به سمت صفر میل می‌کند.[1][4]

این پدیده از نظر ریاضی به عنوان سوگیری تضعیف یا رقیق‌شدگی رگرسیون شناخته می‌شود. دلیل بروز آن این است که فرمول آماری برای ضریب رگرسیون، کوواریانس دو متغیر را بر واریانس متغیر پیش‌بین تقسیم می‌کند.[2][6]

تحت مدل کلاسیک خطاهای متغیرها، داده‌های مشاهده‌شده شامل مقدار واقعی به علاوه یک جمله خطای کاملاً تصادفی است. از آنجا که این خطا مستقل است، واریانس داده‌های مشاهده‌شده اکیداً بزرگتر از واریانس داده‌های واقعی است.[1]

متورم شدن مخرج کسرِ ضریب، از نظر ریاضی نتیجه کوچکتری را تضمین می‌کند. اگر واریانس واقعی یک مجموعه داده ۸۰ و واریانس خطای اندازه‌گیری ۲۰ باشد، کل واریانس مشاهده‌شده به ۱۰۰ می‌رسد و ضریب حاصل را دقیقاً به ۸۰ درصد اندازه واقعی‌اش کاهش می‌دهد.[6]

نسبت پایایی دقیقاً تعیین می‌کند که یک ضریب رگرسیون تحت خطای اندازه‌گیری کلاسیک چقدر کوچک می‌شود.

دپارتمان آمار دانشگاه Penn State این موضوع را در برنامه درسی خود پیرامون آنچه هنگام وجود «پیش‌بین‌های اشتباه» در یک مدل رخ می‌دهد، فرمول‌بندی کرده و خاطرنشان می‌کند که جایگزینی یک شاخص نویزدار به جای متغیر واقعی، ناگزیر شیب را مسطح می‌کند.[4]

این قطعیت ریاضی یک تله جدی برای دانشمندان داده ایجاد می‌کند: افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را برطرف نمی‌کند. این کار صرفاً فاصله اطمینان را در اطراف عدد اشتباه و تضعیف‌شده تنگ‌تر می‌کند و مدل را به شکلی دقیق اما نادرست درمی‌آورد.[3][6]

این قطعیت ریاضی یک تله جدی برای دانشمندان داده ایجاد می‌کند: افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را برطرف نمی‌کند.

در اپیدمیولوژی، این سازوکار سوگیری رقیق‌شدگی رگرسیون نامیده می‌شود. یک مقاله روش‌شناسی در سال ۲۰۱۲ در نشریه BMC Medical Research Methodology توضیح می‌دهد که چگونه اندازه‌گیری‌های پایه و منفرد از عواملی مانند فشار خون، در ثبت میانگین‌های بلندمدت ناکام می‌مانند.[2]

از آنجا که فشار خون بیمار به‌طور طبیعی در یک چرخه ۲۴ ساعته در نوسان است، یک بار خوانش در کلینیک در مقایسه با خطر پایه واقعی او، حاوی خطای تصادفی قابل‌توجهی است.[2]

اگر پژوهشگران خطر سکته مغزی را بر اساس همان یک خوانش نویزدار رگرسیون کنند، ضریب به‌دست‌آمده خطر واقعی فشار خون بالا را به‌شدت دست‌کم می‌گیرد و در صورت عدم اصلاح سوگیری، می‌تواند دستورالعمل‌های بهداشت عمومی را تغییر دهد.[2]

با افزایش واریانس نویز تصادفی، ضریب برآورد شده بیشتر به سمت صفر رانده می‌شود.

وقتی مدل‌ها شامل چندین متغیر پیش‌بین باشند، این مشکل به‌طور تصاعدی پیچیده‌تر می‌شود. یک مقاله کاری در سال ۲۰۱۸ از پلتفرم هیئت علمی Wharton نشان می‌دهد که خطای اندازه‌گیری کلاسیک در یک متغیر، فقط ضریب خودش را تضعیف نمی‌کند.

در عوض، این خطا در سراسر ماتریس واریانس-کوواریانس نشت می‌کند. این امر می‌تواند متغیرهای کمکی را که در همان مدل به‌طور کامل و دقیق اندازه‌گیری شده‌اند، متورم یا کوچک کند و یا حتی علامت آن‌ها را معکوس سازد و در نتیجه کل خروجی را غیرقابل‌اعتماد کند.

پژوهشگران در دانشگاه Charles Sturt با تأکید بر نحوه تأثیر این موضوع بر استنتاج آماری، خاطرنشان می‌کنند که خطای اندازه‌گیری، خطاهای استاندارد و مقادیر p را مخدوش می‌کند و به منفی‌های کاذب منجر می‌شود؛ جایی که اثرات واقعی به عنوان موارد فاقد اهمیت آماری نادیده گرفته می‌شوند.[3]

اصلاح این وضعیت نیازمند اطلاعات خارجی است. مدل استاندارد خطاهای متغیرها، برای معکوس کردن این کوچک‌شدگی ریاضی و بازیابی شیب واقعی، بر متغیرهای ابزاری یا نسبت‌های پایاییِ شناخته‌شده تکیه دارد.[1]

خوانش‌های منفرد در کلینیک حاوی نویز بیولوژیکی تصادفی هستند که مدل‌ها را ناچار می‌کند خطر بلندمدت و واقعی فشار خون بالا را دست‌کم بگیرند.

در ژنتیک آماری، پژوهشگران از نمرات خطر چندژنی برای پیش‌بینی استعداد ابتلا به بیماری استفاده می‌کنند. چارچوبی که در نشریه Genetic Epidemiology منتشر شده، یک رویکرد بیزی را برای اصلاح سوگیری تضعیف در زمانی که این نمرات با خطا اندازه‌گیری می‌شوند، شرح می‌دهد و برآوردهای وراثت‌پذیری واقعی را با موفقیت بازیابی می‌کند.[5]

با این حال، این اصلاحات فرض می‌کنند که خطا از نوع کلاسیک است. یک تحلیل در سال ۲۰۲۱ که در econometrics.blog منتشر شده، هشدار می‌دهد که وقتی فراتر از خطای اندازه‌گیری کلاسیک حرکت می‌کنیم - جایی که نویز با مقدار واقعی همبستگی دارد - سوگیری لزوماً به سمت صفر کوچک نمی‌شود و در واقع می‌تواند ضریب را متورم کند.

محدودیت اساسی همچنان پایایی خود ابزار اندازه‌گیری است. بدون یک مجموعه داده ثانویه یا یک متغیر ابزاری برای کمّی کردن واریانس دقیق نویز، اندازه واقعی رابطه از نظر ریاضی در پشت جمله خطا قفل شده باقی می‌ماند.[1][6]

چرا مهم است

هر حوزه‌ای که بر داده‌های مشاهده‌ای تکیه دارد - از اپیدمیولوژی گرفته تا اقتصاد - باید با اندازه‌گیری‌های ناقص دست‌وپنجه نرم کند. عدم اصلاح این خطای ریاضی به این معناست که روابط واقعی و قوی بین متغیرها، ضعیف یا ناموجود به نظر می‌رسند و این امر به رد شدن فرضیه‌ها و اتخاذ تصمیمات سیاستیِ نادرست می‌انجامد.

نکات کلیدی

  • خطای اندازه‌گیری در یک متغیر مستقل به‌طور سیستماتیک ضرایب رگرسیون را به سمت صفر سوگیری می‌دهد.
  • این تضعیف به این دلیل رخ می‌دهد که نویز تصادفی، واریانس کل متغیر پیش‌بین را متورم می‌کند.
  • افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را اصلاح نمی‌کند؛ بلکه تنها اطمینان به برآورد اشتباه را افزایش می‌دهد.
  • در رگرسیون چندگانه، خطا در یک متغیر منفرد می‌تواند ضرایب متغیرهای کمکی را که کاملاً دقیق اندازه‌گیری شده‌اند، مخدوش کند.
  • اصلاح سوگیری تضعیف نیازمند داده‌های خارجی، مانند متغیرهای ابزاری یا نسبت‌های پایایی شناخته‌شده است.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

روش‌شناسی اپیدمیولوژیک 35%نظریه اقتصادسنجی 35%استنتاج آماری 30%
  1. [1]Wikipediaاستنتاج آماری

    Errors-in-variables model

    مطالعه در Wikipedia
  2. [2]BMC Medical Research Methodologyروش‌شناسی اپیدمیولوژیک

    Regression dilution bias: Tools for correction methods and sample size calculation

    مطالعه در BMC Medical Research Methodology
  3. [3]Charles Sturt University Research Output

    How measurement error affects inference in linear regression

    مطالعه در Charles Sturt University Research Output
  4. [4]Penn State Universityاستنتاج آماری

    11.1 - What if the Regression Equation Contains "Wrong" Predictors?

    مطالعه در Penn State University
  5. [5]Genetic Epidemiologyروش‌شناسی اپیدمیولوژیک

    A Bayesian approach to correcting the attenuation bias of regression using polygenic risk score

    مطالعه در Genetic Epidemiology
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.