رفتن به محتوای اصلی
کوهستان
توضیح کوهستانسوگیری آماریبسته شواهد· 4 دقیقه مطالعه· در تحلیل داده

ریاضیات سوگیری تضعیف: چگونه متغیرهای پیش‌بینِ نویزدار، شیب‌های رگرسیون را مسطح می‌کنند

وقتی متغیر مستقل در یک مدل رگرسیون با خطا اندازه‌گیری می‌شود، رابطه برآورد شده به‌طور سیستماتیک به سمت صفر سوگیری پیدا می‌کند. این پدیده ریاضی که به عنوان رقیق‌شدگی رگرسیون شناخته می‌شود، پژوهشگران را ناچار می‌کند تا اثرات واقعی را دست‌کم بگیرند، مگر اینکه اصلاحات خاصی اعمال شود.

به قلم آرش رضایی

به‌طور خلاصه

  • خطای اندازه‌گیری در یک متغیر مستقل به‌طور سیستماتیک ضرایب رگرسیون را به سمت صفر سوگیری می‌دهد.
  • این تضعیف به این دلیل رخ می‌دهد که نویز تصادفی، واریانس کل متغیر پیش‌بین را متورم می‌کند.
  • افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را اصلاح نمی‌کند؛ بلکه تنها اطمینان به برآورد اشتباه را افزایش می‌دهد.

برای اینکه رگرسیون حداقل مربعات معمولی بتواند رابطه بین دو متغیر را به‌دقت برآورد کند، متغیر مستقل باید با دقت کامل اندازه‌گیری شود. در پژوهش‌های مشاهده‌ای، این شرط تقریباً هرگز محقق نمی‌شود.[1]

وقتی یک متغیر پیش‌بین حاوی نویز تصادفی باشد، مدل رگرسیون صرفاً دقت خود را از دست نمی‌دهد؛ بلکه به‌طور سیستماتیک اشتباه می‌کند. شیب برآورد شده مسطح می‌شود و از اثر واقعی فاصله گرفته و به سمت صفر میل می‌کند.[1][4]

این پدیده از نظر ریاضی به عنوان سوگیری تضعیف یا رقیق‌شدگی رگرسیون شناخته می‌شود. دلیل بروز آن این است که فرمول آماری برای ضریب رگرسیون، کوواریانس دو متغیر را بر واریانس متغیر پیش‌بین تقسیم می‌کند.[2][6]

تحت مدل کلاسیک خطاهای متغیرها، داده‌های مشاهده‌شده شامل مقدار واقعی به علاوه یک جمله خطای کاملاً تصادفی است. از آنجا که این خطا مستقل است، واریانس داده‌های مشاهده‌شده اکیداً بزرگتر از واریانس داده‌های واقعی است.[1]

متورم شدن مخرج کسرِ ضریب، از نظر ریاضی نتیجه کوچکتری را تضمین می‌کند. اگر واریانس واقعی یک مجموعه داده ۸۰ و واریانس خطای اندازه‌گیری ۲۰ باشد، کل واریانس مشاهده‌شده به ۱۰۰ می‌رسد و ضریب حاصل را دقیقاً به ۸۰ درصد اندازه واقعی‌اش کاهش می‌دهد.[6]

نسبت پایایی دقیقاً تعیین می‌کند که یک ضریب رگرسیون تحت خطای اندازه‌گیری کلاسیک چقدر کوچک می‌شود.

دپارتمان آمار دانشگاه Penn State این موضوع را در برنامه درسی خود پیرامون آنچه هنگام وجود «پیش‌بین‌های اشتباه» در یک مدل رخ می‌دهد، فرمول‌بندی کرده و خاطرنشان می‌کند که جایگزینی یک شاخص نویزدار به جای متغیر واقعی، ناگزیر شیب را مسطح می‌کند.[4]

این قطعیت ریاضی یک تله جدی برای دانشمندان داده ایجاد می‌کند: افزودن نقاط داده بیشتر به یک مجموعه داده نویزدار، سوگیری را برطرف نمی‌کند. این کار صرفاً فاصله اطمینان را در اطراف عدد اشتباه و تضعیف‌شده تنگ‌تر می‌کند و مدل را به شکلی دقیق اما نادرست درمی‌آورد.[3][6]

در اپیدمیولوژی، این سازوکار سوگیری رقیق‌شدگی رگرسیون نامیده می‌شود. یک مقاله روش‌شناسی در سال ۲۰۱۲ در نشریه BMC Medical Research Methodology توضیح می‌دهد که چگونه اندازه‌گیری‌های پایه و منفرد از عواملی مانند فشار خون، در ثبت میانگین‌های بلندمدت ناکام می‌مانند.[2]

از آنجا که فشار خون بیمار به‌طور طبیعی در یک چرخه ۲۴ ساعته در نوسان است، یک بار خوانش در کلینیک در مقایسه با خطر پایه واقعی او، حاوی خطای تصادفی قابل‌توجهی است.[2]

اگر پژوهشگران خطر سکته مغزی را بر اساس همان یک خوانش نویزدار رگرسیون کنند، ضریب به‌دست‌آمده خطر واقعی فشار خون بالا را به‌شدت دست‌کم می‌گیرد و در صورت عدم اصلاح سوگیری، می‌تواند دستورالعمل‌های بهداشت عمومی را تغییر دهد.[2]

با افزایش واریانس نویز تصادفی، ضریب برآورد شده بیشتر به سمت صفر رانده می‌شود.

وقتی مدل‌ها شامل چندین متغیر پیش‌بین باشند، این مشکل به‌طور تصاعدی پیچیده‌تر می‌شود. یک مقاله کاری در سال ۲۰۱۸ از پلتفرم هیئت علمی Wharton نشان می‌دهد که خطای اندازه‌گیری کلاسیک در یک متغیر، فقط ضریب خودش را تضعیف نمی‌کند.

در عوض، این خطا در سراسر ماتریس واریانس-کوواریانس نشت می‌کند. این امر می‌تواند متغیرهای کمکی را که در همان مدل به‌طور کامل و دقیق اندازه‌گیری شده‌اند، متورم یا کوچک کند و یا حتی علامت آن‌ها را معکوس سازد و در نتیجه کل خروجی را غیرقابل‌اعتماد کند.

پژوهشگران در دانشگاه Charles Sturt با تأکید بر نحوه تأثیر این موضوع بر استنتاج آماری، خاطرنشان می‌کنند که خطای اندازه‌گیری، خطاهای استاندارد و مقادیر p را مخدوش می‌کند و به منفی‌های کاذب منجر می‌شود؛ جایی که اثرات واقعی به عنوان موارد فاقد اهمیت آماری نادیده گرفته می‌شوند.[3]

اصلاح این وضعیت نیازمند اطلاعات خارجی است. مدل استاندارد خطاهای متغیرها، برای معکوس کردن این کوچک‌شدگی ریاضی و بازیابی شیب واقعی، بر متغیرهای ابزاری یا نسبت‌های پایاییِ شناخته‌شده تکیه دارد.[1]

خوانش‌های منفرد در کلینیک حاوی نویز بیولوژیکی تصادفی هستند که مدل‌ها را ناچار می‌کند خطر بلندمدت و واقعی فشار خون بالا را دست‌کم بگیرند.

در ژنتیک آماری، پژوهشگران از نمرات خطر چندژنی برای پیش‌بینی استعداد ابتلا به بیماری استفاده می‌کنند. چارچوبی که در نشریه Genetic Epidemiology منتشر شده، یک رویکرد بیزی را برای اصلاح سوگیری تضعیف در زمانی که این نمرات با خطا اندازه‌گیری می‌شوند، شرح می‌دهد و برآوردهای وراثت‌پذیری واقعی را با موفقیت بازیابی می‌کند.[5]

با این حال، این اصلاحات فرض می‌کنند که خطا از نوع کلاسیک است. یک تحلیل در سال ۲۰۲۱ که در econometrics.blog منتشر شده، هشدار می‌دهد که وقتی فراتر از خطای اندازه‌گیری کلاسیک حرکت می‌کنیم - جایی که نویز با مقدار واقعی همبستگی دارد - سوگیری لزوماً به سمت صفر کوچک نمی‌شود و در واقع می‌تواند ضریب را متورم کند.

محدودیت اساسی همچنان پایایی خود ابزار اندازه‌گیری است. بدون یک مجموعه داده ثانویه یا یک متغیر ابزاری برای کمّی کردن واریانس دقیق نویز، اندازه واقعی رابطه از نظر ریاضی در پشت جمله خطا قفل شده باقی می‌ماند.[1][6]

اصطلاحات کلیدی

خطای اندازه‌گیری کلاسیک
نویز تصادفی در یک متغیر که کاملاً مستقل از مقدار واقعی و جمله خطای رگرسیون است.
سوگیری تضعیف
پدیده ریاضی که در آن خطای اندازه‌گیری در یک متغیر پیش‌بین، ضریب رگرسیون برآورد شده را به صفر نزدیک‌تر می‌کند.
نسبت پایایی
نسبتی از کل واریانس مشاهده‌شده که به جای نویز اندازه‌گیری، از سیگنال واقعی ناشی می‌شود.
مدل خطاهای متغیرها
دسته‌ای از مدل‌های آماری که برای در نظر گرفتن خطای اندازه‌گیری در متغیرهای مستقل طراحی شده‌اند.

بررسی عمیق دیدگاه‌ها

روش‌شناسی اپیدمیولوژیک

بر این موضوع تمرکز دارد که چگونه خطای اندازه‌گیری در خوانش‌های بالینی، خطرات بلندمدت بیماری را دست‌کم می‌گیرد.

اپیدمیولوژیست‌ها در درجه اول نگران سوگیری رقیق‌شدگی رگرسیون در مطالعات طولی هستند. وقتی یک اندازه‌گیری پایه منفرد - مانند فشار خون یا کلسترول - برای پیش‌بینی پیامدهای بلندمدت مانند سکته مغزی یا بیماری قلبی استفاده می‌شود، نوسانات بیولوژیکی طبیعی خطای تصادفی ایجاد می‌کنند. این خطا شیب رگرسیون را مسطح می‌کند و باعث می‌شود مقامات بهداشت عمومی به‌طور سیستماتیک خطر واقعی این عوامل خطر را دست‌کم بگیرند، مگر اینکه اندازه‌گیری‌های مکرر برای محاسبه نسبت پایایی انجام شود.

نظریه اقتصادسنجی

بر این موضوع تمرکز دارد که چگونه خطا در یک متغیر، کل ماتریس واریانس-کوواریانس را در رگرسیون چندگانه مخدوش می‌کند.

اقتصادسنجی‌دانان سیستم‌های پیچیده‌ای را با چندین متغیر در حال تعامل مدل‌سازی می‌کنند که این امر سوگیری تضعیف را بسیار مخرب‌تر می‌سازد. اگر یک پیش‌بین منفرد در یک مدل رگرسیون چندگانه با خطا اندازه‌گیری شود، سوگیری فقط آن ضریب خاص را کوچک نمی‌کند. بلکه در سراسر مدل نشت می‌کند و به‌طور بالقوه متغیرهای کمکی را که کاملاً دقیق اندازه‌گیری شده‌اند، متورم کرده یا علامت آن‌ها را معکوس می‌کند. برای مقابله با این موضوع، اقتصادسنجی‌دانان به‌شدت به متغیرهای ابزاری تکیه می‌کنند - نقاط داده خارجی که با سیگنال واقعی همبستگی دارند اما مستقل از نویز هستند.

ژنتیک آماری

بر بازیابی برآوردهای وراثت‌پذیری واقعی از نمرات خطر چندژنی نویزدار تمرکز دارد.

در ژنتیک آماری، پژوهشگران از نمرات خطر چندژنی برای پیش‌بینی استعداد یک فرد برای ابتلا به بیماری‌های پیچیده استفاده می‌کنند. با این حال، از آنجا که این نمرات از مطالعات ارتباط سراسر ژنومِ محدود برآورد می‌شوند، ذاتاً حاوی خطای اندازه‌گیری هستند. ژنتیک‌دانان از چارچوب‌های اصلاحی بیزی برای تعدیل این تضعیف استفاده می‌کنند تا اطمینان حاصل کنند که وراثت‌پذیری برآورد شده یک صفت، به‌طور مصنوعی توسط نویز در فرآیند توالی‌یابی و نمره‌گذاری سرکوب نمی‌شود.

روش‌شناسی اپیدمیولوژیک 35%نظریه اقتصادسنجی 35%استنتاج آماری 30%
روش‌شناسی اپیدمیولوژیک
بر این موضوع تمرکز دارد که چگونه خطای اندازه‌گیری در خوانش‌های بالینی، خطرات بلندمدت بیماری را دست‌کم می‌گیرد.
نظریه اقتصادسنجی
بر این موضوع تمرکز دارد که چگونه خطا در یک متغیر، کل ماتریس واریانس-کوواریانس را در رگرسیون چندگانه مخدوش می‌کند.
استنتاج آماری
بر کران‌های ریاضی مدل خطاهای متغیرها و تأثیر آن بر مقادیر p تمرکز دارد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • متخصصان یادگیری ماشین
  • طراحان کارآزمایی‌های بالینی

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

روش‌شناسی اپیدمیولوژیک 35%نظریه اقتصادسنجی 35%استنتاج آماری 30%
  1. [1]Wikipediaاستنتاج آماری

    Errors-in-variables model

    مطالعه در Wikipedia →
  2. [2]BMC Medical Research Methodologyروش‌شناسی اپیدمیولوژیک

    Regression dilution bias: Tools for correction methods and sample size calculation

    مطالعه در BMC Medical Research Methodology →
  3. [3]Charles Sturt University Research Output

    How measurement error affects inference in linear regression

    مطالعه در Charles Sturt University Research Output →
  4. [4]Penn State Universityاستنتاج آماری

    11.1 - What if the Regression Equation Contains "Wrong" Predictors?

    مطالعه در Penn State University →
  5. [5]Genetic Epidemiologyروش‌شناسی اپیدمیولوژیک

    A Bayesian approach to correcting the attenuation bias of regression using polygenic risk score

    مطالعه در Genetic Epidemiology →
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.