رفتن به محتوای اصلی
Koohestun
توضیح کوهستانعیب‌یابی رگرسیونمقاله تشریحی· 6 دقیقه مطالعه· در تحلیل داده

چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، هم‌خطی چندگانه را در رگرسیون آشکار می‌کند

وقتی متغیرهای پیش‌بین در یک مدل رگرسیون بیش از حد با هم هم‌پوشانی داشته باشند، ماتریس طراحی به سمت تکینگی میل می‌کند. ردیابی کوچک‌ترین مقدار ویژه این ماتریس، معیار ریاضی دقیقی از میزان تورم مصنوعی واریانس در اثر هم‌خطی چندگانه به دست می‌دهد.

به قلم اِلا فرجاد

پژوهشگران استنتاج علی 40%مدل‌سازان پیش‌بین 35%طرفداران منظم‌سازی 25%
پژوهشگران استنتاج علی
نیاز به پایداری دقیق ضرایب برای تفکیک اثر واقعی متغیرهای فردی.
مدل‌سازان پیش‌بین
تمرکز بر دقت کلی مدل به جای پایداری ضرایب فردی.
طرفداران منظم‌سازی
ترجیح جریمه‌های ریاضی بر حذف متغیرها برای مدیریت تکینگی ماتریس.

دیدگاه‌هایی که این گزارش پوشش نداده

  • آماردانان بیزی که از توزیع‌های پیشین برای محدود کردن طبیعی واریانس ضرایب بدون نیاز به جریمه‌های ماتریسی استفاده می‌کنند.
  • متخصصان حوزه‌های تخصصی که گنجاندن نظری متغیرها را بر پایداری ریاضی و خالص ماتریس ترجیح می‌دهند.

نکات کلیدی

  • یک مقدار ویژه نزدیک به صفر نشان می‌دهد که ماتریس طراحی در حال نزدیک شدن به تکینگی است؛ حالتی که در آن متغیرها به طور کامل توسط متغیرهای دیگر قابل پیش‌بینی هستند.
  • این تکینگی ماتریس باعث می‌شود واریانس ضرایب رگرسیون به شدت افزایش یابد و تحلیل تک‌تک متغیرها را غیرقابل اعتماد کند.
  • شاخص وضعیت که از نسبت حداکثر به حداقل مقدار ویژه به دست می‌آید، در صورتی که از ۳۰ فراتر رود، نشان‌دهنده هم‌خطی چندگانه شدید است.
  • تحلیل بردارهای ویژه به آماردانان اجازه می‌دهد تا ترکیب خطی دقیقی از متغیرها را که باعث این هم‌پوشانی شده‌اند، شناسایی کنند.
  • راه‌حل‌ها شامل حذف متغیرهای زائد، رگرسیون مولفه‌های اصلی، یا اعمال جریمه‌های منظم‌سازی مانند رگرسیون ریج (Ridge) است.

برای اینکه رگرسیون حداقل مربعات معمولی بتواند ضرایب پایداری را محاسبه کند، متغیرهای پیش‌بین باید از نظر ریاضی مستقل از یکدیگر باشند. این قید الزام‌آور — مبنی بر اینکه ماتریس طراحی باید رتبه ستونی کامل خود را حفظ کند — تضمین می‌کند که مدل می‌تواند اثر منحصربه‌فرد هر ورودی را تفکیک کند. وقتی این شرایط برقرار باشد، ماتریس به راحتی وارون‌پذیر است تا ضرایب محاسبه شوند. اما وقتی این شرط نقض شود، ماتریس به سمت تکینگی میل می‌کند و موتور رگرسیون توانایی خود را برای تشخیص اینکه کدام متغیر واقعاً محرک نتیجه است، از دست می‌دهد.[1]

نقص مکانیکی که هنگام هم‌پوشانی متغیرها رخ می‌دهد، به عنوان هم‌خطی چندگانه شناخته می‌شود. در یک مدل خطی استاندارد، واریانس ضرایب برآورد شده با وارون ماتریسی که از ضرب ماتریس طراحی ترانهاده در خودش به دست می‌آید، متناسب است. اگر دو ستون در آن ماتریس تقریباً یکسان باشند — مثلاً یکی دما را به سلسیوس و دیگری به فارنهایت نشان دهد، یا متراژ و تعداد اتاق‌خواب‌ها — دترمینان آن ماتریس به سمت صفر کاهش می‌یابد.[2]

با نزدیک شدن دترمینان به صفر، وارون ماتریس به سمت بی‌نهایت میل می‌کند. این واقعیت ریاضی بدان معناست که حتی تغییرات میکروسکوپی در داده‌های آموزش، نوسانات عظیم و نامنظمی در برآورد ضرایب حاصل ایجاد خواهد کرد. متغیری که در یک نمونه اثر مثبت و قوی نشان می‌دهد، ممکن است در نمونه‌ای دیگر اثر منفی شدیدی داشته باشد و در نتیجه مدل را برای استنتاج در دنیای واقعی کاملاً غیرقابل اعتماد کند.[3]

برای تشخیص این ناپایداری پیش از آنکه مدل را مخدوش کند، آماردانان به مقادیر ویژه ماتریس طراحی مقیاس‌بندی‌شده تکیه می‌کنند. یک مقدار ویژه نشان‌دهنده میزان واریانسی است که توسط یک مولفه اصلی داده‌ها ثبت شده است. اگر یک مدل شامل پنج پیش‌بین مستقل باشد، ماتریس پنج مقدار ویژه با اندازه‌های نسبتاً مشابه تولید می‌کند که نشان می‌دهد هر بُعد اطلاعات معنادار و متمایزی را به سیستم اضافه می‌کند.[4]

با کاهش حداقل مقدار ویژه به سمت صفر، شاخص وضعیت به صورت نمایی افزایش می‌یابد.

علامت هشداردهنده عیب‌یابی زمانی ظاهر می‌شود که یک یا چند مقدار ویژه به نزدیک صفر افت کنند. یک مقدار ویژه نزدیک به صفر از نظر ریاضی ثابت می‌کند که حداقل یک مولفه اصلی تقریباً هیچ واریانسی در خود ندارد. در عمل، این بدان معناست که یکی از متغیرهای پیش‌بین را می‌توان تقریباً به طور کامل با استفاده از ترکیب خطی سایر متغیرهای موجود در مجموعه داده بازسازی کرد.[1]

مجله کره‌ای بیهوشی (Korean Journal of Anesthesiology) در مرور سال ۲۰۱۹ خود بر تله‌های آماری خاطرنشان می‌کند: «هم‌خطی چندگانه قدرت پیش‌بینی یا قابلیت اطمینان مدل را به طور کلی، حداقل در محدوده مجموعه داده‌های نمونه، کاهش نمی‌دهد. این پدیده تنها بر محاسبات مربوط به پیش‌بین‌های فردی تأثیر می‌گذارد. به عبارت دیگر، یک مدل رگرسیون چندمتغیره با پیش‌بین‌های هم‌خط می‌تواند نشان دهد که کل مجموعه پیش‌بین‌ها چقدر خوب متغیر پیامد را پیش‌بینی می‌کنند، اما ممکن است نتایج معتبری درباره هیچ‌یک از پیش‌بین‌های فردی ارائه ندهد.»[1]

این پدیده تنها بر محاسبات مربوط به پیش‌بین‌های فردی تأثیر می‌گذارد.

شدت این هم‌پوشانی با استفاده از شاخص وضعیت (Condition Index) سنجیده می‌شود؛ معیاری که مستقیماً از مقادیر ویژه به دست می‌آید. شاخص وضعیت به عنوان جذر نسبت بین حداکثر مقدار ویژه و مقدار ویژه خاصِ در حال ارزیابی محاسبه می‌شود. وقتی کوچک‌ترین مقدار ویژه کاهش می‌یابد، مخرج این کسر به سمت صفر میل می‌کند و شاخص وضعیت را به صورت نمایی بالا می‌برد.[4]

شاخص وضعیت بین ۱۰ تا ۳۰ نشان‌دهنده هم‌خطی چندگانه متوسط است، در حالی که مقدار بیش از ۳۰ به طور گسترده به عنوان آستانه ناپایداری شدید و مخرب برای مدل پذیرفته شده است. در شاخص وضعیت ۳۰، واریانس ضرایب تحت تأثیر به طور مصنوعی با ضریبی در حدود ۱۰ متورم می‌شود که قدرت آماری مدل را از بین برده و آزمون فرض را تقریباً غیرممکن می‌سازد.[5]

رابطه ریاضی میان کاهش مقادیر ویژه و تورم واریانس.

این تحلیل مقادیر ویژه، ابزار عیب‌یابی دقیق‌تری نسبت به عامل تورم واریانس (VIF) که کاربرد رایج‌تری دارد، ارائه می‌دهد. در حالی که نمره VIF — که اندازه می‌گیرد واریانس یک ضریب رگرسیون برآورد شده در صورت همبستگی پیش‌بین‌ها چقدر افزایش می‌یابد — می‌تواند زائد بودن یک متغیر را مشخص کند، اما همیشه نمی‌تواند خوشه خاصی از متغیرها را که باعث بروز مشکل شده‌اند شناسایی کند. VIF صرفاً یک متغیر را در برابر سایر متغیرها جدا می‌کند.[2]

در مقابل، تجزیه مقادیر ویژه ابعاد دقیق هم‌پوشانی را تفکیک می‌کند. با بررسی بردارهای ویژه مرتبط با مقادیر ویژه نزدیک به صفر، یک تحلیل‌گر می‌تواند وزن‌های دقیق ترکیب خطی را که باعث تکینگی شده است، مشاهده کند. اگر بردار ویژه برای یک مقدار ویژه نزدیک به صفر وزن سنگینی به «سن» و «سابقه» اختصاص دهد، ریاضیات به صراحت آن دو متغیر را به عنوان جفت هم‌خط شناسایی می‌کند.[4]

پلتفرم‌های مدرن علم داده به طور فزاینده‌ای این تجزیه ماتریس را خودکار می‌کنند. در یک بررسی فنی در سال ۲۰۲۳، دانشمندان داده شرکت Hex نشان دادند که چگونه کتابخانه‌های پایتون مانند statsmodels این مقادیر ویژه را به طور پیش‌فرض در طول تولید خلاصه حداقل مربعات معمولی محاسبه می‌کنند. تیم مهندسی Hex توضیح می‌دهد: «وقتی عدد وضعیت بالایی دارید، به این معنی است که ماتریس به تکینگی نزدیک است»، و خاطرنشان می‌کنند که این تکینگی مانع از یافتن یک راه‌حل ریاضی منحصربه‌فرد توسط الگوریتم می‌شود.[5]

راه‌حل استاندارد برای یک مقدار ویژه نزدیک به صفر، کاهش ابعاد است. تحلیل‌گران می‌توانند یکی از متغیرهای زائد شناسایی‌شده توسط بردار ویژه را حذف کنند، یا می‌توانند از رگرسیون مولفه‌های اصلی (PCR) برای تصویر کردن داده‌ها روی مولفه‌های متعامد مرتبط با مقادیر ویژه غیرصفر استفاده کنند. با کنار گذاشتن بُعد دارای واریانس نزدیک به صفر، ماتریس رتبه کامل خود را بازمی‌یابد و ضرایب باقی‌مانده به ثبات می‌رسند.[3]

تحلیل بردارهای ویژه، متغیرهای خاصی را که باعث تکینگی ماتریس می‌شوند، جدا می‌کند.

از سوی دیگر، تکنیک‌های منظم‌سازی مانند رگرسیون ریج (Ridge Regression) از نظر ریاضی ماتریس را از تکینگی دور می‌کنند. رگرسیون ریج یک ثابت مثبت کوچک — یک عبارت جریمه — را پیش از وارون‌سازی به عناصر قطر اصلی ماتریس اضافه می‌کند. این تقویت مصنوعی تضمین می‌کند که هیچ مقدار ویژه‌ای نمی‌تواند کاملاً به صفر برسد، و حداکثر واریانس ممکن ضرایب را به قیمت معرفی مقدار کمی سوگیری محدود می‌کند.[2]

انتخاب راه‌حل کاملاً به هدف تحلیل‌گر بستگی دارد. اگر هدف صرفاً پیش‌بینی باشد، ناپایداری ضرایب فردی ممکن است قابل تحمل باشد و منظم‌سازی اغلب کافی است. اما اگر هدف استنتاج علی باشد — یعنی درک تأثیر دقیق یک متغیر واحد، مانند دوز دارو یا تغییر قیمت — متغیرهای هم‌خط باید از هم باز شوند یا حذف گردند تا یکپارچگی ماتریس طراحی بازیابی شود.[6]

10
آستانه رایج عامل تورم واریانس (VIF)
30
شاخص وضعیت نشان‌دهنده هم‌خطی چندگانه شدید
0.01
آستانه حداقل مقدار ویژه برای تکینگی

روند رویداد

  1. دهه ۱۹۷۰

    شاخص وضعیت به عنوان یک ابزار عیب‌یابی برای تشخیص هم‌خطی چندگانه در مدل‌های رگرسیون خطی فرموله شد.

  2. دهه ۱۹۸۰

    عامل تورم واریانس (VIF) به قاعده سرانگشتی استاندارد در بسته‌های نرم‌افزاری آماری تبدیل شد.

  3. ۱۹۹۶

    پذیرش گسترده رگرسیون ریج یک راه‌حل محاسباتی برای ماتریس‌های نزدیک به تکینگی فراهم کرد.

  4. دهه ۲۰۱۰

    کتابخانه‌های یادگیری ماشین تجزیه مقادیر ویژه را خودکار کردند و عیب‌یابی ماتریس را در پایتون و R به یک استاندارد تبدیل کردند.

آنچه نمی‌دانیم

  • هیچ آستانه ریاضی مورد توافق جهانی برای اینکه چه زمانی یک مقدار ویژه «بیش از حد» به صفر نزدیک است وجود ندارد؛ قواعد سرانگشتی مانند شاخص وضعیت ۳۰ همچنان ذهنی و سلیقه‌ای هستند.
  • هنوز مشخص نیست که آیا هم‌خطی چندگانه یک ویژگی ساختاری در جامعه آماری است یا صرفاً یک خطای ناشی از یک نمونه خاص و محدود.
  • اگرچه منظم‌سازی مشکل وارونگی ماتریس را حل می‌کند، اما روابط بنیادین واقعی را پنهان می‌سازد و مکانیسم علی واقعی را ناشناخته باقی می‌گذارد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران استنتاج علی 40%مدل‌سازان پیش‌بین 35%طرفداران منظم‌سازی 25%
  1. [1]Korean Journal of Anesthesiologyپژوهشگران استنتاج علی

    Multicollinearity and misleading statistical results

    مطالعه در Korean Journal of Anesthesiology
  2. [2]University of Leedsپژوهشگران استنتاج علی

    Section 15 Multicollinearity

    مطالعه در University of Leeds
  3. [3]ResearchGateطرفداران منظم‌سازی

    Multicollinearity in Regression Models

    مطالعه در ResearchGate
  4. [4]American Journal of Applied Mathematics and Statisticsطرفداران منظم‌سازی

    Detecting Multicollinearity in Regression Analysis

    مطالعه در American Journal of Applied Mathematics and Statistics
  5. [5]Hexمدل‌سازان پیش‌بین

    Detecting and Remedying Multicollinearity in Your Data Analysis

    مطالعه در Hex
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.