چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
وقتی متغیرهای پیشبین در یک مدل رگرسیون بیش از حد با هم همپوشانی داشته باشند، ماتریس طراحی به سمت تکینگی میل میکند. ردیابی کوچکترین مقدار ویژه این ماتریس، معیار ریاضی دقیقی از میزان تورم مصنوعی واریانس در اثر همخطی چندگانه به دست میدهد.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- پژوهشگران استنتاج علی
- نیاز به پایداری دقیق ضرایب برای تفکیک اثر واقعی متغیرهای فردی.
- مدلسازان پیشبین
- تمرکز بر دقت کلی مدل به جای پایداری ضرایب فردی.
- طرفداران منظمسازی
- ترجیح جریمههای ریاضی بر حذف متغیرها برای مدیریت تکینگی ماتریس.
دیدگاههایی که این گزارش پوشش نداده
- آماردانان بیزی که از توزیعهای پیشین برای محدود کردن طبیعی واریانس ضرایب بدون نیاز به جریمههای ماتریسی استفاده میکنند.
- متخصصان حوزههای تخصصی که گنجاندن نظری متغیرها را بر پایداری ریاضی و خالص ماتریس ترجیح میدهند.
نکات کلیدی
- یک مقدار ویژه نزدیک به صفر نشان میدهد که ماتریس طراحی در حال نزدیک شدن به تکینگی است؛ حالتی که در آن متغیرها به طور کامل توسط متغیرهای دیگر قابل پیشبینی هستند.
- این تکینگی ماتریس باعث میشود واریانس ضرایب رگرسیون به شدت افزایش یابد و تحلیل تکتک متغیرها را غیرقابل اعتماد کند.
- شاخص وضعیت که از نسبت حداکثر به حداقل مقدار ویژه به دست میآید، در صورتی که از ۳۰ فراتر رود، نشاندهنده همخطی چندگانه شدید است.
- تحلیل بردارهای ویژه به آماردانان اجازه میدهد تا ترکیب خطی دقیقی از متغیرها را که باعث این همپوشانی شدهاند، شناسایی کنند.
- راهحلها شامل حذف متغیرهای زائد، رگرسیون مولفههای اصلی، یا اعمال جریمههای منظمسازی مانند رگرسیون ریج (Ridge) است.
برای اینکه رگرسیون حداقل مربعات معمولی بتواند ضرایب پایداری را محاسبه کند، متغیرهای پیشبین باید از نظر ریاضی مستقل از یکدیگر باشند. این قید الزامآور — مبنی بر اینکه ماتریس طراحی باید رتبه ستونی کامل خود را حفظ کند — تضمین میکند که مدل میتواند اثر منحصربهفرد هر ورودی را تفکیک کند. وقتی این شرایط برقرار باشد، ماتریس به راحتی وارونپذیر است تا ضرایب محاسبه شوند. اما وقتی این شرط نقض شود، ماتریس به سمت تکینگی میل میکند و موتور رگرسیون توانایی خود را برای تشخیص اینکه کدام متغیر واقعاً محرک نتیجه است، از دست میدهد.[1]
نقص مکانیکی که هنگام همپوشانی متغیرها رخ میدهد، به عنوان همخطی چندگانه شناخته میشود. در یک مدل خطی استاندارد، واریانس ضرایب برآورد شده با وارون ماتریسی که از ضرب ماتریس طراحی ترانهاده در خودش به دست میآید، متناسب است. اگر دو ستون در آن ماتریس تقریباً یکسان باشند — مثلاً یکی دما را به سلسیوس و دیگری به فارنهایت نشان دهد، یا متراژ و تعداد اتاقخوابها — دترمینان آن ماتریس به سمت صفر کاهش مییابد.[2]
با نزدیک شدن دترمینان به صفر، وارون ماتریس به سمت بینهایت میل میکند. این واقعیت ریاضی بدان معناست که حتی تغییرات میکروسکوپی در دادههای آموزش، نوسانات عظیم و نامنظمی در برآورد ضرایب حاصل ایجاد خواهد کرد. متغیری که در یک نمونه اثر مثبت و قوی نشان میدهد، ممکن است در نمونهای دیگر اثر منفی شدیدی داشته باشد و در نتیجه مدل را برای استنتاج در دنیای واقعی کاملاً غیرقابل اعتماد کند.[3]
برای تشخیص این ناپایداری پیش از آنکه مدل را مخدوش کند، آماردانان به مقادیر ویژه ماتریس طراحی مقیاسبندیشده تکیه میکنند. یک مقدار ویژه نشاندهنده میزان واریانسی است که توسط یک مولفه اصلی دادهها ثبت شده است. اگر یک مدل شامل پنج پیشبین مستقل باشد، ماتریس پنج مقدار ویژه با اندازههای نسبتاً مشابه تولید میکند که نشان میدهد هر بُعد اطلاعات معنادار و متمایزی را به سیستم اضافه میکند.[4]
علامت هشداردهنده عیبیابی زمانی ظاهر میشود که یک یا چند مقدار ویژه به نزدیک صفر افت کنند. یک مقدار ویژه نزدیک به صفر از نظر ریاضی ثابت میکند که حداقل یک مولفه اصلی تقریباً هیچ واریانسی در خود ندارد. در عمل، این بدان معناست که یکی از متغیرهای پیشبین را میتوان تقریباً به طور کامل با استفاده از ترکیب خطی سایر متغیرهای موجود در مجموعه داده بازسازی کرد.[1]
مجله کرهای بیهوشی (Korean Journal of Anesthesiology) در مرور سال ۲۰۱۹ خود بر تلههای آماری خاطرنشان میکند: «همخطی چندگانه قدرت پیشبینی یا قابلیت اطمینان مدل را به طور کلی، حداقل در محدوده مجموعه دادههای نمونه، کاهش نمیدهد. این پدیده تنها بر محاسبات مربوط به پیشبینهای فردی تأثیر میگذارد. به عبارت دیگر، یک مدل رگرسیون چندمتغیره با پیشبینهای همخط میتواند نشان دهد که کل مجموعه پیشبینها چقدر خوب متغیر پیامد را پیشبینی میکنند، اما ممکن است نتایج معتبری درباره هیچیک از پیشبینهای فردی ارائه ندهد.»[1]
این پدیده تنها بر محاسبات مربوط به پیشبینهای فردی تأثیر میگذارد.
شدت این همپوشانی با استفاده از شاخص وضعیت (Condition Index) سنجیده میشود؛ معیاری که مستقیماً از مقادیر ویژه به دست میآید. شاخص وضعیت به عنوان جذر نسبت بین حداکثر مقدار ویژه و مقدار ویژه خاصِ در حال ارزیابی محاسبه میشود. وقتی کوچکترین مقدار ویژه کاهش مییابد، مخرج این کسر به سمت صفر میل میکند و شاخص وضعیت را به صورت نمایی بالا میبرد.[4]
شاخص وضعیت بین ۱۰ تا ۳۰ نشاندهنده همخطی چندگانه متوسط است، در حالی که مقدار بیش از ۳۰ به طور گسترده به عنوان آستانه ناپایداری شدید و مخرب برای مدل پذیرفته شده است. در شاخص وضعیت ۳۰، واریانس ضرایب تحت تأثیر به طور مصنوعی با ضریبی در حدود ۱۰ متورم میشود که قدرت آماری مدل را از بین برده و آزمون فرض را تقریباً غیرممکن میسازد.[5]
این تحلیل مقادیر ویژه، ابزار عیبیابی دقیقتری نسبت به عامل تورم واریانس (VIF) که کاربرد رایجتری دارد، ارائه میدهد. در حالی که نمره VIF — که اندازه میگیرد واریانس یک ضریب رگرسیون برآورد شده در صورت همبستگی پیشبینها چقدر افزایش مییابد — میتواند زائد بودن یک متغیر را مشخص کند، اما همیشه نمیتواند خوشه خاصی از متغیرها را که باعث بروز مشکل شدهاند شناسایی کند. VIF صرفاً یک متغیر را در برابر سایر متغیرها جدا میکند.[2]
در مقابل، تجزیه مقادیر ویژه ابعاد دقیق همپوشانی را تفکیک میکند. با بررسی بردارهای ویژه مرتبط با مقادیر ویژه نزدیک به صفر، یک تحلیلگر میتواند وزنهای دقیق ترکیب خطی را که باعث تکینگی شده است، مشاهده کند. اگر بردار ویژه برای یک مقدار ویژه نزدیک به صفر وزن سنگینی به «سن» و «سابقه» اختصاص دهد، ریاضیات به صراحت آن دو متغیر را به عنوان جفت همخط شناسایی میکند.[4]
پلتفرمهای مدرن علم داده به طور فزایندهای این تجزیه ماتریس را خودکار میکنند. در یک بررسی فنی در سال ۲۰۲۳، دانشمندان داده شرکت Hex نشان دادند که چگونه کتابخانههای پایتون مانند statsmodels این مقادیر ویژه را به طور پیشفرض در طول تولید خلاصه حداقل مربعات معمولی محاسبه میکنند. تیم مهندسی Hex توضیح میدهد: «وقتی عدد وضعیت بالایی دارید، به این معنی است که ماتریس به تکینگی نزدیک است»، و خاطرنشان میکنند که این تکینگی مانع از یافتن یک راهحل ریاضی منحصربهفرد توسط الگوریتم میشود.[5]
راهحل استاندارد برای یک مقدار ویژه نزدیک به صفر، کاهش ابعاد است. تحلیلگران میتوانند یکی از متغیرهای زائد شناساییشده توسط بردار ویژه را حذف کنند، یا میتوانند از رگرسیون مولفههای اصلی (PCR) برای تصویر کردن دادهها روی مولفههای متعامد مرتبط با مقادیر ویژه غیرصفر استفاده کنند. با کنار گذاشتن بُعد دارای واریانس نزدیک به صفر، ماتریس رتبه کامل خود را بازمییابد و ضرایب باقیمانده به ثبات میرسند.[3]
از سوی دیگر، تکنیکهای منظمسازی مانند رگرسیون ریج (Ridge Regression) از نظر ریاضی ماتریس را از تکینگی دور میکنند. رگرسیون ریج یک ثابت مثبت کوچک — یک عبارت جریمه — را پیش از وارونسازی به عناصر قطر اصلی ماتریس اضافه میکند. این تقویت مصنوعی تضمین میکند که هیچ مقدار ویژهای نمیتواند کاملاً به صفر برسد، و حداکثر واریانس ممکن ضرایب را به قیمت معرفی مقدار کمی سوگیری محدود میکند.[2]
انتخاب راهحل کاملاً به هدف تحلیلگر بستگی دارد. اگر هدف صرفاً پیشبینی باشد، ناپایداری ضرایب فردی ممکن است قابل تحمل باشد و منظمسازی اغلب کافی است. اما اگر هدف استنتاج علی باشد — یعنی درک تأثیر دقیق یک متغیر واحد، مانند دوز دارو یا تغییر قیمت — متغیرهای همخط باید از هم باز شوند یا حذف گردند تا یکپارچگی ماتریس طراحی بازیابی شود.[6]
روند رویداد
دهه ۱۹۷۰
شاخص وضعیت به عنوان یک ابزار عیبیابی برای تشخیص همخطی چندگانه در مدلهای رگرسیون خطی فرموله شد.
دهه ۱۹۸۰
عامل تورم واریانس (VIF) به قاعده سرانگشتی استاندارد در بستههای نرمافزاری آماری تبدیل شد.
۱۹۹۶
پذیرش گسترده رگرسیون ریج یک راهحل محاسباتی برای ماتریسهای نزدیک به تکینگی فراهم کرد.
دهه ۲۰۱۰
کتابخانههای یادگیری ماشین تجزیه مقادیر ویژه را خودکار کردند و عیبیابی ماتریس را در پایتون و R به یک استاندارد تبدیل کردند.
آنچه نمیدانیم
- هیچ آستانه ریاضی مورد توافق جهانی برای اینکه چه زمانی یک مقدار ویژه «بیش از حد» به صفر نزدیک است وجود ندارد؛ قواعد سرانگشتی مانند شاخص وضعیت ۳۰ همچنان ذهنی و سلیقهای هستند.
- هنوز مشخص نیست که آیا همخطی چندگانه یک ویژگی ساختاری در جامعه آماری است یا صرفاً یک خطای ناشی از یک نمونه خاص و محدود.
- اگرچه منظمسازی مشکل وارونگی ماتریس را حل میکند، اما روابط بنیادین واقعی را پنهان میسازد و مکانیسم علی واقعی را ناشناخته باقی میگذارد.
منابع
[1]Korean Journal of Anesthesiologyپژوهشگران استنتاج علیMulticollinearity and misleading statistical results
مطالعه در Korean Journal of Anesthesiology →
[2]University of Leedsپژوهشگران استنتاج علیSection 15 Multicollinearity
مطالعه در University of Leeds →
[3]ResearchGateطرفداران منظمسازیMulticollinearity in Regression Models
مطالعه در ResearchGate →
[4]American Journal of Applied Mathematics and Statisticsطرفداران منظمسازیDetecting Multicollinearity in Regression Analysis
مطالعه در American Journal of Applied Mathematics and Statistics →
[5]Hexمدلسازان پیشبینDetecting and Remedying Multicollinearity in Your Data Analysis
مطالعه در Hex →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
جداول توافقی
چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموعهای حاشیهای تقسیم بر مجموع کل به دست میآید
6 منبع
الگوریتمهای جستجو
چرا الگوریتمهای واژگانی مثل BM25 در جستوجوهای حجیم از بازیابی متراکم عصبی پیشی میگیرند
2 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





