چگونه بردارهای ویژه ماتریس کوواریانس، جهتهای بیشترین واریانس را در تحلیل مؤلفههای اصلی تعیین میکنند
تحلیل مؤلفههای اصلی (PCA) برای نقشهبرداری از روابط بین متغیرها در دادههای با ابعاد بالا، به ماتریس کوواریانس متکی است. این الگوریتم با استخراج بردارهای ویژه و مقادیر ویژه از این ماتریس، دقیقاً همان جهتهای متعامدی را شناسایی میکند که دادهها در آنها بیشترین تغییرات را دارند.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- مفسران هندسی
- نگاه به PCA عمدتاً به عنوان یک چرخش فضایی محورهای مختصات برای همراستا شدن با شکل طبیعی دادهها.
- خلوصگرایان جبری
- تمرکز بر مکانیک دقیق جبر خطی در تجزیه ماتریس و معادلات مقادیر ویژه.
- دانشمندان داده کاربردی
- اولویت دادن به کاربرد عملی حفظ واریانس و کاهش ابعاد برای یادگیری ماشین.
دیدگاههایی که این گزارش پوشش نداده
- پژوهشگران یادگیری منیفولد غیرخطی
- نظریهپردازان پیچیدگی محاسباتی
نکات کلیدی
- ماتریس کوواریانس روابط زوجی و واریانسهای تمام ویژگیها را در یک مجموعه داده استانداردشده ثبت میکند.
- بردارهای ویژه ماتریس کوواریانس، جهتهای متعامد بیشترین واریانس را که به عنوان مؤلفههای اصلی شناخته میشوند، تعریف میکنند.
- مقادیر ویژه، مقدار دقیق واریانس ثبتشده توسط بردارهای ویژه متناظر خود را کمیتسنجی میکنند.
- تقسیم یک مقدار ویژه منفرد بر مجموع تمام مقادیر ویژه، درصد کل اطلاعات حفظشده توسط آن مؤلفه را آشکار میسازد.
چرا مهم است
این سازوکار ریاضی با تقلیل هزاران متغیر به چند مؤلفه اصلی بدون از دست دادن سیگنالهای بنیادین، آموزش مدلهای یادگیری ماشین روی مجموعه دادههای عظیم، فشردهسازی رسانههای با وضوح بالا و کشف الگوهای ژنتیکی که در غیر این صورت در میان نویزها پنهان میماندند را امکانپذیر میسازد.
مجموعه دادهای با ۱۰,۰۰۰ متغیر مجزا را تصور کنید؛ مقیاسی از اطلاعات چنان وسیع که یک تحلیلگر انسانی قادر به تجسم آن نیست و یک مدل رگرسیون استاندارد بلافاصله در آن دچار بیشبرازش میشود. برای درک این آشوبِ پرابعاد، دانشمندان داده به یک سازوکار ریاضی تکیه میکنند که نویز را فشرده کرده و در عین حال سیگنال را حفظ میکند. این سازوکار، تحلیل مؤلفههای اصلی (PCA) است و موتور محرک آن، ماتریس کوواریانس است. این روش که نخستین بار توسط کارل پیرسون در سال ۱۹۰۱ معرفی شد و به طور مستقل توسط هارولد هتلینگ در سال ۱۹۳۳ توسعه یافت، همچنان الگوریتم بنیادین برای کاهش ابعاد به شمار میرود.[3][5]
این سازوکار با استانداردسازی دادهها و محاسبه ماتریس کوواریانس آغاز میشود. این ماتریس یک شبکه مربعی است — به طور دقیقتر، یک ماتریس p × p که در آن p نشاندهنده تعداد ویژگیهاست — و کمیت این موضوع را تعیین میکند که هر متغیر در یک مجموعه داده چگونه در رابطه با سایر متغیرها حرکت میکند. اگر دو متغیر با هم افزایش یابند، کوواریانس آنها مثبت است؛ اگر در جهت مخالف حرکت کنند، منفی خواهد بود. با محاسبه این ماتریس، الگوریتم کل شکل ساختاری دادهها را در یک شیء ریاضی واحد ثبت میکند.[1][4]
اما تفسیر ماتریسی پر از کوواریانسها همچنان دشوار است. برای یافتن مسیرهای واقعیِ بیشترین اطلاعات، الگوریتم باید این ماتریس را به ویژگیهای هندسی بنیادین آن تجزیه کند: بردارهای ویژه و مقادیر ویژه. در جبر خطی، بردار ویژه برداری است که با اعمال یک تبدیل خطی روی آن، جهت خود را تغییر نمیدهد — بلکه تنها کشیده یا فشرده میشود. ضریبی که بردار با آن کشیده میشود، مقدار ویژه آن است. همانطور که یک بررسی فنی در سال ۲۰۲۱ توسط GeeksforGeeks توضیح میدهد، معادله ریاضی Cv = λv این رابطه را تعریف میکند، که در آن C ماتریس کوواریانس، v بردار ویژه و λ مقدار ویژه است.[1][2][5]
هنگامی که این بردارهای ویژه روی ماتریس کوواریانس اعمال میشوند، معنای آماری عمیقی پیدا میکنند. آنها به مؤلفههای اصلی تبدیل میشوند. بردار ویژهای که متناظر با بزرگترین مقدار ویژه است، دقیقاً به سمت جهتی اشاره میکند که بیشترین واریانس را در مجموعه داده دارد. این همان مؤلفه اصلی اول است. بردار ویژه دوم، که از نظر ریاضی باید بر اولی عمود باشد — یعنی با زاویه دقیق ۹۰ درجه متقاطع شود — به سمت دومین واریانس بزرگ اشاره میکند، و به همین ترتیب.[3][4]
هنگامی که این بردارهای ویژه روی ماتریس کوواریانس اعمال میشوند، معنای آماری عمیقی پیدا میکنند.
مقادیر ویژه به عنوان وزنهای کمی برای این جهتها عمل میکنند. با تقسیم یک مقدار ویژه منفرد بر مجموع تمام مقادیر ویژه، یک تحلیلگر میتواند درصد دقیق واریانس کلی را که یک مؤلفه اصلی خاص توضیح میدهد، محاسبه کند. به عنوان مثال، اگر دو مقدار ویژه اول به ترتیب ۹۶٪ و ۴٪ از کل واریانس را به خود اختصاص دهند، یک مجموعه داده پرابعاد میتواند با خیال راحت و بدون هیچگونه افت اطلاعات ساختاری بنیادین، تنها به دو بُعد کاهش یابد.[4][5]
از منظر هندسی، اگر نقاط داده استانداردشده را در یک فضای پرابعاد رسم کنید، آنها یک بیضیگون n-بُعدی تشکیل میدهند. بردارهای ویژه ماتریس کوواریانس، دقیقاً محورهای این بیضیگون را نشان میدهند. طولانیترین محور، مؤلفه اصلی اول است که وسیعترین پراکندگی دادهها را در بر میگیرد. همانطور که در تعریف ریاضی ویکیپدیا آمده است: «مؤلفههای اصلی مجموعهای از نقاط در یک فضای مختصات حقیقی، دنبالهای از بردارهای یکه هستند، که در آن بردار i-اُم جهت خطی است که به بهترین شکل با دادهها برازش دارد در حالی که بر بردارهای i-1 قبلی عمود است».[5]
الگوریتم PCA با چرخش سیستم مختصات برای همراستا شدن با این محورها، همبستگی متغیرها را از بین میبرد و تضمین میکند که هر مؤلفه اصلی جدید کاملاً مستقل از بقیه باشد. یک مقاله مروری که در سال ۲۰۱۶ توسط انجمن سلطنتی منتشر شد، اشاره میکند که این تبدیل، ماتریس کوواریانس را به یک فرم قطری تبدیل میکند، جایی که عناصر روی قطر نشاندهنده واریانس هر محور جدید هستند و تمام کوواریانسهای خارج از قطر به اجبار صفر میشوند.[2][3]
با این حال، این ظرافت ریاضی با محدودیتهای سختگیرانهای همراه است. الگوریتم PCA فرض میکند که روابط بین متغیرها خطی است و دادهها به درستی مقیاسبندی شدهاند. از آنجا که ماتریس کوواریانس به شدت نسبت به بزرگی متغیرهای اولیه حساس است، عدم استانداردسازی دادهها پیش از محاسبه ماتریس باعث میشود متغیرهایی با دامنههای بزرگتر — مانند متغیری که از ۰ تا ۱۰۰ مقیاسبندی شده در برابر متغیری از ۰ تا ۱ — به طور مصنوعی بر مؤلفههای اصلی مسلط شوند. علاوه بر این، PCA نمیتواند منیفولدهای غیرخطی را ثبت کند، به همین دلیل است که برای ساختارهای دادهای بسیار پیچیده، به الگوریتمهای پیچیدهتری نیاز است.[3][4]
با وجود این محدودیتها، تجزیه مقادیر ویژه ماتریس کوواریانس همچنان یکی از قدرتمندترین ابزارها در علم داده است. از فشردهسازی تصاویر با وضوح بالا گرفته تا جداسازی نشانگرهای ژنتیکی در بیوانفورماتیک، توانایی تعریف ریاضی جهتهای بیشترین واریانس به محققان اجازه میدهد تا حقیقت اساسی پنهان در حجم عظیمی از دادهها را استخراج کنند. بردارهای ویژه فقط دادهها را کاهش نمیدهند؛ بلکه شکل بنیادین آنها را آشکار میسازند.[5]
منابع
[1]GeeksforGeeksخلوصگرایان جبریMathematical Approach to PCA
مطالعه در GeeksforGeeks →
[2]Stack Exchangeمفسران هندسیMaking sense of principal component analysis, eigenvectors & eigenvalues
مطالعه در Stack Exchange →
[3]Royal Society Publishingدانشمندان داده کاربردیPrincipal component analysis: a review and recent developments
مطالعه در Royal Society Publishing →
[4]Built Inدانشمندان داده کاربردیStep-by-Step Explanation of Principal Component Analysis
مطالعه در Built In →
[5]Wikipediaمفسران هندسیPrincipal component analysis
مطالعه در Wikipedia →
[6]Factlen Editorial TeamSynthesis by Factlen editorial team
مطالعه در Factlen Editorial Team →
نظرات
بیشتر در تحلیل داده
مشاهده همه →استنتاج آماری
چرا بازههای پیشبینی هرگز به صفر نمیرسند، اما بازههای اطمینان چرا؟
7 منبع
همبستگی رتبهای
ضریب اسپیرمن در برابر تاوی کندال: بدهبستانهای ریاضی در همبستگی رتبهای
5 منبع
تشخیص ناهنجاری
پرونده شواهد: دقت قانون بنفورد در کشف تقلبهای مالی و انتخاباتی
6 منبع
دادههای مهاجرت
دادههای سازمان بینالمللی مهاجرت: با وجود کاهش شدید ورود مهاجران، مرگ و میر در مسیرهای کلیدی دو برابر شد
2 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





