رفتن به محتوای اصلی
Koohestun
توضیح کوهستانکاهش ابعادتشریح الگوریتم· 5 دقیقه مطالعه· در متا

یافتن محورهای متعامد: تحلیل مؤلفه‌های اساسی چگونه با به حداکثر رساندن واریانس، داده‌های با ابعاد بالا را فشرده می‌کند

الگوریتم PCA با محاسبه بردارهای ویژه یک ماتریس کوواریانس، جهت‌های دارای بیشترین واریانس را در یک مجموعه داده شناسایی می‌کند؛ این کار به الگوریتم‌ها اجازه می‌دهد تا بدون از دست دادن اطلاعات حیاتی، ابعاد اضافی را کنار بگذارند.

به قلم دلناز نورانی

یادگیری ماشین کاربردی 45%آمار کلاسیک 30%توپولوژی پیشرفته داده 25%
یادگیری ماشین کاربردی
از PCA در درجه اول به عنوان یک مرحله پیش‌پردازش برای کاهش بار محاسباتی و جلوگیری از بیش‌برازش استفاده می‌کند.
آمار کلاسیک
برای PCA به منظور تحلیل اکتشافی و تفسیر متغیرهای پنهان ارزش قائل است.
توپولوژی پیشرفته داده
محدودیت‌های تصویرسازی‌های خطی را برجسته کرده و از کاهش ابعاد غیرخطی دفاع می‌کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • متخصصان حوزه‌های خاص (مانند متخصصان ژنتیک) که باید معنای فیزیکی مؤلفه‌های به‌دست‌آمده را تفسیر کنند.
  • مهندسان سخت‌افزاری که ضرب ماتریس‌ها برای PCA را روی تراشه‌های سیلیکونی تخصصی بهینه‌سازی می‌کنند.

لحظه دقیقی که یک مجموعه داده با ابعاد بالا بدون از دست دادن ساختار زیربنایی‌اش با موفقیت فشرده می‌شود، در طول تجزیه مقادیر ویژه ماتریس کوواریانس آن رخ می‌دهد. این عملیات ماتریسی خاص دقیقاً تعیین می‌کند که کدام محورها بیشترین اطلاعات را در خود جای داده‌اند و کدام‌یک صرفاً نویز آماری هستند. یک الگوریتم با جداسازی بردارهای ویژه مرتبط با بزرگ‌ترین مقادیر ویژه، پیش از انجام هرگونه تبدیل واقعی روی داده‌ها، تصویرسازی بهینه در ابعاد پایین‌تر را تثبیت می‌کند.[4][6]

خطوط لوله یادگیری ماشین مدرن اغلب با کاهش ابعاد مانند یک مرحله پیش‌پردازش جعبه‌سیاه برخورد می‌کنند و جبر خطی نهفته در آن را پنهان می‌سازند. وقتی یک مجموعه داده ۱۰۰۰ بعدی به یک شبکه عصبی خورانده می‌شود، هزینه محاسباتی به صورت نمایی بالا می‌رود. تحلیل مؤلفه‌های اساسی (PCA) زبان بازاریابی پر زرق و برق «استخراج ویژگی» را کنار می‌زند تا یک فرآیند قطعی ریاضیاتی را آشکار کند: چرخش سیستم مختصات برای هم‌راستا شدن با گستردگی طبیعی داده‌ها.[3][7]

این فرآیند با مرکزیت بخشیدن به داده‌ها آغاز می‌شود؛ یعنی کم کردن میانگین هر متغیر تا کل مجموعه داده در مبدأ مختصات قرار گیرد. از آنجا، الگوریتم یک ماتریس کوواریانس را محاسبه می‌کند؛ یک شبکه مربعی که نشان می‌دهد هر متغیر منفرد چگونه در رابطه با سایر متغیرها نوسان می‌کند. همان‌طور که در تحلیل سال ۲۰۲۲ گرگوری گاندرسن اشاره شده است، این ماتریس متقارن و نیمه‌معین مثبت است، که تضمین می‌کند تجزیه بعدی آن به مقادیر ویژه حقیقی و غیرمنفی منجر خواهد شد.[6]

گام حیاتی، استخراج بردارهای ویژه و مقادیر ویژه از این ماتریس کوواریانس است. یک بردار ویژه نشان‌دهنده یک جهت در فضای با ابعاد بالا است، در حالی که مقدار ویژه متناظر با آن، اندازه واریانس در امتداد آن جهت خاص را کمّی‌سازی می‌کند. اولین مؤلفه اساسی به سادگی همان بردار ویژه‌ای است که مطلقاً بالاترین مقدار ویژه را دارد.[4][5]

هزینه محاسباتی استخراج مؤلفه‌های اساسی به صورت نمایی با تعداد ویژگی‌ها افزایش می‌یابد.

این در واقع همان اصل به حداکثر رساندن واریانس در عمل است. طبق تعریف، اولین مؤلفه اساسی بیشترین واریانس ممکن از داده‌های تصویرشده را در بر می‌گیرد. سپس مؤلفه اساسی دوم تحت یک محدودیت سخت‌گیرانه محاسبه می‌شود: این مؤلفه باید کاملاً بر مؤلفه اول متعامد باشد (یعنی در فضای چندبعدی زاویه ۹۰ درجه بسازد)، در حالی که بیشترین واریانس باقی‌مانده را نیز به خود اختصاص دهد.[1][2]

این محدودیت تعامد تضمین می‌کند که محورهای جدید کاملاً بدون همبستگی هستند. اگر مجموعه داده اصلی شامل دو ویژگی بود که همگام با هم حرکت می‌کردند، مانند متراژ و قیمت خانه، PCA آن‌ها را در یک مؤلفه غالب واحد ادغام می‌کند. بُعد اضافی عملاً مسطح شده و هم‌خطی چندگانه از مجموعه داده حذف می‌شود.[3][7]

این محدودیت تعامد تضمین می‌کند که محورهای جدید کاملاً بدون همبستگی هستند.

کریستوفر بیشاپ در کتاب بنیادین خود در سال ۲۰۰۶ با عنوان «تشخیص الگو و یادگیری ماشین»، این بهینه‌سازی را به دقت تعریف می‌کند. بیشاپ می‌نویسد که PCA را می‌توان به عنوان «تصویرسازی متعامد داده‌ها روی یک فضای خطی با ابعاد پایین‌تر، معروف به زیرفضای اساسی، به گونه‌ای که واریانس داده‌های تصویرشده به حداکثر برسد» تعریف کرد.[2]

بیشاپ همچنین خاطرنشان می‌کند که این کار از نظر ریاضی معادل به حداقل رساندن مجموع خطاهای بازسازی مجذور شده است؛ یعنی فاصله خطی بین نقاط داده اصلی و مکان‌های جدید تصویرشده آن‌ها. به حداکثر رساندن گستردگی داده‌ها به طور همزمان اطلاعات از دست رفته در طول فشرده‌سازی را به حداقل می‌رساند.[2]

در کاربردهای سازمانی، همان‌طور که در مستندات فنی سال ۲۰۲۴ شرکت IBM به تفصیل آمده است، PCA به طور معمول برای فشرده‌سازی مجموعه داده‌های تصویری یا توالی‌های ژنومی که ابعاد آن‌ها می‌تواند به ده‌ها هزار برسد، به کار گرفته می‌شود. گلوگاه محاسباتی در مرحله تجزیه مقادیر ویژه نهفته است، که با پیچیدگی زمانی O(p^3) مقیاس می‌شود، جایی که p تعداد ویژگی‌ها است.[3]

برای تصمیم‌گیری در مورد اینکه چه تعداد از ابعاد باید حفظ شوند، متخصصان به منحنی افت مقادیر ویژه تکیه می‌کنند که معمولاً نمودار اسکری نامیده می‌شود. در حالی که متون نظری اغلب توصیه می‌کنند مؤلفه‌های کافی برای حفظ ۹۵ درصد از کل واریانس نگه داشته شوند، واقعیتِ استقرار این مدل‌ها در محیط عملیاتی اغلب آستانه پایین‌تری را دیکته می‌کند.[2][8]

نمودار اسکری به مهندسان کمک می‌کند تا نقطه «آرنج» را شناسایی کنند؛ جایی که مؤلفه‌های اساسیِ بیشتر، بازدهی نزولی در حفظ واریانس دارند.

اگر نمودار اسکری یک افت شدید (یک «آرنج») را پس از مؤلفه سوم نشان دهد، مهندسان معمولاً داده‌ها را در همان‌جا قطع می‌کنند، حتی اگر آن سه مؤلفه تنها ۷۵ یا ۸۰ درصد از واریانس را در بر بگیرند. ۲۰ درصد باقی‌مانده از نظر ریاضی به عنوان نویز طبقه‌بندی می‌شود و دور ریختن آن اغلب با جلوگیری از بیش‌برازش، عملکرد الگوریتم‌های خوشه‌بندی در مراحل بعدی را بهبود می‌بخشد.[3][8]

با این حال، PCA اساساً یک تبدیل خطی است. این الگوریتم فرض می‌کند که ساختار زیربنایی داده‌ها می‌تواند توسط خطوط راست و صفحات تخت ثبت شود. اگر داده‌ها روی یک منیفولد پیچیده و منحنی قرار داشته باشند (مانند یک رولت سوئیسی لوله‌شده در فضای سه‌بعدی)، PCA در باز کردن آن شکست می‌خورد و صرفاً لایه‌های هم‌پوشانی‌شده را روی یک شبکه تخت تصویر کرده و توپولوژی را از بین می‌برد.[1][5]

اولین مؤلفه اساسی در راستای بیشترین واریانس قرار می‌گیرد، در حالی که مؤلفه دوم باید کاملاً بر مؤلفه اول متعامد باشد.

بنابراین، تصمیم برای استفاده از PCA به این فرض بستگی دارد که واریانس معادل سیگنال است. وقتی حیاتی‌ترین اطلاعات در یک مجموعه داده در ناهنجاری‌های با واریانس پایین پنهان شده باشد، چرخاندن محورها برای به حداکثر رساندن گستردگی، دقیقاً همان الگوهایی را که الگوریتم برای یافتن آن‌ها مستقر شده بود، مدفون می‌کند. ظرافت ریاضیاتی ماتریس کوواریانس تنها یک تصویرسازی خطی بهینه را تضمین می‌کند؛ اما نمی‌تواند تضمین کند که این تصویرسازی واقعاً مفید است.[1][8]

نکات کلیدی

  • الگوریتم PCA داده‌های با ابعاد بالا را با یافتن محورهایی که بیشترین واریانس را در بر می‌گیرند، فشرده می‌کند.
  • این الگوریتم بردارهای ویژه و مقادیر ویژه ماتریس کوواریانس مجموعه داده را محاسبه می‌کند.
  • هر مؤلفه اساسی جدید از نظر ریاضیاتی ملزم است که بر مؤلفه‌های قبلی متعامد (عمود) باشد.
  • مهندسان اغلب از نمودارهای اسکری (scree plots) برای تعیین تعداد بهینه مؤلفه‌هایی که باید حفظ شوند، استفاده می‌کنند.
  • الگوریتم PCA یک تبدیل خطی است و در مواجهه با منیفولدهای داده‌ای پیچیده و منحنی دچار مشکل می‌شود.

چرا مهم است

درک نحوه فشرده‌سازی داده‌ها توسط PCA، بده‌بستان‌های ریاضیاتی نهفته در سیستم‌های هوش مصنوعی مدرن را آشکار می‌کند و دقیقاً نشان می‌دهد وقتی الگوریتم‌ها داده‌های پیچیده انسانی را پردازش می‌کنند، چه اطلاعاتی دور ریخته می‌شود.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

یادگیری ماشین کاربردی 45%آمار کلاسیک 30%توپولوژی پیشرفته داده 25%
  1. [1]PMCتوپولوژی پیشرفته داده

    Principal component analysis: a review and recent developments

    مطالعه در PMC
  2. [2]Academic/Textbookآمار کلاسیک

    12.1. Principal Component Analysis

    مطالعه در Academic/Textbook
  3. [3]IBMیادگیری ماشین کاربردی

    What Is Principal Component Analysis (PCA)?

    مطالعه در IBM
  4. [4]Harvard (CS181)آمار کلاسیک

    Chapter 17 The Math of Principal Component Analysis

    مطالعه در Harvard (CS181)
  5. [5]Anna-Lena Popkesیادگیری ماشین کاربردی

    Principal component analysis (PCA)

    مطالعه در Anna-Lena Popkes
  6. [6]Gregory Gundersenتوپولوژی پیشرفته داده

    Principal Component Analysis

    مطالعه در Gregory Gundersen
  7. [7]Built Inیادگیری ماشین کاربردی

    Principal Component Analysis (PCA): Explained Step-by-Step

    مطالعه در Built In
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.