رفتن به محتوای اصلی
Koohestun
توضیح کوهستانعیب‌یابی رگرسیونمقاله تشریحی· 5 دقیقه مطالعه· در تحلیل داده

فاصله کوک چگونه تغییر ضرایب رگرسیون را با حذف یک داده منفرد اندازه‌گیری می‌کند؟

فاصله کوک با اندازه‌گیری میزان جابه‌جایی در پیش‌بینی‌های یک مدل هنگام حذف یک نقطه داده، نشان می‌دهد که کدام مشاهدات منفرد در خفا روند کلی را دیکته می‌کنند.

به قلم الوین شادمهر

مقیاس‌بندی پویا 60%عیب‌یابی محافظه‌کارانه 40%
مقیاس‌بندی پویا
از آستانه‌های تعدیل‌شده بر اساس حجم نمونه دفاع می‌کند تا اطمینان حاصل شود که نقاط تأثیرگذار همچنان در مجموعه داده‌های عظیم و مدرن شناسایی می‌شوند.
عیب‌یابی محافظه‌کارانه
از آستانه‌های ثابت دفاع می‌کند تا دستکاری داده‌ها را به حداقل برساند و از دور ریختن مشاهدات معتبر توسط تحلیلگران جلوگیری کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مهندسان یادگیری ماشین خودکار
  • آماردانان بیزی

نتیجه یک مدل رگرسیون خطی درست در لحظه‌ای تعیین می‌شود که الگوریتم مجموع مجذور پسماندها را به حداقل می‌رساند. از آنجا که جریمه ریاضی برای خطا به توان دو می‌رسد، یک نقطه داده که دور از بقیه توزیع قرار گرفته است، می‌تواند کل خط برازش را به سمت خود بکشاند. به همین دلیل است که شناسایی مشاهدات تأثیرگذار اهمیت دارد: یک ردیف ناهنجار در یک مجموعه داده می‌تواند رابطه بین متغیرها را برای کل جمعیت بازنویسی کند.[1][7]

برای درک اینکه یک نقطه منفرد چقدر قدرت دارد، آماردانان به معیاری تکیه می‌کنند که توسط آماردان آمریکایی، آر. دنیس کوک (R. Dennis Cook) در سال ۱۹۷۷ معرفی شد. «فاصله کوک» که اغلب با حرف D نشان داده می‌شود، تغییر دقیق در ضرایب یک مدل رگرسیون را هنگام حذف یک مشاهده خاص از مجموعه داده‌ها کمّی‌سازی می‌کند.[1][3]

کالج علوم ابرلی در دانشگاه ایالتی پنسیلوانیا در برنامه درسی STAT 462 خود توضیح می‌دهد: «فاصله کوک برآوردی از میزان تأثیر یک نقطه داده است. این معیار هم اهرم و هم پسماند هر مشاهده را در نظر می‌گیرد.»[2]

«اهرم» (Leverage) اندازه می‌گیرد که یک نقطه داده از نظر متغیرهای مستقل خود (موقعیت آن در محور ایکس) چقدر افراطی است. نقطه‌ای با اهرم بالا در فاصله زیادی از مرکز توده داده‌ها قرار می‌گیرد و به آن یک «بازوی اهرم» ریاضی بلندتر می‌دهد تا خط رگرسیون را به سمت خود بکشد.[3][4]

فاصله کوک برای اندازه‌گیری تأثیر کل، اهرم یک نقطه و پسماند آن را ترکیب می‌کند.

در همین حال، «پسماند» (Residual) اندازه می‌گیرد که مقدار واقعی وای (Y) یک نقطه چقدر از مقدار پیش‌بینی‌شده توسط مدل فاصله دارد. یک نقطه می‌تواند پسماند بزرگی داشته باشد بدون اینکه اهرم بالایی داشته باشد، یا اهرم بالایی داشته باشد بدون اینکه پسماند بزرگی ثبت کند.[1][4]

فاصله کوک این دو نیرو را در هم ضرب می‌کند. یک نقطه تنها در صورتی امتیاز بالایی کسب می‌کند که هم اهرم لازم برای حرکت دادن خط را داشته باشد و هم پسماند آن به قدری بزرگ باشد که نشان دهد در حال دور کردن خط از روند اصلی است.[2][5]

معادله رسمی، مجموع تمام تفاوت‌های مجذور بین پیش‌بینی‌های مدل با در نظر گرفتن نقطه و پیش‌بینی‌ها بدون آن نقطه را محاسبه کرده و آن را بر اساس تعداد متغیرهای پیش‌بین و میانگین مربعات خطا نرمال‌سازی می‌کند.[1][5]

همان‌طور که پلتفرم GeeksforGeeks در مستندات سال ۲۰۲۴ خود اشاره می‌کند، این فرمول از نظر محاسباتی بسیار ظریف است زیرا در واقع نیازی به اجرای چندین باره رگرسیون ندارد. از طریق جبر ماتریسی، این فاصله را می‌توان مستقیماً از پسماندها و مقادیر اهرم مدل اولیه محاسبه کرد که از قطر «ماتریس کلاه» (Hat matrix) استخراج می‌شوند.[5]

حذف یک نقطه با اهرم بالا می‌تواند ضرایب مدل را به‌طور بنیادین تغییر دهد.
همان‌طور که پلتفرم GeeksforGeeks در مستندات سال ۲۰۲۴ خود اشاره می‌کند، این فرمول از نظر محاسباتی بسیار ظریف است زیرا در واقع نیازی به اجرای چندین باره رگرسیون ندارد.

پس از محاسبه فاصله‌ها، تحلیلگر داده باید تصمیم بگیرد که چه چیزی یک مقدار «بزرگ» محسوب می‌شود. اینجاست که اجماع آماری به قوانین سرانگشتی رقیب تجزیه می‌شود و چالشی همیشگی در تحلیل داده‌ها ایجاد می‌کند.[3][6]

سنتی‌ترین روش اکتشافی بیان می‌کند که هر مشاهده‌ای با فاصله کوک بزرگتر از ۱ باید به عنوان یک داده بسیار تأثیرگذار بررسی شود. به خاطر سپردن این آستانه آسان است و در دوره‌های مقدماتی آمار به‌طور گسترده تدریس می‌شود.[2][3]

با این حال، با بزرگ‌تر شدن مجموعه داده‌ها، آستانه ۱ به‌طور فزاینده‌ای ناکارآمد شده است. در یک مجموعه داده با هزاران ردیف، تأثیر نسبی هر نقطه منفرد به‌طور طبیعی کاهش می‌یابد؛ به این معنی که تقریباً هیچ نقطه‌ای هرگز از آستانه ۱ عبور نخواهد کرد، حتی اگر برازش محلی را به‌شدت مخدوش کند.[4][6]

برای اصلاح این مشکل، متخصصان مدرن اغلب از یک آستانه تعدیل‌شده بر اساس حجم نمونه استفاده می‌کنند: ۴ تقسیم بر n، که در آن n تعداد کل مشاهدات است. برای یک مجموعه داده با ۱۰۰۰ مشاهده، این کار آستانه بررسی را از ۱٫۰ به ۰٫۰۰۴ کاهش می‌دهد.[1][3]

سومین آستانه رایج پیشنهاد می‌کند نقاطی بررسی شوند که فاصله آن‌ها بیشتر از ۴ تقسیم بر (n - k - 1) است؛ این فرمول هم برای حجم نمونه و هم برای تعداد متغیرهای پیش‌بین (k) تعدیل می‌شود. این کار از پنهان شدن نقاط تأثیرگذار در مدل‌هایی با ده‌ها ویژگی جلوگیری می‌کند.[1][6]

با بزرگ‌تر شدن مجموعه داده‌ها، آستانه سنتی ۱ برای تشخیص داده‌های پرت بیش از حد محافظه‌کارانه می‌شود.

اختلاف بین این آستانه‌ها یک نقطه تصمیم‌گیری حیاتی برای تحلیلگران است. تکیه بر آستانه سنتی ۱ در یک مجموعه داده بزرگ و مدرن، عملاً چشم محقق را به روی داده‌های پرت تأثیرگذار می‌بندد، در حالی که استفاده از قانون حجم نمونه در یک مجموعه داده کوچک می‌تواند نقاط بیش از حدی را برای بررسی دستی علامت‌گذاری کند.[7]

فاصله کوک یک ابزار عیب‌یابی است، نه یک قانون حذف خودکار. کریس یان (Chris Yan)، دانشمند داده، خاطرنشان می‌کند: «مهم است به یاد داشته باشیم که فاصله کوک بزرگ لزوماً به این معنا نیست که نقطه داده باید حذف شود. این صرفاً بدان معناست که نقطه داده تأثیر زیادی بر مدل رگرسیون دارد و باید بیشتر مورد بررسی قرار گیرد.»[6]

حذف یک نقطه داده معتبر صرفاً به دلیل تأثیرگذار بودن آن، واریانس مدل را به‌طور مصنوعی کاهش داده و در میزان قطعیت یافته‌ها اغراق می‌کند. تحلیلگران باید تعیین کنند که آیا نقطه پرنفوذ نشان‌دهنده یک خطای اندازه‌گیری، یک زیرجمعیت متمایز، یا یک مورد افراطی واقعی است که مدل باید یاد بگیرد خود را با آن تطبیق دهد.[2][7]

نکات کلیدی

  1. فاصله کوک تغییر در پیش‌بینی‌های یک مدل رگرسیون را هنگام حذف یک مشاهده منفرد اندازه‌گیری می‌کند.
  2. این معیار با ضرب کردن اهرم یک نقطه داده در مجذور پسماند آن محاسبه می‌شود.
  3. فاصله کوک بالا نشان می‌دهد که یک ردیف منفرد از داده‌ها به‌طور نامتناسبی در حال دیکته کردن ضرایب مدل است.
  4. کتاب‌های درسی سنتی پیشنهاد می‌کنند نقاطی با فاصله بیشتر از ۱ بررسی شوند، در حالی که در رویه‌های مدرن از آستانه ۴/n استفاده می‌شود.
  5. نقاط پرنفوذ باید از نظر خطاهای اندازه‌گیری بررسی شوند، نه اینکه به‌طور خودکار از مجموعه داده‌ها حذف گردند.

چرا مهم است

در حوزه‌های مختلف از نظرسنجی‌های انتخاباتی گرفته تا کارآزمایی‌های بالینی، یک داده پرت بررسی‌نشده می‌تواند نتایج یک مدل را به‌طور مصنوعی منحرف کند. درک سازوکار «فاصله کوک» به تحلیلگران اجازه می‌دهد تا ثابت کنند آیا یک روند آماری واقعی است یا صرفاً زاییده یک مشاهده افراطی است.

بررسی عمیق دیدگاه‌ها

آماردانان سنتی

طرفدار آستانه‌های محافظه‌کارانه و ثابت برای جلوگیری از دستکاری بیش از حد داده‌ها هستند.

این گروه استدلال می‌کند که آستانه سنتی ۱ از دستکاری داده‌ها توسط تحلیلگران با دور ریختن نقاطی که تنها تأثیر حاشیه‌ای دارند، جلوگیری می‌کند. آن‌ها تأکید می‌کنند که داده‌ها تنها در صورتی باید حذف شوند که خطای اندازه‌گیری مستندی وجود داشته باشد، و یک آستانه بالا تضمین می‌کند که تنها شدیدترین ناهنجاری‌های مخرب مدل برای بررسی علامت‌گذاری شوند.

دانشمندان داده مدرن

مدافع آستانه‌های پویا و تعدیل‌شده بر اساس حجم نمونه در یادگیری ماشین مقیاس‌بزرگ هستند.

متخصصانی که با مجموعه داده‌های عظیم کار می‌کنند استدلال می‌کنند که آستانه ثابت ۱ از نظر ریاضی منسوخ شده است. در یک مجموعه داده با میلیون‌ها ردیف، اهرم هر نقطه منفرد رقیق می‌شود، به این معنی که یک نقطه باید به طرز غیرممکنی افراطی باشد تا به فاصله کوک ۱ برسد. آن‌ها به قانون ۴/n تکیه می‌کنند تا تأثیرگذارترین نقاط را نسبت به اندازه خاص مجموعه داده‌ها نمایان کنند و اطمینان حاصل کنند که سیستم‌های تشخیص ناهنجاری خودکار همچنان می‌توانند در مقیاس وسیع عمل کنند.

منابع

پوشش منابع

7 منبع

2 دیدگاه شناسایی‌شده

مقیاس‌بندی پویا 60%عیب‌یابی محافظه‌کارانه 40%
  1. [1]Wikipediaمقیاس‌بندی پویا

    Cook's distance

    مطالعه در Wikipedia
  2. [2]Penn State STAT 462عیب‌یابی محافظه‌کارانه

    9.5 - Identifying Influential Data Points

    مطالعه در Penn State STAT 462
  3. [3]Statistics How Toعیب‌یابی محافظه‌کارانه

    Cook's Distance / Cook's D: Definition, Interpretation

    مطالعه در Statistics How To
  4. [4]RPubsمقیاس‌بندی پویا

    Cook's Distance Formula

    مطالعه در RPubs
  5. [5]GeeksforGeeksمقیاس‌بندی پویا

    Cook's Distance Formula

    مطالعه در GeeksforGeeks
  6. [6]Chris Yanمقیاس‌بندی پویا

    Understanding Cook's Distance in Regression Analysis

    مطالعه در Chris Yan
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.