چرا جایگزینی با میانگین، واریانس دادهها را مخدوش میکند و چگونه معادلات زنجیرهای آن را حفظ میکنند؟
جایگزین کردن دادههای گمشده با میانگینها به طور مصنوعی واریانس را کاهش داده و اطمینان کاذب ایجاد میکند. روش انتساب چندگانه با معادلات زنجیرهای (MICE) این مشکل را با تولید چندین مجموعه داده محتمل حل میکند تا عدم قطعیت دقیق سوابق گمشده را کمیسازی کند.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- محققان کاربردی
- اولویتبندی اجرای عملی، خطاهای استاندارد قوی، و اجتناب از مثبتهای کاذب در مطالعات بالینی یا اقتصادی.
- آمارشناسان محاسباتی
- تمرکز بر کارایی الگوریتمی و ویژگیهای همگرایی معادلات زنجیرهای.
- متخصصان علم داده
- ارزیابی روشهای انتساب بر اساس دقت پیشبینی و حفظ هندسه مجموعه داده.
محدودیت الزامآور هر الگوریتم دادههای گمشده، مکانیسم خودِ گمشده بودن است: مقدار مشاهده نشده نباید دلیل گمشده بودن داده باشد. آمارشناسان این شرط را «گمشده به صورت تصادفی» (MAR) مینامند. اگر یک بیمار در یک کارآزمایی بالینی نظرسنجی افسردگی را دقیقاً به این دلیل که افسردگیاش برای بلند شدن از رختخواب بسیار شدید است، کنار بگذارد، دادهها «گمشده نه به صورت تصادفی» (MNAR) هستند و هیچ الگوریتمی نمیتواند با اطمینان جای خالی را استنتاج کند. اما هنگامی که شرط MAR برقرار است—مثلاً یک حسگر به سادگی یک بسته داده را از دست میدهد، یا یک شرکتکننده به طور تصادفی از یک صفحه صرف نظر میکند—محققان با یک انتخاب ریاضی برای پر کردن شکافها روبرو هستند.[1][5]
از لحاظ تاریخی، پاسخ پیشفرض به یک خانه خالی، جایگزینی با میانگین بود: محاسبه میانگین دادههای موجود برای آن متغیر و قرار دادن آن در جای خالی. نرمافزار Statistica اشاره میکند که اگرچه این رویکرد اندازه کلی نمونه را برای الگوریتم حفظ میکند، اما اساساً هندسه مجموعه داده را تغییر میدهد. از آنجا که مقادیر جایگزین شده دقیقاً روی میانگین قرار میگیرند، انحراف صفر از مرکز را به همراه دارند.
جریمه ریاضی جایگزینی با میانگین، اطمینان مصنوعی است. مشارکتکنندگان در Cross Validated خاطرنشان میکنند که این کار به طور مصنوعی واریانس متغیر را کاهش میدهد، تمام همبستگیها را به سمت صفر میکشد و نویز طبیعی را که نشاندهنده عدم قطعیت دنیای واقعی است، از بین میبرد. اگر ۲۰٪ (بیست درصد) از مقادیر یک مجموعه داده گمشده باشد، قرار دادن میانگین واریانس را دقیقاً ۲۰٪ کاهش میدهد و عملاً نرخهای مثبت کاذب متورم را در رگرسیونهای بعدی تضمین میکند.[6]
انتساب چندگانه با معادلات زنجیرهای (MICE) این مشکل را با در نظر گرفتن گمشده بودن نه به عنوان یک جای خالی که باید با یک حدس واحد پر شود، بلکه به عنوان یک توزیع احتمالات حل میکند. همانطور که در مقالهای در سال ۲۰۱۱ (سال دو هزار و یازده) در Journal of Statistical Software به تفصیل آمده است، الگوریتم MICE یک مدل پیشبینی مجزا برای هر متغیر ناقص مشخص میکند. به جای فرض یک مقدار واقعی واحد، عدم قطعیت ذاتی رکورد گمشده را تصدیق میکند.[2]
این الگوریتم از طریق یک فرآیند چرخهای عمل میکند. International Journal of Methods in Psychiatric Research توضیح میدهد که MICE به صورت چرخشی در متغیرها حرکت میکند و از دادههای مشاهده شده از بقیه مجموعه داده برای پیشبینی دادههای گمشده برای یک ستون خاص در هر زمان استفاده میکند. این روش از یک توزیع پیشبینیکننده نمونهبرداری میکند تا یک مقدار محتمل تولید کند و دقیقاً همان مقدار نویز آماری مورد نیاز برای حفظ واریانس اصلی را تزریق میکند.[1]
این روش از یک توزیع پیشبینیکننده نمونهبرداری میکند تا یک مقدار محتمل تولید کند و دقیقاً همان مقدار نویز آماری مورد نیاز برای حفظ واریانس اصلی را تزریق میکند.
این فرآیند به جای تولید یک مجموعه داده وصلهشده، چندین مجموعه داده تولید میکند. دانشکده بهداشت عمومی میلمن دانشگاه کلمبیا (Columbia University Mailman School of Public Health) اشاره میکند که «انتساب چندگانه شامل پر کردن مقادیر گمشده به دفعات متعدد و ایجاد چندین مجموعه داده 'کامل' است.» معمولاً، محققان بین ۵ تا ۲۰ مجموعه داده متمایز تولید میکنند که هر کدام حاوی مقادیر انتسابی کمی متفاوت هستند که عدم قطعیت پیشبینی را منعکس میکند.[5]
هنگامی که مجموعههای داده تولید شدند، محقق تحلیل آماری مورد نظر خود—یک رگرسیون، یک ANOVA، یا یک مدل بقا—را به طور مستقل بر روی تک تک آنها اجرا میکند. سپس نتایج با استفاده از مجموعهای از فرمولها که به «قوانین روبین» (Rubin's Rules) معروف هستند، ادغام میشوند. این مرحله ادغام، خطای استاندارد را با ترکیب واریانس درون هر مجموعه داده با واریانس بین مجموعههای داده محاسبه میکند و به طور صریح عدم قطعیت ناشی از دادههای گمشده را کمیسازی میکند.[3][5]
بسته نرمافزاری `mice` در شبکه جامع آرشیو R (CRAN) به ابزار محاسباتی استاندارد برای اجرای این گردش کار تبدیل شده است. این بسته به دانشمندان داده اجازه میدهد تا مدلهای پیشبینی خاصی را به انواع دادههای خاص نگاشت کنند: رگرسیون لجستیک برای متغیرهای باینری، تطبیق میانگین پیشبینیکننده برای متغیرهای پیوسته، و مدلهای شانس متناسب برای دستهبندیهای مرتب شده.[2][4]
این تکنیک بدون محدودیتهای سختگیرانه نیست. راهنمای Bookdown در مورد تحلیل کاربردی دادههای گمشده هشدار میدهد که MICE از نظر محاسباتی فشرده است و به تعریف مدل انتساب بسیار حساس است. اگر مدل پیشبینیکنندهای که برای تولید انتسابها استفاده میشود، یک اثر تعاملی حیاتی را که در دنیای واقعی وجود دارد، حذف کند، برآوردهای ادغام شده نهایی میتوانند سوگیرانهتر از حالتی باشند که محقق به سادگی ردیفهای ناقص را به طور کامل حذف کرده بود.[3]
مرز بعدی در تحلیل دادههای گمشده بر روی نقطهای متمرکز است که در آن محدودیت الزامآور شکست میخورد. هنگامی که دادهها MNAR هستند، محققان نمیتوانند تنها به معادلات زنجیرهای تکیه کنند. در عوض، آنها در حال توسعه تحلیلهای حساسیت هستند تا آزمایش کنند که نتایج MICE چقدر قوی باقی میمانند، زمانی که فرض MAR به طور سیستماتیک نقض میشود، و نقطه دقیقی را ترسیم میکنند که در آن استنتاج آماری جای خود را به عدم قطعیت غیرقابل حل میدهد.[1][7]
نکات کلیدی
- جایگزینی با میانگین به طور مصنوعی واریانس دادهها را کاهش میدهد که منجر به اطمینان کاذب و نرخهای مثبت کاذب (False-Positive) متورم میشود.
- MICE مقادیر گمشده را به جای اعداد مجهول واحد، به عنوان توزیعهای احتمالی در نظر میگیرد.
- این الگوریتم به صورت چرخشی در متغیرها حرکت میکند و از دادههای مشاهده شده برای پیشبینی تکراری دادههای گمشده استفاده میکند.
- MICE چندین مجموعه داده کامل تولید میکند و به محققان اجازه میدهد تا عدم قطعیت دقیق سوابق گمشده را کمیسازی کنند.
- این روش بر فرض «گمشده به صورت تصادفی» (MAR) متکی است؛ اگر دادهها «گمشده نه به صورت تصادفی» (MNAR) باشند، انتساب میتواند سوگیری شدیدی ایجاد کند.
بررسی عمیق دیدگاهها
آمارشناسان محاسباتی
تمرکز بر کارایی الگوریتمی و ویژگیهای همگرایی معادلات زنجیرهای.
برای آمارشناسانی که نرمافزار را میسازند، نگرانی اصلی این است که آیا معادلات زنجیرهای واقعاً به یک توزیع پایدار همگرا میشوند یا خیر. از آنجا که MICE به جای یک توزیع مشترک واحد، یک مدل مجزا برای هر متغیر مشخص میکند، هیچ تضمین نظری وجود ندارد که فرآیند تکراری به یک حالت معتبر ریاضی برسد. با این حال، آمارشناسان محاسباتی اشاره میکنند که در عمل، این الگوریتم به طرز شگفتآوری قوی است و معمولاً حتی در مجموعههای داده بسیار پیچیده و غیرخطی، در عرض پنج تا ده تکرار همگرا میشود.
محققان کاربردی
اولویتبندی اجرای عملی، خطاهای استاندارد قوی، و اجتناب از مثبتهای کاذب در مطالعات بالینی یا اقتصادی.
اپیدمیولوژیستها و اقتصاددانان MICE را در درجه اول به عنوان یک مکانیسم دفاعی در برابر مثبتهای کاذب میبینند. هنگام اجرای یک کارآزمایی بالینی یا یک رگرسیون اقتصادی، خطاهای استاندارد که به طور مصنوعی کوچک شدهاند—که مشخصه جایگزینی با میانگین است—میتوانند باعث شوند یک دارو یا سیاست بیفایده از نظر آماری معنادار به نظر برسد. محققان کاربردی به MICE متکی هستند زیرا قوانین روبین به صراحت بازه اطمینان نهایی را به دلیل میزان دادههای گمشده جریمه میکند و تضمین میکند که نتایج مطالعه قدرت شواهد را بیش از حد بیان نکنند.
نظریهپردازان استنتاج علّی
تمرکز بر مفروضات غیرقابل آزمایش زیربنای مکانیسم انتساب.
نظریهپردازانی که در استنتاج علّی کار میکنند، استدلال میکنند که مکانیک MICE اغلب از مشکل عمیقتر مکانیسم گمشده بودن منحرف میشود. آنها اشاره میکنند که فرض «گمشده به صورت تصادفی» (MAR) اساساً با استفاده از دادههای مشاهده شده قابل آزمایش نیست. اگر مقادیر مشاهده نشده عامل گمشده بودن باشند، MICE با اطمینان چندین مجموعه داده تولید خواهد کرد که همگی دقیقاً و به یک اندازه اشتباه هستند. این گروه توصیه میکند که هر گردش کار MICE با تحلیلهای حساسیت دقیق همراه شود تا مشخص شود که اگر فرض MAR نقض شود، نتایج مطالعه با چه سرعتی فرو میریزند.
چرا مهم است
هر مجموعه داده بزرگ علمی، پزشکی و اقتصادی حاوی مقادیر گمشده است. نحوه پر کردن این شکافها توسط محققان تعیین میکند که آیا یک کارآزمایی بالینی نشان دهد دارو مؤثر است یا شکست میخورد، و این امر روشهای انتساب (Imputation) را به پایه نامرئی سیاستگذاری مبتنی بر شواهد تبدیل میکند.
منابع
[1]Int J Methods Psychiatr Resمحققان کاربردیMultiple imputation by chained equations: what is it and how does it work?
مطالعه در Int J Methods Psychiatr Res →
[2]Journal of Statistical Softwareآمارشناسان محاسباتیmice: Multivariate Imputation by Chained Equations in R
مطالعه در Journal of Statistical Software →
[3]Bookdownمحققان کاربردیChapter4 Multiple Imputation
مطالعه در Bookdown →
[4]CRANآمارشناسان محاسباتیPackage mice
مطالعه در CRAN →
[5]Columbia University Mailman School of Public Healthمحققان کاربردیMissing Data and Multiple Imputation
مطالعه در Columbia University Mailman School of Public Health →
[6]Cross Validatedمتخصصان علم دادهWhat are the disadvantages of using mean for missing values?
مطالعه در Cross Validated →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.


