سه شرطی که سازوکار دادههای گمشده را تعریف میکنند (MCAR، MAR، MNAR)
طبقهبندی سال ۱۹۷۶ دونالد روبین، آماردان، دادههای گمشده را به سه سازوکار احتمالی تقسیم میکند که مشخص میکنند آیا شکافهای یک کارآزمایی بالینی از نظر ریاضی قابلترمیم هستند یا اینکه کل مطالعه را بیاعتبار میسازند.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- طبقهبندی سال ۱۹۷۶ دونالد روبین، دادههای گمشده را به سه سازوکار تقسیم میکند: MCAR، MAR و MNAR.
- کاملاً گمشده بهطور تصادفی (MCAR) توان آماری را کاهش میدهد، اما سوگیری در برآوردها ایجاد نمیکند.
- گمشده بهطور تصادفی (MAR) به الگوریتمها اجازه میدهد تا مقادیر گمشده را بر اساس سایر متغیرهای مشاهدهشده بهدقت جایگذاری کنند.
برای یک مهندس یادگیری ماشین که در حال ساخت یک مدل پیشبینی است، یک سلول خالی در مجموعه دادهها مانعی است که باید از آن عبور کرد؛ شکافی که باید با یک مقدار میانگین پر شود یا بهکل حذف گردد تا الگوریتم بتواند اجرا شود. اما برای یک آمارشناس زیستی در یک کارآزمایی بالینی، همان سلول خالی یک سیگنال است.
اگر یک بیمار ثبت فشار خون روزانه خود را متوقف کند، نبود این عدد ممکن است به این معنا باشد که او صرفاً فراموش کرده است، یا ممکن است به این معنا باشد که داروی آزمایشی عارضه جانبی چنان شدیدی ایجاد کرده که او از مطالعه خارج شده است. برخورد یکسان با مورد دوم و اول، یکپارچگی کارآزمایی را از بین میبرد.
چارچوب ریاضیاتی که یک شکاف بیضرر را از یک سوگیری کشنده جدا میکند، در سال ۱۹۷۶ توسط آماردانی به نام دونالد روبین (Donald Rubin) پایهگذاری شد. روبین در مقالهای تأثیرگذار که در نشریه Biometrika منتشر شد، این مفهوم را فرمولبندی کرد که دادههای گمشده صرفاً نبود اطلاعات نیستند، بلکه یک رویداد احتمالی هستند که توسط قوانین خاصی اداره میشوند.
او این رویدادها را به سه سازوکار مجزا طبقهبندی کرد: کاملاً گمشده بهطور تصادفی (MCAR)، گمشده بهطور تصادفی (MAR) و گمشده غیرتصادفی (MNAR). این سه شرط تعیین میکنند که آیا یک پژوهشگر میتواند با خیال راحت این شکافها را نادیده بگیرد، آنها را از نظر ریاضی جایگذاری کند، یا اینکه باید کل مطالعه را کنار بگذارد.[3]
شرط اول، یعنی کاملاً گمشده بهطور تصادفی (MCAR)، نشاندهنده بهترین سناریو برای پژوهشگران است. تحت شرایط MCAR، احتمال گمشدن یک نقطه داده کاملاً مستقل از هر متغیر دیگری در مجموعه دادهها (چه مشاهدهشده و چه مشاهدهنشده) است. راهنمای آماری Bookdown در این باره مینویسد: «دادهها زمانی MCAR هستند که احتمال گمشدن دادهها در یک متغیر، به هیچ متغیر اندازهگیریشده دیگری و همچنین به خود متغیر دارای مقادیر گمشده ارتباطی نداشته باشد.»
اگر یک تکنسین آزمایشگاه ۵٪ از نمونههای خون را روی زمین بیندازد، ۹۵٪ باقیمانده همچنان یک زیرمجموعه کاملاً تصادفی از جمعیت اولیه را نشان میدهند. در این حالت، اگرچه توان آماری به دلیل کوچکتر شدن حجم نمونه کاهش مییابد، اما خود برآوردها بدون سوگیری باقی میمانند.[3]
با این حال، MCAR خالص در تحقیقات انسانی بسیار نادر است. شرط دوم، یعنی گمشده بهطور تصادفی (MAR)، فرضی است که اساس بیشتر نرمافزارهای آماری مدرن را تشکیل میدهد. تحت شرایط MAR، گمشدگی با سایر متغیرهای مشاهدهشده در مجموعه دادهها مرتبط است، اما به خود مقدار گمشده ارتباطی ندارد.
برای مثال، اگر احتمال پاسخ ندادن مردان به یک سؤال نظرسنجی درباره افسردگی ۲۰٪ کمتر از زنان باشد، تا زمانی که پژوهشگر جنسیت شرکتکنندگان را ثبت کرده باشد، این دادهها MAR محسوب میشوند. از آنجا که گمشدگی را میتوان بهطور کامل توسط متغیرهای دیگر توضیح داد، الگوریتمهایی مانند جایگذاری چندگانه (MI) یا حداکثر درستنمایی اطلاعات کامل (FIML) میتوانند مجموعه دادهها را بهدقت بازسازی کنند.
شرط سوم، یعنی گمشده غیرتصادفی (MNAR)، یک تهدید حیاتی برای تحقیقات کمی است. MNAR زمانی رخ میدهد که احتمال گمشدن یک مقدار به خود مقدار مشاهدهنشده بستگی داشته باشد. نشریه Circulation متعلق به انجمن قلب آمریکا گزارش میدهد: «این بدترین نوع دادههای گمشده در نظر گرفته میشود، زیرا خروج افراد از مطالعه با درمان یا مداخله مورد بررسی مرتبط است.»
اگر افراد پردرآمد از گزارش حقوق خود امتناع کنند، یا اگر بیمارانی که دچار خونریزی داخلی شدید شدهاند از شرکت در پیگیریهای بالینی خودداری کنند، دادههای گمشده دقیقاً همان پدیدهای را پنهان میکنند که مطالعه در تلاش برای اندازهگیری آن است.[4]
خطرات ناشی از طبقهبندی اشتباه این سازوکارها بسیار زیاد است. سالانه بیش از ۷ میلیارد دلار صرف ارزیابی داروها، دستگاهها و مواد بیولوژیک در کارآزماییهای بالینی تأییدی فاز ۳ میشود. در سال ۲۰۱۰، به درخواست سازمان غذا و داروی آمریکا (FDA)، شورای ملی تحقیقات هیئتی را برای رسیدگی به بحران دادههای گمشده در این کارآزماییها تشکیل داد. گزارش حاصل از این نشست، استانداردهای نظارتی را بهطور بنیادین تغییر داد و هشدار داد که دادههای گمشده میتوانند نتایج یک کارآزمایی بالینی را تحت تأثیر قرار داده یا حتی بیاعتبار کنند.[4]
دستورالعملهای بعدی FDA تأکید کردند که جادوی آماری نمیتواند یک کارآزمایی با طراحی ضعیف را نجات دهد. اگر دادهها MNAR باشند، هیچ الگوریتم جایگذاری نمیتواند مقادیر گمشده را بهدقت حدس بزند، زیرا این الگو توسط دادههایی هدایت میشود که پژوهشگران در اختیار ندارند.
نشریه AHA خاطرنشان میکند: «اگر تفاوتهایی در ویژگیهای شرکتکنندگان دارای دادههای گمشده و بدون دادههای گمشده وجود داشته باشد، آنگاه سانسور اطلاعاتی (informative censoring) رخ میدهد.» این سانسور اطلاعاتی میتواند با حذف بیسروصدای بیمارانی که بدترین پیامدها را تجربه کردهاند، ایمنی یا اثربخشی ظاهری یک دارو را بهطور کاذب افزایش دهد.[4]
برای مقابله با این مشکل، پروتکلهای بالینی مدرن اکنون حفظ بیماران را بر اصلاح دادهها ترجیح میدهند. دستورالعمل ICH E9 شورای بینالمللی هماهنگسازی الزامات فنی داروها برای استفاده انسانی، که در ابتدا در سال ۱۹۹۸ صادر شد، الزامی میکند که تحلیلهای حساسیت و نحوه مدیریت دادههای گمشده باید پیش از آغاز کارآزمایی در پروتکل از پیش تعریف شوند.
علاوه بر این، چارچوبهای نظارتی موظف میکنند که دادههای جمعآوریشده از سوژهها تا لحظه خروج آنها باید در پایگاه داده حفظ شود تا اطمینان حاصل گردد که عوارض جانبی اولیه از سوابق پاک نمیشوند.[1][2]
با وجود این چارچوبهای سختگیرانه، یک پارادوکس در قلب نظریه دادههای گمشده باقی میماند: از نظر ریاضی غیرممکن است که تنها با استفاده از مجموعه دادههای مشاهدهشده، بهطور قطعی ثابت کرد که دادهها MAR هستند و نه MNAR.
از آنجا که مقادیر گمشده، بنا به تعریف، مشاهدهنشده هستند، پژوهشگران هرگز نمیتوانند کاملاً مطمئن باشند که گمشدگی توسط خود مقادیر پنهان هدایت نمیشود. آنها میتوانند با مقایسه گروههای مشاهدهشده و گمشده، وضعیت MCAR را آزمایش کنند، اما مرز بین MAR و MNAR کاملاً به درک پژوهشگر از سازوکار دنیای واقعی که دادهها را تولید کرده است، بستگی دارد.[2][3]
این محدودیت، پژوهشگران را مجبور میکند تا به تحلیلهای حساسیت تکیه کنند؛ یعنی آزمایش اینکه اگر سازوکار دادههای گمشده از MAR به MNAR تغییر کند، نتیجهگیریهای آنها چقدر تغییر خواهد کرد. اگر نرخ ۱۰ درصدی دادههای گمشده تحت فرض MNAR، نتیجه یک کارآزمایی دارویی را از مؤثر به مضر تغییر دهد، یافته اولیه برای اعتماد کردن بیش از حد شکننده است. یکپارچگی تحلیل دادههای مدرن نه بر مجموعه دادههای کاملاً بینقص، بلکه بر پذیرش شفاف این موضوع استوار است که سلولهای خالی ممکن است چه چیزی را پنهان کرده باشند.[4]
اصطلاحات کلیدی
- MCAR (کاملاً گمشده بهطور تصادفی)
- وضعیتی که در آن احتمال گمشدن یک نقطه داده کاملاً مستقل از هر داده دیگری، چه مشاهدهشده و چه مشاهدهنشده، است.
- MAR (گمشده بهطور تصادفی)
- وضعیتی که در آن گمشدگی را میتوان بهطور کامل توسط سایر متغیرهای مشاهدهشده در مجموعه دادهها توضیح داد، که امکان جایگذاری الگوریتمی دقیق را فراهم میکند.
- MNAR (گمشده غیرتصادفی)
- وضعیتی که در آن گمشدگی به خود مقدار مشاهدهنشده بستگی دارد و سوگیری شدیدی ایجاد میکند که بهراحتی قابلاصلاح نیست.
- سانسور اطلاعاتی (Informative Censoring)
- سوگیریای که زمانی رخ میدهد که سوژهها به دلایل مرتبط با درمان از مطالعه خارج میشوند و نتایج نهایی را منحرف میکنند.
- جایگذاری چندگانه (Multiple Imputation)
- یک تکنیک آماری که مقادیر گمشده را با چندین نسخه شبیهسازیشده جایگزین میکند تا عدم قطعیت دادههای گمشده را در نظر بگیرد.
بررسی عمیق دیدگاهها
آمارشناسان زیستی بالینی
طراحی کارآزمایی و تحلیل حساسیت را برای کاهش سوگیری غیرقابلاصلاح MNAR در اولویت قرار میدهند.
برای آمارشناسان زیستی که کارآزماییهای فاز ۳ را طراحی میکنند، دادههای گمشده بیشتر یک تهدید ساختاری است تا یک دردسر ریاضی. از آنجا که نمیتوان MNAR را بهطور قطعی رد کرد، آنها استدلال میکنند که هیچ الگوریتم جایگذاری نمیتواند کارآزمایی با نرخ بالای ریزش را نجات دهد. تمرکز آنها بر طراحی پیشگیرانه پروتکل است؛ یعنی درگیر نگه داشتن بیماران و پیگیری دلایل خروج آنها، تا بتوان سازوکار دادههای گمشده را بهدقت شناسایی کرده و از طریق تحلیلهای حساسیت مدلسازی کرد.
متخصصان یادگیری ماشین
بر الگوریتمهای پیشرفته جایگذاری با فرض MAR تمرکز میکنند تا کارایی مجموعه دادههای عظیم و پرنویز را به حداکثر برسانند.
در حوزه مدلسازی پیشبینیکننده و علم داده، حذف ردیفهای ناقص (حذف لیستی) اغلب بهعنوان هدررفت غیرقابلقبول دادههای آموزشی در نظر گرفته میشود. متخصصان معمولاً به تکنیکهایی مانند جایگذاری چندگانه با معادلات زنجیرهای (MICE) یا جایگذاری کی-نزدیکترین همسایه (KNN) تکیه میکنند. این الگوریتمها فرض میکنند که دادهها MAR هستند و از همبستگیهای پیچیده درون مجموعه دادههای عظیم برای بازسازی مقادیر گمشده استفاده میکنند و دقت پیشبینی را بر استنتاج علی ترجیح میدهند.
آژانسهای نظارتی
خواستار پروتکلهای از پیش تعریفشده و گزارشدهی شفاف هستند تا از پنهان شدن عوارض جانبی داروها توسط دادههای گمشده جلوگیری کنند.
آژانسهایی مانند FDA دادههای گمشده را از دریچه ایمنی بیمار بررسی میکنند. نگرانی اصلی آنها سانسور اطلاعاتی است؛ یعنی این خطر که بیمارانی که عوارض جانبی شدیدی را تجربه میکنند، بیسروصدا از کارآزمایی خارج شوند و یک داروی خطرناک را ایمن جلوه دهند. در نتیجه، نهادهای نظارتی میخواهند که استراتژیهای مربوط به دادههای گمشده پیش از آغاز کارآزمایی تثبیت شوند و توانایی حامیان مالی برای انتخاب مطلوبترین روش جایگذاری پس از مشخص شدن نتایج را بهشدت محدود میکنند.
- آمارشناسان زیستی بالینی
- طراحی کارآزمایی و تحلیل حساسیت را برای کاهش سوگیری غیرقابلاصلاح MNAR در اولویت قرار میدهند.
- متخصصان یادگیری ماشین
- بر الگوریتمهای پیشرفته جایگذاری با فرض MAR تمرکز میکنند تا کارایی مجموعه دادههای عظیم را به حداکثر برسانند.
- نظریهپردازان آماری
- بر تعاریف ریاضیاتی و مرزهای احتمالی سازوکارهای دادههای گمشده تمرکز دارند.
دیدگاههایی که این گزارش پوشش نداده
- بیمارانی که از کارآزماییهای بالینی انصراف دادهاند
منابع
[1]NCBIآمارشناسان زیستی بالینیTypes of Missing Data - Managing Missing Data in Patient Registries
مطالعه در NCBI →
[2]arXivمتخصصان یادگیری ماشینA Comprehensive Review of Handling Missing Data: Exploring Special Missing Mechanisms
مطالعه در arXiv →
[3]Bookdownنظریهپردازان آماریChapter 7 Missing data Mechanisms
مطالعه در Bookdown →
[4]AHA Journalsآمارشناسان زیستی بالینیMissing Data in Clinical Trials
مطالعه در AHA Journals →
[5]تیم سردبیری کوهستاننظریهپردازان آماریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →روششناسی آماری
چگونه خطای معیار در مقایسه با انحراف معیار، واریانس ظاهری را فشرده میکند
9 منبع
تحلیل سریهای زمانی
چگونه آزمون ریشه واحد از همبستگی کاذب در سریهای زمانی ناایستا جلوگیری میکند
7 منبع
روشهای بازنمونهگیری
چگونه بازنمونهگیری با جایگذاری، توزیع نمونهگیری هر آمارهای را تخمین میزند؟
8 منبع
مدلسازی اقتصادی
بسته شواهد: اعتبار «پیشبینی حال» شاخصهای اقتصادی با استفاده از دادههای جایگزین
6 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





