سه شرطی که سازوکار دادههای گمشده را تعریف میکنند (MCAR، MAR، MNAR)
طبقهبندی سال ۱۹۷۶ دونالد روبین، آماردان، دادههای گمشده را به سه سازوکار احتمالی تقسیم میکند که مشخص میکنند آیا شکافهای یک کارآزمایی بالینی از نظر ریاضی قابلترمیم هستند یا اینکه کل مطالعه را بیاعتبار میسازند.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- آمارشناسان زیستی بالینی
- طراحی کارآزمایی و تحلیل حساسیت را برای کاهش سوگیری غیرقابلاصلاح MNAR در اولویت قرار میدهند.
- متخصصان یادگیری ماشین
- بر الگوریتمهای پیشرفته جایگذاری با فرض MAR تمرکز میکنند تا کارایی مجموعه دادههای عظیم را به حداکثر برسانند.
- نظریهپردازان آماری
- بر تعاریف ریاضیاتی و مرزهای احتمالی سازوکارهای دادههای گمشده تمرکز دارند.
دیدگاههایی که این گزارش پوشش نداده
- بیمارانی که از کارآزماییهای بالینی انصراف دادهاند
نکات کلیدی
- طبقهبندی سال ۱۹۷۶ دونالد روبین، دادههای گمشده را به سه سازوکار تقسیم میکند: MCAR، MAR و MNAR.
- کاملاً گمشده بهطور تصادفی (MCAR) توان آماری را کاهش میدهد، اما سوگیری در برآوردها ایجاد نمیکند.
- گمشده بهطور تصادفی (MAR) به الگوریتمها اجازه میدهد تا مقادیر گمشده را بر اساس سایر متغیرهای مشاهدهشده بهدقت جایگذاری کنند.
- گمشده غیرتصادفی (MNAR) زمانی رخ میدهد که گمشدگی توسط خود دادههای پنهان هدایت شود و تهدیدی جدی برای اعتبار کارآزمایی محسوب میشود.
- آژانسهای نظارتی مانند FDA اکنون طراحی کارآزماییهایی را در اولویت قرار میدهند که از گمشدن دادهها جلوگیری میکنند، نه اینکه به اصلاحات آماری پس از وقوع تکیه کنند.
برای یک مهندس یادگیری ماشین که در حال ساخت یک مدل پیشبینی است، یک سلول خالی در مجموعه دادهها مانعی است که باید از آن عبور کرد؛ شکافی که باید با یک مقدار میانگین پر شود یا بهکل حذف گردد تا الگوریتم بتواند اجرا شود. اما برای یک آمارشناس زیستی در یک کارآزمایی بالینی، همان سلول خالی یک سیگنال است. اگر یک بیمار ثبت فشار خون روزانه خود را متوقف کند، نبود این عدد ممکن است به این معنا باشد که او صرفاً فراموش کرده است، یا ممکن است به این معنا باشد که داروی آزمایشی عارضه جانبی چنان شدیدی ایجاد کرده که او از مطالعه خارج شده است. برخورد یکسان با مورد دوم و اول، یکپارچگی کارآزمایی را از بین میبرد.
چارچوب ریاضیاتی که یک شکاف بیضرر را از یک سوگیری کشنده جدا میکند، در سال ۱۹۷۶ توسط آماردانی به نام دونالد روبین (Donald Rubin) پایهگذاری شد. روبین در مقالهای تأثیرگذار که در نشریه Biometrika منتشر شد، این مفهوم را فرمولبندی کرد که دادههای گمشده صرفاً نبود اطلاعات نیستند، بلکه یک رویداد احتمالی هستند که توسط قوانین خاصی اداره میشوند. او این رویدادها را به سه سازوکار مجزا طبقهبندی کرد: کاملاً گمشده بهطور تصادفی (MCAR)، گمشده بهطور تصادفی (MAR) و گمشده غیرتصادفی (MNAR). این سه شرط تعیین میکنند که آیا یک پژوهشگر میتواند با خیال راحت این شکافها را نادیده بگیرد، آنها را از نظر ریاضی جایگذاری کند، یا اینکه باید کل مطالعه را کنار بگذارد.[3]
شرط اول، یعنی کاملاً گمشده بهطور تصادفی (MCAR)، نشاندهنده بهترین سناریو برای پژوهشگران است. تحت شرایط MCAR، احتمال گمشدن یک نقطه داده کاملاً مستقل از هر متغیر دیگری در مجموعه دادهها (چه مشاهدهشده و چه مشاهدهنشده) است. راهنمای آماری Bookdown در این باره مینویسد: «دادهها زمانی MCAR هستند که احتمال گمشدن دادهها در یک متغیر، به هیچ متغیر اندازهگیریشده دیگری و همچنین به خود متغیر دارای مقادیر گمشده ارتباطی نداشته باشد.» اگر یک تکنسین آزمایشگاه ۵٪ از نمونههای خون را روی زمین بیندازد، ۹۵٪ باقیمانده همچنان یک زیرمجموعه کاملاً تصادفی از جمعیت اولیه را نشان میدهند. در این حالت، اگرچه توان آماری به دلیل کوچکتر شدن حجم نمونه کاهش مییابد، اما خود برآوردها بدون سوگیری باقی میمانند.[3]
با این حال، MCAR خالص در تحقیقات انسانی بسیار نادر است. شرط دوم، یعنی گمشده بهطور تصادفی (MAR)، فرضی است که اساس بیشتر نرمافزارهای آماری مدرن را تشکیل میدهد. تحت شرایط MAR، گمشدگی با سایر متغیرهای مشاهدهشده در مجموعه دادهها مرتبط است، اما به خود مقدار گمشده ارتباطی ندارد. برای مثال، اگر احتمال پاسخ ندادن مردان به یک سؤال نظرسنجی درباره افسردگی ۲۰٪ کمتر از زنان باشد، تا زمانی که پژوهشگر جنسیت شرکتکنندگان را ثبت کرده باشد، این دادهها MAR محسوب میشوند. از آنجا که گمشدگی را میتوان بهطور کامل توسط متغیرهای دیگر توضیح داد، الگوریتمهایی مانند جایگذاری چندگانه (MI) یا حداکثر درستنمایی اطلاعات کامل (FIML) میتوانند مجموعه دادهها را بهدقت بازسازی کنند.
شرط سوم، یعنی گمشده غیرتصادفی (MNAR)، یک تهدید حیاتی برای تحقیقات کمی است. MNAR زمانی رخ میدهد که احتمال گمشدن یک مقدار به خود مقدار مشاهدهنشده بستگی داشته باشد. نشریه Circulation متعلق به انجمن قلب آمریکا گزارش میدهد: «این بدترین نوع دادههای گمشده در نظر گرفته میشود، زیرا خروج افراد از مطالعه با درمان یا مداخله مورد بررسی مرتبط است.» اگر افراد پردرآمد از گزارش حقوق خود امتناع کنند، یا اگر بیمارانی که دچار خونریزی داخلی شدید شدهاند از شرکت در پیگیریهای بالینی خودداری کنند، دادههای گمشده دقیقاً همان پدیدهای را پنهان میکنند که مطالعه در تلاش برای اندازهگیری آن است.[4]
شرط سوم، یعنی گمشده غیرتصادفی (MNAR)، یک تهدید حیاتی برای تحقیقات کمی است.
خطرات ناشی از طبقهبندی اشتباه این سازوکارها بسیار زیاد است. سالانه بیش از ۷ میلیارد دلار صرف ارزیابی داروها، دستگاهها و مواد بیولوژیک در کارآزماییهای بالینی تأییدی فاز ۳ میشود. در سال ۲۰۱۰، به درخواست سازمان غذا و داروی آمریکا (FDA)، شورای ملی تحقیقات هیئتی را برای رسیدگی به بحران دادههای گمشده در این کارآزماییها تشکیل داد. گزارش حاصل از این نشست، استانداردهای نظارتی را بهطور بنیادین تغییر داد و هشدار داد که دادههای گمشده میتوانند نتایج یک کارآزمایی بالینی را تحت تأثیر قرار داده یا حتی بیاعتبار کنند.[4]
دستورالعملهای بعدی FDA تأکید کردند که جادوی آماری نمیتواند یک کارآزمایی با طراحی ضعیف را نجات دهد. اگر دادهها MNAR باشند، هیچ الگوریتم جایگذاری نمیتواند مقادیر گمشده را بهدقت حدس بزند، زیرا این الگو توسط دادههایی هدایت میشود که پژوهشگران در اختیار ندارند. نشریه AHA خاطرنشان میکند: «اگر تفاوتهایی در ویژگیهای شرکتکنندگان دارای دادههای گمشده و بدون دادههای گمشده وجود داشته باشد، آنگاه سانسور اطلاعاتی (informative censoring) رخ میدهد.» این سانسور اطلاعاتی میتواند با حذف بیسروصدای بیمارانی که بدترین پیامدها را تجربه کردهاند، ایمنی یا اثربخشی ظاهری یک دارو را بهطور کاذب افزایش دهد.[4]
برای مقابله با این مشکل، پروتکلهای بالینی مدرن اکنون حفظ بیماران را بر اصلاح دادهها ترجیح میدهند. دستورالعمل ICH E9 شورای بینالمللی هماهنگسازی الزامات فنی داروها برای استفاده انسانی، که در ابتدا در سال ۱۹۹۸ صادر شد، الزامی میکند که تحلیلهای حساسیت و نحوه مدیریت دادههای گمشده باید پیش از آغاز کارآزمایی در پروتکل از پیش تعریف شوند. علاوه بر این، چارچوبهای نظارتی موظف میکنند که دادههای جمعآوریشده از سوژهها تا لحظه خروج آنها باید در پایگاه داده حفظ شود تا اطمینان حاصل گردد که عوارض جانبی اولیه از سوابق پاک نمیشوند.[1][2]
با وجود این چارچوبهای سختگیرانه، یک پارادوکس در قلب نظریه دادههای گمشده باقی میماند: از نظر ریاضی غیرممکن است که تنها با استفاده از مجموعه دادههای مشاهدهشده، بهطور قطعی ثابت کرد که دادهها MAR هستند و نه MNAR. از آنجا که مقادیر گمشده، بنا به تعریف، مشاهدهنشده هستند، پژوهشگران هرگز نمیتوانند کاملاً مطمئن باشند که گمشدگی توسط خود مقادیر پنهان هدایت نمیشود. آنها میتوانند با مقایسه گروههای مشاهدهشده و گمشده، وضعیت MCAR را آزمایش کنند، اما مرز بین MAR و MNAR کاملاً به درک پژوهشگر از سازوکار دنیای واقعی که دادهها را تولید کرده است، بستگی دارد.[2][3]
این محدودیت، پژوهشگران را مجبور میکند تا به تحلیلهای حساسیت تکیه کنند؛ یعنی آزمایش اینکه اگر سازوکار دادههای گمشده از MAR به MNAR تغییر کند، نتیجهگیریهای آنها چقدر تغییر خواهد کرد. اگر نرخ ۱۰ درصدی دادههای گمشده تحت فرض MNAR، نتیجه یک کارآزمایی دارویی را از مؤثر به مضر تغییر دهد، یافته اولیه برای اعتماد کردن بیش از حد شکننده است. یکپارچگی تحلیل دادههای مدرن نه بر مجموعه دادههای کاملاً بینقص، بلکه بر پذیرش شفاف این موضوع استوار است که سلولهای خالی ممکن است چه چیزی را پنهان کرده باشند.[4]
چرا مهم است
دادههای گمشده صرفاً یک مزاحمت الگوریتمی نیستند؛ در کارآزماییهای بالینی، تشخیص اشتباه علت گمشدن دادهها میتواند عوارض جانبی شدید را پنهان کرده و ایمنی ظاهری یک دارو را بهطور کاذب بالا ببرد.
منابع
[1]NCBIآمارشناسان زیستی بالینیTypes of Missing Data - Managing Missing Data in Patient Registries
مطالعه در NCBI →
[2]arXivمتخصصان یادگیری ماشینA Comprehensive Review of Handling Missing Data: Exploring Special Missing Mechanisms
مطالعه در arXiv →
[3]Bookdownنظریهپردازان آماریChapter 7 Missing data Mechanisms
مطالعه در Bookdown →
[4]AHA Journalsآمارشناسان زیستی بالینیMissing Data in Clinical Trials
مطالعه در AHA Journals →
[5]تیم سردبیری کوهستاننظریهپردازان آماریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





