رفتن به محتوای اصلی
کوهستان
توضیح کوهستاننظریه آماریبسته شواهد· 6 دقیقه مطالعه· در تحلیل داده

سه شرطی که سازوکار داده‌های گمشده را تعریف می‌کنند (MCAR، MAR، MNAR)

طبقه‌بندی سال ۱۹۷۶ دونالد روبین، آماردان، داده‌های گمشده را به سه سازوکار احتمالی تقسیم می‌کند که مشخص می‌کنند آیا شکاف‌های یک کارآزمایی بالینی از نظر ریاضی قابل‌ترمیم هستند یا اینکه کل مطالعه را بی‌اعتبار می‌سازند.

به قلم آزاده ابراهیمی

به‌طور خلاصه

  1. طبقه‌بندی سال ۱۹۷۶ دونالد روبین، داده‌های گمشده را به سه سازوکار تقسیم می‌کند: MCAR، MAR و MNAR.
  2. کاملاً گمشده به‌طور تصادفی (MCAR) توان آماری را کاهش می‌دهد، اما سوگیری در برآوردها ایجاد نمی‌کند.
  3. گمشده به‌طور تصادفی (MAR) به الگوریتم‌ها اجازه می‌دهد تا مقادیر گمشده را بر اساس سایر متغیرهای مشاهده‌شده به‌دقت جایگذاری کنند.

برای یک مهندس یادگیری ماشین که در حال ساخت یک مدل پیش‌بینی است، یک سلول خالی در مجموعه داده‌ها مانعی است که باید از آن عبور کرد؛ شکافی که باید با یک مقدار میانگین پر شود یا به‌کل حذف گردد تا الگوریتم بتواند اجرا شود. اما برای یک آمارشناس زیستی در یک کارآزمایی بالینی، همان سلول خالی یک سیگنال است.

اگر یک بیمار ثبت فشار خون روزانه خود را متوقف کند، نبود این عدد ممکن است به این معنا باشد که او صرفاً فراموش کرده است، یا ممکن است به این معنا باشد که داروی آزمایشی عارضه جانبی چنان شدیدی ایجاد کرده که او از مطالعه خارج شده است. برخورد یکسان با مورد دوم و اول، یکپارچگی کارآزمایی را از بین می‌برد.

چارچوب ریاضیاتی که یک شکاف بی‌ضرر را از یک سوگیری کشنده جدا می‌کند، در سال ۱۹۷۶ توسط آماردانی به نام دونالد روبین (Donald Rubin) پایه‌گذاری شد. روبین در مقاله‌ای تأثیرگذار که در نشریه Biometrika منتشر شد، این مفهوم را فرمول‌بندی کرد که داده‌های گمشده صرفاً نبود اطلاعات نیستند، بلکه یک رویداد احتمالی هستند که توسط قوانین خاصی اداره می‌شوند.

او این رویدادها را به سه سازوکار مجزا طبقه‌بندی کرد: کاملاً گمشده به‌طور تصادفی (MCAR)، گمشده به‌طور تصادفی (MAR) و گمشده غیرتصادفی (MNAR). این سه شرط تعیین می‌کنند که آیا یک پژوهشگر می‌تواند با خیال راحت این شکاف‌ها را نادیده بگیرد، آن‌ها را از نظر ریاضی جایگذاری کند، یا اینکه باید کل مطالعه را کنار بگذارد.[3]

شرط اول، یعنی کاملاً گمشده به‌طور تصادفی (MCAR)، نشان‌دهنده بهترین سناریو برای پژوهشگران است. تحت شرایط MCAR، احتمال گم‌شدن یک نقطه داده کاملاً مستقل از هر متغیر دیگری در مجموعه داده‌ها (چه مشاهده‌شده و چه مشاهده‌نشده) است. راهنمای آماری Bookdown در این باره می‌نویسد: «داده‌ها زمانی MCAR هستند که احتمال گم‌شدن داده‌ها در یک متغیر، به هیچ متغیر اندازه‌گیری‌شده دیگری و همچنین به خود متغیر دارای مقادیر گمشده ارتباطی نداشته باشد.»

اگر یک تکنسین آزمایشگاه ۵٪ از نمونه‌های خون را روی زمین بیندازد، ۹۵٪ باقی‌مانده همچنان یک زیرمجموعه کاملاً تصادفی از جمعیت اولیه را نشان می‌دهند. در این حالت، اگرچه توان آماری به دلیل کوچک‌تر شدن حجم نمونه کاهش می‌یابد، اما خود برآوردها بدون سوگیری باقی می‌مانند.[3]

سه سازوکار تعریف‌شده توسط دونالد روبین مشخص می‌کنند که آیا داده‌های گمشده را می‌توان با خیال راحت جایگذاری کرد یا خیر.

با این حال، MCAR خالص در تحقیقات انسانی بسیار نادر است. شرط دوم، یعنی گمشده به‌طور تصادفی (MAR)، فرضی است که اساس بیشتر نرم‌افزارهای آماری مدرن را تشکیل می‌دهد. تحت شرایط MAR، گم‌شدگی با سایر متغیرهای مشاهده‌شده در مجموعه داده‌ها مرتبط است، اما به خود مقدار گمشده ارتباطی ندارد.

برای مثال، اگر احتمال پاسخ ندادن مردان به یک سؤال نظرسنجی درباره افسردگی ۲۰٪ کمتر از زنان باشد، تا زمانی که پژوهشگر جنسیت شرکت‌کنندگان را ثبت کرده باشد، این داده‌ها MAR محسوب می‌شوند. از آنجا که گم‌شدگی را می‌توان به‌طور کامل توسط متغیرهای دیگر توضیح داد، الگوریتم‌هایی مانند جایگذاری چندگانه (MI) یا حداکثر درست‌نمایی اطلاعات کامل (FIML) می‌توانند مجموعه داده‌ها را به‌دقت بازسازی کنند.

شرط سوم، یعنی گمشده غیرتصادفی (MNAR)، یک تهدید حیاتی برای تحقیقات کمی است. MNAR زمانی رخ می‌دهد که احتمال گم‌شدن یک مقدار به خود مقدار مشاهده‌نشده بستگی داشته باشد. نشریه Circulation متعلق به انجمن قلب آمریکا گزارش می‌دهد: «این بدترین نوع داده‌های گمشده در نظر گرفته می‌شود، زیرا خروج افراد از مطالعه با درمان یا مداخله مورد بررسی مرتبط است.»

اگر افراد پردرآمد از گزارش حقوق خود امتناع کنند، یا اگر بیمارانی که دچار خونریزی داخلی شدید شده‌اند از شرکت در پیگیری‌های بالینی خودداری کنند، داده‌های گمشده دقیقاً همان پدیده‌ای را پنهان می‌کنند که مطالعه در تلاش برای اندازه‌گیری آن است.[4]

خطرات ناشی از طبقه‌بندی اشتباه این سازوکارها بسیار زیاد است. سالانه بیش از ۷ میلیارد دلار صرف ارزیابی داروها، دستگاه‌ها و مواد بیولوژیک در کارآزمایی‌های بالینی تأییدی فاز ۳ می‌شود. در سال ۲۰۱۰، به درخواست سازمان غذا و داروی آمریکا (FDA)، شورای ملی تحقیقات هیئتی را برای رسیدگی به بحران داده‌های گمشده در این کارآزمایی‌ها تشکیل داد. گزارش حاصل از این نشست، استانداردهای نظارتی را به‌طور بنیادین تغییر داد و هشدار داد که داده‌های گمشده می‌توانند نتایج یک کارآزمایی بالینی را تحت تأثیر قرار داده یا حتی بی‌اعتبار کنند.[4]

در حالی که MCAR توان آماری را کاهش می‌دهد، MNAR سوگیری شدیدی ایجاد می‌کند که برآوردهای نهایی را منحرف می‌سازد.

دستورالعمل‌های بعدی FDA تأکید کردند که جادوی آماری نمی‌تواند یک کارآزمایی با طراحی ضعیف را نجات دهد. اگر داده‌ها MNAR باشند، هیچ الگوریتم جایگذاری نمی‌تواند مقادیر گمشده را به‌دقت حدس بزند، زیرا این الگو توسط داده‌هایی هدایت می‌شود که پژوهشگران در اختیار ندارند.

نشریه AHA خاطرنشان می‌کند: «اگر تفاوت‌هایی در ویژگی‌های شرکت‌کنندگان دارای داده‌های گمشده و بدون داده‌های گمشده وجود داشته باشد، آنگاه سانسور اطلاعاتی (informative censoring) رخ می‌دهد.» این سانسور اطلاعاتی می‌تواند با حذف بی‌سروصدای بیمارانی که بدترین پیامدها را تجربه کرده‌اند، ایمنی یا اثربخشی ظاهری یک دارو را به‌طور کاذب افزایش دهد.[4]

برای مقابله با این مشکل، پروتکل‌های بالینی مدرن اکنون حفظ بیماران را بر اصلاح داده‌ها ترجیح می‌دهند. دستورالعمل ICH E9 شورای بین‌المللی هماهنگ‌سازی الزامات فنی داروها برای استفاده انسانی، که در ابتدا در سال ۱۹۹۸ صادر شد، الزامی می‌کند که تحلیل‌های حساسیت و نحوه مدیریت داده‌های گمشده باید پیش از آغاز کارآزمایی در پروتکل از پیش تعریف شوند.

علاوه بر این، چارچوب‌های نظارتی موظف می‌کنند که داده‌های جمع‌آوری‌شده از سوژه‌ها تا لحظه خروج آن‌ها باید در پایگاه داده حفظ شود تا اطمینان حاصل گردد که عوارض جانبی اولیه از سوابق پاک نمی‌شوند.[1][2]

پروتکل‌های کارآزمایی بالینی مدرن، حفظ بیماران را در اولویت قرار می‌دهند تا در وهله اول از گم‌شدن داده‌ها جلوگیری کنند.

با وجود این چارچوب‌های سخت‌گیرانه، یک پارادوکس در قلب نظریه داده‌های گمشده باقی می‌ماند: از نظر ریاضی غیرممکن است که تنها با استفاده از مجموعه داده‌های مشاهده‌شده، به‌طور قطعی ثابت کرد که داده‌ها MAR هستند و نه MNAR.

از آنجا که مقادیر گمشده، بنا به تعریف، مشاهده‌نشده هستند، پژوهشگران هرگز نمی‌توانند کاملاً مطمئن باشند که گم‌شدگی توسط خود مقادیر پنهان هدایت نمی‌شود. آن‌ها می‌توانند با مقایسه گروه‌های مشاهده‌شده و گمشده، وضعیت MCAR را آزمایش کنند، اما مرز بین MAR و MNAR کاملاً به درک پژوهشگر از سازوکار دنیای واقعی که داده‌ها را تولید کرده است، بستگی دارد.[2][3]

این محدودیت، پژوهشگران را مجبور می‌کند تا به تحلیل‌های حساسیت تکیه کنند؛ یعنی آزمایش اینکه اگر سازوکار داده‌های گمشده از MAR به MNAR تغییر کند، نتیجه‌گیری‌های آن‌ها چقدر تغییر خواهد کرد. اگر نرخ ۱۰ درصدی داده‌های گمشده تحت فرض MNAR، نتیجه یک کارآزمایی دارویی را از مؤثر به مضر تغییر دهد، یافته اولیه برای اعتماد کردن بیش از حد شکننده است. یکپارچگی تحلیل داده‌های مدرن نه بر مجموعه داده‌های کاملاً بی‌نقص، بلکه بر پذیرش شفاف این موضوع استوار است که سلول‌های خالی ممکن است چه چیزی را پنهان کرده باشند.[4]

اصطلاحات کلیدی

MCAR (کاملاً گمشده به‌طور تصادفی)
وضعیتی که در آن احتمال گم‌شدن یک نقطه داده کاملاً مستقل از هر داده دیگری، چه مشاهده‌شده و چه مشاهده‌نشده، است.
MAR (گمشده به‌طور تصادفی)
وضعیتی که در آن گم‌شدگی را می‌توان به‌طور کامل توسط سایر متغیرهای مشاهده‌شده در مجموعه داده‌ها توضیح داد، که امکان جایگذاری الگوریتمی دقیق را فراهم می‌کند.
MNAR (گمشده غیرتصادفی)
وضعیتی که در آن گم‌شدگی به خود مقدار مشاهده‌نشده بستگی دارد و سوگیری شدیدی ایجاد می‌کند که به‌راحتی قابل‌اصلاح نیست.
سانسور اطلاعاتی (Informative Censoring)
سوگیری‌ای که زمانی رخ می‌دهد که سوژه‌ها به دلایل مرتبط با درمان از مطالعه خارج می‌شوند و نتایج نهایی را منحرف می‌کنند.
جایگذاری چندگانه (Multiple Imputation)
یک تکنیک آماری که مقادیر گمشده را با چندین نسخه شبیه‌سازی‌شده جایگزین می‌کند تا عدم قطعیت داده‌های گمشده را در نظر بگیرد.

بررسی عمیق دیدگاه‌ها

آمارشناسان زیستی بالینی

طراحی کارآزمایی و تحلیل حساسیت را برای کاهش سوگیری غیرقابل‌اصلاح MNAR در اولویت قرار می‌دهند.

برای آمارشناسان زیستی که کارآزمایی‌های فاز ۳ را طراحی می‌کنند، داده‌های گمشده بیشتر یک تهدید ساختاری است تا یک دردسر ریاضی. از آنجا که نمی‌توان MNAR را به‌طور قطعی رد کرد، آن‌ها استدلال می‌کنند که هیچ الگوریتم جایگذاری نمی‌تواند کارآزمایی با نرخ بالای ریزش را نجات دهد. تمرکز آن‌ها بر طراحی پیشگیرانه پروتکل است؛ یعنی درگیر نگه داشتن بیماران و پیگیری دلایل خروج آن‌ها، تا بتوان سازوکار داده‌های گمشده را به‌دقت شناسایی کرده و از طریق تحلیل‌های حساسیت مدل‌سازی کرد.

متخصصان یادگیری ماشین

بر الگوریتم‌های پیشرفته جایگذاری با فرض MAR تمرکز می‌کنند تا کارایی مجموعه داده‌های عظیم و پرنویز را به حداکثر برسانند.

در حوزه مدل‌سازی پیش‌بینی‌کننده و علم داده، حذف ردیف‌های ناقص (حذف لیستی) اغلب به‌عنوان هدررفت غیرقابل‌قبول داده‌های آموزشی در نظر گرفته می‌شود. متخصصان معمولاً به تکنیک‌هایی مانند جایگذاری چندگانه با معادلات زنجیره‌ای (MICE) یا جایگذاری کی-نزدیک‌ترین همسایه (KNN) تکیه می‌کنند. این الگوریتم‌ها فرض می‌کنند که داده‌ها MAR هستند و از همبستگی‌های پیچیده درون مجموعه داده‌های عظیم برای بازسازی مقادیر گمشده استفاده می‌کنند و دقت پیش‌بینی را بر استنتاج علی ترجیح می‌دهند.

آژانس‌های نظارتی

خواستار پروتکل‌های از پیش تعریف‌شده و گزارش‌دهی شفاف هستند تا از پنهان شدن عوارض جانبی داروها توسط داده‌های گمشده جلوگیری کنند.

آژانس‌هایی مانند FDA داده‌های گمشده را از دریچه ایمنی بیمار بررسی می‌کنند. نگرانی اصلی آن‌ها سانسور اطلاعاتی است؛ یعنی این خطر که بیمارانی که عوارض جانبی شدیدی را تجربه می‌کنند، بی‌سروصدا از کارآزمایی خارج شوند و یک داروی خطرناک را ایمن جلوه دهند. در نتیجه، نهادهای نظارتی می‌خواهند که استراتژی‌های مربوط به داده‌های گمشده پیش از آغاز کارآزمایی تثبیت شوند و توانایی حامیان مالی برای انتخاب مطلوب‌ترین روش جایگذاری پس از مشخص شدن نتایج را به‌شدت محدود می‌کنند.

آمارشناسان زیستی بالینی 40%متخصصان یادگیری ماشین 35%نظریه‌پردازان آماری 25%
آمارشناسان زیستی بالینی
طراحی کارآزمایی و تحلیل حساسیت را برای کاهش سوگیری غیرقابل‌اصلاح MNAR در اولویت قرار می‌دهند.
متخصصان یادگیری ماشین
بر الگوریتم‌های پیشرفته جایگذاری با فرض MAR تمرکز می‌کنند تا کارایی مجموعه داده‌های عظیم را به حداکثر برسانند.
نظریه‌پردازان آماری
بر تعاریف ریاضیاتی و مرزهای احتمالی سازوکارهای داده‌های گمشده تمرکز دارند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • بیمارانی که از کارآزمایی‌های بالینی انصراف داده‌اند

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان زیستی بالینی 40%متخصصان یادگیری ماشین 35%نظریه‌پردازان آماری 25%
  1. [1]NCBIآمارشناسان زیستی بالینی

    Types of Missing Data - Managing Missing Data in Patient Registries

    مطالعه در NCBI →
  2. [2]arXivمتخصصان یادگیری ماشین

    A Comprehensive Review of Handling Missing Data: Exploring Special Missing Mechanisms

    مطالعه در arXiv →
  3. [3]Bookdownنظریه‌پردازان آماری

    Chapter 7 Missing data Mechanisms

    مطالعه در Bookdown →
  4. [4]AHA Journalsآمارشناسان زیستی بالینی

    Missing Data in Clinical Trials

    مطالعه در AHA Journals →
  5. [5]تیم سردبیری کوهستاننظریه‌پردازان آماری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.