رفتن به محتوای اصلی
Koohestun
توضیح کوهستاننظریه آماریبسته شواهد· 6 دقیقه مطالعه· در تحلیل داده

سه شرطی که سازوکار داده‌های گمشده را تعریف می‌کنند (MCAR، MAR، MNAR)

طبقه‌بندی سال ۱۹۷۶ دونالد روبین، آماردان، داده‌های گمشده را به سه سازوکار احتمالی تقسیم می‌کند که مشخص می‌کنند آیا شکاف‌های یک کارآزمایی بالینی از نظر ریاضی قابل‌ترمیم هستند یا اینکه کل مطالعه را بی‌اعتبار می‌سازند.

به قلم آزاده ابراهیمی

آمارشناسان زیستی بالینی 40%متخصصان یادگیری ماشین 35%نظریه‌پردازان آماری 25%
آمارشناسان زیستی بالینی
طراحی کارآزمایی و تحلیل حساسیت را برای کاهش سوگیری غیرقابل‌اصلاح MNAR در اولویت قرار می‌دهند.
متخصصان یادگیری ماشین
بر الگوریتم‌های پیشرفته جایگذاری با فرض MAR تمرکز می‌کنند تا کارایی مجموعه داده‌های عظیم را به حداکثر برسانند.
نظریه‌پردازان آماری
بر تعاریف ریاضیاتی و مرزهای احتمالی سازوکارهای داده‌های گمشده تمرکز دارند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • بیمارانی که از کارآزمایی‌های بالینی انصراف داده‌اند

نکات کلیدی

  1. طبقه‌بندی سال ۱۹۷۶ دونالد روبین، داده‌های گمشده را به سه سازوکار تقسیم می‌کند: MCAR، MAR و MNAR.
  2. کاملاً گمشده به‌طور تصادفی (MCAR) توان آماری را کاهش می‌دهد، اما سوگیری در برآوردها ایجاد نمی‌کند.
  3. گمشده به‌طور تصادفی (MAR) به الگوریتم‌ها اجازه می‌دهد تا مقادیر گمشده را بر اساس سایر متغیرهای مشاهده‌شده به‌دقت جایگذاری کنند.
  4. گمشده غیرتصادفی (MNAR) زمانی رخ می‌دهد که گم‌شدگی توسط خود داده‌های پنهان هدایت شود و تهدیدی جدی برای اعتبار کارآزمایی محسوب می‌شود.
  5. آژانس‌های نظارتی مانند FDA اکنون طراحی کارآزمایی‌هایی را در اولویت قرار می‌دهند که از گم‌شدن داده‌ها جلوگیری می‌کنند، نه اینکه به اصلاحات آماری پس از وقوع تکیه کنند.

برای یک مهندس یادگیری ماشین که در حال ساخت یک مدل پیش‌بینی است، یک سلول خالی در مجموعه داده‌ها مانعی است که باید از آن عبور کرد؛ شکافی که باید با یک مقدار میانگین پر شود یا به‌کل حذف گردد تا الگوریتم بتواند اجرا شود. اما برای یک آمارشناس زیستی در یک کارآزمایی بالینی، همان سلول خالی یک سیگنال است. اگر یک بیمار ثبت فشار خون روزانه خود را متوقف کند، نبود این عدد ممکن است به این معنا باشد که او صرفاً فراموش کرده است، یا ممکن است به این معنا باشد که داروی آزمایشی عارضه جانبی چنان شدیدی ایجاد کرده که او از مطالعه خارج شده است. برخورد یکسان با مورد دوم و اول، یکپارچگی کارآزمایی را از بین می‌برد.

چارچوب ریاضیاتی که یک شکاف بی‌ضرر را از یک سوگیری کشنده جدا می‌کند، در سال ۱۹۷۶ توسط آماردانی به نام دونالد روبین (Donald Rubin) پایه‌گذاری شد. روبین در مقاله‌ای تأثیرگذار که در نشریه Biometrika منتشر شد، این مفهوم را فرمول‌بندی کرد که داده‌های گمشده صرفاً نبود اطلاعات نیستند، بلکه یک رویداد احتمالی هستند که توسط قوانین خاصی اداره می‌شوند. او این رویدادها را به سه سازوکار مجزا طبقه‌بندی کرد: کاملاً گمشده به‌طور تصادفی (MCAR)، گمشده به‌طور تصادفی (MAR) و گمشده غیرتصادفی (MNAR). این سه شرط تعیین می‌کنند که آیا یک پژوهشگر می‌تواند با خیال راحت این شکاف‌ها را نادیده بگیرد، آن‌ها را از نظر ریاضی جایگذاری کند، یا اینکه باید کل مطالعه را کنار بگذارد.[3]

شرط اول، یعنی کاملاً گمشده به‌طور تصادفی (MCAR)، نشان‌دهنده بهترین سناریو برای پژوهشگران است. تحت شرایط MCAR، احتمال گم‌شدن یک نقطه داده کاملاً مستقل از هر متغیر دیگری در مجموعه داده‌ها (چه مشاهده‌شده و چه مشاهده‌نشده) است. راهنمای آماری Bookdown در این باره می‌نویسد: «داده‌ها زمانی MCAR هستند که احتمال گم‌شدن داده‌ها در یک متغیر، به هیچ متغیر اندازه‌گیری‌شده دیگری و همچنین به خود متغیر دارای مقادیر گمشده ارتباطی نداشته باشد.» اگر یک تکنسین آزمایشگاه ۵٪ از نمونه‌های خون را روی زمین بیندازد، ۹۵٪ باقی‌مانده همچنان یک زیرمجموعه کاملاً تصادفی از جمعیت اولیه را نشان می‌دهند. در این حالت، اگرچه توان آماری به دلیل کوچک‌تر شدن حجم نمونه کاهش می‌یابد، اما خود برآوردها بدون سوگیری باقی می‌مانند.[3]

سه سازوکار تعریف‌شده توسط دونالد روبین مشخص می‌کنند که آیا داده‌های گمشده را می‌توان با خیال راحت جایگذاری کرد یا خیر.

با این حال، MCAR خالص در تحقیقات انسانی بسیار نادر است. شرط دوم، یعنی گمشده به‌طور تصادفی (MAR)، فرضی است که اساس بیشتر نرم‌افزارهای آماری مدرن را تشکیل می‌دهد. تحت شرایط MAR، گم‌شدگی با سایر متغیرهای مشاهده‌شده در مجموعه داده‌ها مرتبط است، اما به خود مقدار گمشده ارتباطی ندارد. برای مثال، اگر احتمال پاسخ ندادن مردان به یک سؤال نظرسنجی درباره افسردگی ۲۰٪ کمتر از زنان باشد، تا زمانی که پژوهشگر جنسیت شرکت‌کنندگان را ثبت کرده باشد، این داده‌ها MAR محسوب می‌شوند. از آنجا که گم‌شدگی را می‌توان به‌طور کامل توسط متغیرهای دیگر توضیح داد، الگوریتم‌هایی مانند جایگذاری چندگانه (MI) یا حداکثر درست‌نمایی اطلاعات کامل (FIML) می‌توانند مجموعه داده‌ها را به‌دقت بازسازی کنند.

شرط سوم، یعنی گمشده غیرتصادفی (MNAR)، یک تهدید حیاتی برای تحقیقات کمی است. MNAR زمانی رخ می‌دهد که احتمال گم‌شدن یک مقدار به خود مقدار مشاهده‌نشده بستگی داشته باشد. نشریه Circulation متعلق به انجمن قلب آمریکا گزارش می‌دهد: «این بدترین نوع داده‌های گمشده در نظر گرفته می‌شود، زیرا خروج افراد از مطالعه با درمان یا مداخله مورد بررسی مرتبط است.» اگر افراد پردرآمد از گزارش حقوق خود امتناع کنند، یا اگر بیمارانی که دچار خونریزی داخلی شدید شده‌اند از شرکت در پیگیری‌های بالینی خودداری کنند، داده‌های گمشده دقیقاً همان پدیده‌ای را پنهان می‌کنند که مطالعه در تلاش برای اندازه‌گیری آن است.[4]

شرط سوم، یعنی گمشده غیرتصادفی (MNAR)، یک تهدید حیاتی برای تحقیقات کمی است.

خطرات ناشی از طبقه‌بندی اشتباه این سازوکارها بسیار زیاد است. سالانه بیش از ۷ میلیارد دلار صرف ارزیابی داروها، دستگاه‌ها و مواد بیولوژیک در کارآزمایی‌های بالینی تأییدی فاز ۳ می‌شود. در سال ۲۰۱۰، به درخواست سازمان غذا و داروی آمریکا (FDA)، شورای ملی تحقیقات هیئتی را برای رسیدگی به بحران داده‌های گمشده در این کارآزمایی‌ها تشکیل داد. گزارش حاصل از این نشست، استانداردهای نظارتی را به‌طور بنیادین تغییر داد و هشدار داد که داده‌های گمشده می‌توانند نتایج یک کارآزمایی بالینی را تحت تأثیر قرار داده یا حتی بی‌اعتبار کنند.[4]

در حالی که MCAR توان آماری را کاهش می‌دهد، MNAR سوگیری شدیدی ایجاد می‌کند که برآوردهای نهایی را منحرف می‌سازد.

دستورالعمل‌های بعدی FDA تأکید کردند که جادوی آماری نمی‌تواند یک کارآزمایی با طراحی ضعیف را نجات دهد. اگر داده‌ها MNAR باشند، هیچ الگوریتم جایگذاری نمی‌تواند مقادیر گمشده را به‌دقت حدس بزند، زیرا این الگو توسط داده‌هایی هدایت می‌شود که پژوهشگران در اختیار ندارند. نشریه AHA خاطرنشان می‌کند: «اگر تفاوت‌هایی در ویژگی‌های شرکت‌کنندگان دارای داده‌های گمشده و بدون داده‌های گمشده وجود داشته باشد، آنگاه سانسور اطلاعاتی (informative censoring) رخ می‌دهد.» این سانسور اطلاعاتی می‌تواند با حذف بی‌سروصدای بیمارانی که بدترین پیامدها را تجربه کرده‌اند، ایمنی یا اثربخشی ظاهری یک دارو را به‌طور کاذب افزایش دهد.[4]

برای مقابله با این مشکل، پروتکل‌های بالینی مدرن اکنون حفظ بیماران را بر اصلاح داده‌ها ترجیح می‌دهند. دستورالعمل ICH E9 شورای بین‌المللی هماهنگ‌سازی الزامات فنی داروها برای استفاده انسانی، که در ابتدا در سال ۱۹۹۸ صادر شد، الزامی می‌کند که تحلیل‌های حساسیت و نحوه مدیریت داده‌های گمشده باید پیش از آغاز کارآزمایی در پروتکل از پیش تعریف شوند. علاوه بر این، چارچوب‌های نظارتی موظف می‌کنند که داده‌های جمع‌آوری‌شده از سوژه‌ها تا لحظه خروج آن‌ها باید در پایگاه داده حفظ شود تا اطمینان حاصل گردد که عوارض جانبی اولیه از سوابق پاک نمی‌شوند.[1][2]

پروتکل‌های کارآزمایی بالینی مدرن، حفظ بیماران را در اولویت قرار می‌دهند تا در وهله اول از گم‌شدن داده‌ها جلوگیری کنند.

با وجود این چارچوب‌های سخت‌گیرانه، یک پارادوکس در قلب نظریه داده‌های گمشده باقی می‌ماند: از نظر ریاضی غیرممکن است که تنها با استفاده از مجموعه داده‌های مشاهده‌شده، به‌طور قطعی ثابت کرد که داده‌ها MAR هستند و نه MNAR. از آنجا که مقادیر گمشده، بنا به تعریف، مشاهده‌نشده هستند، پژوهشگران هرگز نمی‌توانند کاملاً مطمئن باشند که گم‌شدگی توسط خود مقادیر پنهان هدایت نمی‌شود. آن‌ها می‌توانند با مقایسه گروه‌های مشاهده‌شده و گمشده، وضعیت MCAR را آزمایش کنند، اما مرز بین MAR و MNAR کاملاً به درک پژوهشگر از سازوکار دنیای واقعی که داده‌ها را تولید کرده است، بستگی دارد.[2][3]

این محدودیت، پژوهشگران را مجبور می‌کند تا به تحلیل‌های حساسیت تکیه کنند؛ یعنی آزمایش اینکه اگر سازوکار داده‌های گمشده از MAR به MNAR تغییر کند، نتیجه‌گیری‌های آن‌ها چقدر تغییر خواهد کرد. اگر نرخ ۱۰ درصدی داده‌های گمشده تحت فرض MNAR، نتیجه یک کارآزمایی دارویی را از مؤثر به مضر تغییر دهد، یافته اولیه برای اعتماد کردن بیش از حد شکننده است. یکپارچگی تحلیل داده‌های مدرن نه بر مجموعه داده‌های کاملاً بی‌نقص، بلکه بر پذیرش شفاف این موضوع استوار است که سلول‌های خالی ممکن است چه چیزی را پنهان کرده باشند.[4]

چرا مهم است

داده‌های گمشده صرفاً یک مزاحمت الگوریتمی نیستند؛ در کارآزمایی‌های بالینی، تشخیص اشتباه علت گم‌شدن داده‌ها می‌تواند عوارض جانبی شدید را پنهان کرده و ایمنی ظاهری یک دارو را به‌طور کاذب بالا ببرد.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان زیستی بالینی 40%متخصصان یادگیری ماشین 35%نظریه‌پردازان آماری 25%
  1. [1]NCBIآمارشناسان زیستی بالینی

    Types of Missing Data - Managing Missing Data in Patient Registries

    مطالعه در NCBI
  2. [2]arXivمتخصصان یادگیری ماشین

    A Comprehensive Review of Handling Missing Data: Exploring Special Missing Mechanisms

    مطالعه در arXiv
  3. [3]Bookdownنظریه‌پردازان آماری

    Chapter 7 Missing data Mechanisms

    مطالعه در Bookdown
  4. [4]AHA Journalsآمارشناسان زیستی بالینی

    Missing Data in Clinical Trials

    مطالعه در AHA Journals
  5. [5]تیم سردبیری کوهستاننظریه‌پردازان آماری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.