پرونده شواهد: دقت و محدودیتهای تطبیق نمره گرایش در تحقیقات مشاهدهای
دهههاست که پژوهشگران ادعا میکنند تطبیق سوژهها بر اساس یک «نمره گرایش» واحد میتواند کارکردی شبیه به کارآزمایی تصادفی داشته باشد و سوگیری انتخاب را از بین ببرد. با این حال، اثباتهای ریاضی نشان میدهند که تطبیق نمره گرایش در واقع میتواند در مقایسه با سایر روشهای تطبیق، باعث افزایش عدم تعادل، ناکارآمدی و وابستگی به مدل شود.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
بهطور خلاصه
- تطبیق نمره گرایش (PSM) در بیش از ۴۷,۳۰۰ مطالعه برای شبیهسازی کارآزماییهای تصادفی استفاده شده است.
- اثباتهای ریاضی از سال ۲۰۱۹ نشان میدهند که PSM اغلب باعث افزایش عدم تعادل، ناکارآمدی و سوگیری میشود.
- «پارادوکس PSM» به این دلیل رخ میدهد که هرس کردن تطابقهای دور بر اساس نمره، فاصله بین متغیرهای کمکی واقعی را افزایش میدهد.
«اگر ویژگیهای پایه را به اندازه کافی اندازهگیری کنید، میتوانید آنها را در یک نمره واحد فشرده کرده و یک کارآزمایی تصادفیسازیشده و کنترلشده را بینقص شبیهسازی کنید.» این ادعا که از زمان معرفی توسط آمارگران، پل روزنبام (Paul Rosenbaum) و دونالد روبین (Donald Rubin) در سال ۱۹۸۳، به پایه و اساس تحقیقات مشاهدهای تبدیل شد، بیان میکند که «تعدیل بر اساس نمره گرایش اسکالر برای رفع سوگیری ناشی از تمام متغیرهای کمکی مشاهدهشده کافی است» [۱].
پژوهشگران بر این باور بودند که با محاسبه احتمال شرطی دریافت درمان توسط یک سوژه بر اساس ویژگیهای پسزمینه او، میتوانند سوژههای درمانشده و درماننشده را جفت کرده و سوگیری انتخاب را به طور کامل حذف کنند [۱].[1]
برای ۳۶ سال، این روش بر آمار کاربردی تسلط داشت. تا سال ۲۰۱۹، تطبیق نمره گرایش (PSM) در بیش از ۴۷,۳۰۰ مقاله علمی در حوزههای اقتصاد، اپیدمیولوژی، پزشکی و علوم سیاسی استفاده یا به آن ارجاع داده شده بود [۴].
همانطور که پیتر آستین (Peter Austin) در مرور متدولوژیک بسیار پرارجاع خود در سال ۲۰۱۱ توضیح داد، نمره گرایش به عنوان یک مکانیسم ایجاد تعادل عمل میکند: با شرطی کردن روی آن مقدار اسکالر واحد، فرض بر این است که توزیع متغیرهای کمکی پایه مشاهدهشده بین گروههای درمانشده و درماننشده مشابه است [۳]. این امر به مطالعات مشاهدهای اجازه میداد تا شرایط یک کارآزمایی تصادفی را شبیهسازی کنند و در مواقعی که انجام آزمایشهای واقعی غیرممکن یا غیراخلاقی بود، تصمیمات کلان پزشکی و سیاستی را هدایت کنند [۲، ۳].[2][3][4]
اما اجماع ریاضیاتی درگیر یک نقطه کور عظیم بود. در سال ۲۰۱۹، روششناسان علوم سیاسی، گری کینگ (Gary King) و ریچارد نیلسن (Richard Nielsen)، ردیهای تاریخساز در نشریه Political Analysis منتشر کردند که نشان میداد این روش هنگام اعمال بر روی دادههای دنیای واقعی، دارای ایرادی بنیادین است.
آنها از طریق اثباتهای دقیق ریاضی و مجموعه دادههای شبیهسازیشده نشان دادند که PSM «اغلب دقیقاً برعکس هدف مورد نظر خود عمل میکند—و در نتیجه باعث افزایش عدم تعادل، ناکارآمدی، وابستگی به مدل و سوگیری میشود» [۴]. همان ابزاری که برای قابلاعتمادتر کردن دادههای مشاهدهای طراحی شده بود، به طور فعال در حال تحریف نتایج هزاران مطالعه بود [۴، ۶].[4][6]
این شکست از چیزی نشأت میگیرد که کینگ و نیلسن آن را «پارادوکس PSM» نامیدند. زمانی که پژوهشگران از PSM استفاده میکنند، معمولاً مجموعه دادهها را هرس کرده و سوژههای کنترلی را که از نظر نمره گرایش تطابق نزدیکی با سوژههای درمانشده ندارند، کنار میگذارند [۴]. در ابتدا، این هرس کردن به حذف شدیدترین دادههای پرت کمک میکند.
اما فراتر از یک آستانه مشخص، هرس کردن بدترین تطابقها در واقع فاصله بین جفتهای باقیمانده را در سراسر متغیرهای کمکی اولیه افزایش میدهد [۴، ۶]. به جای اینکه مقایسه دقیقتر شود، الگوریتم شروع به تطبیق سوژههایی میکند که در واقعیت شباهت کمتری به یکدیگر دارند [۴].[4][6]
این پارادوکس به این دلیل رخ میدهد که PSM تلاش میکند یک آزمایش کاملاً تصادفی را تقریب بزند، نه یک آزمایش تصادفی کاملاً بلوکبندیشده را [۴]. در یک کارآزمایی کاملاً تصادفی با اندازه نمونه محدود، شانس تصادفی تضمین میکند که برخی از متغیرهای کمکی نامتعادل خواهند بود—درست همانطور که ۱۰ بار پرتاب سکه به ندرت دقیقاً پنج شیر به همراه دارد.
با فشردهسازی تمام متغیرها در یک بعد واحد، PSM از نظر ریاضی نسبت به آن عدم تعادل پنهان کور میشود و عملاً دادهها را به روشهایی بر هم میزند که دقیقاً همان سوگیریای را که قرار بود از بین ببرد، دوباره وارد میکند [۴، ۶].[4][6]
دو بیمار میتوانند به راحتی از طریق مسیرهای بالینی کاملاً متفاوت به نمره گرایش دقیقاً یکسان ۴۵ درصدی برسند. یکی ممکن است به دلیل سن بالا، فشار خون بالا و سابقه سیگار کشیدن نمره بالایی داشته باشد، در حالی که دیگری به دلیل درآمد پایین، موقعیت جغرافیایی و یک نشانگر ژنتیکی خاص به ۴۵ درصد برسد.
تطبیق آنها صرفاً بر اساس نمره ۴۵ درصدی، عدم تعادل عظیم و چندبعدی در پروفایلهای بالینی واقعی آنها را نادیده میگیرد و سوژههایی را جفت میکند که اساساً نباید در یک کارآزمایی پزشکی با هم مقایسه شوند [۴، ۶].[4][6]
علاوه بر این، رویه استاندارد به حداکثر رساندن قدرت پیشبینی مدل گرایش با گنجاندن تمام متغیرهای پیش از درمانِ در دسترس، خطرات ساختاری شدیدی را به همراه دارد.
در سال ۲۰۱۰، دانشمند علوم کامپیوتر جودیا پرل (Judea Pearl) نشان داد که شرطی کردن روی متغیرهای خاص—بهویژه متغیرهای ابزاری که بر انتخاب درمان تأثیر میگذارند اما هیچ تأثیر مستقیمی بر نتیجه ندارند—«تمایل دارد سوگیری مخدوشکننده را در تحلیل اثرات علی تشدید کند» [۵]. ریختن تمام متغیرها در مدل فقط نویز اضافه نمیکند؛ بلکه به طور فعال مخدوشکنندههای مشاهدهنشده را به سلاحی مخرب تبدیل میکند [۵، ۶].[5][6]
مدلهای علی ساختاری پرل ثابت کردند که افزودن این متغیرهای تشدیدکننده سوگیری به مدل نمره گرایش میتواند سوگیری جدیدی را در جایی که قبلاً وجود نداشته است، ایجاد کند [۵].
این واقعیت ریاضی مستقیماً با توصیههای رایج در تحقیقات کاربردی در تضاد است، که اغلب پژوهشگران را تشویق میکند تا تمام متغیرهای کمکی موجود را در رگرسیون لجستیکِ مورد استفاده برای تولید نمره بگنجانند تا اطمینان حاصل شود هیچ چیزی از قلم نیفتاده است [۲، ۵]. پژوهشگران با تغذیه کورکورانه الگوریتم با دادههای بیشتر، ناخواسته در حال تشدید همان اثرات انتخابی بودند که سعی در کنترل آنها داشتند [۵، ۶].[2][5][6]
شواهد به سمت روشهای تطبیق جایگزینی اشاره دارند که به کاهش ابعاد متکی نیستند. تکنیکهایی مانند تطبیق فاصله ماهالانوبیس (MDM) و تطبیق دقیق درشتنماییشده (CEM) آزمایشهای کاملاً بلوکبندیشده را تقریب میزنند و تضمین میکنند که جفتهای تطبیقیافته در تمام ابعادِ اندازهگیریشده واقعاً مشابه هستند [۴].
برخلاف PSM، این روشها با هرس شدن تطابقهای دورتر، عدم تعادل را به صورت یکنواخت کاهش میدهند [۴، ۶]. اگر یک پژوهشگر بدترین تطابق را با استفاده از MDM حذف کند، از نظر ریاضی تضمین میشود که مجموعه دادههای باقیمانده متعادلتر از قبل خواهد بود [۴].[4][6]
برخلاف PSM، این روشها با هرس شدن تطابقهای دورتر، عدم تعادل را به صورت یکنواخت کاهش میدهند [۴، ۶].
اتکا به PSM تأخیر خطرناکی را بین نظریه آماری مجانبی و تحقیقات کاربردی برجسته میکند. در حالی که اثباتهای سال ۱۹۸۳ روزنبام و روبین در نمونههای بینهایت که در آنها تطبیق تصادفی بیضرر است صادق است، اعمال آنها بر روی مجموعه دادههای محدود دقیقاً همان جریمه تطبیق تصادفی را فعال میکند که کینگ و نیلسن آن را افشا کردند [۱، ۴].
اصطلاحات کلیدی
- نمره گرایش
- احتمال شرطی اینکه یک سوژه بر اساس ویژگیهای پایه مشاهدهشده خود، درمان خاصی را دریافت کند.
- عدم تعادل متغیرهای کمکی
- میزانی که ویژگیهای پسزمینه گروه درمانشده با گروه درماننشده تفاوت دارد.
- متغیر ابزاری
- متغیری که بر دریافت یا عدم دریافت درمان توسط سوژه تأثیر میگذارد، اما هیچ تأثیر مستقیمی بر نتیجه اندازهگیریشده ندارد.
- تطبیق فاصله ماهالانوبیس
- یک روش تطبیق جایگزین که به جای فشردهسازی متغیرها در یک نمره واحد، فاصله چندبعدی بین سوژهها را در تمام متغیرهای کمکی محاسبه میکند.
بررسی عمیق دیدگاهها
توهم نمره واحد
این باور که فشردهسازی تمام متغیرهای کمکی در یک نمره گرایش واحد، یک کارآزمایی تصادفی را به طور کامل شبیهسازی میکند.
دهههاست که پژوهشگران کاربردی به تطبیق نمره گرایش متکی بودهاند، زیرا این روش راهی از نظر ریاضی ظریف برای کاهش دادههای با ابعاد بالا به یک عدد واحد و با قابلیت تطبیق آسان ارائه میداد. فرض بر این بود که اگر دو سوژه احتمال یکسانی برای دریافت درمان داشته باشند، هرگونه تفاوت در ویژگیهای پسزمینه واقعی آنها صرفاً نویز تصادفی است، دقیقاً همانطور که در یک کارآزمایی تصادفیسازیشده و کنترلشده اتفاق میافتد. این پارادایم به پژوهشگران اجازه میداد سوژههای تطبیقنیافته را کنار بگذارند و آزمونهای آماری سادهای را روی جفتهای باقیمانده اجرا کنند، که این امر محرک هزاران مطالعه مشاهدهای در پزشکی و اقتصاد بود.
ردیه توپولوژیک
اثبات ریاضی مبنی بر اینکه هرس کردن بر اساس یک نمره واحد به طور فعال عدم تعادل متغیرهای کمکی را افزایش میدهد.
منتقدان متدولوژی، به رهبری گری کینگ و ریچارد نیلسن، نشان دادند که رویکرد نمره واحد دارای یک نقص توپولوژیک مهلک است. از آنجا که تطبیق نمره گرایش به جای یک آزمایش کاملاً بلوکبندیشده، یک آزمایش کاملاً تصادفی را تقریب میزند، نسبت به فاصله چندبعدی واقعی بین سوژهها کور است. زمانی که پژوهشگران مجموعه دادهها را هرس میکنند تا تطابقهای نزدیکتری روی نمره پیدا کنند، ناخواسته سوژههایی را جفت میکنند که در متغیرهای کمکی واقعی خود به شدت متفاوت هستند. این «پارادوکس نمره گرایش» به این معناست که عملِ اصلاح مدل، به طور فعال سوگیریای را که برای حذف آن طراحی شده بود، افزایش میدهد.
تله تشدید سوگیری
یافته علی ساختاری مبنی بر اینکه گنجاندن تمام متغیرهای در دسترس در مدل، برآوردها را بدتر میکند.
نظریهپردازان استنتاج علی خطر ساختاری دیگری را در نحوه محاسبه معمول نمرات گرایش برجسته میکنند. توصیه استاندارد در تحقیقات کاربردی این بوده است که تمام متغیرهای پیش از درمانِ در دسترس در رگرسیون لجستیک گنجانده شوند تا قدرت پیشبینی مدل به حداکثر برسد. با این حال، مدلهای علی ساختاری جودیا پرل ثابت میکنند که شرطی کردن روی متغیرهای ابزاری—ویژگیهایی که بر انتخاب درمان تأثیر میگذارند اما بر نتیجه تأثیری ندارند—در واقع سوگیری مخدوشکننده موجود را تشدید میکند. پژوهشگران با تغذیه کورکورانه الگوریتم با دادههای بیشتر، ناخواسته مخدوشکنندههای مشاهدهنشده را به سلاح تبدیل کرده و سوگیری جدیدی را در جایی که قبلاً وجود نداشت، وارد میکنند.
- منتقدان متدولوژی
- استدلال میکنند که تقریب PSM از تصادفیسازی کامل، به طور فعال باعث افزایش عدم تعادل و وابستگی به مدل در نمونههای محدود میشود.
- پژوهشگران کاربردی
- برای تطبیق نمره گرایش به دلیل سادگی و توانایی آن در کاهش دادههای با ابعاد بالا به یک نمره واحد و با قابلیت تطبیق آسان، ارزش قائل هستند.
- نظریهپردازان استنتاج علی
- تأکید میکنند که گنجاندن متغیرهای تشدیدکننده سوگیری در مدل گرایش، برآوردها را از نظر ساختاری بدتر میکند.
دیدگاههایی که این گزارش پوشش نداده
- داوران همتا
- سردبیران مجلات
منابع
[1]BiometrikaThe central role of the propensity score in observational studies for causal effects
مطالعه در Biometrika →
[2]Statistical Scienceپژوهشگران کاربردیMatching Methods for Causal Inference: A Review and a Look Forward
مطالعه در Statistical Science →
[3]Multivariate Behavioral Researchپژوهشگران کاربردیAn Introduction to Propensity Score Methods for Reducing the Effects of Confounding in Observational Studies
مطالعه در Multivariate Behavioral Research →
[4]Political Analysisمنتقدان متدولوژیWhy Propensity Scores Should Not Be Used for Matching
مطالعه در Political Analysis →
[5]ArXivنظریهپردازان استنتاج علیOn a Class of Bias-Amplifying Variables that Endanger Effect Estimates
مطالعه در ArXiv →
[6]تیم سردبیری کوهستانمنتقدان متدولوژیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →استنتاج آماری
چرا ناهمسانی واریانس خطاهای استاندارد را مخدوش میکند و چگونه خطاهای استاندارد استوار ماتریس واریانس را اصلاح میکنند
6 منبع
سوگیری متغیر حذفشده
فرمول ریاضی که جهت و بزرگی سوگیری متغیر حذفشده در رگرسیون را تعیین میکند
6 منبع
استنتاج علّی
چگونه مرزهای عددی دلخواه، علت و معلول را در دادههای مشاهدهای جدا میکنند
7 منبع
استنتاج علّی
مکانیسم تطبیق نمره تمایل: چگونه مطالعات مشاهدهای، کارآزماییهای کنترلشده تصادفی را شبیهسازی میکنند
8 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





