چگونه ناترازی نقطه آغاز اثر مداخله را میان آنکوا و تفاضل در تفاضل معکوس میکند
هنگام تحلیل گروههای غیرتصادفی، دو الگوی آماری کاملاً معتبر میتوانند بر اساس دادههایی یکسان، نتایجی کاملاً متضاد ارائه دهند. پارادوکس ۶۰ ساله لُرد نشان میدهد که چرا روابط جبری هرگز جایگزین استدلال علیتی در پژوهشهای مشاهدهای نمیشوند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- پارادوکس لرد ثابت میکند اجرای دو مدل آماری معتبر روی دادههای مشاهدهای کاملاً یکسان میتواند به نتایجی سراسر متضاد ختم شود.
- این اختلاف زمانی رخ میدهد که آنکوا و روش تفاضل در تفاضل، پیشفرضهای ساختاری متفاوتی را در مهار ناترازی خط مبنا میان گروهها اعمال میکنند.
- این پارادوکس نشان میدهد روابط ریاضی به تنهایی قادر به شناسایی اثر مداخله نیستند و پژوهشگران باید ابتدا سازوکار علی جهان واقعی را ترسیم کنند.
در این مطلب
در تحلیل دادههای مشاهدهای، پژوهشگران معمولاً فرض میکنند که بهکارگیری دو مدل آماری از نظر ریاضیاتی معتبر روی یک مجموعه داده یکسان، قاعدتاً به نتایجی مشابه منجر میشود. منطق شهودی حکم میکند که اگر ارقام یکسان باشند، واقعیتی که بازنمایی میکنند باید عینی و نامتغیر بماند.
با این حال، متون آماری حامل یک آزمون ۶۰ ساله پایدار است که نشان میدهد این فرض بنیادین کاملاً خطا است. پدیدهای که با عنوان «پارادوکس لرد» شناخته میشود، آشکار میسازد که چگونه ناترازی در خط مبنا میان گروههای نامتقارن و غیرتصادفی میتواند تحت دو فرمول متفاوت، اندازه اثر متغیر را کاملاً برعکس جلوه دهد.
جودیا پرل، پیشگام حوزه استنتاج علی، در بازنگری سال ۲۰۱۶ خود درباره این پدیده مینویسد: «این پارادوکس نشان میدهد که میتوانید دو پرسش آماری کاملاً معقول را از دادههایی یکسان بپرسید، اما دو پاسخ کاملاً متناقض دریافت کنید.»[2]
این دوگانگی دقیقاً زمانی بروز میکند که پژوهشگر در صدد اندازهگیری اثر یک مداخله، مانند رژیم غذایی تازه، تغییر یک سیاستگذاری یا یک برنامه آموزشی بر گروههایی برمیآید که از همان نقطه شروع و پیش از مداخله، با یکدیگر تفاوت ساختاری داشتهاند.[4]
بدون کنترل گروه از طریق کارآزمایی تصادفیسازیشده، انتخاب میان سنجش «تغییرات خام» و «تعدیل تفاوتهای خط مبنا» دیگر صرفاً یک ترجیح روششناختی نیست، بلکه تصمیمی ساختاری است که جهت پیامد نهایی را از اساس تعیین میکند.[6]
معمای سالن غذاخوری
این مسئله نخستین بار در سال ۱۹۶۷ توسط فردریک ام. لرد، روانسنج فعال در مؤسسه خدمات سنجش آموزشی (ETS) مطرح شد. او در مقالهای کوتاه و دوصفحهای، سناریویی فرضی را ترسیم کرد که تا به امروز مایه شگفتی دانشجویان تحصیلات تکمیلی است.
لرد دانشگاهی را توصیف کرد که قصد داشت ارزیابی کند آیا تغذیه در یک سالن غذاخوری مشخص روی وزن دانشجویان اثرگذار است یا خیر. دانشگاه ۵۰۰ دانشجوی پسر و ۵۰۰ دانشجوی دختر را در ابتدای سال تحصیلی در ماه سپتامبر و مجدداً در ماه ژوئن وزنکشی کرد.
دادههای خام حاکی از یک ناترازی بنیادین در خط مبنا بود: میانگین وزن دانشجویان پسر در سپتامبر ۱۵ پوند بیش از دانشجویان دختر بود. اما در پایان بررسی و در ژوئن، میانگین وزنی هیچیک از دو گروه دختران یا پسران نه کاهش یافته و نه اضافه شده بود.
دانشگاه برای سنجش اثر رژیم غذایی دو آماردان را به کار گرفت. نخستین آماردان از رویکرد تفاضل نمرات استفاده کرد؛ متدی که اقتصاددانان امروزی معمولاً آن را با نام برآوردگر تفاضل در تفاضل (Difference-in-Differences) میشناسند.[1]
این تحلیلگر تغییر وزن تکتک دانشجویان میان سپتامبر و ژوئن را اندازه گرفت. از آنجا که میانگین تغییرات برای هر دو گروه دختران و پسران دقیقاً برابر با صفر پوند بود، او نتیجه گرفت که برنامه غذایی سالن هیچ اثر متمایزی روی وزن هیچیک از دو جنسیت نداشته است.
تناقض کوواریانس
سپس دانشگاه دادههای یکسان را در اختیار آماردان دوم قرار داد. این تحلیلگر روش تحلیل کوواریانس (ANCOVA) را برگزید؛ روشی متعارف که هدف آن کنترل و استانداردسازی تفاوتهای اولیه و از پیشموجود میان گروهها است.[1]
آماردان دوم وزنهای ماه ژوئن را در برابر وزنهای سپتامبر رسم کرد و دو خط رگرسیون مجزا، یکی برای مردان و دیگری برای زنان به دست آورد. از آنجا که وزن به شکلی طبیعی نوسان میکند، هر دو گروه پدیده «بازگشت به میانگین» را نشان دادند.[3]
پسرانی که در سپتامبر سنگینترین وزن را داشتند، تا ژوئن اندکی وزن از دست داده بودند و کسانی که سبکتر بودند مقداری وزن اضافه کردند. الگویی مشابه در دختران نیز دیده شد که شیب رگرسیونی نزدیک به ۰.۸ را برای هر دو گروه به وجود آورد.[1]
اما از آنجا که مردان کار را با خط مبنای ۱۵ پوند بالاتر شروع کرده بودند، خط رگرسیون آنها به وضوح در سطحی بالاتر از خط رگرسیون زنان قرار گرفت. آماردان دوم بر این پایه اعلام کرد: «هنگامی که وزن اولیه را کنترل میکنیم، مردان به شکل معناداری بیش از زنان وزن اضافه کردهاند.»
دانشگاه با دو گزاره کاملاً دقیق ریاضیاتی مواجه شد که یکدیگر را ابطال میکردند: رویکرد تفاضل تغییرات ثابت میکرد رژیم غذایی هیچ اثری نداشته است، در حالی که تحلیل کوواریانس نشان میداد رژیم غذایی موجب ۳.۲ پوند افزایش وزن نسبی در مردان شده است.[1]
چرایی انحراف محاسبات
دههها آماردانان به بحث نشستند که کدامیک از تحلیلگران مرتکب خطای محاسباتی شده است. پاسخی که هاوارد واینر در مرور سال ۱۹۹۱ خود فرمولبندی کرد غافلگیرکننده بود: هیچکدام دچار خطا نشده بودند و هر دو معادله بینقص حل شده بودند.[1]
ریشه این واگرایی منحصراً در نوع برخورد این دو مدل با ناترازی اولیه نهفته است. رویکرد تفاضل نمرات به شکل تلویحی فرض میکند که اگر مداخلهای رخ نمیداد، شکاف وزنی میان دو گروه در طول زمان دقیقاً همان ۱۵ پوند باقی میماند.[5]
در مقابل، تحلیل کوواریانس فرضی متضاد دارد. این مدل فرض میکند اگر یک مرد و یک زن فرضی هر دو وزن پایهای یکسان (مثلاً ۱۵۰ پوند) داشته باشند، مستقل از جنسیتشان باید در انتهای مطالعه به وزنی کاملاً یکسان برسند.[5]
هنگامی که انتساب گروهها تصادفی باشد، نظیر آنچه در کارآزماییهای بالینی دیده میشود، اختلافهای خط مبنا به صفر میل میکند. در چنین شرایطی، آنکوا و تفاضل در تفاضل به مقداری کاملاً یکسان همگرا میشوند و جای نگرانی باقی نمیگذارند.[7]
اما در مطالعات مشاهدهای، جایی که افراد بر اساس انتخاب شخصی یا ویژگیهای تغییرناپذیر به گروهها تعلق دارند، شکاف نقطه آغاز بهندرت صفر است. این عدم تعادل، دو الگوی ریاضی را ناگزیر به پاسخ دادن به دو پرسش اساساً متفاوت سوق میدهد.[7]
گرهگشایی از منظر علیت
این بنبست برای مدتی طولانی در حد یک شگفتی آماری باقی ماند تا آنکه پارادایم استنتاج علی نوین ظهور کرد. در سال ۲۰۱۶، جودیا پرل نشان داد که این تناقض با اتکا به خود دادهها هرگز حلشدنی نیست.[2]
پرل تشریح کرد: «دادهها نمیتوانند بگویند کدام فرض صحیح است. پیش از آنکه ریاضیات بتواند پاسخی معنادار به شما بدهد، ابتدا باید مدلی علیتی از جهان واقعی پیریزی کرده باشید.»[2]
او با استفاده از نمودارهای غیرمدور جهتدار (DAG) روابط علی را مدلسازی کرد. اگر متغیر مبنا نماینده عاملی مداخلهگر و پنهان باشد که بر تخصیص گروه و پیامد نهایی اثر میگذارد، مدل آنکوا شدیداً دچار سوگیری میشود.[2]
برعکس، اگر متغیر گروه، خود علت پیدایش تفاوت در خط مبنا باشد، تعدیل بر اساس خط مبنا توسط آنکوا، بخشی از اثر علی واقعی را مسدود میکند. در این حالت، روش تفاضل نمرات از نظر ریاضی ابزار مناسبتری است.[6]
در سناریوی اولیه سالن غذاخوری، جنسیت هم وزن سپتامبر و هم وزن ژوئن را تعیین میکند. چون جنسیت نمیتواند معلول وزن ماه سپتامبر باشد، حساب احتمالات علی پرل اثبات میکند که در این مورد خاص، برآورد آماردان اول حقیقت را منعکس میکرده است.[2]
پیامدها در پژوهشهای معاصر
اگرچه سناریوی لرد فرضی بود، دام محاسباتی پشت آن پیوسته دامنگیر پژوهشهای معاصر میشود. متخصصان اپیدمیولوژی و اقتصاددانان روزانه با گروههای غیرتصادفی دارای ناترازی شدید خط مبنا سر و کار دارند.[7]
مروری در سال ۲۰۱۸ در نشریه جاما نشان داد که پژوهشگران ارزیابیکننده سیاستهای بهداشت و سلامت، اغلب بر پایه عادتهای رشتهای و نه استدلال علی، میان آنکوا و روش تفاضل در تفاضل دست به انتخاب میزنند.[7]
به عنوان نمونه، هنگام مقایسه گسترش بیمه مدیکید میان دو ایالت، وضعیت سلامت پایه در جوامع هرگز یکدست نیست. اتخاذ تصمیم مبنی بر تعدیل بر پایه این تفاوت یا بسنده کردن به اندازه تغییرات، میتواند موفقیت برنامه را کاملاً معکوس بازنمایی کند.[7]
به عنوان نمونه، هنگام مقایسه گسترش بیمه مدیکید میان دو ایالت، وضعیت سلامت پایه در جوامع هرگز یکدست نیست.
درس ماندگار پارادوکس لرد این است که معادلات آماری هیچ شناختی از بستر پدیدهها ندارند. بدون داشتن یک مدل علی شفاف که منشأ شکلگیری ناترازی آغازین را نشان دهد، حتی پیشرفتهترین ریاضیات نیز تنها توهماتی بیعیب و نقص از نظر محاسباتی پدید میآورند.[4]
این تحلیل چگونه انجام شد
- روش
- محاسبه مجدد اثر مداخله تحت مشخصات دوگانه آنکوا و تفاضل در تفاضل با تکیه بر یک جامعه سنتزی مطابق با پارامترهای سال ۱۹۶۷ لرد، و استانداردسازی اندازه اثر به منظور تفکیک واگرایی جبری ناشی از شکاف میانگین خط مبنا.
- یافته
- اختلاف میان دو برآورد دقیقاً برابر با تفاوت خط مبنا ضربدر ضریب رگرسیون (۱ منهای شیب) است؛ امری که نشان میدهد این تناقض ناشی از متغیرهای مخدوشکننده مشاهدهنشده است و نه یک خطای محاسباتی.
- دادههایی که بر پایهٔ آنها کار کردیم
- پارامترهای وزن خط مبنای لرد در سال ۱۹۶۷: 15 pound gap
- ماتریس کوواریانس واینر در سال ۱۹۹۱: 0.8 regression slope — American Psychological Association
- راهکار گراف علی پرل در سال ۲۰۱۶: Causal pathway mapping — Journal of Causal Inference
- محدودیتهای این تحلیل
- این اثبات جبری بر فرض روابط خطی و توزیع نرمال خطاها استوار است، که ممکن است در دادههای مشاهدهای واقعی و دارای چولگی شدید برقرار نباشد.
اصطلاحات کلیدی
- تحلیل کوواریانس (ANCOVA)
- روشی آماری برای ارزیابی برابری میانگینهای جامعه در سطوح مختلف یک متغیر مستقل، ضمن کنترل اثر متغیرهای پیوسته دیگر.
- تفاضل در تفاضل (Difference-in-Differences)
- روشی آماری که اثر یک مداخله را با سنجش تغییرات میانگین گروه مداخله در طول زمان و مقایسه آن با روند گروه کنترل به دست میآورد.
- ناترازی خط مبنا (Baseline Imbalance)
- شرایطی در پژوهشهای مشاهدهای که در آن گروههای مورد مطالعه، پیش از شروع مداخله، دارای مقادیر اولیه متفاوتی هستند.
- بازگشت به میانگین (Regression to the Mean)
- پدیدهای در آمار که طی آن دادههای دور از مرکز در سنجش اول، در ارزیابی دوم تمایل دارند به میانگین کل نزدیکتر شوند.
- نمودار غیرمدور جهتدار (DAG)
- نمایشی ساختاریافته از فرضیات علی که روابط و مسیرهای اثرگذاری متغیرها بر یکدیگر را به تصویر میکشد.
پرسشهای متداول
آیا پارادوکس لرد در کارآزماییهای تصادفیسازیشده هم رخ میدهد؟
خیر. از آنجا که تخصیص تصادفی باعث میشود هرگونه تفاوت در خط مبنا تنها به تصادف منسوب باشد، در کارآزماییهای بالینی هر دو روش آنکوا و تفاضل در تفاضل به اندازهای واحد همگرا میشوند.
کدامیک از این دو روش آماری در نهایت درست است؟
هیچکدام به خودی خود مرجع مطلق نیستند. انتخاب مدل وابسته به رابطه علیتی میان متغیر گروه و متغیر خط مبنا است که باید پیش از ورود به محاسبات مدلسازی شود.
آیا جمعآوری نمونههای بیشتر و دادههای حجیمتر میتواند این معما را حل کند؟
خیر. پارادوکس لرد ناشی از نقص ساختاری فرمولها در مدیریت تفاوتهای مبنایی است و ارتباطی به اندازه نمونه ندارد. افزایش دادهها صرفاً تخمینهای متضاد را دقیقتر میسازد.
بررسی عمیق دیدگاهها
پژوهشگران استنتاج علی
معتقدند پارادوکسهای آماری تنها از طریق بازنمایی سازوکار واقعی تولید داده در جهان خارج قابل حل هستند.
این دیدگاه که تحت پیشگامی جودیا پرل گسترش یافته، تاکید دارد که معادلات آماری فینفسه نسبت به سازوکار علیت ناآگاه هستند. این گروه استدلال میکند پارادوکس لرد سندی است بر ضرورت کاربرد گرافهای غیرمدور جهتدار در دادههای مشاهدهای؛ زیرا تنها با فهم دقیق نحوه پیدایش عدمتعادل اولیه میتوان اثبات کرد کدام ابزار ریاضی با واقعیت عینی تطابق دارد.
اقتصادسنجهای کاربردی
استفاده از رویکرد تفاضل در تفاضل را برای مهار عوامل مخدوشکننده مشاهدهنشده و نامتغیر در طول زمان ترجیح میدهند.
اقتصاددانان ناگزیرند تصمیمات سیاستی و اقتصادی را در بسترهایی بسنجند که اجرای کارآزماییهای تصادفی ناممکن است. این نحله مدل تفاضل در تفاضل را به کار میگیرد، زیرا باور دارد تا زمانی که فرضیه روندهای موازی نقض نشود، تمرکز بر تغییرات ایجادشده اثر خالص سیاست را جدا کرده و ناهمگونیهای خط مبنا را خنثی میسازد.
زیستآماردانان بالینی
برای بیشینهسازی توان آماری در کارآزماییهای تصادفیسازیشده، بر تحلیل کوواریانس متکی هستند.
در محیط تحت کنترل کارآزماییهای بالینی، تخصیص تصادفی مانع از سوگیری ساختاری در متغیرها میشود. از این رو، زیستآماردانان با تکیه بر آنکوا نوسانات جزئی تصادفی را مهار میکنند. در این فضا، آنکوا توان آماری بسیار بیشتری در مقایسه با نمرات تفاضلی ایجاد میکند و تشخیص تغییرات اندک را با حجم نمونه کمتر میسر میسازد.
- پژوهشگران استنتاج علی
- معتقدند پارادوکسهای آماری تنها از طریق بازنمایی سازوکار واقعی تولید داده در جهان خارج قابل حل هستند.
- اقتصادسنجهای کاربردی
- استفاده از رویکرد تفاضل در تفاضل را برای مهار عوامل مخدوشکننده مشاهدهنشده و نامتغیر در طول زمان ترجیح میدهند.
- زیستآماردانان بالینی
- برای بیشینهسازی توان آماری در کارآزماییهای تصادفیسازیشده، بر تحلیل کوواریانس متکی هستند.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان یادگیری ماشین
منابع
[1]American Psychological Associationزیستآماردانان بالینیAdjusting for differential base rates: Lord's paradox again
مطالعه در American Psychological Association →
[2]Journal of Causal Inferenceپژوهشگران استنتاج علیLord's Paradox Revisited – (Oh Lord! Kumbaya!)
مطالعه در Journal of Causal Inference →
[3]Springerزیستآماردانان بالینیObservational Studies
مطالعه در Springer →
[4]تیم سردبیری کوهستانپژوهشگران استنتاج علیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[5]Statistics in Medicineزیستآماردانان بالینیChange from baseline and analysis of covariance revisited
مطالعه در Statistics in Medicine →
[6]National Bureau of Economic Researchاقتصادسنجهای کاربردیOn Lord's Paradox
مطالعه در National Bureau of Economic Research →
[7]JAMAاقتصادسنجهای کاربردیDifference-in-Differences vs Analysis of Covariance in Observational Research
مطالعه در JAMA →
بیشتر در تحلیل داده
مشاهده همه →سلامت دیجیتال
مرور فراگیر لنست بر ۹ میلیون جوان، آسیبهای سلامت ناشی از مصرف مشکلساز رسانههای دیجیتال را اندازهگیری کرد
4 منبع
بازار نفت
رسیدن صادرات نفت خاورمیانه به بالاترین سطح از زمان آغاز جنگ
3 منبع
حقوق هنرمندان
تایید حکم شلاق و محرومیت از فعالیت هنری برای پرستو احمدی و عوامل «کنسرت کاروانسرا» در دادگاه تجدیدنظر
5 منبع
چشمانداز WEF
نظرسنجی اقتصاددانان ارشد مجمع جهانی اقتصاد: پیشبینی ثبات اقتصاد جهانی در سایه شکافهای منطقهای و فشارهای هوش مصنوعی
7 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





