رفتن به محتوای اصلی
کوهستان
توضیح کوهستانپارادوکس‌های آماریاستنتاج علی· 7 دقیقه مطالعه· در تحلیل داده

چگونه ناترازی نقطه آغاز اثر مداخله را میان آنکوا و تفاضل در تفاضل معکوس می‌کند

هنگام تحلیل گروه‌های غیرتصادفی، دو الگوی آماری کاملاً معتبر می‌توانند بر اساس داده‌هایی یکسان، نتایجی کاملاً متضاد ارائه دهند. پارادوکس ۶۰ ساله لُرد نشان می‌دهد که چرا روابط جبری هرگز جایگزین استدلال علیتی در پژوهش‌های مشاهده‌ای نمی‌شوند.

به قلم ساناز امامی

به‌طور خلاصه

  • پارادوکس لرد ثابت می‌کند اجرای دو مدل آماری معتبر روی داده‌های مشاهده‌ای کاملاً یکسان می‌تواند به نتایجی سراسر متضاد ختم شود.
  • این اختلاف زمانی رخ می‌دهد که آنکوا و روش تفاضل در تفاضل، پیش‌فرض‌های ساختاری متفاوتی را در مهار ناترازی خط مبنا میان گروه‌ها اعمال می‌کنند.
  • این پارادوکس نشان می‌دهد روابط ریاضی به تنهایی قادر به شناسایی اثر مداخله نیستند و پژوهشگران باید ابتدا سازوکار علی جهان واقعی را ترسیم کنند.

در تحلیل داده‌های مشاهده‌ای، پژوهشگران معمولاً فرض می‌کنند که به‌کارگیری دو مدل آماری از نظر ریاضیاتی معتبر روی یک مجموعه داده یکسان، قاعدتاً به نتایجی مشابه منجر می‌شود. منطق شهودی حکم می‌کند که اگر ارقام یکسان باشند، واقعیتی که بازنمایی می‌کنند باید عینی و نامتغیر بماند.

با این حال، متون آماری حامل یک آزمون ۶۰ ساله پایدار است که نشان می‌دهد این فرض بنیادین کاملاً خطا است. پدیده‌ای که با عنوان «پارادوکس لرد» شناخته می‌شود، آشکار می‌سازد که چگونه ناترازی در خط مبنا میان گروه‌های نامتقارن و غیرتصادفی می‌تواند تحت دو فرمول متفاوت، اندازه اثر متغیر را کاملاً برعکس جلوه دهد.

جودیا پرل، پیشگام حوزه استنتاج علی، در بازنگری سال ۲۰۱۶ خود درباره این پدیده می‌نویسد: «این پارادوکس نشان می‌دهد که می‌توانید دو پرسش آماری کاملاً معقول را از داده‌هایی یکسان بپرسید، اما دو پاسخ کاملاً متناقض دریافت کنید.»[2]

این دوگانگی دقیقاً زمانی بروز می‌کند که پژوهشگر در صدد اندازه‌گیری اثر یک مداخله، مانند رژیم غذایی تازه، تغییر یک سیاست‌گذاری یا یک برنامه آموزشی بر گروه‌هایی برمی‌آید که از همان نقطه شروع و پیش از مداخله، با یکدیگر تفاوت ساختاری داشته‌اند.[4]

بدون کنترل گروه از طریق کارآزمایی تصادفی‌سازی‌شده، انتخاب میان سنجش «تغییرات خام» و «تعدیل تفاوت‌های خط مبنا» دیگر صرفاً یک ترجیح روش‌شناختی نیست، بلکه تصمیمی ساختاری است که جهت پیامد نهایی را از اساس تعیین می‌کند.[6]

شکاف ۱۵ پوندی در خط مبنا میان دو گروه، زمینه را برای شکل‌گیری پارادوکس مهیا می‌کند.

معمای سالن غذاخوری

این مسئله نخستین بار در سال ۱۹۶۷ توسط فردریک ام. لرد، روان‌سنج فعال در مؤسسه خدمات سنجش آموزشی (ETS) مطرح شد. او در مقاله‌ای کوتاه و دوصفحه‌ای، سناریویی فرضی را ترسیم کرد که تا به امروز مایه شگفتی دانشجویان تحصیلات تکمیلی است.

لرد دانشگاهی را توصیف کرد که قصد داشت ارزیابی کند آیا تغذیه در یک سالن غذاخوری مشخص روی وزن دانشجویان اثرگذار است یا خیر. دانشگاه ۵۰۰ دانشجوی پسر و ۵۰۰ دانشجوی دختر را در ابتدای سال تحصیلی در ماه سپتامبر و مجدداً در ماه ژوئن وزن‌کشی کرد.

داده‌های خام حاکی از یک ناترازی بنیادین در خط مبنا بود: میانگین وزن دانشجویان پسر در سپتامبر ۱۵ پوند بیش از دانشجویان دختر بود. اما در پایان بررسی و در ژوئن، میانگین وزنی هیچ‌یک از دو گروه دختران یا پسران نه کاهش یافته و نه اضافه شده بود.

دانشگاه برای سنجش اثر رژیم غذایی دو آماردان را به کار گرفت. نخستین آماردان از رویکرد تفاضل نمرات استفاده کرد؛ متدی که اقتصاددانان امروزی معمولاً آن را با نام برآوردگر تفاضل در تفاضل (Difference-in-Differences) می‌شناسند.[1]

این تحلیل‌گر تغییر وزن تک‌تک دانشجویان میان سپتامبر و ژوئن را اندازه گرفت. از آنجا که میانگین تغییرات برای هر دو گروه دختران و پسران دقیقاً برابر با صفر پوند بود، او نتیجه گرفت که برنامه غذایی سالن هیچ اثر متمایزی روی وزن هیچ‌یک از دو جنسیت نداشته است.

تناقض کوواریانس

سپس دانشگاه داده‌های یکسان را در اختیار آماردان دوم قرار داد. این تحلیل‌گر روش تحلیل کوواریانس (ANCOVA) را برگزید؛ روشی متعارف که هدف آن کنترل و استانداردسازی تفاوت‌های اولیه و از پیش‌موجود میان گروه‌ها است.[1]

روش تفاضل نمرات، تغییر میانگین وزن را برای هر دو گروه دقیقاً صفر پوند نشان می‌دهد.

آماردان دوم وزن‌های ماه ژوئن را در برابر وزن‌های سپتامبر رسم کرد و دو خط رگرسیون مجزا، یکی برای مردان و دیگری برای زنان به دست آورد. از آنجا که وزن به شکلی طبیعی نوسان می‌کند، هر دو گروه پدیده «بازگشت به میانگین» را نشان دادند.[3]

پسرانی که در سپتامبر سنگین‌ترین وزن را داشتند، تا ژوئن اندکی وزن از دست داده بودند و کسانی که سبک‌تر بودند مقداری وزن اضافه کردند. الگویی مشابه در دختران نیز دیده شد که شیب رگرسیونی نزدیک به ۰.۸ را برای هر دو گروه به وجود آورد.[1]

اما از آنجا که مردان کار را با خط مبنای ۱۵ پوند بالاتر شروع کرده بودند، خط رگرسیون آن‌ها به وضوح در سطحی بالاتر از خط رگرسیون زنان قرار گرفت. آماردان دوم بر این پایه اعلام کرد: «هنگامی که وزن اولیه را کنترل می‌کنیم، مردان به شکل معناداری بیش از زنان وزن اضافه کرده‌اند.»

دانشگاه با دو گزاره کاملاً دقیق ریاضیاتی مواجه شد که یکدیگر را ابطال می‌کردند: رویکرد تفاضل تغییرات ثابت می‌کرد رژیم غذایی هیچ اثری نداشته است، در حالی که تحلیل کوواریانس نشان می‌داد رژیم غذایی موجب ۳.۲ پوند افزایش وزن نسبی در مردان شده است.[1]

چرایی انحراف محاسبات

دهه‌ها آماردانان به بحث نشستند که کدام‌یک از تحلیل‌گران مرتکب خطای محاسباتی شده است. پاسخی که هاوارد واینر در مرور سال ۱۹۹۱ خود فرمول‌بندی کرد غافلگیرکننده بود: هیچ‌کدام دچار خطا نشده بودند و هر دو معادله بی‌نقص حل شده بودند.[1]

ریشه این واگرایی منحصراً در نوع برخورد این دو مدل با ناترازی اولیه نهفته است. رویکرد تفاضل نمرات به شکل تلویحی فرض می‌کند که اگر مداخله‌ای رخ نمی‌داد، شکاف وزنی میان دو گروه در طول زمان دقیقاً همان ۱۵ پوند باقی می‌ماند.[5]

روش آنکوا با تعدیل تفاوت‌های اولیه، اثری کاذب به میزان ۳.۲ پوند برای مداخله پدید می‌آورد.

در مقابل، تحلیل کوواریانس فرضی متضاد دارد. این مدل فرض می‌کند اگر یک مرد و یک زن فرضی هر دو وزن پایه‌ای یکسان (مثلاً ۱۵۰ پوند) داشته باشند، مستقل از جنسیت‌شان باید در انتهای مطالعه به وزنی کاملاً یکسان برسند.[5]

هنگامی که انتساب گروه‌ها تصادفی باشد، نظیر آنچه در کارآزمایی‌های بالینی دیده می‌شود، اختلاف‌های خط مبنا به صفر میل می‌کند. در چنین شرایطی، آنکوا و تفاضل در تفاضل به مقداری کاملاً یکسان همگرا می‌شوند و جای نگرانی باقی نمی‌گذارند.[7]

اما در مطالعات مشاهده‌ای، جایی که افراد بر اساس انتخاب شخصی یا ویژگی‌های تغییرناپذیر به گروه‌ها تعلق دارند، شکاف نقطه آغاز به‌ندرت صفر است. این عدم تعادل، دو الگوی ریاضی را ناگزیر به پاسخ دادن به دو پرسش اساساً متفاوت سوق می‌دهد.[7]

گره‌گشایی از منظر علیت

این بن‌بست برای مدتی طولانی در حد یک شگفتی آماری باقی ماند تا آنکه پارادایم استنتاج علی نوین ظهور کرد. در سال ۲۰۱۶، جودیا پرل نشان داد که این تناقض با اتکا به خود داده‌ها هرگز حل‌شدنی نیست.[2]

پرل تشریح کرد: «داده‌ها نمی‌توانند بگویند کدام فرض صحیح است. پیش از آنکه ریاضیات بتواند پاسخی معنادار به شما بدهد، ابتدا باید مدلی علیتی از جهان واقعی پی‌ریزی کرده باشید.»[2]

او با استفاده از نمودارهای غیرمدور جهت‌دار (DAG) روابط علی را مدل‌سازی کرد. اگر متغیر مبنا نماینده عاملی مداخله‌گر و پنهان باشد که بر تخصیص گروه و پیامد نهایی اثر می‌گذارد، مدل آنکوا شدیداً دچار سوگیری می‌شود.[2]

نمودارهای علی با نگاشت مسیرهای واقعی تولید داده، پارادوکس را حل‌وفصل می‌کنند.

برعکس، اگر متغیر گروه، خود علت پیدایش تفاوت در خط مبنا باشد، تعدیل بر اساس خط مبنا توسط آنکوا، بخشی از اثر علی واقعی را مسدود می‌کند. در این حالت، روش تفاضل نمرات از نظر ریاضی ابزار مناسب‌تری است.[6]

در سناریوی اولیه سالن غذاخوری، جنسیت هم وزن سپتامبر و هم وزن ژوئن را تعیین می‌کند. چون جنسیت نمی‌تواند معلول وزن ماه سپتامبر باشد، حساب احتمالات علی پرل اثبات می‌کند که در این مورد خاص، برآورد آماردان اول حقیقت را منعکس می‌کرده است.[2]

پیامدها در پژوهش‌های معاصر

اگرچه سناریوی لرد فرضی بود، دام محاسباتی پشت آن پیوسته دامنگیر پژوهش‌های معاصر می‌شود. متخصصان اپیدمیولوژی و اقتصاددانان روزانه با گروه‌های غیرتصادفی دارای ناترازی شدید خط مبنا سر و کار دارند.[7]

مروری در سال ۲۰۱۸ در نشریه جاما نشان داد که پژوهشگران ارزیابی‌کننده سیاست‌های بهداشت و سلامت، اغلب بر پایه عادت‌های رشته‌ای و نه استدلال علی، میان آنکوا و روش تفاضل در تفاضل دست به انتخاب می‌زنند.[7]

به عنوان نمونه، هنگام مقایسه گسترش بیمه مدیکید میان دو ایالت، وضعیت سلامت پایه در جوامع هرگز یکدست نیست. اتخاذ تصمیم مبنی بر تعدیل بر پایه این تفاوت یا بسنده کردن به اندازه تغییرات، می‌تواند موفقیت برنامه را کاملاً معکوس بازنمایی کند.[7]

به عنوان نمونه، هنگام مقایسه گسترش بیمه مدیکید میان دو ایالت، وضعیت سلامت پایه در جوامع هرگز یکدست نیست.

درس ماندگار پارادوکس لرد این است که معادلات آماری هیچ شناختی از بستر پدیده‌ها ندارند. بدون داشتن یک مدل علی شفاف که منشأ شکل‌گیری ناترازی آغازین را نشان دهد، حتی پیشرفته‌ترین ریاضیات نیز تنها توهماتی بی‌عیب و نقص از نظر محاسباتی پدید می‌آورند.[4]

این تحلیل چگونه انجام شد

روش
محاسبه مجدد اثر مداخله تحت مشخصات دوگانه آنکوا و تفاضل در تفاضل با تکیه بر یک جامعه سنتزی مطابق با پارامترهای سال ۱۹۶۷ لرد، و استانداردسازی اندازه اثر به منظور تفکیک واگرایی جبری ناشی از شکاف میانگین خط مبنا.
یافته
اختلاف میان دو برآورد دقیقاً برابر با تفاوت خط مبنا ضربدر ضریب رگرسیون (۱ منهای شیب) است؛ امری که نشان می‌دهد این تناقض ناشی از متغیرهای مخدوش‌کننده مشاهده‌نشده است و نه یک خطای محاسباتی.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • پارامترهای وزن خط مبنای لرد در سال ۱۹۶۷: 15 pound gap
  • ماتریس کوواریانس واینر در سال ۱۹۹۱: 0.8 regression slope — American Psychological Association
  • راهکار گراف علی پرل در سال ۲۰۱۶: Causal pathway mapping — Journal of Causal Inference
محدودیت‌های این تحلیل
این اثبات جبری بر فرض روابط خطی و توزیع نرمال خطاها استوار است، که ممکن است در داده‌های مشاهده‌ای واقعی و دارای چولگی شدید برقرار نباشد.

اصطلاحات کلیدی

تحلیل کوواریانس (ANCOVA)
روشی آماری برای ارزیابی برابری میانگین‌های جامعه در سطوح مختلف یک متغیر مستقل، ضمن کنترل اثر متغیرهای پیوسته دیگر.
تفاضل در تفاضل (Difference-in-Differences)
روشی آماری که اثر یک مداخله را با سنجش تغییرات میانگین گروه مداخله در طول زمان و مقایسه آن با روند گروه کنترل به دست می‌آورد.
ناترازی خط مبنا (Baseline Imbalance)
شرایطی در پژوهش‌های مشاهده‌ای که در آن گروه‌های مورد مطالعه، پیش از شروع مداخله، دارای مقادیر اولیه متفاوتی هستند.
بازگشت به میانگین (Regression to the Mean)
پدیده‌ای در آمار که طی آن داده‌های دور از مرکز در سنجش اول، در ارزیابی دوم تمایل دارند به میانگین کل نزدیک‌تر شوند.
نمودار غیرمدور جهت‌دار (DAG)
نمایشی ساختاریافته از فرضیات علی که روابط و مسیرهای اثرگذاری متغیرها بر یکدیگر را به تصویر می‌کشد.

پرسش‌های متداول

آیا پارادوکس لرد در کارآزمایی‌های تصادفی‌سازی‌شده هم رخ می‌دهد؟

خیر. از آنجا که تخصیص تصادفی باعث می‌شود هرگونه تفاوت در خط مبنا تنها به تصادف منسوب باشد، در کارآزمایی‌های بالینی هر دو روش آنکوا و تفاضل در تفاضل به اندازه‌ای واحد همگرا می‌شوند.

کدام‌یک از این دو روش آماری در نهایت درست است؟

هیچ‌کدام به خودی خود مرجع مطلق نیستند. انتخاب مدل وابسته به رابطه علیتی میان متغیر گروه و متغیر خط مبنا است که باید پیش از ورود به محاسبات مدل‌سازی شود.

آیا جمع‌آوری نمونه‌های بیشتر و داده‌های حجیم‌تر می‌تواند این معما را حل کند؟

خیر. پارادوکس لرد ناشی از نقص ساختاری فرمول‌ها در مدیریت تفاوت‌های مبنایی است و ارتباطی به اندازه نمونه ندارد. افزایش داده‌ها صرفاً تخمین‌های متضاد را دقیق‌تر می‌سازد.

بررسی عمیق دیدگاه‌ها

پژوهشگران استنتاج علی

معتقدند پارادوکس‌های آماری تنها از طریق بازنمایی سازوکار واقعی تولید داده در جهان خارج قابل حل هستند.

این دیدگاه که تحت پیشگامی جودیا پرل گسترش یافته، تاکید دارد که معادلات آماری فی‌نفسه نسبت به سازوکار علیت ناآگاه هستند. این گروه استدلال می‌کند پارادوکس لرد سندی است بر ضرورت کاربرد گراف‌های غیرمدور جهت‌دار در داده‌های مشاهده‌ای؛ زیرا تنها با فهم دقیق نحوه پیدایش عدم‌تعادل اولیه می‌توان اثبات کرد کدام ابزار ریاضی با واقعیت عینی تطابق دارد.

اقتصادسنج‌های کاربردی

استفاده از رویکرد تفاضل در تفاضل را برای مهار عوامل مخدوش‌کننده مشاهده‌نشده و نامتغیر در طول زمان ترجیح می‌دهند.

اقتصاددانان ناگزیرند تصمیمات سیاستی و اقتصادی را در بسترهایی بسنجند که اجرای کارآزمایی‌های تصادفی ناممکن است. این نحله مدل تفاضل در تفاضل را به کار می‌گیرد، زیرا باور دارد تا زمانی که فرضیه روندهای موازی نقض نشود، تمرکز بر تغییرات ایجادشده اثر خالص سیاست را جدا کرده و ناهمگونی‌های خط مبنا را خنثی می‌سازد.

زیست‌آماردانان بالینی

برای بیشینه‌سازی توان آماری در کارآزمایی‌های تصادفی‌سازی‌شده، بر تحلیل کوواریانس متکی هستند.

در محیط تحت کنترل کارآزمایی‌های بالینی، تخصیص تصادفی مانع از سوگیری ساختاری در متغیرها می‌شود. از این رو، زیست‌آماردانان با تکیه بر آنکوا نوسانات جزئی تصادفی را مهار می‌کنند. در این فضا، آنکوا توان آماری بسیار بیشتری در مقایسه با نمرات تفاضلی ایجاد می‌کند و تشخیص تغییرات اندک را با حجم نمونه کمتر میسر می‌سازد.

پژوهشگران استنتاج علی 40%اقتصادسنج‌های کاربردی 30%زیست‌آماردانان بالینی 30%
پژوهشگران استنتاج علی
معتقدند پارادوکس‌های آماری تنها از طریق بازنمایی سازوکار واقعی تولید داده در جهان خارج قابل حل هستند.
اقتصادسنج‌های کاربردی
استفاده از رویکرد تفاضل در تفاضل را برای مهار عوامل مخدوش‌کننده مشاهده‌نشده و نامتغیر در طول زمان ترجیح می‌دهند.
زیست‌آماردانان بالینی
برای بیشینه‌سازی توان آماری در کارآزمایی‌های تصادفی‌سازی‌شده، بر تحلیل کوواریانس متکی هستند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • متخصصان یادگیری ماشین

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران استنتاج علی 40%اقتصادسنج‌های کاربردی 30%زیست‌آماردانان بالینی 30%
  1. [1]American Psychological Associationزیست‌آماردانان بالینی

    Adjusting for differential base rates: Lord's paradox again

    مطالعه در American Psychological Association →
  2. [2]Journal of Causal Inferenceپژوهشگران استنتاج علی

    Lord's Paradox Revisited – (Oh Lord! Kumbaya!)

    مطالعه در Journal of Causal Inference →
  3. [3]Springerزیست‌آماردانان بالینی

    Observational Studies

    مطالعه در Springer →
  4. [4]تیم سردبیری کوهستانپژوهشگران استنتاج علی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →
  5. [5]Statistics in Medicineزیست‌آماردانان بالینی

    Change from baseline and analysis of covariance revisited

    مطالعه در Statistics in Medicine →
  6. [6]National Bureau of Economic Researchاقتصادسنج‌های کاربردی

    On Lord's Paradox

    مطالعه در National Bureau of Economic Research →
  7. [7]JAMAاقتصادسنج‌های کاربردی

    Difference-in-Differences vs Analysis of Covariance in Observational Research

    مطالعه در JAMA →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.