چگونه تصادفیسازی محلی در نزدیکی یک نقطه برش، اثرات علی را در دادههای مشاهدهای مجزا میکند
محققان با در نظر گرفتن یک پنجره باریک در اطراف یک آستانه دلخواه به عنوان یک قرعهکشی خالص، میتوانند دقت یک کارآزمایی بالینی را بدون نیاز به اجرای آن شبیهسازی کنند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- طرحهای ناپیوستگی رگرسیون از نقاط برش دلخواه برای تقلید از کارآزماییهای تصادفی کنترلشده در دادههای مشاهدهای استفاده میکنند.
- چارچوب تصادفیسازی محلی فرض میکند که تخصیص درمان در یک پنجره بسیار باریک در اطراف آستانه، یک قرعهکشی کاملاً تصادفی است.
- محققان باید اندازه این پنجره را از نظر ریاضی متعادل کنند تا ویژگیهای یکسان سوژهها حفظ شود، بدون اینکه توان آماری از دست برود.
وقتی یک دستورالعمل پزشکی تعیین میکند که بیماران با فشار خون ۱۴۰ میلیمتر جیوه دارو دریافت کنند در حالی که بیماران با فشار خون ۱۳۹ میلیمتر جیوه از دریافت آن محروم بمانند، این مرز دلخواه است که درمان را دیکته میکند. این تقسیمبندی دقیق، یک آزمایشگاه طبیعی برای محققان میسازد.
آمارشناسان با مقایسه افراد دقیقاً مجاور این آستانه، میتوانند بدون نیاز به اجرای یک کارآزمایی تصادفی کنترلشده چند میلیون دلاری، تأثیر دقیق دارو را مجزا کنند؛ چرا که بیماران در دو طرف این شکاف یکامتیازی، از نظر بیولوژیکی غیرقابل تشخیص و کاملاً مشابهاند.
این سازوکار، پایه و اساس «طرح ناپیوستگی رگرسیون» (RDD) است. بر اساس یک راهنمای بنیادین که در سال ۲۰۰۷ توسط دفتر ملی تحقیقات اقتصادی منتشر شد، این رویکرد از این واقعیت بهره میبرد که سوژهها نمیتوانند موقعیت خود را در اطراف یک نقطه برش سختگیرانه به دقت دستکاری کنند. همانطور که دیوید لی و توماس لمیو، نویسندگان این مقاله، اشاره میکنند: «طرح RD اغلب معتبرترین طرح پژوهشی غیرآزمایشی در نظر گرفته میشود»، زیرا به شدت شبیه به یک آزمایش واقعی عمل میکند.[1]
از نظر تاریخی، محققان RDD را از طریق یک چارچوب پیوستگی تفسیر میکردند؛ با این فرض که پیامدهای بالقوه به نرمی در طول آستانه تغییر میکنند و از خطوط رگرسیون برای برونیابی تا مرز استفاده میکردند. با این حال، یک شاخه روششناختی متمایز، چارچوب «تصادفیسازی محلی» را فرمولبندی کرده است. همانطور که در یک مرور سال ۲۰۱۸ منتشر شده در arXiv به تفصیل بیان شده، این رویکرد صراحتاً فرض میکند که در یک پنجره بسیار باریک در اطراف نقطه برش، تخصیص درمان به اندازه یک انتخاب کاملاً تصادفی، معتبر است.[4]
این تمایز برای نحوه سنجش و پردازش شواهد اهمیت بنیادینی دارد. در رویکرد پیوستگی، محققان از دادههای بسیار دورتر از نقطه برش برای برازش مدلهای خود استفاده میکنند. اما رویکرد تصادفیسازی محلی، که توسط روششناسان دانشگاه پرینستون و انتشارات دانشگاه کمبریج تبیین شده است، دادههای دور را به طور کامل کنار میگذارد.
این روش، نوار باریک دادهها — برای مثال، نمرات آزمونی که دقیقاً بین ۸۴.۵ و ۸۵.۵ قرار میگیرند — را به عنوان یک قرعهکشی خالص در نظر میگیرد و آن را دقیقاً همانطور که یک کارآزمایی بالینی تحلیل میشود، مورد بررسی قرار میدهد.[3][6]
برای اجرای این کار، تحلیلگران به ابزارهای محاسباتی خاصی تکیه میکنند که برای یافتن آن پنجره بینقص طراحی شدهاند. بسته rdlocrand، که در سال ۲۰۱۶ در Stata Journal به تفصیل معرفی شد و به عنوان یک مخزن متنباز در گیتهاب نگهداری میشود، این زیرساخت الگوریتمی را فراهم میکند. این ابزار به محققان اجازه میدهد تا به طور سیستماتیک پهنای باندی را انتخاب کنند که در آن ویژگیهای پایه — مانند سن، درآمد، یا تحصیلات قبلی — در هر دو طرف این شکاف از نظر آماری یکسان باشند.[5][7]
یافتن این پنجره نیازمند یک تعادل ریاضی ظریف است. اگر پنجره بیش از حد عریض باشد، سوژههای دو طرف دیگر یکسان نخواهند بود؛ دانشآموزی که نمره ۹۰ میگیرد اساساً با دانشآموزی که نمره ۸۰ میگیرد متفاوت است. از سوی دیگر، اگر پنجره بیش از حد باریک باشد، اندازه نمونه به سطحی کاهش مییابد که توان آماری از بین میرود و تشخیص یک اثر واقعی از نویز تصادفی با مقدار پی استاندارد ۰.۰۵ غیرممکن میشود.
یک تحلیل در سال ۲۰۱۷ که توسط گروه انتشاراتی امرالد منتشر شد، دقیقاً همین بدهبستان را هنگام تفسیر RDD به عنوان یک آزمایش محلی بررسی کرد. نویسندگان نشان دادند که اعتبار ادعای علی، کاملاً به ناتوانی سوژهها در مرتبسازی خود در طول مرز بستگی دارد. اگر دانشآموزی بداند که نقطه برش بورسیه تحصیلی ۸۵ است و بتواند آزمون را تا زمانی که دقیقاً به نمره ۸۵.۱ برسد تکرار کند، فرض تصادفی بودن به طور کامل فرو میریزد.[8]
برای تشخیص این دستکاری، محققان از آزمونهای چگالی، به ویژه آزمون مرتبسازی مککراری، استفاده میکنند. اگر توزیع متغیر اجرا — یعنی نمره یا معیاری که درمان را تعیین میکند — یک جهش عظیم را دقیقاً بالای نقطه برش و یک دره خالی را دقیقاً زیر آن نشان دهد، این سیگنالی است که افراد سیستم را دور زدهاند. در چنین مواردی، چارچوب تصادفیسازی محلی قابل اجرا نیست و هرگونه ادعای علی باطل خواهد بود.
زمانی که این مفروضات پابرجا باشند، نتایج به طرز چشمگیری مستحکم هستند و چندین حوزه را بازآفرینی کردهاند. در علوم سیاسی، تصادفیسازی محلی اغلب برای مطالعه مزیت متصدی بودن از طریق بررسی انتخاباتی که با حاشیه کمتر از ۱ درصد تعیین شدهاند، استفاده میشود. شهرداریای که در آن یک نامزد با ۵۰.۱ درصد آرا پیروز شده، عملاً با شهرداریای که در آن با ۴۹.۹ درصد شکست خورده یکسان است؛ این امر اثر خالص در اختیار داشتن منصب را از گرایشهای سیاسی زیربنایی شهر مجزا میکند.
این چارچوب همچنین پیش از نتیجهگیری، نیازمند بررسیهای دقیق تعادل متغیرهای کمکی است. پیش از بررسی پیامد نهایی، محققان باید ثابت کنند که گروههای درمان و کنترل در داخل پنجره، دارای ویژگیهای پیش از درمان یکسانی هستند. اگر الگوریتم پنجرهای را انتخاب کند که در آن میانگین سنی در یک طرف ۴۲ سال و در طرف دیگر ۴۸ سال باشد، فرض تصادفیسازی محلی نقض شده است و پنجره باید باریکتر شود.
تکامل این روشها بازتابدهنده یک تغییر گستردهتر در اقتصاد تجربی و علم داده به سمت استنتاج مبتنی بر طراحی است. رویکرد تصادفیسازی محلی، به جای تکیه بر مدلهای پیچیده و مبهم برای تعدیل صدها متغیر مخدوشکننده، محقق را مجبور میکند تا یک قرعهکشی شفاف و طبیعی را در دادهها بیابد و بدین ترتیب مفروضات را قابل مشاهده و آزمونپذیر میسازد.[2]
اعتبار بیرونی این یافتهها به شدت محدود به ریاضیات این طرح باقی میماند. اثر درمانی محاسبهشده در نقطه برش، تنها برای افراد نزدیک به آن نقطه صدق میکند. اینکه آیا یک دارو برای بیماری با فشار خون ۱۸۰ میلیمتر جیوه کارساز است، یا یک بورسیه به دانشآموزی با نمره ۹۵ کمک میکند، توسط این ناپیوستگی قابل پاسخگویی نیست.
دقت این آزمایش محلی دقیقاً با فدا کردن توانایی تعمیم جهانی به دست میآید و محققان را وا میدارد تا قطعیت مطلق یک ادعای محدود را در برابر عدم قطعیت یک ادعای گسترده بسنجند.[9]
اصطلاحات کلیدی
- طرح ناپیوستگی رگرسیون (RDD)
- یک روش آماری که با مقایسه سوژههایی که دقیقاً در بالا و پایین یک نقطه برش دقیق و دلخواه قرار دارند، اثرات علی را مجزا میکند.
- متغیر اجرا
- معیار زیربنایی، مانند نمره آزمون یا سهم آرا، که تعیین میکند آیا یک سوژه درمان را دریافت میکند یا خیر.
- تعادل متغیرهای کمکی
- وضعیتی که در آن ویژگیهای پایه، مانند سن یا درآمد، بین گروههای درمان و کنترل از نظر آماری یکسان هستند.
- پهنای باند
- عرض مشخصی از پنجره دادهها در اطراف نقطه برش که برای تحلیل استفاده میشود.
بررسی عمیق دیدگاهها
حامیان تصادفیسازی محلی
استدلال میکنند که در نظر گرفتن نقطه برش به عنوان یک قرعهکشی خالص، شفافترین راه برای اثبات علیت است.
طرفداران این چارچوب استدلال میکنند که مدلهای مبتنی بر پیوستگی بیش از حد به برونیابی و مفروضات فرم تابعی متکی هستند. محققان با محدود کردن تحلیل صرفاً به نقاط دادهای که دقیقاً مجاور نقطه برش هستند، نیاز به مدلسازی رفتار پیامد در فواصل دور از آستانه را از بین میبرند. این امر محقق را مجبور میکند تا ثابت کند که سوژهها واقعاً یکسان هستند و در نتیجه ادعای علی را به اندازه یک کارآزمایی بالینی مستحکم میسازد.
طرفداران چارچوب پیوستگی
معتقدند که استفاده از دادههای دورتر از نقطه برش با استفاده از مدلهای رگرسیون، توان آماری لازم را فراهم میکند.
محققانی که رویکرد سنتی پیوستگی را ترجیح میدهند، خاطرنشان میکنند که کنار گذاشتن دادههای خارج از پنجره باریک تصادفیسازی محلی، توان آماری را از بین میبرد. در مجموعه دادههایی با اندازه نمونه کوچک، رویکرد تصادفیسازی محلی اغلب در تشخیص اثرات واقعی شکست میخورد، صرفاً به این دلیل که سوژههای کافی دقیقاً در مرز وجود ندارند. آنها استدلال میکنند که برازش خطوط رگرسیون انعطافپذیر به دادهها اجازه میدهد تا خودشان صحبت کنند، در حالی که فواصل اطمینان معقولی نیز حفظ میشود.
شکاکان به اعتبار بیرونی
هشدار میدهند که یافتههای بهدستآمده در نقطه برش به ندرت برای جمعیت گستردهتر صدق میکنند.
منتقدان هر دو چارچوب RDD تأکید میکنند که اثر درمانی ذاتاً محلی است. اگر مطالعهای ثابت کند که یک بورسیه تحصیلی به دانشآموزانی که دقیقاً نمره ۸۵ میگیرند کمک میکند، هیچ شواهد ریاضیاتی درباره اینکه این بورسیه چگونه بر یک دانشآموز ضعیف با نمره ۶۰ یا یک دانشآموز استثنایی با نمره ۹۹ تأثیر میگذارد، ارائه نمیدهد. سیاستگذارانی که یافتههای RDD را به جمعیتهای گسترده تعمیم میدهند، اغلب از مرزهای ریاضی شواهد فراتر میروند.
- تجربهگرایان مبتنی بر طراحی
- استدلال میکنند که در نظر گرفتن نقطه برش به عنوان یک قرعهکشی خالص، شفافترین راه برای اثبات علیت بدون تکیه بر مدلهای پیچیده است.
- روششناسان الگوریتمی
- بر توسعه ابزارهای ریاضی و محاسباتی مورد نیاز برای انتخاب پنجره بهینه بدون سوگیری محقق تمرکز دارند.
- اقتصادسنجیدانان کاربردی
- بر بدهبستانهای میان مفروضات سختگیرانه تصادفیسازی محلی و توان آماری بهدستآمده از طریق استفاده از چارچوبهای پیوستگی تأکید میکنند.
دیدگاههایی که این گزارش پوشش نداده
- حامیان کارآزماییهای بالینی
- نظریهپردازان یادگیری ماشین
منابع
[1]National Bureau of Economic Researchتجربهگرایان مبتنی بر طراحیRegression Discontinuity Designs: A Guide to Practice
مطالعه در National Bureau of Economic Research →
[2]Annual Reviewsاقتصادسنجیدانان کاربردیRegression Discontinuity Designs
مطالعه در Annual Reviews →
[3]Cambridge University Pressاقتصادسنجیدانان کاربردیA Practical Introduction to Regression Discontinuity Designs: Extensions
مطالعه در Cambridge University Press →
[4]arXivروششناسان الگوریتمیThe Local Randomization Framework for Regression Discontinuity Designs: A Review and Some Extensions
مطالعه در arXiv →
[5]Stata Journalروششناسان الگوریتمیInference in Regression Discontinuity Designs under Local Randomization
مطالعه در Stata Journal →
[6]Princeton Universityتجربهگرایان مبتنی بر طراحیRegression Discontinuity Designs
مطالعه در Princeton University →
[7]GitHubروششناسان الگوریتمیGitHub - rdpackages/rdlocrand: Local Randomization Methods for RD Designs
مطالعه در GitHub →
[8]Emerald Group Publishingاقتصادسنجیدانان کاربردیOn Interpreting the Regression Discontinuity Design as a Local Experiment
مطالعه در Emerald Group Publishing →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →بازار نفت
رسیدن صادرات نفت خاورمیانه به بالاترین سطح از زمان آغاز جنگ
3 منبع
حقوق هنرمندان
تایید حکم شلاق و محرومیت از فعالیت هنری برای پرستو احمدی و عوامل «کنسرت کاروانسرا» در دادگاه تجدیدنظر
5 منبع
چشمانداز WEF
نظرسنجی اقتصاددانان ارشد مجمع جهانی اقتصاد: پیشبینی ثبات اقتصاد جهانی در سایه شکافهای منطقهای و فشارهای هوش مصنوعی
7 منبع
جداول توافقی
چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموعهای حاشیهای تقسیم بر مجموع کل به دست میآید
6 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





