چگونه فرض SUTVA از نابودی استنتاج علی توسط تداخل شبکهای در چارچوب پیامدهای بالقوه جلوگیری میکند
پایه و اساس ریاضی استنتاج علی نیازمند «فرض ثبات ارزش تیمار واحد» (SUTVA) است تا تضمین کند که قرار گرفتن یک سوژه در معرض تیمار، پیامد سوژه دیگر را تغییر نمیدهد.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
- آماردانان کلاسیک
- فرض SUTVA را به عنوان یک الزام باینری سختگیرانه میبینند که باید از طریق طراحی دقیق آزمایش و ایزولهسازی فیزیکی برآورده شود.
- دانشمندان داده صنعت فناوری
- نقض SUTVA را به عنوان یک واقعیت اجتنابناپذیر پلتفرمهای شبکهای در نظر میگیرند که نیازمند راهحلهای الگوریتمی مانند تصادفیسازی خوشهای است.
- نظریهپردازان استنتاج علی
- بر توسعه چارچوبهای ریاضی جدیدی تمرکز دارند که میتوانند در صورت نقض جزئی SUTVA، سوگیری را کمّی کرده و محدود کنند.
دیدگاههایی که این گزارش پوشش نداده
- اقتصادسنجیدانانی که از مدلهای ساختاری استفاده میکنند
چرا مهم است
بدون فرض SUTVA، تستهای استاندارد A/B در شبکههای اجتماعی یا بازارهای دوطرفه نتایج نامعتبر ریاضی تولید میکنند و سازمانها را به سمت اجرای تغییراتی سوق میدهند که در واقع ارزشآفرین نیستند و به سیستم ضربه میزنند.
نکات کلیدی
- مسئله بنیادین استنتاج علی بیان میکند که ما هرگز نمیتوانیم یک واحد منفرد را در هر دو حالت تیمارشده و تیمارنشده به طور همزمان مشاهده کنیم.
- چارچوب پیامدهای بالقوه این دادههای گمشده را با مقایسه میانگینها در گروههای تصادفیشده تخمین میزند.
- فرض SUTVA ایجاب میکند که واحدها با یکدیگر تداخل نداشته باشند و تیمار برای همه کسانی که آن را دریافت میکنند کاملاً یکسان باشد.
- شبکههای اجتماعی و بازارهای دوطرفه به طور طبیعی SUTVA را نقض میکنند زیرا تیمار یک کاربر، محیط را برای دیگران تغییر میدهد.
- علم داده مدرن از تصادفیسازی خوشهای و طراحیهای دوگانه برای ایزوله کردن تداخل و حفظ اعتبار آماری استفاده میکند.
مدیران محصول و تحلیلگران داده تازهکار معمولاً ادعا میکنند که مقایسه مستقیم یک گروه تیمار (Treated) با یک گروه کنترل (Control)، تأثیر واقعی یک ویژگی جدید را میسنجد. با این حال، پایه و اساس ریاضی استنتاج علی ثابت میکند که اگر تیمار یک کاربر رفتار کاربر دیگری را تغییر دهد، این رویکرد استاندارد تست A/B کاملاً فرو میپاشد. وقتی یک اپلیکیشن تاکسی اینترنتی الگوریتم جدیدی را روی نیمی از رانندگان خود آزمایش میکند، رانندگان گروه تیمار سفرهایی را از چنگ گروه کنترل درمیآورند و خط پایه (Baseline) را نابود میکنند. شواهد نشان میدهد که بدون ایزولهسازی دقیق، تفاوت بین این دو گروه صرفاً همخواری شبکهای (Network Cannibalization) را اندازه میگیرد، نه اثر علی را.
این شکست از چیزی نشأت میگیرد که پل هالند (Paul Holland)، آماردان، در سال ۱۹۸۶ رسماً آن را «مسئله بنیادین استنتاج علی» نامید. همانطور که در فصلی از کتاب درسی IntechOpen در سال ۲۰۲۲ آمده است: «مسئله بنیادین استنتاج علی این است که مشاهده همزمان هر دو پیامد بالقوه برای یک فرد غیرممکن است.» یک بیمار یا دارو را دریافت میکند یا نمیکند؛ یک کاربر یا رابط کاربری جدید را میبیند یا قدیمی را. ما هرگز نمیتوانیم واکنش دقیق بیولوژیکی یا رفتاری آنها را به سناریوی مخالف در همان لحظه اندازه بگیریم.[3]
برای عبور از این عدم امکان، آماردانان به چارچوب «پیامدهای بالقوه» (Potential Outcomes) تکیه میکنند که توسط دونالد روبین (Donald Rubin) در سال ۱۹۷۴ فرمولبندی شد. این چارچوب فرض میکند که هر واحد دو حالت نظری دارد: Y(1) در صورت قرار گرفتن در معرض تیمار، و Y(0) در غیر این صورت. اثر علی واقعی، صرفاً تفاوت بین این دو است. از آنجا که ما تنها میتوانیم یک حالت را برای هر واحد مشاهده کنیم، دادههای خلافواقع (Counterfactual) گمشده را با میانگینگیری پیامدها در یک گروه کنترل تصادفی بزرگ تخمین میزنیم، با این فرض که گروهها قبل از مداخله از نظر آماری کاملاً یکسان بودهاند.[1]
اما این ریاضیات میانگینگیری تنها در صورتی کار میکند که یک شرط حیاتی و اغلب نادیدهگرفتهشده برقرار باشد: «فرض ثبات ارزش تیمار واحد» یا SUTVA. این فرض که در سال ۱۹۸۰ توسط روبین نامگذاری شد، ستون باربر کل این چارچوب است. وبلاگ Social Science Statistics در سال ۲۰۰۶ نوشت که «SUTVA فرضی است که اغلب به صورت ضمنی در نظر گرفته میشود»، با این حال نقض آن سالانه میلیونها دلار در تحقیقات شرکتی و پزشکی را با آلوده کردن گروه کنترل، در سکوت بیاعتبار میکند.[2]
فرض SUTVA نیازمند دو تضمین ریاضی مجزا است. اولین مورد «عدم تداخل» است. طبق برنامه درسی STA 640 دانشگاه دوک، این بدان معناست که «پیامدهای بالقوه هر واحد با تیمارهای اختصاصیافته به سایر واحدها تغییر نمیکند.» اگر تزریق واکسن به شخص الف، احتمال ابتلای شخص ب به ویروس را کاهش دهد، تیمار شخص الف پیامد بالقوه شخص ب را تغییر داده است. واحدها در حال تداخل با یکدیگر هستند و نرخ عفونت گروه کنترل دیگر نشاندهنده خط پایه واقعی بدون تیمار نیست.
واحدها در حال تداخل با یکدیگر هستند و نرخ عفونت گروه کنترل دیگر نشاندهنده خط پایه واقعی بدون تیمار نیست.
در اپیدمیولوژی، این تداخل «ایمنی گلهای» نامیده میشود. در بخش فناوری، به آن «اثر شبکهای» میگویند. اگر یک پلتفرم رسانه اجتماعی ویژگی جدید اشتراکگذاری را روی ۱۰,۰۰۰ کاربر آزمایش کند، آن کاربران ناگزیر محتوا را برای کاربران گروه کنترل ارسال خواهند کرد. گروه کنترل دیگر یک خط پایه خالص نیست؛ آنها به طور غیرمستقیم توسط آزمایش تیمار شدهاند. دادههای بهدستآمده به طور سیستماتیک اندازه اثر واقعی ویژگی را کمتر یا بیشتر از حد واقعی تخمین میزنند و مقدار p (p-value) را بیمعنی میکنند.[1]
دومین تضمین مورد نیاز SUTVA این است که هیچ تنوع پنهانی در تیمار وجود نداشته باشد. اگر مطالعهای تأثیر «جراحی» را بر درد مفاصل ارزیابی کند، اما برخی از بیماران یک روش کمتهاجمی دریافت کنند در حالی که دیگران جراحی باز شوند، تیمار یکنواخت نیست. فرض SUTVA ایجاب میکند که تیمار اعمالشده بر یک واحد از نظر ریاضی با تیمار اعمالشده بر واحد دیگر کاملاً یکسان باشد، تا اطمینان حاصل شود که Y(1) در کل مجموعه داده دقیقاً به یک معناست.[3]
وقتی محققان این شرط دوم را نادیده میگیرند، خطای اندازهگیری شدیدی را وارد میکنند. بررسی سال ۲۰۲۲ چارچوبهای استنتاج علی منتشر شده در arXiv تأکید میکند که تعریف بیش از حد کلی تیمار، مکانیسم واقعی اثر را پنهان میکند. اگر دوز، روش تحویل یا زمانبندی متفاوت باشد، متغیر دیگر نشاندهنده یک پیامد واحد و پایدار نیست و میانگین اثر تیمار به یک معیار ترکیبی از مداخلات کاملاً متفاوت تبدیل میشود.[1]
صنعت فناوری در دهه گذشته زمان زیادی را صرف مهندسی راهحلهایی برای نقض SUTVA، بهویژه مشکل تداخل کرده است. از آنجا که تستهای استاندارد A/B در بازارهای دوطرفه مانند اوبر (Uber) یا ایربیانبی (Airbnb) با شکست مواجه میشوند، دانشمندان داده از «تصادفیسازی خوشهای» (Cluster Randomization) استفاده میکنند. آنها به جای تصادفیسازی کاربران فردی، کل شهرها یا بلوکهای زمانی را تصادفی میکنند. با تیمار کردن کل شیکاگو و نگه داشتن کل بوستون به عنوان کنترل، آنها تداخل را درون خوشه تیمارشده ایزوله کرده و یکپارچگی مقایسه را حفظ میکنند.[1]
رویکرد مدرن دیگر، طراحی آزمایش دوگانه (Bipartite) است که سمتی از بازار که تیمار میشود را از سمتی که اندازهگیری میشود جدا میکند. اگر آزمایشی نحوه مشاهده نتایج جستجو توسط خریداران را تغییر دهد، محققان تأثیر آن را بر فروشندگان اندازهگیری میکنند تا اطمینان حاصل کنند که تداخل خریداران با یکدیگر، معیارهای پیامد فروشندگان را آلوده نمیکند. این جداسازی ساختاری، SUTVA را به طور مصنوعی در محیطهایی که در غیر این صورت به طور طبیعی با شکست مواجه میشد، اعمال میکند.[1]
با وجود این راهحلها، SUTVA همچنان یک فرض غیرقابلآزمون است. هیچ آزمون آماری نمیتواند پس از پایان آزمایش به طور قطعی ثابت کند که تداخل صفر بوده است. محققان باید برای توجیه این فرض پیش از شروع آزمایش، به دانش دامنه و مدلهای علی ساختاری تکیه کنند. اگر مکانیسم فیزیکی یا اجتماعی اجازه سرریز (Spillover) را بدهد، ریاضیات چارچوب پیامدهای بالقوه نمیتواند به طور جادویی آن را از مجموعه داده پاک کند.[2]
مرزهای استنتاج علی اکنون بر محدود کردن خطا در زمانی که مشخص است SUTVA نقض شده، متمرکز است. آماردانان به جای کنار گذاشتن کامل چارچوب پیامدهای بالقوه، در حال توسعه مدلهایی هستند که اندازه دقیق سرریز شبکهای را کمّی میکنند. با اندازهگیری میزان تداخل، محققان میتوانند طیفی از اثرات علی محتمل را محاسبه کنند و در ازای صداقت ریاضی درباره محدودیتهای دادههایشان، حاشیه خطای وسیعتری را بپذیرند.[1][4]
بررسی عمیق دیدگاهها
آماردانان کلاسیک
فرض SUTVA را به عنوان یک الزام باینری سختگیرانه میبینند که باید از طریق طراحی دقیق آزمایش برآورده شود.
در آمار کلاسیک و کارآزماییهای بالینی، SUTVA به عنوان یک محدودیت فیزیکی سخت در نظر گرفته میشود. اگر طراحی یک کارآزمایی به بیماران اجازه دهد داروهای خود را به اشتراک بگذارند یا یک جراح تکنیک خود را در اواسط مطالعه تغییر دهد، دادههای بهدستآمده اساساً مخدوش تلقی میشوند. این دیدگاه استدلال میکند که تعدیلهای آماری نمیتوانند آزمایشی را که در آن فرض پایه ایزولهسازی و تیمار یکنواخت نقض شده است نجات دهند، و در عوض میطلبد که محققان پارامترهای فیزیکی مطالعه را برای اعمال ایزولهسازی از نو طراحی کنند.
دانشمندان داده صنعت فناوری
نقض SUTVA را به عنوان یک واقعیت اجتنابناپذیر پلتفرمهای شبکهای در نظر میگیرند که نیازمند راهحلهای الگوریتمی است.
برای دانشمندان داده که در شرکتهایی مانند اوبر، ایربیانبی یا متا کار میکنند، رعایت دقیق SUTVA غیرممکن است. هر کاربر به کاربران دیگر متصل است، به این معنی که هر تغییر معنادار در محصول به گروه کنترل سرریز خواهد کرد. این گروه به جای کنار گذاشتن تست A/B، به طراحیهای آزمایشی پیشرفتهای متکی هستند - مانند تستهای متناوب (Switchback) که در آن یک شهر کامل در بلوکهای زمانی بین تیمار و کنترل جابهجا میشود - تا تداخل را به طور مصنوعی محصور کرده و سیگنال علی را نجات دهند.
نظریهپردازان استنتاج علی
بر توسعه چارچوبهای ریاضی جدیدی تمرکز دارند که میتوانند در صورت نقض جزئی SUTVA، سوگیری را کمّی کرده و محدود کنند.
مرزهای آکادمیک استنتاج علی اذعان دارد که نگاه باینری به SUTVA برای مجموعهدادههای مدرن بیش از حد محدودکننده است. نظریهپردازان در حال توسعه مدلهایی از «تداخل جزئی» هستند که فرض میکنند اثرات سرریز وجود دارند اما در طول فاصله شبکهای کاهش مییابند. با نقشهبرداری از توپولوژی دقیق یک شبکه اجتماعی، این محققان تلاش میکنند سوگیری ریاضی دقیقی را که توسط تداخل ایجاد شده محاسبه کنند، و به آنها اجازه میدهد تا محدوده مشخصی را برای اثر علی واقعی تخمین بزنند، حتی زمانی که گروه کنترل آلوده شده باشد.
منابع
[1]arXivنظریهپردازان استنتاج علیA Survey of Causal Inference Frameworks
مطالعه در arXiv →
[2]تیم سردبیری کوهستاندانشمندان داده صنعت فناوریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[3]IntechOpenآماردانان کلاسیک2 Causal Inference: Theory and Basic Concepts
مطالعه در IntechOpen →
[4]تیم سردبیری کوهستاندانشمندان داده صنعت فناوریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





