رفتن به محتوای اصلی
توضیح کوهستانروش‌شناسی نظرسنجیتوضیح و تحلیل۱۱ شهریور ۱۴۰۵، ۹:۲۸· 5 دقیقه مطالعه· در تحلیل داده

مکانیک رگرسیون چندسطحی و پساطبقه‌بندی: چگونه نظرسنج‌ها بدون نمونه‌های نماینده، انتخابات را پیش‌بینی می‌کنند

در حالی که نظرسنجی‌های سنتی تلفنی در حال فروپاشی هستند، آمارشناسان از روش یادگیری ماشینی به نام MRP (رگرسیون چندسطحی و پساطبقه‌بندی) استفاده می‌کنند تا پیش‌بینی‌های ملی بسیار دقیقی را از داده‌های اینترنتی داوطلبانه و به شدت سوگیرانه استخراج کنند.

به قلم الوین شادمهر

آمارشناسان بیزی 40%روش‌شناسان نظرسنجی 35%نظرسنج‌های سنتی 25%
آمارشناسان بیزی
استدلال می‌کنند که استخرسازی جزئی MRP تنها راهکار ریاضی معتبر برای استخراج سیگنال‌های دقیق از نمونه‌های پر سر و صدای غیر احتمالی و در دسترس است.
روش‌شناسان نظرسنجی
MRP را به دلیل کاهش برتر سوگیری در زیرگروه‌های کوچک ارج می‌نهند، اما نسبت به اتکای آن به مفروضات مدل‌سازی پیچیده و مبهم هشدار می‌دهند.
نظرسنج‌های سنتی
هشدار می‌دهند که کنار گذاشتن نمونه‌گیری احتمالی به نفع مدل‌سازی الگوریتمی، در صورت حذف متغیرهای پنهان، خطر شکست‌های فاجعه‌بار در پیش‌بینی را به همراه دارد.

چرا مهم است

زیربنای ریاضی نظرسنجی‌های سنتی همزمان با کاهش نرخ پاسخگویی از بین رفته است. این بدان معناست که پیش‌بینی‌هایی که کمپین‌های سیاسی، سیاست‌های اقتصادی و روایت‌های رسانه‌ای را هدایت می‌کنند، اکنون به جای جمع‌آوری داده‌های خام، کاملاً متکی بر مدل‌سازی الگوریتمی پیشرفته هستند.

نظرسنجی احتمالی سنتی با یک بحران وجودی روبرو است. از آنجایی که نرخ پاسخگویی برای شماره‌گیری تصادفی تلفنی به زیر ۱٪ سقوط کرده است، اساس ریاضی تحقیقات نظرسنجی – این ایده که هر شهروندی شانس برابری برای تماس دارد – عملاً فروپاشیده است. با این حال، با وجود اتکا به پنل‌های اینترنتی داوطلبانه و بسیار غیرنماینده، نظرسنج‌های مدرن به نحوی در حال تولید پیش‌بینی‌های بسیار دقیق و جزئی برای انتخابات ملی و سیاست‌های زیرملی هستند. این تضاد بین کاهش کیفیت داده‌ها و بهبود دقت پیش‌بینی، یکی از مهم‌ترین پارادوکس‌های آمار مدرن را نشان می‌دهد.[6]

راه حل این پارادوکس در یک تغییر اساسی در نحوه پردازش داده‌های نظرسنجی نهفته است. صنعت نظرسنجی بی‌سروصدا از پارادایم «جمع‌آوری داده» به پارادایم «مدل‌سازی داده» منتقل شده است. موتور محرک این تحول، یک تکنیک آماری به نام رگرسیون چندسطحی و پساطبقه‌بندی (MRP) است که به محققان اجازه می‌دهد یک نمونه سوگیرانه از کاربران اینترنت را گرفته و آن را به صورت ریاضی بر روی ساختار جمعیتی واقعی یک کشور فرافکنی کنند.[1][2]

MRP فرض نمونه نماینده بودن را کنار می‌گذارد و در عوض، تحلیل نظرسنجی را به عنوان یک مشکل «داده‌های گمشده» در نظر می‌گیرد. به جای صرفاً شمارش پاسخ‌های خام یک نظرسنجی و اختصاص وزن‌های ثابت، MRP از داده‌های نظرسنجی برای آموزش یک مدل یادگیری ماشینی پیش‌بینی‌کننده استفاده می‌کند. هدف اندازه‌گیری خود نمونه نیست، بلکه کشف روابط ریاضی زمینه‌ای بین ویژگی‌های جمعیتی و افکار عمومی است.[2]

فرآیند ریاضی دو مرحله‌ای که نظرسنجی‌های مدرن MRP را به حرکت در می‌آورد.

مرحله اول این فرآیند، رگرسیون چندسطحی است. الگوریتم جمعیت هدف را به هزاران «سلول» ریزجمعیتی بسیار خاص تقسیم می‌کند؛ به عنوان مثال، زنان اسپانیایی‌تبار ۱۸ تا ۲۴ ساله دارای مدرک دانشگاهی که در یک حوزه کنگره‌ای خاص زندگی می‌کنند. از آنجایی که اکثر نظرسنجی‌های داوطلبانه حتی یک پاسخ‌دهنده مطابق با این مشخصات دقیق نخواهند داشت، یک نظرسنجی سنتی در جدول متقاطع خود یک نقطه خالی خواهد داشت.[1][2]

برای پر کردن این نقاط خالی، مدل از «استخرسازی جزئی» بیزی استفاده می‌کند. اگر الگوریتم نیاز به پیش‌بینی نظر یک سلول خاص داشته باشد اما داده مستقیمی در اختیار نداشته باشد، قدرت آماری را از گروه‌های مجاور قرض می‌گیرد. این مدل به نظرات پایه تمام زنان اسپانیایی‌تبار، تمام جوانان، و تمام ساکنان آن حوزه نگاه می‌کند و آن روندهای گسترده‌تر را در هم می‌آمیزد تا یک حدس بسیار آگاهانه و از نظر ریاضی محدود شده برای سلول خالی سنتز کند.[1][2]

مرحله دوم، پساطبقه‌بندی (Poststratification)، این پیش‌بینی‌های الگوریتمی را به واقعیت جمعیتی متصل می‌کند. هنگامی که مدل رگرسیون نظر احتمالی هر سلول کوچک را تخمین زد، این تخمین‌ها در تعداد واقعی افراد آن سلول ضرب می‌شوند، که این تعداد توسط یک سرشماری ملی با کیفیت بالا یا نظرسنجی جامعه ثبت شده است.[1][2]

مرحله دوم، پساطبقه‌بندی (Poststratification)، این پیش‌بینی‌های الگوریتمی را به واقعیت جمعیتی متصل می‌کند.

با وزن‌دهی نظرات سنتز شده در برابر شمارش جمعیت واقعی، MRP عملاً یک نمونه اینترنتی سوگیرانه و غیرنماینده را بر روی داربست جمعیتی واقعی کشور فرافکنی می‌کند. این امر به محققان اجازه می‌دهد تا تخمین‌های قابل اعتمادی برای مناطق جغرافیایی کوچک یا گروه‌های اقلیت خاص تولید کنند که اندازه‌گیری آن‌ها با استفاده از تکنیک‌های وزن‌دهی نظرسنجی سنتی از نظر ریاضی غیرممکن بود.[4][5]

شواهد تجربی نشان می‌دهد که MRP به طور قابل توجهی بهتر از روش‌های وزن‌دهی سنتی عمل می‌کند، به ویژه برای زیرگروه‌های کوچک. در یک آزمایش جامع که MRP را با «Raking» (روش استاندارد صنعت برای تنظیم وزن‌های نظرسنجی برای مطابقت با حاشیه‌های جمعیت) مقایسه کرد، محققان دریافتند که در حالی که هر دو روش دقت مشابهی در سطح ملی داشتند، MRP در حاشیه‌ها برتری داشت.[3]

آزمایش‌های تجربی، توانایی برتر MRP در اصلاح سوگیری در زیرجمعیت‌های اقلیت را نشان می‌دهند.

به عنوان مثال، هنگام تخمین رفتار رأی‌دهی بزرگسالان اسپانیایی‌تبار، مدل MRP به طور اضافی ۱۲ واحد درصد سوگیری را در مقایسه با روش سنتی Raking حذف کرد. از آنجایی که Raking متکی بر اختصاص یک وزن ثابت و واحد به هر پاسخ‌دهنده است، در اصلاح عدم تعادل‌های شدید در زیرجمعیت‌های کوچک بدون افزایش مصنوعی حاشیه خطا، دچار مشکل می‌شود. رگرسیون سلول به سلول MRP با مدل‌سازی مستقیم نتیجه، این محدودیت را به طور کامل دور می‌زند.[3]

مقیاس مدل‌های مدرن MRP نیازمند ورودی‌های داده‌ای عظیمی است که اساساً اقتصاد نظرسنجی را تغییر می‌دهد. در حالی که یک نظرسنجی تلفنی ملی سنتی ممکن است از ۱۰۰۰ نفر نظرسنجی کند، مدل‌های تجاری MRP اغلب بین ۴۰,۰۰۰ تا ۱۰۰,۰۰۰ پاسخ داوطلبانه را جذب می‌کنند. این حجم عظیم نه برای دقت ملی، بلکه برای فراهم کردن نقاط داده متنوع کافی برای مدل رگرسیون ضروری است تا بتواند تعاملات پیچیده بین ویژگی‌های جمعیتی مختلف را به دقت ترسیم کند.[6]

با وجود ظرافت ریاضی، شواهد پشتیبان MRP با محدودیت‌های سختی همراه است. دقت این تکنیک کاملاً به متغیرهای انتخاب شده توسط مدل‌ساز بستگی دارد. اگر یک متغیر پنهان – مانند «اعتماد نهادی» یا «مشارکت سیاسی» – هم احتمال شرکت یک فرد در نظرسنجی آنلاین و هم احتمال رأی دادن او به روشی خاص را هدایت کند، و آن متغیر از مدل رگرسیون حذف شود، تخمین‌های حاصله با اطمینان اشتباه خواهند بود.[3][6]

استخرسازی جزئی بیزی (Bayesian partial pooling) به MRP اجازه می‌دهد تا تخمین‌هایی را برای سلول‌های جمعیتی که هیچ پاسخ‌دهنده واقعی ندارند، سنتز کند.

علاوه بر این، MRP بر این فرض اصلی متکی است که روابط مشاهده شده در نمونه در کل جمعیت نیز صادق است. اگر تعداد انگشت‌شماری از زنان اسپانیایی‌تبار ۱۸ تا ۲۴ ساله که داوطلب شرکت در پنل اینترنتی می‌شوند، از نظر رفتار سیاسی اساساً با کسانی که شرکت نمی‌کنند متفاوت باشند، استخرسازی جزئی بیزی آن سوگیری مشاهده نشده را در کل جدول پساطبقه‌بندی منتشر خواهد کرد.[3][6]

در نهایت، MRP نشان‌دهنده یک تکامل عمیق در علم آمار است. با سنتز یادگیری ماشینی با واقعیت جمعیتی، این روش تحقیقات افکار عمومی را از فروپاشی نظرسنجی تلفنی نجات داده است و ثابت می‌کند که با قدرت محاسباتی کافی و مدل‌سازی دقیق، حتی داده‌های دارای نقص عمیق نیز می‌توانند تصویری بسیار دقیق از بدنه رأی‌دهندگان ارائه دهند.[1][2][6]

بررسی عمیق دیدگاه‌ها

آمارشناسان بیزی

استدلال می‌کنند که استخرسازی جزئی MRP تنها راهکار ریاضی معتبر برای استخراج سیگنال‌های دقیق از نمونه‌های پر سر و صدای غیر احتمالی و در دسترس است.

برای آمارشناسانی که در چارچوب بیزی فعالیت می‌کنند، فروپاشی شماره‌گیری تصادفی تلفنی یک بحران نیست، بلکه فرصتی برای به کارگیری ریاضیات دقیق‌تر است. آن‌ها استدلال می‌کنند که نمونه‌گیری احتمالی سنتی همیشه حاوی سوگیری‌های پنهان بوده است و MRP صرفاً محققان را مجبور می‌کند تا مفروضات خود را صریح سازند. با استفاده از استخرسازی جزئی، مدل به صورت ریاضی عدم قطعیت خود را می‌پذیرد و تخمین‌های غیرعادی ناشی از اندازه‌های نمونه کوچک را به سمت میانگین جمعیت بازمی‌گرداند. این «انقباض» ریاضی از واکنش بیش از حد مدل به نویز آماری جلوگیری می‌کند و تضمین می‌کند که تخمین‌های نهایی به جای ویژگی‌های عجیب چند پاسخ‌دهنده ناهنجار، بر اساس رفتار گسترده‌تر بدنه رأی‌دهندگان استوار باشند.

روش‌شناسان نظرسنجی

MRP را به دلیل کاهش برتر سوگیری در زیرگروه‌های کوچک ارج می‌نهند، اما نسبت به اتکای آن به مفروضات مدل‌سازی پیچیده و مبهم هشدار می‌دهند.

روش‌شناسان اذعان دارند که MRP ابزاری قدرتمند است، به ویژه هنگام تلاش برای اندازه‌گیری نظرات گروه‌های اقلیت یا مناطق جغرافیایی کوچکی که نظرسنجی سنتی آن‌ها را نادیده می‌گیرد. با این حال، آن‌ها تأکید می‌کنند که این تکنیک به شدت به مشخصات مدل حساس است. اگر محققی نتواند یک متغیر حیاتی را در رگرسیون بگنجاند – مانند یک معیار خاص از مشارکت سیاسی یا اعتماد نهادی – مدل با اطمینان یک تخمین سوگیرانه را در کل جمعیت فرافکنی خواهد کرد. آن‌ها خواستار شفافیت دقیق در نحوه ساخت این مدل‌ها هستند و هشدار می‌دهند که پیچیدگی MRP می‌تواند به راحتی نقص‌های اساسی در داده‌های زیربنایی را پنهان کند.

نظرسنج‌های سنتی

هشدار می‌دهند که کنار گذاشتن نمونه‌گیری احتمالی به نفع مدل‌سازی الگوریتمی، در صورت حذف متغیرهای پنهان، خطر شکست‌های فاجعه‌بار در پیش‌بینی را به همراه دارد.

کهنه‌کاران صنعت نظرسنجی نسبت به تغییر کامل به سمت پنل‌های اینترنتی داوطلبانه و سنتز الگوریتمی، تردیدهای عمیقی ابراز می‌کنند. آن‌ها استدلال می‌کنند که نمونه‌گیری احتمالی، با وجود کاهش نرخ پاسخگویی، تنها روشی است که پیوند ریاضی بین نمونه و جمعیت را تضمین می‌کند. از این منظر، MRP یک چسب زخم پیچیده است که تخریب اساسی داده‌های نظرسنجی را پنهن می‌کند. آن‌ها هشدار می‌دهند که اتکا به یادگیری ماشینی برای سنتز «پاسخ‌دهندگان مجازی» برای سلول‌های جمعیتی خالی، توهم خطرناکی از دقت ایجاد می‌کند و در صورت عدم موفقیت الگوریتم‌ها در ثبت تغییرات ناگهانی در رفتار رأی‌دهندگان که خارج از الگوهای تاریخی قرار می‌گیرند، خطر خطاهای فاجعه‌بار نظرسنجی وجود دارد.

نکات کلیدی

  • نظرسنجی احتمالی سنتی به دلیل کاهش شدید نرخ پاسخگویی در حال شکست است و این امر، تغییر به سمت تکنیک‌های مدل‌سازی داده را ضروری کرده است.
  • MRP از رگرسیون چندسطحی بیزی برای پیش‌بینی افکار عمومی در هزاران سلول جمعیتی بسیار خاص استفاده می‌کند.
  • این مدل قدرت آماری را از گروه‌های جمعیتی مجاور قرض می‌گیرد تا نظرات مربوط به سلول‌هایی که هیچ پاسخ‌دهنده واقعی ندارند را تخمین بزند.
  • پساطبقه‌بندی (Poststratification) این پیش‌بینی‌های الگوریتمی را در برابر داده‌های واقعی سرشماری وزن‌دهی می‌کند تا یک پیش‌بینی ملی ارائه دهد.
  • آزمایش‌های تجربی نشان می‌دهند که MRP در تخمین رفتار زیرگروه‌های اقلیت، به طور قابل توجهی بهتر از روش‌های وزن‌دهی سنتی عمل می‌کند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

آمارشناسان بیزی 40%روش‌شناسان نظرسنجی 35%نظرسنج‌های سنتی 25%
  1. [1]Wikipediaنظرسنج‌های سنتی

    Multilevel regression with poststratification

    مطالعه در Wikipedia
  2. [2]Bookdownآمارشناسان بیزی

    Chapter 1 Introduction to MRP

    مطالعه در Bookdown
  3. [3]Pew Research Centerروش‌شناسان نظرسنجی

    Comparing MRP to raking for online opt-in polls

    مطالعه در Pew Research Center
  4. [4]arXivآمارشناسان بیزی

    Correcting socioeconomic bias in mobile phone mobility estimates using multilevel regression and poststratification

    مطالعه در arXiv
  5. [5]arXivآمارشناسان بیزی

    Multilevel Regression and Poststratification Interface

    مطالعه در arXiv
  6. [6]تیم سردبیری کوهستانروش‌شناسان نظرسنجی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.