چرا وزنهای اسمی تاثیر واقعی شاخصها را در رتبهبندیهای ترکیبی مخدوش میکنند؟
طراحان شاخصها درصدهای مشخصی را بهعنوان وزن هر سنجه تعیین میکنند تا میزان اهمیت آن را در نمره نهایی مشخص سازند. با این حال، واریانس آماری و همخطی معمولاً این اهداف را بیاثر میکنند و باعث میشوند متغیرهایی با همبستگی بالا بر وزن موثر رتبهبندی مسلط شوند.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- وزنهای اسمی تنها بازتابدهنده نیت طراح شاخص هستند، در حالی که وزنهای موثر نفوذ آماری واقعی را تعیین میکنند.
- سنجههای با واریانس اندک مانند عدد ثابت عمل میکنند و صرفنظر از وزن تعیینشده، اثر خود را در رتبهبندی از دست میدهند.
- متغیرهای دارای همبستگی شدید اثر یکدیگر را از طریق کوواریانس چندبرابر میکنند و شاخص را به سنجهای برای یک عامل مسلط منفرد بدل میسازند.
طراحان شاخصها — از رتبهبندی دانشگاهها گرفته تا تحلیلگران محیطزیست — هنگام ساخت یک نمره ترکیبی، سهم و وزن تکتک سنجهها را تعیین میکنند. آنها درصدی اسمی در نظر میگیرند، روششناسی را منتشر میکنند و فرمول محاسباتی را برای آن دوره تثبیت مینمایند.
اما محاسبات ادغام دادهها فوراً این قواعد اولیه را دستخوش تغییر میکند. درست از لحظهای که چند جریان داده با یکدیگر ترکیب میشوند و به عددی واحد تبدیل میگردند، وزنهای اعلامشده دیگر حاکم بر میزان تاثیرگذاری واقعی هر سنجه بر رتبهبندی نهایی نیستند.
در عوض، سازوکاری پنهان زمام امور را در دست میگیرد: قدرت واقعی یک سنجه توسط واریانس آن و کوواریانس آن با سایر متغیرهای مدل تعیین میشود؛ حقیقتی آماری که میتواند وزن اسمی ۵۰ درصدی را بهسادگی به پارازیت آماریِ عملاً بیاثر تبدیل کند.
توهم درصدهای اعلامشده
برای درک چراییِ شکست یک رتبهبندی، تحلیلگران باید به نحوه ساخت آن دقت کنند. بیشتر شاخصهای ترکیبی متکی به ادغام جمعی خطی هستند؛ به این معنا که سنجههای استانداردشده در وزن تعیینشده ضرب شده و با یکدیگر جمع میشوند.[5]
سازمان همکاری و توسعه اقتصادی (OECD) و مرکز تحقیقات مشترک کمیسیون اروپا (JRC) در اسناد متعدد، نقایص این رویکرد را ثبت کردهاند. کتابچه راهنمای روششناختی مشترک آنها در سال ۲۰۰۸ هشدار میدهد که وزنهای اسمی صرفاً بازتابدهنده نیت طراح هستند و ربطی به واقعیت آماری ندارند.[3][4]
راهنمای OECD میگوید: «وزنهای اختصاصیافته به متغیرهای گوناگون در یک شاخص ترکیبی لزوماً منعکسکننده سهم واقعی این متغیرها در واریانس شاخص نهایی نیست.» در علم آمار، به این سهم واقعی «وزن موثر» میگویند.[4]
هنگامی که یک نظام رتبهبندی دانشگاهی ادعا میکند نسبت استاد به دانشجو ۲۰ درصد نمره دانشگاه را تشکیل میدهد، در واقع وزنی اسمی را اعلام کرده است. حال اگر نسبت مذکور در تمامی دانشگاههای مورد ارزیابی تقریباً یکسان باشد، وزن موثر این سنجه فارغ از فرمول اعلامشده، به نزدیکی صفر سقوط میکند.
واریانس چگونه قدرت رایدهی را تعیین میکند
نخستین انحراف ریاضی از ناحیه واریانس وارد میشود؛ سنجهای که میزان پراکندگی نقاط داده حول میانگین را اندازه میگیرد. در شاخصهای ترکیبی، واریانس عملاً ارز رایجِ تاثیرگذاری آماری است.[4]
سنجهای که واریانس و تنوع نداشته باشد، توانایی تمایز بخشیدن میان سوژهها را از دست میدهد. آزمون استخدامی را در نظر بگیرید که در آن تمامی داوطلبان در بخش ارزیابی فنی نمره ۹۵ میگیرند، اما نمرات مصاحبه رفتاری بین ۴۰ تا ۹۰ پراکنده است.
حتی اگر کمیته استخدام وزن آزمون فنی را ۸۰ درصد و مصاحبه را ۲۰ درصد تعیین کرده باشد، این مصاحبه رفتاری است که رتبهبندی نهایی را شکل میدهد. نمره فنی مانند یک عدد ثابت عمل میکند که مقداری یکنواخت به همه میافزاید، بدون اینکه جایگاه نسبی افراد را جابهجا کند.
اصول انجمن روانشناسی آمریکا در گزینش پرسنل دقیقاً درباره این دام هشدار میدهد. هنگام ترکیب رویههای مختلف ارزیابی، واریانس مولفهها باید تحلیل شود تا وزن مدنظر با نتایج واقعی سازگار بماند.[7]
آماردانان برای رفع این مشکل، دادهها را پیش از وزندهی استانداردسازی میکنند — معمولاً با تبدیل دادههای خام به نمرات z. این کار سنجهها را وادار میکند دارای میانگین صفر و واریانس یک شوند تا از نظر تئوری پیش از اِعمال وزنها در جایگاهی برابر قرار گیرند.[3]
اثر فزاینده کوواریانس
اما استانداردسازی تنها نیمی از مشکل را حل میکند. انحراف دوم که بهمراتب زیرپوستیتر است، از کوواریانس سرچشمه میگیرد؛ سنجهای که نحوه تغییرات همزمان دو متغیر در کل دادهها را میسنجد.[4]
اگر یک شاخص پنج سنجه گوناگون داشته باشد که همگی بازتابدهنده جنبههای متفاوتی از یک خصلت پایهای واحد باشند — مثلاً متغیر ثروت در رتبهبندی شهرداریها — آن سنجهها همبستگی بالایی خواهند داشت، همگام با هم حرکت میکنند و اثر متقابل را تقویت مینمایند.
فرمول ریاضی واریانسِ یک مجموع، صرفاً مجموع واریانسها نیست؛ بلکه برابر با مجموع واریانسها بهعلاوه دو برابر مجموع کلیه کوواریانسهای میان متغیرها است، که به شکل تصاعدی اثر فزاینده ایجاد میکند.[4]
در مجموعهدادهای با همبستگی بالا، جملات کوواریانس بسیار بزرگتر از جملات واریانس هستند. مطالعهای در سال ۲۰۱۳ در Journal of the Royal Statistical Society نشان داد در بسیاری از شاخصهای شناختهشده، کوواریانس عامل بخش عمده واریانس نمره نهایی است.[1]
این پدیده اثری چندبرابری ایجاد میکند. سنجهای که با چند سنجه پروزن دیگر همبستگی بالایی دارد، با بادکنکی شدن وزن موثرش روبهرو میشود؛ پدیدهای که شاخص را از درون مصادره کرده و درصد اعلامشده طراح را بیاثر میسازد.[1][5]
سنجش نفوذ آماری واقعی
برای پی بردن به آنچه یک شاخص واقعاً اندازه میگیرد، آماردانان از تحلیل حساسیت مبتنی بر واریانس استفاده میکنند. این فرایند رتبهبندی را کالبدشکافی میکند تا معین شود کدام ورودیها محرک اصلی اختلاف میان گزینههای رتبهبندیشده هستند.[3]
کتابچه راهنمای JRC محاسبه ضریب همبستگی پیرسون یا استفاده از شاخصهای سوبول (Sobol) را برای کمیسازی وزن موثر هر مولفه توصیه میکند. این ابزارها سهم دقیق هر سنجه را از کل واریانس آشکار میسازند.[3]
پژوهشگرانی که نتایج خود را در سال ۲۰۱۷ در PubMed Central منتشر کردند، این تکنیکها را روی شاخصهای بهداشت عمومی پیاده کرده و به تناقضهای چشمگیری رسیدند. در مواردی، سنجههایی با وزن اسمی ۱۰ درصد، بهدلیل همخطی، عملاً ۴۰ درصد نتایج رتبهبندی را تعیین میکردند.[2]
شکاف میان وزن اسمی و موثر میتواند چنان عمیق شود که شاخص ترکیبی خروجی متفاوتی نسبت به ساختار نظری اولیه خود نشان دهد. از این رو، پژوهشگران تاکید دارند که طراحان باید همواره وزنهای موثر را در کنار متدولوژی خود گزارش کنند.[2][5]
ناکارآمدی ادغام خطی
ریشه این معضل در پیشفرض جبرانپذیری کامل سنجهها نهفته است. در روش ادغام جمعی خطی این فرض ضمنی وجود دارد که نمره فاجعهبار در یک بخش، تا زمانی که وزنها اجازه دهند، با نمرهای درخشان در بخشی دیگر قابل جبران است.[5]
مروری پژوهشی در سال ۲۰۱۷ در Social Indicators Research تاکید کرد این ویژگی جبرانپذیری اغلب از لحاظ نظری فاقد توجیه است؛ اگر یک شاخص محیطزیستی اجازه دهد رشد اقتصادی بالا آلودگی وخیم آب را کاملاً جبران کند، بحرانهای زیربنایی پنهان میمانند.[5]
هنگامی که متغیرها همبستگی بالایی دارند، این جبران بهصورت خودکار و نامرئی رخ میدهد. در نتیجه شاخص به جای ارزیابی متوازن ابعاد مختلف، به سنجهای برای سنجش عامل مسلط پنهان — اغلب ثروت یا مقیاس — تقلیل مییابد.[1]
راهنمای فنی آزمون استاندارد ACT برای رفع این موضوع، همبستگیهای متقابل میان زیرآزمونها را دقیق ارزیابی میکند تا اطمینان حاصل شود نمره کلی ترکیبی، نشاندهنده آمادگی تحصیلی جامع است نه اینکه تنها به تسلط یک توانایی شناختی خاص محدود بماند.[8]
مهندسی شاخصی منطبق بر موازین ریاضی
مهار این اعوجاجها مستلزم آن است که طراحان شاخص، سادگی وسوسهانگیز وزنهای اسمی را کنار بگذارند. یک راهکار موثر، بهرهگیری از ادغام هندسی است که مولفهها را بهجای جمع کردن در هم ضرب میکند و نحوه تعامل میان آنها را دگرگون میسازد.[4][5]
ادغام هندسی قابلیت جبرانپذیری را محدود میکند. نمرهای نزدیک به صفر در یک سنجه حیاتی، فارغ از نمرات درخشان بخشهای دیگر، حاصلضرب کل را پایین میکشد و رتبهبندی را وادار میکند وزن متمایز هر بخش را لحاظ کند.[4][5]
روش دیگر، متعامدسازی دادههاست. آماردانان میتوانند با تحلیل مولفههای اصلی (PCA)، متغیرهای دارای همبستگی را پیش از اعمال وزنها به متغیرهایی ناهمبسته بدل سازند تا ضریب فزاینده کوواریانس خنثی شود.[6]
آماردانان میتوانند با تحلیل مولفههای اصلی (PCA)، متغیرهای دارای همبستگی را پیش از اعمال وزنها به متغیرهایی ناهمبسته بدل سازند تا ضریب فزاینده کوواریانس خنثی شود.
در نهایت، میتوان از تنظیم مکرر وزنها استفاده کرد. با اجرای آزمونهای تحلیل حساسیت روی پیشنویس شاخص، طراحان میتوانند وزنهای اسمی را آنقدر تعدیل کنند تا وزنهای موثر حاصلشده دقیقاً با چارچوب اولیه منطبق گردند.[3]
تا زمانی که چنین روشهایی همهگیر نشوند، درصدهای رسمی درجشده در مستندات رتبهبندیها نقشی تزئینی خواهند داشت. اولویتهای پنهان هر رتبهبندی در ماتریس کوواریانس آن کدگذاری شده است، نه در متون روابط عمومی و تبلیغات آن.
این تحلیل چگونه انجام شد
- روش
- مقایسه تطبیقی چارچوبهای ریاضی وزن موثر در کتابچه OECD و متدولوژی JRC، و تفکیک فرمولهای واریانس-کوواریانس که تبیینکننده واگرایی وزنهای اسمی از تاثیر واقعی در شاخصهای ترکیبی هستند.
- یافته
- میزان انحراف میان وزن اعلامشده یک سنجه و تاثیر واقعی آن بهصورت غیرخطی با همبستگی آن با سایر سنجهها رشد میکند؛ مسئلهای که وزنهای اسمی را در شاخصهای با همخطی بالا نظیر رتبهبندیهای دانشگاهی یا معیارهای پایداری (ESG) از حیز انتفاع ساقط میسازد.
- دادههایی که بر پایهٔ آنها کار کردیم
- فرمول واریانس شاخصهای ترکیبی OECD: Variance of index = sum of weighted variances + sum of weighted covariances — OECD
- چارچوب تحلیل حساسیت مرکز تحقیقات مشترک (JRC): Variance-based sensitivity measures (Sobol indices) — European Commission Joint Research Centre
- محدودیتهای این تحلیل
- این تحلیل ریاضی عمدتاً بر ادغامهای جمعی خطی صدق میکند؛ الگوهای ادغام هندسی یا غیرخطی رفتارهای انحرافی متفاوتی بروز میدهند که در مدل واریانس فعلی بازتاب نیافته است.
اصطلاحات کلیدی
- وزن اسمی (Nominal Weight)
- درصد یا ضریب اعلامشدهای که طراح شاخص برای نشان دادن میزان اهمیت فرضی یک سنجه در نظر میگیرد.
- وزن موثر (Effective Weight)
- سهم واقعی یک سنجه از کل واریانس نمره نهایی پس از اعمال اندرکنشها و اثرات آماری.
- کوواریانس (Covariance)
- شاخص آماری جهت همبستگی دو متغیر؛ کوواریانس مثبت نشان میدهد دادهها همگام با هم صعودی یا نزولی میشوند.
- همخطی (Collinearity)
- شرایطی که در آن چند متغیر مدل همبستگی بالایی با هم دارند و منجر به تقویت متقابل تاثیر یکدیگر میشوند.
پرسشهای متداول
چگونه میتوان وزن موثر سنجهها را در یک رتبهبندی استخراج کرد؟
وزنهای موثر بهندرت توسط سازندگان شاخص منتشر میشوند. برای محاسبه آنها باید تحلیل حساسیت مبتنی بر واریانس مانند نسبت همبستگی پیرسون را روی دادههای خام مورد استفاده در شاخص اجرا کرد.
آیا استانداردسازی دادهها معضل وزندهی را حل میکند؟
استانداردسازی دادهها به نمرات z ناهمگونی واریانسها را رفع کرده و سنجهها را در مقیاسی واحد مینشاند، اما اثر فزاینده کوواریانس ناشی از متغیرهای همبسته را به هیچ وجه مهار نمیکند.
چرا نهادها همچنان از ادغام خطی بهره میبرند؟
ادغام خطی ساده، کمدردسر در محاسبات و برای عموم قابلدرک است؛ روشهای دقیقتر مانند ادغام هندسی یا PCA به دلیل دشواری در تفهیم برای مخاطبان عام کمتر استفاده میشوند.
بررسی عمیق دیدگاهها
متدولوژیستهای آماری
معتقدند ادغام جمعی خطی برای دادههای همبسته اساساً ناکارآمد است.
آماردانان نهادهایی چون OECD و مرکز تحقیقات مشترک کمیسیون اروپا، وزنهای اسمی را بیشتر نوعی مانور روابط عمومی میدانند تا واقعیتی ریاضی. آنها استدلال میکنند هر شاخصی که بر پایه ادغام خطی ساخته شود در برابر خطای تصاعدی کوواریانس آسیبپذیر است. از این دیدگاه، یک شاخص تنها زمانی اعتبار دارد که پدیدآورندگان آن آزمون تحلیل حساسیت واریانسمحور را انجام داده و منتشر کنند تا انطباق وزنهای موثر با مدل تئوریک اثبات شود.
پژوهشگران علوم کاربردی
بر عواقب عملی همخطی در سیاستگذاریهای عمومی و حوزه سلامت متمرکز هستند.
پژوهشگرانی که به ارزیابی شاخصهای سلامت، محیطزیست و جامعه میپردازند درمییابند ابزارهای تخصیص بودجه و رتبهبندی عملکرد اغلب موضوع اشتباهی را میسنجند. آنها با واکاوی شاخصهای موجود نشان میدهند که چگونه همخطی اجازه میدهد یک فاکتور منفرد — مانند ثروت شهری — بر نمرهای مسلط شود که مدعی بررسی ابعاد گوناگون نظیر عدالت آموزشی و دسترسی به درمان است. آنان ادغام هندسی را پادزهر این انحراف نامرئی میدانند.
متخصصان روانسنجی
بر ضرورت تعادلبخشی به همبستگیهای متقابل در آزمونها جهت سنجش همهجانبه تواناییها تاکید دارند.
در حوزه آزمونهای استخدامی و ارزیابیهای استاندارد، نهادهایی نظیر APA و ACT بر واریانس تکتک بخشهای آزمون تمرکز میکنند. روانسنجها آزمونها را طوری طراحی میکنند که از همخطی پرهیز شود تا نمره بالای یک مهارت شناختی خاص، نمره مرکب کل را به شکلی کاذب متورم نسازد. دغدغه اصلی آنان روایی آزمون است؛ اینکه نمره پایانی برآوردی جامع و متوازن از همه قابلیتهای ارزیابیشونده ارائه دهد.
- متدولوژیستهای آماری
- معتقدند ادغام جمعی خطی برای دادههای همبسته اساساً ناکارآمد است و بر ضرورت استفاده از تحلیل حساسیت مبتنی بر واریانس پافشاری میکنند.
- پژوهشگران علوم کاربردی
- بر عواقب عملی همخطی تمرکز دارند و نشان میدهند شاخصهای اجتماعی و سلامت چگونه اهداف اعلامشده را مخدوش میکنند.
- متخصصان روانسنجی
- بر ضرورت تعادلبخشی به همبستگیهای متقابل در آزمونها تاکید دارند تا نمرات ترکیبی برآیند طیف متنوعی از مهارتها باشد نه فقط یک ویژگی مسلط.
دیدگاههایی که این گزارش پوشش نداده
- کاربران و شهروندان مصرفکننده رتبهبندیها
- نهادها و بنگاههای مشمول رتبهبندی
منابع
[1]Oxford Academicمتدولوژیستهای آماریRatings and Rankings: Voodoo or Science?
مطالعه در Oxford Academic →
[2]PubMed Centralپژوهشگران علوم کاربردیWeights and importance in composite indicators: Closing the gap
مطالعه در PubMed Central →
[3]European Commission Joint Research Centreمتدولوژیستهای آماریHandbook on Constructing Composite Indicators: Methodology and User Guide
مطالعه در European Commission Joint Research Centre →
[4]OECDمتدولوژیستهای آماریHandbook on Constructing Composite Indicators: Methodology and User Guide
مطالعه در OECD →
[5]Springerپژوهشگران علوم کاربردیOn the Methodological Framework of Composite Indices: A Review of the Issues of Weighting, Aggregation, and Robustness
مطالعه در Springer →
[6]SAGE Publicationsپژوهشگران علوم کاربردیDifferential Weighting: A Review of Methods and Empirical Studies
مطالعه در SAGE Publications →
[7]American Psychological Associationمتخصصان روانسنجیPrinciples for the Validation and Use of Personnel Selection Procedures
مطالعه در American Psychological Association →
[8]ACTمتخصصان روانسنجیACT Technical Manual
مطالعه در ACT →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →رکوردهای شطرنج
چگونه یک نابغه ۱۱ ساله شطرنج به جوانترین «استاد بزرگ زنان» تاریخ تبدیل شد؟
3 منبع
روششناسی نظرسنجی
چگونه نظرسنجیهای اعتماد عمومی در ایران انجام میشود؟ بررسی سقوط اعتماد سیاسی به ۸ درصد
3 منبع
معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
توابع زیان
بدهبستان ریاضیاتی میان میانگین و میانه در بهینهسازی تابع زیان
4 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





