رفتن به محتوای اصلی
کوهستان
توضیح کوهستانساخت شاخصسازمان همکاری و توسعه اقتصادی· 6 دقیقه مطالعه· در تحلیل داده

چرا وزن‌های اسمی تاثیر واقعی شاخص‌ها را در رتبه‌بندی‌های ترکیبی مخدوش می‌کنند؟

طراحان شاخص‌ها درصدهای مشخصی را به‌عنوان وزن هر سنجه تعیین می‌کنند تا میزان اهمیت آن را در نمره نهایی مشخص سازند. با این حال، واریانس آماری و هم‌خطی معمولاً این اهداف را بی‌اثر می‌کنند و باعث می‌شوند متغیرهایی با همبستگی بالا بر وزن موثر رتبه‌بندی مسلط شوند.

به قلم فرشید جمشیدی

به‌طور خلاصه

  1. وزن‌های اسمی تنها بازتاب‌دهنده نیت طراح شاخص هستند، در حالی که وزن‌های موثر نفوذ آماری واقعی را تعیین می‌کنند.
  2. سنجه‌های با واریانس اندک مانند عدد ثابت عمل می‌کنند و صرف‌نظر از وزن تعیین‌شده، اثر خود را در رتبه‌بندی از دست می‌دهند.
  3. متغیرهای دارای همبستگی شدید اثر یکدیگر را از طریق کوواریانس چندبرابر می‌کنند و شاخص را به سنجه‌ای برای یک عامل مسلط منفرد بدل می‌سازند.

طراحان شاخص‌ها — از رتبه‌بندی دانشگاه‌ها گرفته تا تحلیلگران محیط‌زیست — هنگام ساخت یک نمره ترکیبی، سهم و وزن تک‌تک سنجه‌ها را تعیین می‌کنند. آن‌ها درصدی اسمی در نظر می‌گیرند، روش‌شناسی را منتشر می‌کنند و فرمول محاسباتی را برای آن دوره تثبیت می‌نمایند.

اما محاسبات ادغام داده‌ها فوراً این قواعد اولیه را دستخوش تغییر می‌کند. درست از لحظه‌ای که چند جریان داده با یکدیگر ترکیب می‌شوند و به عددی واحد تبدیل می‌گردند، وزن‌های اعلام‌شده دیگر حاکم بر میزان تاثیرگذاری واقعی هر سنجه بر رتبه‌بندی نهایی نیستند.

در عوض، سازوکاری پنهان زمام امور را در دست می‌گیرد: قدرت واقعی یک سنجه توسط واریانس آن و کوواریانس آن با سایر متغیرهای مدل تعیین می‌شود؛ حقیقتی آماری که می‌تواند وزن اسمی ۵۰ درصدی را به‌سادگی به پارازیت آماریِ عملاً بی‌اثر تبدیل کند.

توهم درصدهای اعلام‌شده

برای درک چراییِ شکست یک رتبه‌بندی، تحلیلگران باید به نحوه ساخت آن دقت کنند. بیشتر شاخص‌های ترکیبی متکی به ادغام جمعی خطی هستند؛ به این معنا که سنجه‌های استانداردشده در وزن تعیین‌شده ضرب شده و با یکدیگر جمع می‌شوند.[5]

سازمان همکاری و توسعه اقتصادی (OECD) و مرکز تحقیقات مشترک کمیسیون اروپا (JRC) در اسناد متعدد، نقایص این رویکرد را ثبت کرده‌اند. کتابچه راهنمای روش‌شناختی مشترک آن‌ها در سال ۲۰۰۸ هشدار می‌دهد که وزن‌های اسمی صرفاً بازتاب‌دهنده نیت طراح هستند و ربطی به واقعیت آماری ندارند.[3][4]

راهنمای OECD می‌گوید: «وزن‌های اختصاص‌یافته به متغیرهای گوناگون در یک شاخص ترکیبی لزوماً منعکس‌کننده سهم واقعی این متغیرها در واریانس شاخص نهایی نیست.» در علم آمار، به این سهم واقعی «وزن موثر» می‌گویند.[4]

وقتی سنجه‌ها همبستگی بالایی دارند، تاثیر واقعی آن‌ها بسیار فراتر از وزن اسمی اعلام‌شده گسترش می‌یابد.

هنگامی که یک نظام رتبه‌بندی دانشگاهی ادعا می‌کند نسبت استاد به دانشجو ۲۰ درصد نمره دانشگاه را تشکیل می‌دهد، در واقع وزنی اسمی را اعلام کرده است. حال اگر نسبت مذکور در تمامی دانشگاه‌های مورد ارزیابی تقریباً یکسان باشد، وزن موثر این سنجه فارغ از فرمول اعلام‌شده، به نزدیکی صفر سقوط می‌کند.

واریانس چگونه قدرت رای‌دهی را تعیین می‌کند

نخستین انحراف ریاضی از ناحیه واریانس وارد می‌شود؛ سنجه‌ای که میزان پراکندگی نقاط داده حول میانگین را اندازه می‌گیرد. در شاخص‌های ترکیبی، واریانس عملاً ارز رایجِ تاثیرگذاری آماری است.[4]

سنجه‌ای که واریانس و تنوع نداشته باشد، توانایی تمایز بخشیدن میان سوژه‌ها را از دست می‌دهد. آزمون استخدامی را در نظر بگیرید که در آن تمامی داوطلبان در بخش ارزیابی فنی نمره ۹۵ می‌گیرند، اما نمرات مصاحبه رفتاری بین ۴۰ تا ۹۰ پراکنده است.

حتی اگر کمیته استخدام وزن آزمون فنی را ۸۰ درصد و مصاحبه را ۲۰ درصد تعیین کرده باشد، این مصاحبه رفتاری است که رتبه‌بندی نهایی را شکل می‌دهد. نمره فنی مانند یک عدد ثابت عمل می‌کند که مقداری یکنواخت به همه می‌افزاید، بدون اینکه جایگاه نسبی افراد را جابه‌جا کند.

اصول انجمن روان‌شناسی آمریکا در گزینش پرسنل دقیقاً درباره این دام هشدار می‌دهد. هنگام ترکیب رویه‌های مختلف ارزیابی، واریانس مولفه‌ها باید تحلیل شود تا وزن مدنظر با نتایج واقعی سازگار بماند.[7]

آماردانان برای رفع این مشکل، داده‌ها را پیش از وزن‌دهی استانداردسازی می‌کنند — معمولاً با تبدیل داده‌های خام به نمرات z. این کار سنجه‌ها را وادار می‌کند دارای میانگین صفر و واریانس یک شوند تا از نظر تئوری پیش از اِعمال وزن‌ها در جایگاهی برابر قرار گیرند.[3]

سنجه فاقد واریانس همچون عدد ثابت عمل می‌کند: نمره پایه‌ای یکنواخت به همه می‌افزاید بی‌آنکه رتبه‌ها را تغییر دهد.

اثر فزاینده کوواریانس

اما استانداردسازی تنها نیمی از مشکل را حل می‌کند. انحراف دوم که به‌مراتب زیرپوستی‌تر است، از کوواریانس سرچشمه می‌گیرد؛ سنجه‌ای که نحوه تغییرات هم‌زمان دو متغیر در کل داده‌ها را می‌سنجد.[4]

اگر یک شاخص پنج سنجه گوناگون داشته باشد که همگی بازتاب‌دهنده جنبه‌های متفاوتی از یک خصلت پایه‌ای واحد باشند — مثلاً متغیر ثروت در رتبه‌بندی شهرداری‌ها — آن سنجه‌ها همبستگی بالایی خواهند داشت، همگام با هم حرکت می‌کنند و اثر متقابل را تقویت می‌نمایند.

فرمول ریاضی واریانسِ یک مجموع، صرفاً مجموع واریانس‌ها نیست؛ بلکه برابر با مجموع واریانس‌ها به‌علاوه دو برابر مجموع کلیه کوواریانس‌های میان متغیرها است، که به شکل تصاعدی اثر فزاینده ایجاد می‌کند.[4]

در مجموعه‌داده‌ای با همبستگی بالا، جملات کوواریانس بسیار بزرگ‌تر از جملات واریانس هستند. مطالعه‌ای در سال ۲۰۱۳ در Journal of the Royal Statistical Society نشان داد در بسیاری از شاخص‌های شناخته‌شده، کوواریانس عامل بخش عمده واریانس نمره نهایی است.[1]

این پدیده اثری چندبرابری ایجاد می‌کند. سنجه‌ای که با چند سنجه پروزن دیگر همبستگی بالایی دارد، با بادکنکی شدن وزن موثرش روبه‌رو می‌شود؛ پدیده‌ای که شاخص را از درون مصادره کرده و درصد اعلام‌شده طراح را بی‌اثر می‌سازد.[1][5]

سنجش نفوذ آماری واقعی

برای پی بردن به آنچه یک شاخص واقعاً اندازه می‌گیرد، آماردانان از تحلیل حساسیت مبتنی بر واریانس استفاده می‌کنند. این فرایند رتبه‌بندی را کالبدشکافی می‌کند تا معین شود کدام ورودی‌ها محرک اصلی اختلاف میان گزینه‌های رتبه‌بندی‌شده هستند.[3]

واریانس مجموع شامل دو برابر مجموع کوواریانس‌هاست؛ امری که اثر فزاینده شدیدی برای متغیرهای همبسته خلق می‌کند.

کتابچه راهنمای JRC محاسبه ضریب همبستگی پیرسون یا استفاده از شاخص‌های سوبول (Sobol) را برای کمی‌سازی وزن موثر هر مولفه توصیه می‌کند. این ابزارها سهم دقیق هر سنجه را از کل واریانس آشکار می‌سازند.[3]

پژوهشگرانی که نتایج خود را در سال ۲۰۱۷ در PubMed Central منتشر کردند، این تکنیک‌ها را روی شاخص‌های بهداشت عمومی پیاده کرده و به تناقض‌های چشمگیری رسیدند. در مواردی، سنجه‌هایی با وزن اسمی ۱۰ درصد، به‌دلیل هم‌خطی، عملاً ۴۰ درصد نتایج رتبه‌بندی را تعیین می‌کردند.[2]

شکاف میان وزن اسمی و موثر می‌تواند چنان عمیق شود که شاخص ترکیبی خروجی متفاوتی نسبت به ساختار نظری اولیه خود نشان دهد. از این رو، پژوهشگران تاکید دارند که طراحان باید همواره وزن‌های موثر را در کنار متدولوژی خود گزارش کنند.[2][5]

ناکارآمدی ادغام خطی

ریشه این معضل در پیش‌فرض جبران‌پذیری کامل سنجه‌ها نهفته است. در روش ادغام جمعی خطی این فرض ضمنی وجود دارد که نمره فاجعه‌بار در یک بخش، تا زمانی که وزن‌ها اجازه دهند، با نمره‌ای درخشان در بخشی دیگر قابل جبران است.[5]

مروری پژوهشی در سال ۲۰۱۷ در Social Indicators Research تاکید کرد این ویژگی جبران‌پذیری اغلب از لحاظ نظری فاقد توجیه است؛ اگر یک شاخص محیط‌زیستی اجازه دهد رشد اقتصادی بالا آلودگی وخیم آب را کاملاً جبران کند، بحران‌های زیربنایی پنهان می‌مانند.[5]

هنگامی که متغیرها همبستگی بالایی دارند، این جبران به‌صورت خودکار و نامرئی رخ می‌دهد. در نتیجه شاخص به جای ارزیابی متوازن ابعاد مختلف، به سنجه‌ای برای سنجش عامل مسلط پنهان — اغلب ثروت یا مقیاس — تقلیل می‌یابد.[1]

ادغام هندسی مانع از آن می‌شود که یک نمره عالی، فاجعه و افت شدید در متغیری حیاتی را بپوشاند.

راهنمای فنی آزمون استاندارد ACT برای رفع این موضوع، همبستگی‌های متقابل میان زیرآزمون‌ها را دقیق ارزیابی می‌کند تا اطمینان حاصل شود نمره کلی ترکیبی، نشان‌دهنده آمادگی تحصیلی جامع است نه اینکه تنها به تسلط یک توانایی شناختی خاص محدود بماند.[8]

مهندسی شاخصی منطبق بر موازین ریاضی

مهار این اعوجاج‌ها مستلزم آن است که طراحان شاخص، سادگی وسوسه‌انگیز وزن‌های اسمی را کنار بگذارند. یک راهکار موثر، بهره‌گیری از ادغام هندسی است که مولفه‌ها را به‌جای جمع کردن در هم ضرب می‌کند و نحوه تعامل میان آن‌ها را دگرگون می‌سازد.[4][5]

ادغام هندسی قابلیت جبران‌پذیری را محدود می‌کند. نمره‌ای نزدیک به صفر در یک سنجه حیاتی، فارغ از نمرات درخشان بخش‌های دیگر، حاصل‌ضرب کل را پایین می‌کشد و رتبه‌بندی را وادار می‌کند وزن متمایز هر بخش را لحاظ کند.[4][5]

روش دیگر، متعامدسازی داده‌هاست. آماردانان می‌توانند با تحلیل مولفه‌های اصلی (PCA)، متغیرهای دارای همبستگی را پیش از اعمال وزن‌ها به متغیرهایی ناهمبسته بدل سازند تا ضریب فزاینده کوواریانس خنثی شود.[6]

آماردانان می‌توانند با تحلیل مولفه‌های اصلی (PCA)، متغیرهای دارای همبستگی را پیش از اعمال وزن‌ها به متغیرهایی ناهمبسته بدل سازند تا ضریب فزاینده کوواریانس خنثی شود.

در نهایت، می‌توان از تنظیم مکرر وزن‌ها استفاده کرد. با اجرای آزمون‌های تحلیل حساسیت روی پیش‌نویس شاخص، طراحان می‌توانند وزن‌های اسمی را آن‌قدر تعدیل کنند تا وزن‌های موثر حاصل‌شده دقیقاً با چارچوب اولیه منطبق گردند.[3]

تا زمانی که چنین روش‌هایی همه‌گیر نشوند، درصدهای رسمی درج‌شده در مستندات رتبه‌بندی‌ها نقشی تزئینی خواهند داشت. اولویت‌های پنهان هر رتبه‌بندی در ماتریس کوواریانس آن کدگذاری شده است، نه در متون روابط عمومی و تبلیغات آن.

این تحلیل چگونه انجام شد

روش
مقایسه تطبیقی چارچوب‌های ریاضی وزن موثر در کتابچه OECD و متدولوژی JRC، و تفکیک فرمول‌های واریانس-کوواریانس که تبیین‌کننده واگرایی وزن‌های اسمی از تاثیر واقعی در شاخص‌های ترکیبی هستند.
یافته
میزان انحراف میان وزن اعلام‌شده یک سنجه و تاثیر واقعی آن به‌صورت غیرخطی با همبستگی آن با سایر سنجه‌ها رشد می‌کند؛ مسئله‌ای که وزن‌های اسمی را در شاخص‌های با هم‌خطی بالا نظیر رتبه‌بندی‌های دانشگاهی یا معیارهای پایداری (ESG) از حیز انتفاع ساقط می‌سازد.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • فرمول واریانس شاخص‌های ترکیبی OECD: Variance of index = sum of weighted variances + sum of weighted covariances — OECD
  • چارچوب تحلیل حساسیت مرکز تحقیقات مشترک (JRC): Variance-based sensitivity measures (Sobol indices) — European Commission Joint Research Centre
محدودیت‌های این تحلیل
این تحلیل ریاضی عمدتاً بر ادغام‌های جمعی خطی صدق می‌کند؛ الگوهای ادغام هندسی یا غیرخطی رفتارهای انحرافی متفاوتی بروز می‌دهند که در مدل واریانس فعلی بازتاب نیافته است.

اصطلاحات کلیدی

وزن اسمی (Nominal Weight)
درصد یا ضریب اعلام‌شده‌ای که طراح شاخص برای نشان دادن میزان اهمیت فرضی یک سنجه در نظر می‌گیرد.
وزن موثر (Effective Weight)
سهم واقعی یک سنجه از کل واریانس نمره نهایی پس از اعمال اندرکنش‌ها و اثرات آماری.
کوواریانس (Covariance)
شاخص آماری جهت همبستگی دو متغیر؛ کوواریانس مثبت نشان می‌دهد داده‌ها همگام با هم صعودی یا نزولی می‌شوند.
هم‌خطی (Collinearity)
شرایطی که در آن چند متغیر مدل همبستگی بالایی با هم دارند و منجر به تقویت متقابل تاثیر یکدیگر می‌شوند.

پرسش‌های متداول

چگونه می‌توان وزن موثر سنجه‌ها را در یک رتبه‌بندی استخراج کرد؟

وزن‌های موثر به‌ندرت توسط سازندگان شاخص منتشر می‌شوند. برای محاسبه آن‌ها باید تحلیل حساسیت مبتنی بر واریانس مانند نسبت همبستگی پیرسون را روی داده‌های خام مورد استفاده در شاخص اجرا کرد.

آیا استانداردسازی داده‌ها معضل وزن‌دهی را حل می‌کند؟

استانداردسازی داده‌ها به نمرات z ناهمگونی واریانس‌ها را رفع کرده و سنجه‌ها را در مقیاسی واحد می‌نشاند، اما اثر فزاینده کوواریانس ناشی از متغیرهای همبسته را به هیچ وجه مهار نمی‌کند.

چرا نهادها همچنان از ادغام خطی بهره می‌برند؟

ادغام خطی ساده، کم‌دردسر در محاسبات و برای عموم قابل‌درک است؛ روش‌های دقیق‌تر مانند ادغام هندسی یا PCA به دلیل دشواری در تفهیم برای مخاطبان عام کمتر استفاده می‌شوند.

بررسی عمیق دیدگاه‌ها

متدولوژیست‌های آماری

معتقدند ادغام جمعی خطی برای داده‌های همبسته اساساً ناکارآمد است.

آماردانان نهادهایی چون OECD و مرکز تحقیقات مشترک کمیسیون اروپا، وزن‌های اسمی را بیشتر نوعی مانور روابط عمومی می‌دانند تا واقعیتی ریاضی. آن‌ها استدلال می‌کنند هر شاخصی که بر پایه ادغام خطی ساخته شود در برابر خطای تصاعدی کوواریانس آسیب‌پذیر است. از این دیدگاه، یک شاخص تنها زمانی اعتبار دارد که پدیدآورندگان آن آزمون تحلیل حساسیت واریانس‌محور را انجام داده و منتشر کنند تا انطباق وزن‌های موثر با مدل تئوریک اثبات شود.

پژوهشگران علوم کاربردی

بر عواقب عملی هم‌خطی در سیاست‌گذاری‌های عمومی و حوزه سلامت متمرکز هستند.

پژوهشگرانی که به ارزیابی شاخص‌های سلامت، محیط‌زیست و جامعه می‌پردازند درمی‌یابند ابزارهای تخصیص بودجه و رتبه‌بندی عملکرد اغلب موضوع اشتباهی را می‌سنجند. آن‌ها با واکاوی شاخص‌های موجود نشان می‌دهند که چگونه هم‌خطی اجازه می‌دهد یک فاکتور منفرد — مانند ثروت شهری — بر نمره‌ای مسلط شود که مدعی بررسی ابعاد گوناگون نظیر عدالت آموزشی و دسترسی به درمان است. آنان ادغام هندسی را پادزهر این انحراف نامرئی می‌دانند.

متخصصان روان‌سنجی

بر ضرورت تعادل‌بخشی به همبستگی‌های متقابل در آزمون‌ها جهت سنجش همه‌جانبه توانایی‌ها تاکید دارند.

در حوزه آزمون‌های استخدامی و ارزیابی‌های استاندارد، نهادهایی نظیر APA و ACT بر واریانس تک‌تک بخش‌های آزمون تمرکز می‌کنند. روان‌سنج‌ها آزمون‌ها را طوری طراحی می‌کنند که از هم‌خطی پرهیز شود تا نمره بالای یک مهارت شناختی خاص، نمره مرکب کل را به شکلی کاذب متورم نسازد. دغدغه اصلی آنان روایی آزمون است؛ اینکه نمره پایانی برآوردی جامع و متوازن از همه قابلیت‌های ارزیابی‌شونده ارائه دهد.

متدولوژیست‌های آماری 40%پژوهشگران علوم کاربردی 35%متخصصان روان‌سنجی 25%
متدولوژیست‌های آماری
معتقدند ادغام جمعی خطی برای داده‌های همبسته اساساً ناکارآمد است و بر ضرورت استفاده از تحلیل حساسیت مبتنی بر واریانس پافشاری می‌کنند.
پژوهشگران علوم کاربردی
بر عواقب عملی هم‌خطی تمرکز دارند و نشان می‌دهند شاخص‌های اجتماعی و سلامت چگونه اهداف اعلام‌شده را مخدوش می‌کنند.
متخصصان روان‌سنجی
بر ضرورت تعادل‌بخشی به همبستگی‌های متقابل در آزمون‌ها تاکید دارند تا نمرات ترکیبی برآیند طیف متنوعی از مهارت‌ها باشد نه فقط یک ویژگی مسلط.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کاربران و شهروندان مصرف‌کننده رتبه‌بندی‌ها
  • نهادها و بنگاه‌های مشمول رتبه‌بندی

منابع

پوشش منابع

9 منبع

3 دیدگاه شناسایی‌شده

متدولوژیست‌های آماری 40%پژوهشگران علوم کاربردی 35%متخصصان روان‌سنجی 25%
  1. [1]Oxford Academicمتدولوژیست‌های آماری

    Ratings and Rankings: Voodoo or Science?

    مطالعه در Oxford Academic →
  2. [2]PubMed Centralپژوهشگران علوم کاربردی

    Weights and importance in composite indicators: Closing the gap

    مطالعه در PubMed Central →
  3. [3]European Commission Joint Research Centreمتدولوژیست‌های آماری

    Handbook on Constructing Composite Indicators: Methodology and User Guide

    مطالعه در European Commission Joint Research Centre →
  4. [4]OECDمتدولوژیست‌های آماری

    Handbook on Constructing Composite Indicators: Methodology and User Guide

    مطالعه در OECD →
  5. [5]Springerپژوهشگران علوم کاربردی

    On the Methodological Framework of Composite Indices: A Review of the Issues of Weighting, Aggregation, and Robustness

    مطالعه در Springer →
  6. [6]SAGE Publicationsپژوهشگران علوم کاربردی

    Differential Weighting: A Review of Methods and Empirical Studies

    مطالعه در SAGE Publications →
  7. [7]American Psychological Associationمتخصصان روان‌سنجی

    Principles for the Validation and Use of Personnel Selection Procedures

    مطالعه در American Psychological Association →
  8. [8]ACTمتخصصان روان‌سنجی

    ACT Technical Manual

    مطالعه در ACT →
  9. [9]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.