رفتن به محتوای اصلی
Koohestun
توضیح کوهستانداده‌های تابلوییتشریح روش‌شناسی· 5 دقیقه مطالعه

آزمون هاسمن چگونه دوراهی اثرات ثابت در برابر تصادفی را در داده‌های تابلویی حل می‌کند؟

داده‌های تابلویی پژوهشگران را ناچار می‌کند تا بین کنترل متغیرهای پنهان و به حداکثر رساندن کارایی آماری، یکی را انتخاب کنند. آزمون هاسمن با اندازه‌گیری فاصله بین ضرایب برآوردشده، به صورت ریاضی مشخص می‌کند که کدام رویکرد معتبر است.

به قلم کوروش پاکزاد

اولویت‌دهندگان به عدم سوگیری 40%حداکثرکنندگان کارایی 40%مدافعان تشخیص استوار 20%
اولویت‌دهندگان به عدم سوگیری
استدلال می‌کنند که جلوگیری از سوگیری متغیرهای حذف‌شده از اهمیت بالایی برخوردار است، که باعث می‌شود اثرات ثابت با وجود از دست دادن متغیرهای ثابت در طول زمان، امن‌ترین پیش‌فرض باشد.
حداکثرکنندگان کارایی
برای توانایی اندازه‌گیری عوامل جمعیت‌شناختی ثابت ارزش قائل هستند و هر زمان که آزمون هاسمن اجازه دهد، اثرات تصادفی را ترجیح می‌دهند.
مدافعان تشخیص استوار
هشدار می‌دهند که آزمون استاندارد هاسمن در شرایط ناهمسانی واریانس شکست می‌خورد و برای جلوگیری از نتیجه‌گیری‌های نادرست، نیازمند رگرسیون‌های کمکی استوار است.

دیدگاه‌هایی که این گزارش پوشش نداده

  • اقتصادسنجی‌دانان بیزی
  • متخصصان یادگیری ماشین

چرا مهم است

انتخاب مدل اشتباه در داده‌های تابلویی می‌تواند اهمیت یک مداخله سیاستی را به‌طور کاذب بالا ببرد یا یک اثر علی واقعی را پنهان کند. آزمون هاسمن یک آستانه ریاضی و عینی ارائه می‌دهد تا از نابودی پژوهش‌های مشاهده‌ای به دلیل سوگیری متغیرهای حذف‌شده جلوگیری کند.

نکات کلیدی

  • داده‌های تابلویی پژوهشگران را ملزم می‌کند تا بین اثرات ثابت (که متغیرهای پنهان را کنترل می‌کند) و اثرات تصادفی (که کارآمدتر است) یکی را انتخاب کنند.
  • آزمون هاسمن این مسئله را با مقایسه ضرایب هر دو مدل حل می‌کند تا ببیند آیا آن‌ها به‌طور قابل‌توجهی از هم واگرا هستند یا خیر.
  • پی‌مقدار زیر ۰/۰۵ نشان می‌دهد که اثرات تصادفی به دلیل درون‌زایی دارای سوگیری است و استفاده از اثرات ثابت را الزامی می‌کند.
  • اگر داده‌ها از ناهمسانی واریانس رنج ببرند، آزمون‌های استاندارد هاسمن نامعتبر شده و نیازمند رگرسیون‌های کمکی استوار هستند.

یک گروه از اقتصادسنجی‌دانان استدلال می‌کنند که هر موجودیت در یک مجموعه داده - چه یک شرکت، چه یک کشور یا یک بیمار - دارای ویژگی‌های پنهان و ثابت در طول زمان است که با متغیرهای مورد سنجش پژوهشگران همبستگی دارند. نادیده گرفتن این ویژگی‌ها به معنای دعوت از سوگیری متغیرهای حذف‌شده است؛ به این معنی که پژوهشگران باید از اثرات ثابت برای جذب این ناهمگنی پنهان استفاده کنند. گروه مقابل استدلال می‌کند که در نظر گرفتن این ویژگی‌های پنهان به عنوان پارامترهای ثابت، درجات آزادی ارزشمند را هدر می‌دهد و از نظر ریاضی مانع از گنجاندن متغیرهای ثابتی مانند جغرافیا یا جنسیت می‌شود. آن‌ها از اثرات تصادفی دفاع می‌کنند که فرض می‌کند این ویژگی‌های پنهان صرفا نویزهای تصادفی کاملا بدون همبستگی هستند و اجازه می‌دهد مدلی کارآمدتر و جامع‌تر داشته باشیم.[3][4]

انتخاب بین این دو موضع ناسازگار، اعتبار کل رگرسیون را تعیین می‌کند. اگر پژوهشگر زمانی که متغیرهای پنهان در واقع با پیش‌بین‌ها همبستگی دارند، فرض را بر نویز تصادفی بگذارد، ضرایب به‌دست‌آمده دارای سوگیری و ناسازگار خواهند بود. از سوی دیگر، اگر زمانی که اثرات تصادفی کفایت می‌کرد، فرض را بر اثرات ثابت بگذارند، مدل ناکارآمد می‌شود و فواصل اطمینانی به‌طور مصنوعی عریض تولید می‌کند که ممکن است یک کشف واقعی را پنهان کند.[1][6]

داور ریاضی این مناقشه، آزمون تصریح هاسمن است که برای نخستین بار توسط اقتصادسنجی‌دانی به نام جری هاسمن در سال ۱۹۷۸ معرفی شد. این آزمون به شهود یا ترجیح نظری پژوهشگر متکی نیست؛ در عوض، هر دو مدل را به‌طور همزمان اجرا می‌کند و خروجی‌های آن‌ها را برای تشخیص واگرایی ساختاری با هم مقایسه می‌کند.[5][6]

بر اساس مخزن منابع مرکز ملی روش‌های پژوهش، «اثرات ثابت رابطه بین متغیرهای پیش‌بین و پیامد را در درون یک موجودیت بررسی می‌کند.» مدل اثرات ثابت با اختصاص یک عرض از مبدأ منحصربه‌فرد به تک‌تک موجودیت‌های موجود در مجموعه داده، به‌طور موثری تمام تفاوت‌های ثابت در طول زمان بین افراد را کنترل کرده و تنها تغییراتی را که در طول زمان رخ می‌دهند، ایزوله می‌کند.[3]

ماتریس تصمیم‌گیری استاندارد برای تفسیر پی-مقدارهای آزمون هاسمن.

این استحکام با یک هزینه ریاضی سنگین همراه است. از آنجا که مدل اثرات ثابت کاملا به تغییرات درون‌موجودیتی در دوره‌های زمانی متعدد متکی است، هر متغیری که تغییر نمی‌کند - مانند نژاد یک فرد، فاصله یک شهر از ساحل، یا سال تاسیس یک شرکت - با عرض از مبدأ موجودیت هم‌خطی کامل دارد. الگوریتم رگرسیون به سادگی این متغیرها را به‌طور کامل از معادله حذف می‌کند.[1][3]

مدل‌های اثرات تصادفی این محدودیت را با فرض اینکه جمله خطای موجودیت با پیش‌بین‌ها همبستگی ندارد، حل می‌کنند. شرکت مشاوره پژوهشی توبیت خاطرنشان می‌کند که این رویکرد به پژوهشگران اجازه می‌دهد متغیرهای ثابت در طول زمان را وارد مدل کنند، که آن را به گزینه‌ای بسیار جذاب برای تحلیل‌های جمعیت‌شناختی و مطالعاتی تبدیل می‌کند که در آن‌ها عوامل ثابت، متغیرهای اصلی مورد توجه هستند.[4]

آزمون هاسمن ارزیابی می‌کند که آیا آن فرض حیاتیِ همبستگی صفر در داده‌های واقعی صدق می‌کند یا خیر. این آزمون بر اساس یک فرض صفر سخت‌گیرانه عمل می‌کند: اینکه مدل ترجیحی، اثرات تصادفی است؛ به این معنی که ناهمگنی پنهان در واقع برون‌زا بوده و با متغیرهای مستقل همبستگی ندارد.[2][5]

آزمون هاسمن ارزیابی می‌کند که آیا آن فرض حیاتیِ همبستگی صفر در داده‌های واقعی صدق می‌کند یا خیر.

برای اجرای این آزمون، نرم‌افزارهای آماری مانند استاتا ابتدا ضرایب را با استفاده از مدل اثرات ثابت برآورد می‌کنند، که از نظر ریاضی تضمین شده است فارغ از همبستگی زیربنایی، سازگار باشد. سپس ضرایب را با استفاده از مدل اثرات تصادفی برآورد می‌کند، که تنها در صورتی سازگار است که فرض صفر کاملا درست باشد.[1][4]

سپس الگوریتم فاصله دقیق بین این دو مجموعه از ضرایب را محاسبه می‌کند. اگر فرض اثرات تصادفی معتبر باشد، هر دو مدل باید برآوردهای تقریبا یکسانی تولید کنند، زیرا هر دو سازگار هستند. در این حالت، مدل اثرات تصادفی صرفا کارآمدتر خواهد بود و خطای استاندارد کوچکتر و فواصل اطمینان ۹۵ درصدی محدودتری به دست می‌دهد.[5][6]

مدل‌های اثرات تصادفی واریانس کمتری دارند، اما وقتی متغیرهای پنهان با پیش‌بین‌ها همبستگی داشته باشند، سوگیری شدیدی ایجاد می‌کنند.

اگر متغیرهای پنهان در واقع با پیش‌بین‌ها همبستگی داشته باشند، برآوردهای اثرات تصادفی به‌طور قابل‌توجهی از خط پایه اثرات ثابت منحرف خواهند شد. آزمون هاسمن این واگرایی را با استفاده از آماره کای-دو کمی‌سازی می‌کند و می‌سنجد که ضرایب اثرات تصادفی چقدر از معیار سازگار اثرات ثابت فاصله گرفته‌اند.[2][5]

زمانی که مقدار کای-دو محاسبه‌شده به اندازه‌ای بزرگ باشد که پی‌مقداری کمتر از آستانه استاندارد ۰/۰۵ تولید کند، آزمون فرض صفر را رد می‌کند. این حکم ریاضی تایید می‌کند که مدل اثرات تصادفی به دلیل درون‌زایی دارای سوگیری است و پژوهشگر را ناچار می‌کند برای حفظ یکپارچگی تحلیل، از اثرات ثابت استفاده کند.[2][5]

برعکس، اگر پی‌مقدار بزرگتر از ۰/۰۵ باشد، آزمون نمی‌تواند فرض صفر را رد کند. در این سناریو، واگرایی بین دو مدل از نظر آماری بی‌معنی است؛ به این معنی که پژوهشگر می‌تواند با خیال راحت مدل اثرات تصادفی را برای به حداکثر رساندن توان آماری و حفظ آن متغیرهای حیاتی ثابت در طول زمان به کار گیرد.[1][5]

آماره هاسمن از توزیع کای-دو پیروی می‌کند و مقادیر بزرگ آن نشان‌دهنده واگرایی ساختاری بین مدل‌هاست.

البته این آزمون بدون محدودیت نیست. آزمون استاندارد هاسمن فرض می‌کند که خطاهای ویژه دارای واریانس همسان هستند و همبستگی پیاپی ندارند. اگر این مفروضات در داده‌های تابلویی نامتوازن نقض شوند، آماره آزمون استاندارد نامعتبر می‌شود و پژوهشگران باید از نسخه استوار این آزمون استفاده کنند که اغلب از طریق رگرسیون‌های کمکی یا رگرسیون‌های مصنوعی پیاده‌سازی می‌شود.[2]

علاوه بر این، عدم رد فرض صفر به‌طور قطعی ثابت نمی‌کند که اثرات تصادفی کاملا درست تصریح شده‌اند؛ بلکه تنها نشان می‌دهد که داده‌ها شواهد کافی از یک نقض شدید در نرخ خطای نوع اول ۵ درصدی ارائه نمی‌دهند. حجم نمونه‌های کوچک می‌توانند به راحتی منفی‌های کاذب تولید کرده و سوگیری پنهان را بپوشانند.[6]

آزمون هاسمن همچنان مرز ریاضی قطعی بین مفروضات سوگیرانه و استنتاج علی دقیق است. این آزمون با وادار کردن پژوهشگران به کمی‌سازی مبادله بین سوگیری و کارایی، تضمین می‌کند که نتایج به‌دست‌آمده از داده‌های مشاهده‌ای، به جای راحتی روش‌شناختی، بر پایه اثبات‌های آماری قابل دفاع استوار باشند.[3][6]

روند رویداد

  1. دهه ۱۹۴۰

    اقتصادسنجی‌دانان شروع به فرمول‌بندی روش‌های داده‌های تابلویی برای ردیابی موجودیت‌ها در طول زمان کردند.

  2. ۱۹۷۸

    جری هاسمن آزمون تصریحی را منتشر کرد که از نظر ریاضی بین اثرات ثابت و تصادفی تمایز قائل می‌شود.

  3. دهه ۱۹۸۰

    پژوهشگران دریافتند که ناهمسانی واریانس آزمون استاندارد هاسمن را نامعتبر می‌کند، که منجر به توسعه رگرسیون‌های کمکی استوار شد.

  4. دهه ۲۰۰۰

    بسته‌های نرم‌افزاری آماری مانند استاتا آزمون هاسمن را خودکار کردند و آن را به یک مرحله تشخیصی استاندارد در پژوهش‌های مشاهده‌ای تبدیل کردند.

بررسی عمیق دیدگاه‌ها

مدافعان اثرات ثابت

عدم سوگیری را در اولویت قرار می‌دهند و حاضرند برای دستیابی به آن، متغیرهای ثابت در طول زمان را فدا کنند.

پژوهشگران این گروه، سوگیری متغیرهای حذف‌شده را گناه کبیره تحلیل داده‌های مشاهده‌ای می‌دانند. از آنجا که اندازه‌گیری هر عامل مرتبط - مانند تحمل ریسک ذاتی یک مدیرعامل یا پایه ژنتیکی یک بیمار - تقریبا غیرممکن است، آن‌ها استدلال می‌کنند که اثرات ثابت تنها پیش‌فرض قابل دفاع است. با جذب تمام ویژگی‌های ثابت در عرض از مبدأ موجودیت، آن‌ها تضمین می‌کنند که ضرایب باقی‌مانده منعکس‌کننده تغییرات علی واقعی در طول زمان هستند، حتی اگر این به معنای حذف دائمی متغیرهای ثابتی مانند جنسیت یا موقعیت جغرافیایی از مدل باشد.

طرفداران اثرات تصادفی

کارایی آماری و توانایی اندازه‌گیری عوامل جمعیت‌شناختی ثابت را در اولویت قرار می‌دهند.

این دیدگاه استدلال می‌کند که کنار گذاشتن متغیرهای ثابت در طول زمان، دامنه پژوهش‌های اقتصادسنجی را به شدت محدود می‌کند. اگر هدف یک مطالعه اندازه‌گیری تاثیر یک عامل ثابت - مانند فاصله یک مدرسه از مرکز شهر - باشد، اثرات ثابت این تحلیل را غیرممکن می‌سازد. طرفداران استدلال می‌کنند که تا زمانی که آزمون هاسمن نتواند فرض صفر را رد کند، باید از اثرات تصادفی استقبال کرد. مدل حاصل درجات آزادی را حفظ می‌کند، فواصل اطمینان محدودتری به دست می‌دهد و دیدگاه جامع‌تری از داده‌ها ارائه می‌کند.

شکاکان به استواری

استدلال می‌کنند که آزمون استاندارد هاسمن بیش از حد شکننده است و اغلب در داده‌های دنیای واقعی منفی‌های کاذب تولید می‌کند.

روش‌شناسانی که بر یکپارچگی داده‌ها تمرکز دارند هشدار می‌دهند که آزمون استاندارد هاسمن بر مفروضات سخت‌گیرانه همسانی واریانس متکی است. در داده‌های تابلویی نامتوازن دنیای واقعی، واریانس به ندرت ثابت است. زمانی که این مفروضات نقض می‌شوند، آماره کای-دو استاندارد نامعتبر می‌شود و به‌طور بالقوه چراغ سبز کاذبی به پژوهشگران برای استفاده از مدل‌های سوگیرانه اثرات تصادفی می‌دهد. این گروه مدافع کنار گذاشتن آزمون سنتی به نفع رگرسیون‌های کمکی استوار، مانند رویکرد موندلاک هستند که می‌تواند درون‌زایی را حتی زمانی که جملات خطا نامنظم هستند، تشخیص دهد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

اولویت‌دهندگان به عدم سوگیری 40%حداکثرکنندگان کارایی 40%مدافعان تشخیص استوار 20%
  1. [1]Stata Guide - Chenhao Zhouاولویت‌دهندگان به عدم سوگیری

    Ch 5: Panel Data Methods

    مطالعه در Stata Guide - Chenhao Zhou
  2. [2]ResearchGateمدافعان تشخیص استوار

    A Step-by-Step Guide to Conducting Robust Hausman Tests for Random Effects vs. Fixed Effects Models Using Unbalanced Panel Data in Stata

    مطالعه در ResearchGate
  3. [3]NCRM Resource Repositoryاولویت‌دهندگان به عدم سوگیری

    Fixed and random effects models for panel data in Stata

    مطالعه در NCRM Resource Repository
  4. [4]Tobit Research Consultingحداکثرکنندگان کارایی

    Panel Data Analysis in Stata

    مطالعه در Tobit Research Consulting
  5. [5]Real Statistics Using Excelحداکثرکنندگان کارایی

    Hausman Test

    مطالعه در Real Statistics Using Excel
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.