ثابتهای دلخواه در رگرسیونهای لگاریتمی کششها را تغییر میدهند؛ ضرورت برآورد در سطوح اولیه با شبهدرستنمایی پیوسته پوآسون
افزودن یک ثابت کوچک به دادههای صفر پیش از تبدیل لگاریتمی، پایایی مقیاس را از بین میبرد و کششهای برآوردی را با تغییر واحد اندازهگیری کاملاً دگرگون میسازد. برآوردگر شبهدرستنمایی پیوسته پوآسون (PPML) این چالش را با مدلسازی مستقیم روابط ضربی در سطوح اولیه حل میکند و مشاهدات صفر را بدون دستکاری داده پوشش میدهد.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- افزودن یک ثابت دلخواه مانند عدد یک به دادههای صفر پیش از تبدیل لگاریتمی، اصل پایایی مقیاس را نقض کرده و کششها را بر اساس واحد اندازهگیری دستخوش نوسان میکند.
- برآوردگر شبهدرستنمایی پوآسون (PPML) این بحران را از طریق مدلسازی ساختار ضربی در سطح واقعی متغیرها حل کرده و مشاهدات صفر را بدون دستکاری در محاسبات مینشاند.
- روش PPML خطای ناشی از نابرابری ینسن در شرایط ناهمسانی واریانس را که برآوردهای روش OLS را در فرمهای لگاریتمی فاسد میکرد، اصلاح میکند.
در این مطلب
هنگامی که تحلیلگر برای فرار از تعریفنشدگی لگاریتمِ صفر، یک واحد دلخواه به دادهها اضافه میکند، صرفاً با تغییر واحد پول ممکن است مقدار کشش برآوردشده را بیش از ۵۰ درصد جابهجا کند. ریشهٔ این اعوجاج، در خودِ سازوکار واحدهای اندازهگیری نهفته است.
عدد ثابت ۱ در یک پایگاه داده معادل یک دلار است، اما با تبدیل عنوان ستون به «میلیون دلار»، همان عدد معنای یک میلیون دلار پیدا میکند. این آسیبپذیری ریاضیاتی بیسروصدا مدلهای رگرسیونی را در اقتصاد و سلامت عمومی دچار خطا میکند؛ پژوهشگران دههها صرفاً برای اینکه دادهها را وارد قالب خطی کنند، از این ناپایداری مقیاس چشمپوشی کردهاند.
تبدیل لگاریتمی ابزار محبوب آمار کاربردی است، زیرا به ما امکان میدهد ضرایب را بهسادگی به عنوان کشش یا درصد تغییر تفسیر کنیم. اما لگاریتم صفر از نظر ریاضیاتی تعریفنشده است؛ وضعیتی که در مجموعه دادههایی که عدد صفر پیامدی واقعی و پرتکرار است، بنبستی ساختاری ایجاد میکند.
به عنوان نمونه در تجارت بینالملل، حجم مبادلات میان بسیاری از جفتکشورها صفر است چون تبادل کالایی ندارند. حذف کل این صفرها بخشی از واقعیت را دور میریزد و تورش انتخاب نمونه ایجاد میکند. پژوهشگران سنتاً برای اینکه این مشاهدات صفر از دست نروند، عددی ثابت و کوچک به همهٔ مقادیر اضافه میکردند و سپس لگاریتم میگرفتند.
راهحل به ظاهر بیخطر log(y+1) پایایی مقیاس را که شرط بنیادین برآورد درست کشش است، میشکند. اگر تجارت بر حسب تکدلار سنجیده شود، افزودن عدد یک تنها مقدار صفر را به یک دلار میرساند که در برابر ارقام چندمیلیونی اثر چندانی ندارد.
سازوکار اعوجاج مقیاس در دادهها
اما فاجعه از جایی آغاز میشود که همان دادهها را در مقیاسی دیگر تعریف کنیم؛ اگر ارقام به میلیون دلار ثبت شوند، افزودن عدد یک به دادههای صفر یعنی عملاً یک میلیون دلار وارد پایهٔ محاسبات کردهایم. وزن این عدد ثابت بسته به مقیاس متغیر، کاملاً عوض میشود.
از آنجا که این عدد ثابت با دادهها هممقیاس نمیشود، کششهای برآوردشده بهجای بازتاب دادن رفتار اقتصادی، بازیچهٔ واحد اندازهگیری میشوند. دادههایی کاملاً یکسان تنها بهدلیل اینکه بر حسب واحد یا هزار واحد ثبت شدهاند، ضرایب آماری متفاوتی تولید خواهند کرد.
این شکاف تئوریک را در سال ۲۰۰۶ ژوآو سانتوس سیلوا و سیلوانا تنریرو در مقالهای اثرگذار با نام «لگاریتم جاذبه» در نشریه Review of Economics and Statistics برملا کردند. آنها نشان دادند که در حضور ناهمسانی واریانس، برآورد پارامترهای مدلهای لگاریتمی با حداقل مربعات معمولی (OLS) به تخمینهای اریب از کششهای واقعی ختم میشود.[1][3]
سانتوس سیلوا و تنریرو نوشتند: «اگرچه اقتصاددانان از دیرباز با نابرابری ینسن آشنا بودند، پیامد بسیار مهم آن در بسیاری از کاربردهای اقتصادسنجی مغفول ماند». آنها اثبات کردند که ارزش چشمداشتیِ یک لگاریتم برابر با لگاریتمِ ارزش چشمداشتی نیست؛ شکافی که بنیاد مدلهای لگاریتم-خطی را برهم میزند.[1]
نابرابری ینسن میگوید در تبدیلات غیرخطی، تابعِ میانگین با میانگینِ تابع برابر نیست. از آنجا که تابع لگاریتم اکیداً مقعر است، امید ریاضی جملهٔ خطای تبدیلشده شدیداً به واریانس آن بستگی پیدا میکند.[1]
انحراف سیستماتیک ناشی از ناهمسانی واریانس
اگر واریانس جملهٔ خطا در میان مشاهدات ثابت نباشد — وضعیتی که ناهمسانی واریانس نام دارد — امید ریاضی جملهٔ خطا نیز متغیر خواهد شد. این رخداد فرض اساسی OLS را نقض میکند و برآوردگر نوسان واریانس را به حساب متغیرهای مستقل میگذارد و کششها را منحرف میسازد.[1]
نویسندگان مقاله برای رهایی همزمان از بحران صفرهای پرتکرار و تورش ناهمسانی واریانس، پیشنهاد کردند تبدیل لگاریتمی را یکبار برای همیشه کنار بگذاریم و در عوض از برآوردگر شبهدرستنمایی پیوسته پوآسون (PPML) استفاده کنیم؛ برآوردگری که روابط ضربی را مستقیماً در سطح واقعی دادهها برآورد میکند.[1]
برآوردگر PPML بهجای قالبریزی دادهها در یک مدل خطی، یک میانگین شرطی نمایی را بر دادههای خام برازش میدهد. فرم ریاضی مدل E[y|x] = exp(xβ) است و مقادیر صفر را بدون نیاز به هیچ عدد مندرآوردی یا دستکاری داده بهصورت طبیعی در خود جای میدهد.[2]
چون در روش PPML از متغیر وابسته لگاریتم گرفته نمیشود، صفر همان صفر میماند. این برآوردگر با حل معادلات امتیاز پوآسون برای میانگین شرطی، تمام مشاهدات نمونه را حفظ میکند و در عین حال، ضرایب خروجی همچنان درست مانند مدلهای لگاریتم-خطی به صورت کشش تفسیر میشوند.[2]
این برآوردگر نه نیازی دارد که دادهها حتماً از توزیع پوآسون پیروی کنند، و نه متغیر وابسته لزوماً باید عدد صحیح باشد. این یک روش شبهدرستنمایی است؛ یعنی تا زمانی که میانگین شرطی درست تصریح شده باشد، صرفنظر از شکل توزیعِ دادهها، سازگار باقی میماند.[2][6]
برآورد مستقیم در سطوح خام دادهها
فراگیر شدن PPML تا حد زیادی مدیون پیشرفت نرمافزارهای آماری است. امروزه بستههای استاندارد اقتصادسنجی از این برآوردگر پشتیبانی میکنند و پژوهشگران میتوانند مدلهایی با میلیونها مشاهده و چندین اثر ثابت با ابعاد بالا را ظرف چند ثانیه برآورد کنند.[2]
این نرمافزارها برای حل تابع درستنمایی پوآسون از الگوریتم حداقل مربعات با وزندهی مجدد تکراری بهره میبرند. چنین راندمان محاسباتی بالایی آخرین مانع بهکارگیری را برداشت، زیرا در گذشته برآورد مدلهای غیرخطی روی دادههای تابلویی حجیم بار پردازشی سنگینی داشت.[2]
تأثیر عملی استفاده از PPML کاملاً ملموس و قابل سنجش است. در یک مجموعه داده مدل جاذبه با ۲۰۰ مشاهده که ۴۶٫۵ درصد از مقادیر آن صفر است، حذف صفرها برای رگرسیون معمولی شیب گروه را از ۰٫۶۲ به ۰٫۳۷ تنزل میدهد.[2]
این کاهش ۴۰ درصدی در اندازهٔ اثر تنها نتیجهٔ خطای روش آماری منتخب است. روش PPML با نگهداشتن آن ۹۳ مشاهدهٔ صفر و اصلاح ناهمسانی واریانس، اندازهٔ واقعی رابطه را که در پشت پردهٔ مدل لگاریتم-خطی پنهان شده بود آشکار میسازد.[2]
برآوردگر PPML گذشته از مهار صفرها و ناهمسانی واریانس، از یک ویژگی ریاضی منحصربهفرد سود میبرد که آن را برای مدلسازی ساختاری بیبدیل میکند: تنها برآوردگر شبهدرستنمایی است که مجموع جریانهای کل را میان ماتریس واقعی و ماتریس پیشبینیشده حفظ میکند.[4]
پاسخ به معضل جمعپذیری در برآوردها
این چالش که به مسئله «جمعپذیری کل» معروف است، گریبان سایر روشها را میگیرد. در برآورد OLS، حاصلجمع جریانهای تجاری پیشبینیشده در تمام کشورها با رقم واقعی تجارت تطابق ندارد؛ اما PPML تضمین میکند که این دو جمع همواره کاملاً برابر باشند.[4]
بانک جهانی با تأکید بر این ویژگی یادآور شده که PPML تخمینهایی تولید میکند که در آنها سرجمع صادرات واقعی و تخمینی در مقاصد تجاری دقیقاً همپوشانی دارند؛ ثبات ساختاریای که برای شبیهسازی اثر تعرفهها یا توافقهای تجارت آزاد حیاتی است.[4]
رویکرد PPML ادبیات تجربی تجارت را متحول کرده است. مقاله «لگاریتم جاذبه» بیش از ۲۵۰۰ ارجاع در پایگاه EconPapers ثبت کرده و به یکی از ماندگارترین سرفصلهای روششناسی در اقتصاد کاربردی سدهٔ جاری تبدیل شده است.[3]
کاربرد این روش اکنون فراتر از تجارت بینالملل رفته است. در اقتصاد سلامت و مدیریت بازرگانی، از PPML بهطور گسترده برای مهار متغیرهای دارای چولگی مثبت استفاده میشود. هر حوزهای که با دادههای نامنفی و تراکم بالای صفر روبهرو باشد، به این ابزار نیاز دارد.[6]
مثلاً در اقتصاد سلامت، هزینههای درمانی بهشدت به راست چوله هستند و بیماران پرشماری که اصلاً به پزشک مراجعه نکردهاند هزینه صفر ثبت کردهاند. مدل لگاریتمی معمول یا افراد سالم را حذف میکند یا دادههایشان را با یک عدد ثابت منحرف میسازد، اما PPML توزیع واقعی را ثبت میکند.[6]
توسعه فراتر از چارچوبهای اولیه
پژوهشهای نوین اقتصادسنجی همچنان در پی اصلاح چارچوب PPML هستند. در سال ۲۰۲۲ پژوهشگران شبکه CESifo برآوردگر تعمیمیافتهٔ شبهدرستنمایی پوآسون را معرفی کردند تا پیشفرض تناسب مستقیم واریانس شرطی با میانگین شرطی تعدیل شود.[5]
این برآوردگر تعمیمیافته با بهرهگیری از روش گشتاورهای تعمیمیافته تکرارشونده، واریانس شرطی را مستقیماً از خود دادهها استخراج میکند. این کار تخمینها را حتی کاراتر و در برابر ساختارهای گوناگون داده تابآورتر میکند، بدون اینکه توانایی کار با صفرهای اولیه مخدوش شود.[5]
با همهٔ این پیشرفتها، کشف بنیادی سال ۲۰۰۶ همچنان شالودهٔ مدلسازی ضربی مدرن است: قالبریزی اجباری دادهها در یک فرم خطی، خطاهای پنهانی پدید میآورد. بهجای پیچاندن داده، باید مدل را با سرشت واقعی ارقام سازگار کرد.[7]
با همهٔ این پیشرفتها، کشف بنیادی سال ۲۰۰۶ همچنان شالودهٔ مدلسازی ضربی مدرن است: قالبریزی اجباری دادهها در یک فرم خطی، خطاهای پنهانی پدید میآورد.
تکرار پژوهشهای قدیمی با برآوردگر PPML نشان داده که بسیاری از احکام پذیرفتهشدهٔ پیشین فرو میریزند. هنوز بهدرستی معلوم نیست چه تعدادی از یافتههای تجربی ثبتشده در تاریخ اقتصاد و سلامت، صرفاً زاییدهٔ انتخاب دلخواه واحد اندازهگیری در تبدیلهای log(y+1) بودهاند.[7]
برای هر تحلیلگر داده قاعدهٔ راهنما روشن است: زمانی که متغیر نامنفی است، ماهیت ارتباط ضربی است و داده حاوی مقادیر صفر است، استفاده از تبدیل لگاریتمی خطا است. تنها مسیر ریاضی استوار و سازگار، برازش مستقیم در سطوح اولیه از طریق PPML است.[7]
این تحلیل چگونه انجام شد
- روش
- محاسبه تحلیلی تورش کشش وابسته به مقیاس از طریق مقایسه حد ریاضی تبدیل log(y+c) با برآوردگر مستقل از مقیاس PPML در شرایط تغییر مقیاس واحدهای اندازهگیری.
- یافته
- میزان خطای ناشی از راهکار log(y+1) یک انحراف ثابت نیست، بلکه با معکوس واحد اندازهگیری تغییر میکند. در نتیجه، دادههای بنیادین یکسان صرفاً بر پایه اینکه متغیر وابسته بر حسب تکواحد سنجیده شده یا هزاران واحد، ضرایب کشش متفاوتی تولید خواهند کرد؛ نقطهضعفی که برآوردگر PPML کاملاً از آن بری است.
- دادههایی که بر پایهٔ آنها کار کردیم
- تبدیل لگاریتمی OLS به همراه عدد ثابت دلخواه: log(y+1) — The Review of Economics and Statistics
- میانگین شرطی مستقل از مقیاس در برآوردگر PPML: E[y|x] = exp(xβ) — MetricGate
- محدودیتهای این تحلیل
- این استنتاج ریاضی فرض میکند رابطه بنیادین اکیداً ضربی است و متغیرهایی را که در آنها صفر نشانه عدم مشارکت ساختاری واقعی است (و نه راهحل گوشهای)، پوشش نمیدهد.
اصطلاحات کلیدی
- کشش (Elasticity)
- شاخصی برای سنجش میزان پاسخگویی یا تغییر درصدی یک متغیر در برابر درصد معینی تغییر در متغیری دیگر که معمولاً در مدلهای رگرسیون لگاریتم-خطی برآورد میشود.
- پایایی مقیاس (Scale Invariance)
- ویژگی ریاضیاتی که طی آن رابطه میان متغیرها مستقل از واحد اندازهگیری مورد استفاده، استوار و بدون تغییر باقی میماند.
- نابرابری ینسن (Jensen's Inequality)
- قضیهای در ریاضیات که بیان میکند برای توابع غیرخطی، تابعِ میانگین برابر با میانگینِ تابع نیست؛ امری که باعث ایجاد تورش در مدلهای لگاریتم-خطی میشود.
- ناهمسانی واریانس (Heteroskedasticity)
- وضعیتی در آمار که در آن واریانس جملات اخلال در طول مشاهدات یکنواخت نیست؛ امری که به برآوردهای حداقل مربعات معمولی در فرمهای لگاریتمی صدمه میزند.
- شبهدرستنمایی پیوسته پوآسون (PPML)
- تکنیک برآوردی که مدلهای ضربی را مستقیماً روی سطوح داده خام برازش میدهد، مقادیر صفر را پوشش میدهد و خطای ناهمسانی واریانس را برطرف میسازد.
پرسشهای متداول
چرا محاسبه لگاریتم صفر چالشبرانگیز است؟
تابع لگاریتم با نزدیک شدن ورودی به عدد صفر به سمت منفی بینهایت میل میکند، بنابراین لگاریتم صفر از نظر ریاضی تعریفنشده است. این موضوع تحلیلگران را مجبور میکند برای اجرای رگرسیونهای لگاریتم-خطی یا صفرها را حذف کنند یا ساختار داده را تغییر دهند.
آیا میتوان بهجای یک از عدد ثابت بسیار کوچکتری مثل ۰٫۰۰۱ استفاده کرد؟
خیر. افزودن یک عدد ثابت کوچکتر اعوجاج مقیاس را حتی تشدید میکند. هر چقدر عدد کوچکتر باشد، دادههای صفر تغییریافته خط رگرسیون را با شدت بیشتری به سمت خود میکشند و تورش در برآورد کشش بیشتر میشود.
آیا در روش PPML متغیر وابسته حتماً باید اعداد صحیح شمارشی باشد؟
خیر. اگرچه نام این روش از توزیع پوآسون (که مخصوص دادههای شمارشی است) گرفته شده، اما این یک برآوردگر شبهدرستنمایی است و برای هر متغیر پیوسته و نامنفی، برآوردهای سازگار ارائه میدهد.
در چه سناریوهایی نباید از برآوردگر PPML استفاده کرد؟
هنگامی که صفرها نشاندهندهٔ عدم مشارکت ساختاری باشند و نه یک راهحل گوشهای، PPML گزینه مناسبی نیست. برای مثال، نمیتوان از آن برای دستمزد افرادی که خارج از بازار کار هستند استفاده کرد، چرا که دستمزد بالقوه آنها نامشاهدهپذیر است نه واقعاً صفر.
بررسی عمیق دیدگاهها
اقتصادسنجهای کاربردی
پشتیبانی از پایایی ساختاری و عدم وابستگی به مقیاس در مدلسازیهای تجربی.
این طیف معتقدند ساختار آماری رگرسیون باید بازتابدهندهٔ دقیق سازوکار تولید داده باشد. آنها شگرد log(y+1) را یک وصلهٔ غیراصولی میدانند که با ایجاد وابستگی تصنعی به مقیاس، محاسبات کشش را تباه میسازد. از دید این صاحبنظران، استفاده از PPML صرفاً یک تست پایایی ساده نیست، بلکه تنها راهکار استوار و از پیش اثباتشده برای مدلسازی ضربی روی نمونههای دارای صفر است که تمامیت داده خام را نگه میدارد.
طرفداران سنتی OLS
اولویتبخشی به سادگی محاسباتی و شفافیت تفسیر مستقیم در مدلهای خطی-لگاریتمی.
این گروه در گذشته به حداقل مربعات معمولی روی میآوردند چون هزینهٔ محاسباتی اندکی داشت و بستههای نرمافزاری استاندارد بدون زحمت آن را اجرا میکردند. این پژوهشگران معمولاً استدلال میکردند در دادههایی با تعداد صفرهای انگشتشمار و واریانس اندک، خطای ناشی از نابرابری ینسن قابل چشمپوشی است؛ گرچه با اوجگیری توان سختافزارها و اعتبار برهانهای PPML، دیگر دفاع از این رویه دشوار شده است.
توسعهدهندگان نرمافزارهای آماری
تمرکز بر راندمان الگوریتمی و حل سریع اثرات ثابت در ابعاد بالا.
برنامهنویسان بستههای اقتصادسنجی همواره ثبات عددی و پایداری محاسبات برآوردگرها را ملاک عمل قرار میدهند. آنها با بهینهسازی الگوریتمهای حداقل مربعات با وزندهی مجدد تکراری، امکان برازش مدل را روی نمونههای عظیم همراه با انواع متغیرهای ساختاری فراهم کردند و PPML را از نظریهای در کتابها به فرمانی کاربردی و روزمره بدل ساختند.
- اقتصادسنجهای کاربردی
- پشتیبانی از پایایی ساختاری و عدم وابستگی به مقیاس در مدلسازیهای تجربی.
- توسعهدهندگان نرمافزارهای آماری
- تمرکز بر راندمان الگوریتمی و حل سریع اثرات ثابت در ابعاد بالا.
- طرفداران سنتی OLS
- اولویتبخشی به سادگی محاسباتی و شفافیت تفسیر مستقیم در مدلهای خطی-لگاریتمی.
دیدگاههایی که این گزارش پوشش نداده
- پژوهشگران بررسیکنندهٔ مدلهای عدم مشارکت ساختاری
منابع
[1]The Review of Economics and Statisticsاقتصادسنجهای کاربردیThe Log of Gravity
مطالعه در The Review of Economics and Statistics →
[2]MetricGateتوسعهدهندگان نرمافزارهای آماریPoisson Pseudo-Maximum-Likelihood (PPML)
مطالعه در MetricGate →
[3]EconPapersThe Log of Gravity
مطالعه در EconPapers →
[4]World Bankاقتصادسنجهای کاربردیPoisson and the 'Adding Up' Problem
مطالعه در World Bank →
[5]CESifoاقتصادسنجهای کاربردیA Generalized Poisson-Pseudo Maximum Likelihood Estimator
مطالعه در CESifo →
[6]Emerald InsightPoisson pseudo-maximum-likelihood estimator
مطالعه در Emerald Insight →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →مدلسازی آماری
چگونه پارامتر پراکندگی در رگرسیون دوجملهای منفی، بیشپراکندگی دادههای شمارشی را مهار میکند
6 منبع
ارزیابی مدل
چگونه اعتبارسنجی متقاطع K-Fold سوگیری و واریانس را برای تخمین خطای تعمیم مدل متعادل میکند
6 منبع
بازدهی کشاورزی
دادههای کشاورزی ارگانیک در برابر سنتی: چرا اثرات زیستمحیطی به نحوه اندازهگیری شما بستگی دارد
5 منبع
روششناسی آماری
چگونه خطای معیار در مقایسه با انحراف معیار، واریانس ظاهری را فشرده میکند
9 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





