چگونه جریمه درجه دوم در ارزیابی پیشبینی RMSE، دادههای پرت را در مقایسه با زیان خطی MAE مجازات میکند
خطای جذر میانگین مربعات (RMSE) انحرافات پیشبینی را پیش از میانگینگیری به توان دو میرساند و مدلها را وادار میکند تا با شدت از خطاهای بزرگ دوری کنند. در مقابل، خطای میانگین مطلق (MAE) با تمام خطاها به نسبت اندازهشان برخورد میکند؛ سازوکاری که آن را در برابر ناهنجاریها مقاومتر میسازد، اما ممکن است چشم آن را بر روی تکشکستهای فاجعهبار ببندد.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
- طرفداران آمار استوار
- استدلال میکنند که MAE با نادیده گرفتن نویزهای ناهنجار، بازتاب واقعیتری از عملکرد متوسط مدل ارائه میدهد.
- پیشبینیکنندگان ریسکگریز
- RMSE را در اولویت قرار میدهند تا اطمینان حاصل کنند که مدلها با شدت از تکشکستهای فاجعهبار دوری میکنند.
دیدگاههایی که این گزارش پوشش نداده
- پژوهشگران یادگیری عمیق که از معیارهای ترکیبی مانند زیان هیوبر استفاده میکنند
- ذینفعان تجاری که به جریمههای نامتقارن برای پیشبینیهای بیش از حد در برابر پیشبینیهای کمتر از حد نیاز دارند
ارزیابی ریاضی هر مدل پیشبینی به یک قید الزامآور متکی است: این فرض که تابع زیان انتخابشده، هزینه واقعی اشتباه کردن در دنیای واقعی را به دقت بازتاب میدهد. اگر یک الگوریتم پیشبینی هدفی را با اختلاف ده واحد از دست بدهد، سیستم باید بداند که آیا این شکست دقیقاً ده برابر بدتر از یک خطای یک واحدی است، یا صد برابر بدتر. در علم داده مدرن، همین تمایز مکانیسمی است که تعیین میکند مهندسان برای نمرهدهی به مدلهای خود از خطای میانگین مطلق (MAE) استفاده کنند یا خطای جذر میانگین مربعات (RMSE).[1][5]
خطای میانگین مطلق بر اساس یک تناسب دقیق عمل میکند. این معیار، تفاوت مطلق بین مقدار پیشبینیشده و مقدار واقعی را محاسبه کرده و سپس از این تفاوتها در کل مجموعه داده میانگین میگیرد. یک خطای ۴ واحدی دقیقاً دو برابر یک خطای ۲ واحدی جریمه اضافه میکند. به گفته متریکگیت (MetricGate)، این مقیاسبندی خطی باعث میشود MAE به شدت قابل تفسیر باشد، زیرا معیار نهایی دقیقاً با همان واحدهای متغیر هدف بیان میشود. اگر یک الگوریتم خردهفروشی فروش روزانه را پیشبینی کند، MAE برابر با ۵۰ به این معناست که مدل به طور متوسط روزانه ۵۰ کالا خطا دارد.[4]
خطای جذر میانگین مربعات این هندسه را با به توان دو رساندن تفاوتها پیش از میانگینگیری، و سپس گرفتن جذر آن میانگین، تغییر میدهد. این جریمه درجه دوم اساساً درک مدل از شکست را دگرگون میکند. همانطور که ایپیایکس ماشین لرنینگ (ApX Machine Learning) اشاره میکند، به توان دو رساندن خطاها به این معناست که انحرافات بزرگتر به صورت نمایی شدیدتر از انحرافات کوچکتر مجازات میشوند. یک خطای ۱۰ واحدی در طول فرآیند میانگینگیری، ده برابر وزن یک خطای ۱ واحدی را به همراه ندارد؛ بلکه ۱۰۰ برابر وزن دارد.
این واگرایی ریاضی یک بدهبستان ساختاری را در آموزش مدل تحمیل میکند. از آنجا که RMSE نسبت به دادههای پرت بسیار حساس است، یک الگوریتم بهینهسازی به طور فعال دقت خود را در پیشبینیهای عادی و روزمره کاهش میدهد، اگر این کار از یک شکست عظیم منفرد جلوگیری کند. برنامه درسی دیتاکمپ (DataCamp) در مورد توابع زیان تأکید میکند که وقتی «خطاهای بزرگ به طور ویژهای نامطلوب هستند»، RMSE استاندارد پیشفرض است. در مقابل، MAE در برابر دادههای پرت مقاوم است؛ این معیار یک ناهنجاری عظیم را نادیده میگیرد اگر دنبال کردن آن باعث از بین رفتن دقت پایه بقیه مجموعه داده شود.[3]
این واگرایی ریاضی یک بدهبستان ساختاری را در آموزش مدل تحمیل میکند.
با پرنویزتر شدن مجموعه دادهها، این تمایز به یک نقطه تمرکز در یادگیری ماشین کاربردی تبدیل شد. در چارچوبی که در سال ۲۰۲۱ توسط آنالیتیکس ویدیا (Analytics Vidhya) منتشر شد، پژوهشگران تأکید کردند که ارزیابی مدلهای رگرسیون نیازمند درک دقیق همین حساسیت است. نویسندگان بیان میکنند: «RMSE به شدت نسبت به دادههای پرت در مجموعه داده حساس است... اگر دادههای پرت در دادهها داشته باشید، آنها بر معیار RMSE تسلط خواهند یافت.» این تسلط بدان معناست که یک نقطه داده مخدوش میتواند یک پیشبینی بسیار دقیق را منحرف کند.[2]
دوره فشرده یادگیری ماشین گوگل دولوپرز (Google Developers) با تعریف زیان به عنوان یک جریمه قابل اندازهگیری برای یک پیشبینی بد، این موضوع را تقویت میکند. آنها خاطرنشان میکنند که مدلهای رگرسیون خطی به طور سنتی به جای زیان مطلق (L1) بر زیان مجذور (L2) تکیه میکنند، دقیقاً به این دلیل که ویژگیهای ریاضی توابع مجذور، مشتقگیری و بهینهسازی آنها را با استفاده از نزول گرادیان (Gradient Descent) آسانتر میکند. با این حال، این راحتی محاسباتی به قیمت آسیبپذیری در برابر دادههای پرت تمام میشود.[1]
در عمل، این انتخاب است که رفتار سیستم را دیکته میکند. یک مدل پیشبینی شبکه برق نمیتواند ۵۰۰ مگاوات کمبود را تحمل کند، حتی اگر بقیه سال را به طور کامل پیشبینی کند. مهندسان از RMSE استفاده خواهند کرد تا اطمینان حاصل کنند که مدل از آن خطای فاجعهبار خاص میترسد. با این حال، یک تخمینزننده قیمت مسکن ممکن است از MAE استفاده کند، زیرا یک عمارت چند میلیون دلاری منفرد نباید توانایی الگوریتم را در قیمتگذاری خانههای استاندارد حومه شهر مخدوش کند.[4]
رابطه بین این دو معیار همچنین به عنوان یک ابزار تشخیصی عمل میکند. در یک توزیع کاملاً نرمال از خطاها، نسبت RMSE به MAE تقریباً ۱٫۲۵۳ است. زمانی که مهندسان مشاهده میکنند مقدار RMSE به طور قابل توجهی بیش از ۲۵ درصد بالاتر از MAE در همان مجموعه داده است، این موضوع از نظر ریاضی وجود دادههای پرت شدید را در باقیماندههای پیشبینی ثابت میکند و نشان میدهد که مدل در یک زیرمجموعه خاص از دادهها به طور فاجعهباری در حال شکست است.[2][5]
نکات کلیدی
- خطای میانگین مطلق (MAE) جریمهها را به صورت خطی مقیاسبندی میکند و با تمام خطاهای پیشبینی متناسب با اندازهشان برخورد میکند.
- خطای جذر میانگین مربعات (RMSE) انحرافات را به توان دو میرساند و خطاهای بزرگ را به صورت نمایی شدیدتر از خطاهای کوچک مجازات میکند.
- زمانی که خطاهای بزرگ پیشبینی هزینههای سنگینی در دنیای واقعی به همراه دارند، مانند مدیریت شبکه برق، استفاده از RMSE ترجیح داده میشود.
- نسبت بالای RMSE به MAE در یک مجموعه داده یکسان، از نظر ریاضی وجود دادههای پرت شدید را اثبات میکند.
چرا مهم است
انتخاب معیار ارزیابی اشتباه میتواند یک مدل را برای پیامدهای نامطلوب در دنیای واقعی بهینهسازی کند. زنجیره تأمینی که از MAE استفاده میکند، ممکن است یک کمبود عظیم یکروزه را نادیده بگیرد، به شرطی که پیشبینی بقیه ماه دقیق باشد؛ در حالی که RMSE سیستم را مجبور میکند تا جلوگیری از همان یک مورد اتمام موجودی فاجعهبار را در اولویت قرار دهد.
منابع
[1]Google for Developersپیشبینیکنندگان ریسکگریزLinear regression: Loss
مطالعه در Google for Developers →
[2]Analytics Vidhyaپیشبینیکنندگان ریسکگریزA Comprehensive Introduction to Evaluating Regression Models
مطالعه در Analytics Vidhya →
[3]DataCampپیشبینیکنندگان ریسکگریزLoss Functions in Machine Learning Explained
مطالعه در DataCamp →
[4]MetricGateطرفداران آمار استوارRMSE vs. MAE vs. MAPE Compared - MetricGate
مطالعه در MetricGate →
[5]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



