بدهبستان ریاضیاتی میان میانگین و میانه در بهینهسازی تابع زیان
انتخاب میان استفاده از میانگین یا میانه برای خلاصهسازی دادهها، در اساس انتخاب این است که چه جریمه ریاضیاتی بر خطاها اعمال شود. میانگین، خطاهای مجذور (زیان L2) را کمینه میکند، در حالی که میانه خطاهای مطلق (زیان L1) را به حداقل میرساند.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
- نظریهپردازان بهینهسازی کلاسیک
- زیان L2 و میانگین را به دلیل همواری ریاضیاتی، راهحلهای منحصربهفرد و کارایی محاسباتی در نزول گرادیان ترجیح میدهند.
- طرفداران آمار استوار
- زیان L1 و میانه را برای دادههای نویزدار دنیای واقعی ترجیح میدهند، زیرا از مخدوش شدن روند اصلی توسط دادههای پرت جلوگیری میکند.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان یادگیری ماشین که تابع زیان هیوبر را در اولویت قرار میدهند
هنگام خلاصهسازی یک مجموعه داده، «نما» (mode) با اعمال یک جریمه سختگیرانه صفر و یک، پرتکرارترین مقدار را شناسایی میکند؛ این روش تنها به تطابقهای دقیق پاداش میدهد و تمام انحرافها را بدون توجه به فاصلهشان، به طور یکسان مجازات میکند. در مقابل، میانگین و میانه هر دو با اندازهگیری فاصله هر نقطه داده از یک برآورد پیشنهادی، به دنبال یافتن مرکز توزیع هستند. تنها وجه تمایز آنها در نحوه جریمه کردن این فاصله است.[3]
این تمایز صرفاً یک ویژگی توصیفی نیست؛ بلکه یک خاصیت بنیادین در بهینهسازی ریاضیاتی است. در مدلسازی آماری و یادگیری ماشین، یک برآوردگر برای کمینه کردن یک «تابع زیان» مشخص انتخاب میشود - فرمولی ریاضی که هزینه اشتباه کردن را کمّی میکند. انتخاب تابع زیان، شکل مدل نهایی را دیکته میکند.[4]
تابع زیان L2 که معمولاً با نام خطای میانگین مربعات (MSE) شناخته میشود، فاصله بین برآورد و هر نقطه داده را به توان ۲ میرساند. از آنجا که جریمه به صورت درجه دوم رشد میکند، خطایی به اندازه ۴ واحد، ۱۶ برابر شدیدتر از خطای ۱ واحدی مجازات میشود. برای یافتن برآورد بهینهای که این مجموع جریمههای مجذور را به حداقل برساند، باید از تابع زیان مشتق گرفت و آن را برابر با صفر قرار داد.[1][3]
حساب دیفرانسیل یک نتیجه تمیز و ظریف را آشکار میکند: مشتق فاصله مجذور، یک معادله خطی به دست میدهد که در آن مقدار بهینه، به سادگی برابر با مجموع تمام نقاط داده تقسیم بر تعداد آنهاست. این دقیقاً همان تعریف میانگین حسابی است. بنابراین، میانگین، تنها کمینهکننده ریاضیاتی برای زیان L2 است.[4]
بنابراین، میانگین، تنها کمینهکننده ریاضیاتی برای زیان L2 است.
تابع زیان L1، یا خطای مطلق میانگین (MAE)، رویکردی کاملاً متفاوت در پیش میگیرد. این تابع فاصله مطلق بین برآورد و نقاط داده را بدون به توان رساندن آن اندازهگیری میکند. تحت L1، خطایی به اندازه ۴ واحد دقیقاً ۴ برابر شدیدتر از خطای ۱ واحدی مجازات میشود. در اینجا جریمه به جای رشد نمایی، به صورت خطی مقیاسبندی میشود.[2]
بهینهسازی تابع زیان L1 نیازمند یافتن نقطهای است که در آن مجموع انحرافات مطلق کمینه شود. مشتق یک قدر مطلق، یک تابع پلهای است: برای نقاط بالاتر از برآورد مقدار ۱+ و برای نقاط پایینتر از آن مقدار ۱- را برمیگرداند. این سازوکار یک گرادیان ثابت ایجاد میکند که بزرگی خطا را نادیده گرفته و تنها جهت آن را ثبت میکند.[1]
برای برابر قرار دادن این مشتق با صفر و یافتن نقطه کمینه، تعداد ۱+ها باید دقیقاً با تعداد ۱-ها متوازن شود. به عبارت دیگر، برآورد بهینه باید دقیقاً به همان تعداد که نقطه داده در بالای خود دارد، در پایین خود نیز داشته باشد. این تعریف دقیق میانه است. میانه، تنها کمینهکننده برای زیان L1 است.[3][4]
این واقعیت ریاضیاتی دیکته میکند که الگوریتمها در حضور دادههای پرت چگونه رفتار کنند. از آنجا که میانگین خطاهای مجذور را کمینه میکند، یک داده پرت عظیم به تنهایی کششی گرانشی بر روی برآورد اعمال کرده و میانگین را به سمت خود میکشد تا از جریمه فاجعهبار درجه دوم جلوگیری کند. اما میانه که خطاهای مطلق را کمینه میکند، داده پرت را تنها به عنوان یک ۱+ ساده در معادله توازن خود ثبت کرده و بزرگی آن را به کلی نادیده میگیرد.[2]
نکات کلیدی
- میانگین حسابی، کمینهکننده ریاضیاتی برای تابع زیان L2 است که فاصله خطاها را به توان دو میرساند.
- میانه، کمینهکننده ریاضیاتی برای تابع زیان L1 است که فاصله مطلق خطاها را اندازهگیری میکند.
- بهینهسازی L2 برای جلوگیری از جریمههای درجه دوم، برآورد را به سمت دادههای پرت میکشد و آن را نسبت به مقادیر فرین به شدت حساس میکند.
- بهینهسازی L1 تعداد نقاط بالا و پایین برآورد را متوازن میکند و در نتیجه آن را در برابر بزرگی دادههای پرت مقاوم میسازد.
بررسی عمیق دیدگاهها
زیان L2 (خطای میانگین مربعات)
با اعمال یک جریمه درجه دوم بر خطاها، برای میانگین حسابی بهینهسازی میشود.
موافق: از نظر ریاضیاتی هموار و به طور پیوسته مشتقپذیر است که آن را برای الگوریتمهای نزول گرادیان در یادگیری ماشین بسیار کارآمد میکند. این روش یک راهحل منحصربهفرد را تضمین کرده و خطاهای بزرگ را به شدت جریمه میکند تا اطمینان حاصل شود هیچ پیشبینیای به طرز وحشتناکی پرت نیست. مخالف: به شدت نسبت به دادههای پرت حساس است. یک نقطه داده ناهنجار (مثلاً یک خانه ۱۰ میلیون دلاری در محلهای ۳۰۰ هزار دلاری) مدل را به شدت منحرف میکند. شواهد: مشتق x به توان ۲ برابر با 2x است، به این معنی که گرادیان متناسب با بزرگی خطا مقیاس مییابد. مناسب است وقتی: دادهها دارای توزیع نرمال باشند، دادههای پرت خطاهای واقعی باشند که باید اصلاح شوند، یا هزینه تجاری یک خطای بزرگ به صورت نمایی بدتر از یک خطای کوچک باشد. نامناسب است وقتی: مجموعه داده حاوی ناهنجاریهای شدید و غیرمعرفی است که باید نادیده گرفته شوند.
زیان L1 (خطای مطلق میانگین)
با اعمال یک جریمه خطی و ثابت بر خطاها، برای میانه بهینهسازی میشود.
موافق: در برابر دادههای پرت بسیار مقاوم است. از آنجا که جریمه به صورت خطی مقیاس مییابد، یک ناهنجاری عظیم کششی بیشتر از یک انحراف جزئی در همان سمت مرکز، بر روی میانه اعمال نمیکند. مخالف: تابع قدر مطلق در نقطه صفر مشتقپذیر نیست که این امر بهینهسازی را برای برخی الگوریتمهای یادگیری ماشین پیچیده میکند. همچنین اگر مجموعه داده دارای تعداد زوجی از نقاط با یک شکاف در وسط باشد، میتواند چندین راهحل بهینه تولید کند. شواهد: مشتق یک قدر مطلق یک مقدار ثابت ۱+ یا ۱- است، به این معنی که بهینهسازی تنها جهت خطا را میشمارد، نه بزرگی آن را. مناسب است وقتی: مجموعه داده به شدت چوله است (مانند توزیع درآمد، قیمت املاک) و هدف یافتن تجربه معمول است تا مرکز جرم ریاضیاتی. نامناسب است وقتی: خطاهای کوچک و خطاهای بزرگ هزینههای تجاری اساساً متفاوتی دارند، یا زمانی که کارایی محاسباتی در شبکههای عصبی پیچیده در اولویت است.
چرا مهم است
وقتی دانشمندان داده یا تحلیلگران یک برآوردگر را برای خلاصهسازی مجموعه داده یا آموزش مدل یادگیری ماشین انتخاب میکنند، به طور ضمنی در حال تعیین میزان مجازات دادههای پرت هستند. عدم همسویی این برآوردگر با هدف کسبوکار - مانند استفاده از میانگین در زمانی که ناهنجاریهای شدید باید نادیده گرفته شوند - میتواند پیشبینیها و مدلهای مالی را به شدت مخدوش کند.
منابع
[1]Stats StackExchangeطرفداران آمار استوارL1 regression estimates median whereas L2 regression estimates mean?
مطالعه در Stats StackExchange →
[2]PracHubنظریهپردازان بهینهسازی کلاسیکExplain median vs mean for L1/L2
مطالعه در PracHub →
[3]تیم سردبیری کوهستاننظریهپردازان بهینهسازی کلاسیکتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
[4]تیم سردبیری کوهستاننظریهپردازان بهینهسازی کلاسیکتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →مدلسازی آماری
چگونه گامهای امید ریاضی و بیشینهسازی برای یافتن متغیرهای پنهان به برآورد بیشینه درنمایی همگرا میشوند
4 منبع
طراحی کارآزمایی بالینی
چگونه تحلیل «قصد درمان» (ITT) تصادفیسازی را حفظ کرده و از سوگیری انتخاب جلوگیری میکند
9 منبع
تحلیل سریهای زمانی
چگونه پارامتر میرایی در هموارسازی نمایی بین واکنشپذیری به دادههای جدید و پایداری تعادل ایجاد میکند
6 منبع
درک بصری
شواهد علمی پشت طراحی نمودار: مغز انسان چگونه دادههای بصری را پردازش میکند
5 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





