چرا کمینهسازی خطای مطلق، میانه را هدف میگیرد نه میانگین را: ریشه خطای نظاممند در دادههای چوله به راست
میانگین خطای مطلق (MAE) معیاری محبوب برای سنجش مدلهای پیشبینی است چون به همه خطاها وزن یکسان میدهد؛ اما از نظر ریاضی، کمینهسازی MAE مدل را ناگزیر به پیشبینی «میانه» سوق میدهد. در دادههای چوله به راست — نظیر تقاضای خردهفروشی، درآمد یا مدتزمان حضور در وبسایت — میانه همواره کمتر از میانگین است، موضوعی که سبب میشود خروجی تجمیعی مدلهای مبتنی بر MAE بهطور پیوسته کمتر از واقعیت برآورد شود.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- میانگین خطای مطلق (MAE) جریمهای خطی به خطاها میدهد، یعنی هدف ریاضی آن در نقطه بهینه، «میانه» توزیع است.
- در دادههای چوله به راست مانند تقاضای خردهفروشی، میانه همواره از میانگین پایینتر است.
- جمع بستن پیشبینیهای مبتنی بر MAE در سطح اقلام، به کسری انباشته و عظیم در برآورد تقاضای کل منجر میشود.
در این مطلب
هنگامی که دانشمندان داده و برنامهریزان تقاضا دست به ساخت یک مدل پیشبینی جدید میزنند، یکی از نخستین گامها گزینش معیاری است که عیار عملکرد مدل را میسنجد. در این میان، میانگین خطای مطلق (MAE) اغلب بهدلیل شهودی بودن برای مدیران کسبوکار انتخاب میشود؛ چرا که MAE برابر با ۱۰ یعنی پیشبینیهای مدل بهطور متوسط ۱۰ واحد با واقعیت فاصله دارد.[1]
با این حال، این انتخاب بهظاهر ساده، یک پیشفرض ریاضی پنهان را به سیستم تحمیل میکند که نحوه رفتار مدل را در محیط عملیاتی دگرگون میسازد. برعکس میانگین مربعات خطا (MSE) که خطاهای بزرگ را با ضریبی تصاعدی مجازات میکند، MAE جریمهای خطی بر هر خطا اعمال مینماید. وقتی همه انحرافها همارز جریمه شوند، نقطه بهینهای که از نظر ریاضی MAE را به حداقل میرساند، «میانه» توزیع است نه میانگین آن.[3][5]
اگر یک متخصص پیشبینی، مدل یادگیری ماشین خود را منحصراً بر پایه کمینهسازی MAE بهینهسازی کند، عملاً مدل را طوری بار میآورد که میانه را بیابد. تفاوتی که معمولاً در فرآیند آموزش مدل از چشم دور میماند؛ جایی که بسیاری فرض میکنند کمینهسازی هر نوع شاخص خطا، مدل را بهطور خودکار به سمت امید ریاضی یا مقدار مورد انتظار سوق خواهد داد.[1][2]
جدایی میانگین و میانه تنها به این دلیل به یک گلوگاه بحرانی تبدیل میشود که دادههای واقعی در جهان کسبوکار بهندرت متقارناند. ارقامی چون تقاضای خردهفروشی، ترافیک وبسایت و عواید مالی، عموماً دارای چولگی به راست هستند؛ انباشتی از مقادیر خرد در نزدیکی صفر که دمی کشیده از جهشهای گهگاه و انفجاری آنها را همراهی میکند.[1]
در هر توزیع چوله به راست، میانه همواره پایینتر از میانگین جا خوش میکند. از آنجا که دم بلند دادههای فرین، میانگین حسابی را به سمت راست میکشد، میانه همچنان در میانه توده متراکم دادههای کوچک لنگر میاندازد و بالا نمیآید.[1][6]
هنگامی که مدلی آموزش میبیند تا میانه را در چنین دادههایی پیشبینی کند، نوعی سوگیری منفی ساختاری نسبت به میانگین در آن نهادینه میشود. در ارزیابی کالا به کالا یا روز به روز، پیشبینیها کاملاً دقیق به نظر میرسند و حتی در آزمونهای سنجش عملکرد، مدلهای مبتنی بر MSE را شکست میدهند. اما گره ماجرا زمانی آشکار میشود که این پیشبینیهای خرد، تجمیع شوند.[1]
تله تجمیع دادهها
مسئله اساسی به ماهیت ریاضی این دو شاخص بازمیگردد: میانگینها قابلیت جمعپذیری دارند، اما میانهها ندارند. اگر سیستمی میانگین تقاضا را برای تکتک اقلام یک انبار پیشبینی کند، با جمع بستن این ارقام به حجم کل تقاضای واقعی آن انبار دست پیدا خواهد کرد.[1][4]
میانه ابداً چنین رفتاری نشان نمیدهد. از آنجا که در دادههای چوله میانه از میانگین کمتر است، هر پیشبینی فردیِ مدل مبتنی بر MAE اندکی کمتر از متوسط تقاضای واقعی خواهد بود. وقتی دهها هزار مورد از این پیشبینیهای خرد با هم جمع شوند، این کسریهای ناچیز یکدیگر را خنثی نمیکنند.[1]
بلکه برعکس، بر روی هم تلنبار شده و کسری بزرگی در پیشبینی کل حجم انبار رقم میزنند. زنجیره تأمینی که بر پیشبینیهای تجمیعشده MAE تکیه کند، بهطور پیوسته کالا را کمتر از نیاز ثبت سفارش میکند؛ پیامدی که به کسری گسترده موجودی میانجامد، در حالی که داشبوردها بالاترین امتیازهای دقت را در ریزترین لایههای داده گزارش میدهند.[1]
این رخداد در پیشبینی تقاضای متناوب یا منقطع، نظیر قطعات یدکی، کالاهای لوکس یا اقلام فصلی، با شدتی دوچندان بروز میکند. این مجموعه دادهها پر از صفرهای انباشتهاند؛ به این معنا که یک قطعه در بخش عمده روزهای سال فروشی ندارد و تنها در روزهایی خاص خریدهایی ناگهانی و نامنظم را ثبت میکند.[2]
اگر کالایی در بیش از نیمی از روزهای سال هیچ فروشی نداشته باشد، میانه دقیق ریاضی آن توزیع دقیقاً صفر خواهد بود. مدلی که MAE را کمینه میکند خیلی زود میآموزد که امنترین و کمخطاترین پیشبینی برای هر روز سال، پیشبینی عدد صفر است.[2]
اگرچه پیشبینی صفرِ مطلق بر پایه سنجه MAE بینقصترین گزینه آماری است، اما در میدان عمل یک فاجعه به تمام معنا به بار میآورد. ادعای اینکه انبار در آینده نزدیک هیچ تقاضایی نخواهد داشت راهبردی آماری و کمریسک برای فرار از جریمه است، اما عملاً کسبوکار را از حفظ حداقل موجودی برای پاسخ به خریدهای واقعی محروم میکند.[2]
منطق ریاضی جریمه خطا
برای لمس مکانیسم ریاضی MAE، باید سطح جریمه این سنجه را کاوش کرد. هنگام سنجش یک پیشبینی احتمالاتی، خطای مطلق درست در نقطهای کمینه میشود که جرم احتمال توزیع به دو نیمه دقیقاً برابر تقسیم شده باشد.[3]
اگر مدل مقداری بالاتر از میانه تخمین بزند، خطا برای تمامی دادههای واقعیِ پایینتر از آن نقطه افزایش مییابد. بالا یا پایین بردن برآورد به اندازه یک واحد، خطای مطلق مورد انتظار را صرفاً بر اساس شمار مشاهدات در هر دو سو کم و زیاد میکند.[3]
میانگین مربعات خطا (MSE) بر منطقی کاملاً متفاوت استوار است. از آنجا که MSE فاصله پیشبینی تا رخداد واقعی را به توان دو میرساند، خطاهای بزرگ را با شدتی چشمگیر مجازات میکند. مدل برای گریز از این جریمه سنگین درجه دوم، ناچار است برآورد خود را به سمت دم کشیده مقادیر فرین شیفت دهد و دقیقاً بر روی میانگین فرود آید.[1][5]
همین ویژگی، MSE را در سناریوهایی که بار مالی خطاهای پیشبینی تصاعدی رشد میکند، یا وقتی جمع کل تقاضا اهمیتی فراتر از برآورد تکتک اقلام دارد، به گزینهای بهینهتر بدل میسازد. آموزش مدل بر پایه MSE سبب میشود تخمینهای پایه در سطح اقلام کمی بالاتر برود و مانع از کسری ساختاری در افق تجمیعی شود.[1]
تعادل میان پایداری و صحت کلان
با این حال، کوچ کامل به سمت MSE چالشهای خاص خود را در پی دارد. به توان دو رساندن خطاها سبب میشود MSE در برابر دادههای پرت بهشدت آسیبپذیر باشد؛ بهطوری که یک داده مخدوش یا یک تکجهش استثنایی و تکرارناپذیر میتواند ساختار مدل را در تلاش برای صفر کردن خطای درجه دوم دگرگون کند.[5]
مهندسان یادگیری ماشین غالباً MAE را دقیقاً به خاطر همین پایداری در برابر دادههای پرت میپسندند. در محیطهای پر از نوفه، MAE پایهای استوار فراهم میآورد که ناهنجاریهای رادیکال را نادیده میگیرد و مانع از تباهی منطق اصلی مدل توسط چند داده پرت میشود.[5][6]
تیمهای فنی برای آشتی دادن پایداری MAE با ناسوگیری MSE در مقیاس کلان، معمولاً سراغ توابع زیان ترکیبی میروند. تابع زیان هابر (Huber Loss) از نمونههای محبوب است که برای خطاهای بزرگ شبیه MAE عمل میکند تا در برابر پرتها بایستد، و برای خطاهای کوچک رفتاری شبیه MSE پیش میگیرد تا بر میانگین تمرکز داشته باشد.[5]
راهکار پیشرفتهتر دیگر، بهکارگیری خانواده انحراف توئیدی (Tweedie Deviance) است. رگرسیون توئیدی بهطور اختصاصی برای دادههای چوله به راست، با مقادیر صرفاً نامنفی و دمهای سنگین نظیر خسارتهای بیمه، میزان بارندگی یا ارقام فروش تدوین شده و برای پیشبینی تقاضا در غیاب مقادیر منفی انتخابی ساختارمند است.[4]
بهینهسازی بر مدار توئیدی به مهندسان اجازه میدهد سطح جریمه را متناسبسازی کنند؛ با این فرض که توزیع حول نقطه برآورد، به جای نرمال صِرف، دارای توزیع توئیدی است. این تمهید میانهای ریاضی میسازد که چولگی مثبت دادهها را لحاظ میکند بی آنکه مدل را در تله میانه گرفتار سازد.[4]
افزون بر این، میتوان از توابع زیان نامتقارن نظیر زیان چندک (Quantile Loss) یا پینبال (Pinball Loss) سود برد. این شاخصها دست پژوهشگر را باز میگذارند تا جریمه کمبرآوردی را سنگینتر از بیشبرآوردی تعیین کند؛ سناریویی سازگار با خردهفروشی که در آن زیان تمام شدن موجودی از هزینه انبارداری کالا فراتر میرود.[2][4]
نقش تصحیح سوگیری
اگر سیستمی به دلایل میراثی یا سلیقه مدیران ناچار به بهرهگیری از MAE یا همتای درصدی آن، یعنی MAPE باشد، اصلاح پسینیِ سوگیری (Post-hoc Bias Correction) گریزناپذیر خواهد بود. در این رهیافت، مدل ابتدا برای شکار میانه تعلیم مییابد و سپس خروجیها با اعمال ضریبی ریاضی به سمت بالا تعدیل میشوند تا میانگین بازیابی گردد.[4]
یکی از شیوههای متداول تصحیح، وزندهی به فروش در دادههای آموزشی است. با اعمال وزنهای خطی یا رادیکالی مبتنی بر حجم فروش واقعی روی هر ردیف داده، مدل وادار میشود به روزهای پرفروش حساسیت بیشتری نشان دهد و پیشبینی مبتنی بر میانه را به میانگین واقعی نزدیکتر سازد.[4]
پیادهسازی وزندهی به فروش در کتابخانههای استاندارد یادگیری ماشین دشوار نیست، اما دستیابی به نقطه تعادل نیازمند آزمونهای فراوان است؛ چرا که اگر وزنها بیش از حد بزرگ انتخاب شوند، سوگیری منفی معکوس شده و با بیشبرآوردی شدید، دقت سراسری پیشبینی از دست میرود.[4]
در تحلیل نهایی، برگزیدن سنجه ارزیابی تنها یک جزئیات پیشپاافتاده فنی نیست؛ تصمیمی بنیادین برای کسبوکار است که وضعیت انبار، صف نیروهای انسانی و پیشبینی درآمدها را ترسیم میکند. شاخصی که روی داشبورد بیعیبونقص به نظر میآید، چنانچه خواص ریاضیاش با اهداف سازمان همجهت نباشد، کارایی کل سیستم را در سکوت فرسایش میدهد.[1]
تیمهای علم داده باید فراتر از شاخصهای پیشفرض گام بردارند و صراحتاً روشن سازند که سامانههای پاییندستی به «میانگین» نیاز دارند یا «میانه». اگر قرار است پیشبینیها برای تصمیمگیریهای کلان روی هم انباشته شوند، هدف گرفتن میانگین یک ضرورت ساختاری است، حتی اگر MAE بسیار ملموستر به نظر برسد.[1][2]
با بلوغ پیشبینی در یادگیری ماشین، شکاف میان نحوه آموزش مدل و شیوه سنجش آن باید برچیده شود. با درک پیوند عمیق میان MAE، میانه و دادههای چوله به راست، سازمانها میتوانند از تعقیب آمارهای فریبنده دست بکشند و پیشبینیهایی بسازند که هنگام تجمیع، حسابوکتابشان دقیق از آب دربیاید.[6]
این تحلیل چگونه انجام شد
- روش
- محاسبه مجدد پیشبینیهای بهینه ثابت بر روی یک توزیع سنتتیک لاگنرمال و چوله به راست برای مقایسه منحنیهای جریمه در دو سنجه MAE و MSE.
- یافته
- مدلی که MAE را در یک مجموعه داده با چولگی شدید به راست به کمترین حد میرساند، حجم کل تجمیعی را بهصورت ساختاری کمتر از واقعیت برآورد میکند؛ کسری پایایی که با کمینهسازی MSE بهکلی محو میشود.
- دادههایی که بر پایهٔ آنها کار کردیم
- هدف بهینهسازی MAE: Median of the distribution — Blue Yonder
- هدف بهینهسازی MSE: Mean of the distribution — Albert Heijn Technology
- الگوی چولگی تقاضای خردهفروشی: Right-skewed (median < mean) — Albert Heijn Technology
- محدودیتهای این تحلیل
- توزیع دادهها بهصورت دقیق لاگنرمال فرض شده است؛ دادههای جهان واقعی ممکن است الگوهای چولگی متفاوتی داشته باشند یا با کرانهای نامتقارن روبهرو شوند.
اصطلاحات کلیدی
- میانگین خطای مطلق (MAE)
- معیاری که متوسط اختلاف مطلق میان مقادیر پیشبینیشده و مقادیر واقعی را میسنجد و بدون توجه به جهت خطا، برای همه انحرافها جریمه یکسانی در نظر میگیرد.
- میانگین مربعات خطا (MSE)
- معیاری که اختلاف میان پیشبینی و دادههای واقعی را پیش از میانگینگیری به توان دو میرساند و خطاهای بزرگ را بسیار شدیدتر جریمه میکند.
- توزیع چوله به راست (Right-Skewed)
- مجموعه دادهای که در آن بیشتر مقادیر حول اعداد کوچک انباشته شدهاند، اما دمی کشیده از اعداد نادر و بسیار بزرگ به سمت راست امتداد دارد.
- تقاضای متناوب (Intermittent Demand)
- الگویی از فروش که در آن کالا در بازههای زمانی متوالی فروش صفر را ثبت میکند و تنها گاهبهگاه با جهشهای مقطعی روبهرو میشود.
پرسشهای متداول
چرا میانگین خطای مطلق (MAE) میانه را هدف میگیرد؟
سنجه MAE جریمهای کاملاً خطی اعمال میکند؛ یعنی صرفاً فاصله مطلق پیشبینی از واقعیت برایش اهمیت دارد. از نگاه ریاضی، تنها نقطهای که مجموع فاصلههای قدرمطلقی را با تمام دادهها کمینه میکند «میانه» است، زیرا دادهها را دقیقاً به دو نیمه برابر تقسیم میکند.
چه زمانی استفاده از MAE انتخاب درستی است؟
استفاده از MAE زمانی کاملاً معقول است که توزیع دادهها کاملاً متقارن باشد، یا پیشبینی یک متغیر پیوسته مد نظر باشد که دادههای پرت در آن نباید تعقیب شوند. همچنین اگر هزینه ناشی از خطا با بزرگی آن رابطهای کاملاً خطی داشته باشد، MAE انتخابی مناسب است.
انحراف توئیدی (Tweedie deviance) چیست؟
انحراف توئیدی خانوادهای از توابع زیان است که مشخصاً برای دادههای نامنفی، چوله به راست و با دمهای سنگین (مانند ادعاهای بیمه یا فروش خرد) طراحی شده است. این تابع به تحلیلگران امکان میدهد تابع جریمه را تنظیم کنند تا رفتار دم بلند داده لحاظ شود، بدون اینکه مدل الزاماً روی میانه یا میانگین خالص سقوط کند.
بررسی عمیق دیدگاهها
حامیان پیشبینی تجمیعی
اولویت دادن به میانگین برای تضمین انطباق حاصلجمع پیشبینی اقلام با تقاضای واقعی کل.
برای تیمهای زنجیره تأمین و مدیریت انبار، دقت در سطح ارقام تجمیعی بالاترین اهمیت را دارد. چنانچه مدلی به دلیل هدفگیری میانه دچار کمبرآوردی ساختاری شود، انبارها برای پوشش دادن جهشهای دم توزیع با کمبود کالا مواجه میشوند. این کارشناسان استفاده از MSE یا توابع زیان نامتقارن را ترجیح میدهند تا کمبرآوردی جریمه سنگینتری بگیرد و جمع پیشبینیهای خرد با تقاضای کل انبار منطبق شود.
طرفداران پایداری آماری
اولویت دادن به میانه برای پیشگیری از تخریب برآوردهای پایه مدل توسط دادههای ناهنجار و فرین.
مهندسان یادگیری ماشین اغلب تابع زیان MAE یا هابر را انتخاب میکنند چون نسبت به دادههای پرت مقاوماند. در مجموعههایی که پر از دادههای معیوب یا جهشهای غیرعادی است، تابع MSE وزنهای مدل را بهشدت برهم میزند تا تکدادههای پرت را توجیه کند. استدلال این گروه آن است که ساخت مدلی پایدار با هدفگیری میانه، بهتر از آسیب زدن به هسته یادگیری سیستم به بهای تعقیب ناهنجاریهاست.
موافقان تصحیح سوگیری
پشتیبانی از آموزش مدل با MAE و اعمال تعدیلات ریاضی روی خروجیها برای بازسازی میانگین.
این دیدگاه واقعیت ریاضی MAE را میپذیرد اما تمایلی به کنار گذاشتن مقاومت آن ندارد. به جای جابهجایی مستقیم به سمت MSE، مدل را با MAE آموزش میدهند و سپس با تکنیکهای تصحیح پسینی، نظیر وزندهی به فروش در دادههای آموزشی، خروجی را ارتقا میبخشند. بدین ترتیب مدل به روزهای پرفروش اهمیت بیشتری میدهد و تخمین میانه به میانگین نزدیک میشود، بی آنکه الگوریتم زیر بار جریمههای تصاعدی دادههای پرت برود.
- حامیان پیشبینی تجمیعی
- اولویت دادن به میانگین برای تضمین انطباق حاصلجمع پیشبینی اقلام با تقاضای واقعی کل.
- طرفداران پایداری آماری
- اولویت دادن به میانه برای پیشگیری از تخریب برآوردهای پایه مدل توسط دادههای ناهنجار و فرین.
- موافقان تصحیح سوگیری
- پشتیبانی از آموزش مدل با MAE و اعمال تعدیلات ریاضی روی خروجیها برای بازسازی میانگین.
دیدگاههایی که این گزارش پوشش نداده
- مدیران ارشد کسبوکار
- برنامهریزان مالی
منابع
[1]Albert Heijn Technologyحامیان پیشبینی تجمیعیThe choice of loss function matters: MAE targets the median of the demand distribution
مطالعه در Albert Heijn Technology →
[2]OpenForecastموافقان تصحیح سوگیریNaughty APEs and the quest for the holy grail
مطالعه در OpenForecast →
[3]Blue Yonderطرفداران پایداری آماریHow to evaluate Mean Absolute Error for probabilistic forecasts
مطالعه در Blue Yonder →
[4]arXivموافقان تصحیح سوگیریWe also note that optimizing on MAE/ MAPE outputs median sales distribution
مطالعه در arXiv →
[5]MetricGateطرفداران پایداری آماریMetricGate computes MAE and its companion diagnostics
مطالعه در MetricGate →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
تحلیل سریهای زمانی
چگونه آزمون علیت گرنجر تقدم پیشبینانه را میسنجد، نه اثرگذاری علی واقعی را
6 منبع
هوش مصنوعی در زلزلهشناسی
دقت یادگیری عمیق در برابر مدل ETAS در پیشبینی پسلرزهها
6 منبع
اپیدمیولوژی فاضلاب
بسته شواهد: دقت پایش فاضلاب در پیشبینی شیوع منطقهای ویروسها
4 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





