رفتن به محتوای اصلی
کوهستان
توضیح کوهستانتوابع زیانتحلیل خرده‌فروشی· 8 دقیقه مطالعه· در تحلیل داده

چرا کمینه‌سازی خطای مطلق، میانه را هدف می‌گیرد نه میانگین را: ریشه خطای نظام‌مند در داده‌های چوله به راست

میانگین خطای مطلق (MAE) معیاری محبوب برای سنجش مدل‌های پیش‌بینی است چون به همه خطاها وزن یکسان می‌دهد؛ اما از نظر ریاضی، کمینه‌سازی MAE مدل را ناگزیر به پیش‌بینی «میانه» سوق می‌دهد. در داده‌های چوله به راست — نظیر تقاضای خرده‌فروشی، درآمد یا مدت‌زمان حضور در وب‌سایت — میانه همواره کمتر از میانگین است، موضوعی که سبب می‌شود خروجی تجمیعی مدل‌های مبتنی بر MAE به‌طور پیوسته کمتر از واقعیت برآورد شود.

به قلم اِلا فرجاد

به‌طور خلاصه

  • میانگین خطای مطلق (MAE) جریمه‌ای خطی به خطاها می‌دهد، یعنی هدف ریاضی آن در نقطه بهینه، «میانه» توزیع است.
  • در داده‌های چوله به راست مانند تقاضای خرده‌فروشی، میانه همواره از میانگین پایین‌تر است.
  • جمع بستن پیش‌بینی‌های مبتنی بر MAE در سطح اقلام، به کسری انباشته و عظیم در برآورد تقاضای کل منجر می‌شود.

هنگامی که دانشمندان داده و برنامه‌ریزان تقاضا دست به ساخت یک مدل پیش‌بینی جدید می‌زنند، یکی از نخستین گام‌ها گزینش معیاری است که عیار عملکرد مدل را می‌سنجد. در این میان، میانگین خطای مطلق (MAE) اغلب به‌دلیل شهودی بودن برای مدیران کسب‌وکار انتخاب می‌شود؛ چرا که MAE برابر با ۱۰ یعنی پیش‌بینی‌های مدل به‌طور متوسط ۱۰ واحد با واقعیت فاصله دارد.[1]

با این حال، این انتخاب به‌ظاهر ساده، یک پیش‌فرض ریاضی پنهان را به سیستم تحمیل می‌کند که نحوه رفتار مدل را در محیط عملیاتی دگرگون می‌سازد. برعکس میانگین مربعات خطا (MSE) که خطاهای بزرگ را با ضریبی تصاعدی مجازات می‌کند، MAE جریمه‌ای خطی بر هر خطا اعمال می‌نماید. وقتی همه انحراف‌ها هم‌ارز جریمه شوند، نقطه بهینه‌ای که از نظر ریاضی MAE را به حداقل می‌رساند، «میانه» توزیع است نه میانگین آن.[3][5]

اگر یک متخصص پیش‌بینی، مدل یادگیری ماشین خود را منحصراً بر پایه کمینه‌سازی MAE بهینه‌سازی کند، عملاً مدل را طوری بار می‌آورد که میانه را بیابد. تفاوتی که معمولاً در فرآیند آموزش مدل از چشم دور می‌ماند؛ جایی که بسیاری فرض می‌کنند کمینه‌سازی هر نوع شاخص خطا، مدل را به‌طور خودکار به سمت امید ریاضی یا مقدار مورد انتظار سوق خواهد داد.[1][2]

جدایی میانگین و میانه تنها به این دلیل به یک گلوگاه بحرانی تبدیل می‌شود که داده‌های واقعی در جهان کسب‌وکار به‌ندرت متقارن‌اند. ارقامی چون تقاضای خرده‌فروشی، ترافیک وب‌سایت و عواید مالی، عموماً دارای چولگی به راست هستند؛ انباشتی از مقادیر خرد در نزدیکی صفر که دمی کشیده از جهش‌های گهگاه و انفجاری آن‌ها را همراهی می‌کند.[1]

در داده‌های چوله به راست، میانه همواره پایین‌تر از میانگین قرار می‌گیرد و شکافی ساختاری میان این دو شاخص پدید می‌آورد.

در هر توزیع چوله به راست، میانه همواره پایین‌تر از میانگین جا خوش می‌کند. از آنجا که دم بلند داده‌های فرین، میانگین حسابی را به سمت راست می‌کشد، میانه همچنان در میانه توده متراکم داده‌های کوچک لنگر می‌اندازد و بالا نمی‌آید.[1][6]

هنگامی که مدلی آموزش می‌بیند تا میانه را در چنین داده‌هایی پیش‌بینی کند، نوعی سوگیری منفی ساختاری نسبت به میانگین در آن نهادینه می‌شود. در ارزیابی کالا به کالا یا روز به روز، پیش‌بینی‌ها کاملاً دقیق به نظر می‌رسند و حتی در آزمون‌های سنجش عملکرد، مدل‌های مبتنی بر MSE را شکست می‌دهند. اما گره ماجرا زمانی آشکار می‌شود که این پیش‌بینی‌های خرد، تجمیع شوند.[1]

تله تجمیع داده‌ها

مسئله اساسی به ماهیت ریاضی این دو شاخص بازمی‌گردد: میانگین‌ها قابلیت جمع‌پذیری دارند، اما میانه‌ها ندارند. اگر سیستمی میانگین تقاضا را برای تک‌تک اقلام یک انبار پیش‌بینی کند، با جمع بستن این ارقام به حجم کل تقاضای واقعی آن انبار دست پیدا خواهد کرد.[1][4]

میانه ابداً چنین رفتاری نشان نمی‌دهد. از آنجا که در داده‌های چوله میانه از میانگین کمتر است، هر پیش‌بینی فردیِ مدل مبتنی بر MAE اندکی کمتر از متوسط تقاضای واقعی خواهد بود. وقتی ده‌ها هزار مورد از این پیش‌بینی‌های خرد با هم جمع شوند، این کسری‌های ناچیز یکدیگر را خنثی نمی‌کنند.[1]

بلکه برعکس، بر روی هم تلنبار شده و کسری بزرگی در پیش‌بینی کل حجم انبار رقم می‌زنند. زنجیره تأمینی که بر پیش‌بینی‌های تجمیع‌شده MAE تکیه کند، به‌طور پیوسته کالا را کمتر از نیاز ثبت سفارش می‌کند؛ پیامدی که به کسری گسترده موجودی می‌انجامد، در حالی که داشبوردها بالاترین امتیازهای دقت را در ریزترین لایه‌های داده گزارش می‌دهند.[1]

اگرچه پیش‌بینی‌های مدل مبتنی بر MAE در سطح اقلام دقت بالایی دارند، اما هنگام تجمیع با کسری چشمگیر تقاضا مواجه می‌شوند.

این رخداد در پیش‌بینی تقاضای متناوب یا منقطع، نظیر قطعات یدکی، کالاهای لوکس یا اقلام فصلی، با شدتی دوچندان بروز می‌کند. این مجموعه داده‌ها پر از صفرهای انباشته‌اند؛ به این معنا که یک قطعه در بخش عمده روزهای سال فروشی ندارد و تنها در روزهایی خاص خریدهایی ناگهانی و نامنظم را ثبت می‌کند.[2]

اگر کالایی در بیش از نیمی از روزهای سال هیچ فروشی نداشته باشد، میانه دقیق ریاضی آن توزیع دقیقاً صفر خواهد بود. مدلی که MAE را کمینه می‌کند خیلی زود می‌آموزد که امن‌ترین و کم‌خطاترین پیش‌بینی برای هر روز سال، پیش‌بینی عدد صفر است.[2]

اگرچه پیش‌بینی صفرِ مطلق بر پایه سنجه MAE بی‌نقص‌ترین گزینه آماری است، اما در میدان عمل یک فاجعه به تمام معنا به بار می‌آورد. ادعای اینکه انبار در آینده نزدیک هیچ تقاضایی نخواهد داشت راهبردی آماری و کم‌ریسک برای فرار از جریمه است، اما عملاً کسب‌وکار را از حفظ حداقل موجودی برای پاسخ به خریدهای واقعی محروم می‌کند.[2]

منطق ریاضی جریمه خطا

برای لمس مکانیسم ریاضی MAE، باید سطح جریمه این سنجه را کاوش کرد. هنگام سنجش یک پیش‌بینی احتمالاتی، خطای مطلق درست در نقطه‌ای کمینه می‌شود که جرم احتمال توزیع به دو نیمه دقیقاً برابر تقسیم شده باشد.[3]

اگر مدل مقداری بالاتر از میانه تخمین بزند، خطا برای تمامی داده‌های واقعیِ پایین‌تر از آن نقطه افزایش می‌یابد. بالا یا پایین بردن برآورد به اندازه یک واحد، خطای مطلق مورد انتظار را صرفاً بر اساس شمار مشاهدات در هر دو سو کم و زیاد می‌کند.[3]

میانگین مربعات خطا (MSE) بر منطقی کاملاً متفاوت استوار است. از آنجا که MSE فاصله پیش‌بینی تا رخداد واقعی را به توان دو می‌رساند، خطاهای بزرگ را با شدتی چشمگیر مجازات می‌کند. مدل برای گریز از این جریمه سنگین درجه دوم، ناچار است برآورد خود را به سمت دم کشیده مقادیر فرین شیفت دهد و دقیقاً بر روی میانگین فرود آید.[1][5]

توابع زیان گوناگون، هر یک اهداف ریاضی کاملاً متفاوتی را برای پیش‌بینی بهینه می‌سازند.

همین ویژگی، MSE را در سناریوهایی که بار مالی خطاهای پیش‌بینی تصاعدی رشد می‌کند، یا وقتی جمع کل تقاضا اهمیتی فراتر از برآورد تک‌تک اقلام دارد، به گزینه‌ای بهینه‌تر بدل می‌سازد. آموزش مدل بر پایه MSE سبب می‌شود تخمین‌های پایه در سطح اقلام کمی بالاتر برود و مانع از کسری ساختاری در افق تجمیعی شود.[1]

تعادل میان پایداری و صحت کلان

با این حال، کوچ کامل به سمت MSE چالش‌های خاص خود را در پی دارد. به توان دو رساندن خطاها سبب می‌شود MSE در برابر داده‌های پرت به‌شدت آسیب‌پذیر باشد؛ به‌طوری که یک داده مخدوش یا یک تک‌جهش استثنایی و تکرارناپذیر می‌تواند ساختار مدل را در تلاش برای صفر کردن خطای درجه دوم دگرگون کند.[5]

مهندسان یادگیری ماشین غالباً MAE را دقیقاً به خاطر همین پایداری در برابر داده‌های پرت می‌پسندند. در محیط‌های پر از نوفه، MAE پایه‌ای استوار فراهم می‌آورد که ناهنجاری‌های رادیکال را نادیده می‌گیرد و مانع از تباهی منطق اصلی مدل توسط چند داده پرت می‌شود.[5][6]

تیم‌های فنی برای آشتی دادن پایداری MAE با ناسوگیری MSE در مقیاس کلان، معمولاً سراغ توابع زیان ترکیبی می‌روند. تابع زیان هابر (Huber Loss) از نمونه‌های محبوب است که برای خطاهای بزرگ شبیه MAE عمل می‌کند تا در برابر پرت‌ها بایستد، و برای خطاهای کوچک رفتاری شبیه MSE پیش می‌گیرد تا بر میانگین تمرکز داشته باشد.[5]

راهکار پیشرفته‌تر دیگر، به‌کارگیری خانواده انحراف توئیدی (Tweedie Deviance) است. رگرسیون توئیدی به‌طور اختصاصی برای داده‌های چوله به راست، با مقادیر صرفاً نامنفی و دم‌های سنگین نظیر خسارت‌های بیمه، میزان بارندگی یا ارقام فروش تدوین شده و برای پیش‌بینی تقاضا در غیاب مقادیر منفی انتخابی ساختارمند است.[4]

بهینه‌سازی بر مدار توئیدی به مهندسان اجازه می‌دهد سطح جریمه را متناسب‌سازی کنند؛ با این فرض که توزیع حول نقطه برآورد، به جای نرمال صِرف، دارای توزیع توئیدی است. این تمهید میانه‌ای ریاضی می‌سازد که چولگی مثبت داده‌ها را لحاظ می‌کند بی آنکه مدل را در تله میانه گرفتار سازد.[4]

سنجه MSE با اعمال جریمه درجه دوم بر خطاهای کلان، مدل را ناگزیر به تعقیب دم کشیده مقادیر فرین می‌کند.

افزون بر این، می‌توان از توابع زیان نامتقارن نظیر زیان چندک (Quantile Loss) یا پین‌بال (Pinball Loss) سود برد. این شاخص‌ها دست پژوهشگر را باز می‌گذارند تا جریمه کم‌برآوردی را سنگین‌تر از بیش‌برآوردی تعیین کند؛ سناریویی سازگار با خرده‌فروشی که در آن زیان تمام شدن موجودی از هزینه انبارداری کالا فراتر می‌رود.[2][4]

نقش تصحیح سوگیری

اگر سیستمی به دلایل میراثی یا سلیقه مدیران ناچار به بهره‌گیری از MAE یا همتای درصدی آن، یعنی MAPE باشد، اصلاح پسینیِ سوگیری (Post-hoc Bias Correction) گریزناپذیر خواهد بود. در این رهیافت، مدل ابتدا برای شکار میانه تعلیم می‌یابد و سپس خروجی‌ها با اعمال ضریبی ریاضی به سمت بالا تعدیل می‌شوند تا میانگین بازیابی گردد.[4]

یکی از شیوه‌های متداول تصحیح، وزن‌دهی به فروش در داده‌های آموزشی است. با اعمال وزن‌های خطی یا رادیکالی مبتنی بر حجم فروش واقعی روی هر ردیف داده، مدل وادار می‌شود به روزهای پرفروش حساسیت بیشتری نشان دهد و پیش‌بینی مبتنی بر میانه را به میانگین واقعی نزدیک‌تر سازد.[4]

پیاده‌سازی وزن‌دهی به فروش در کتابخانه‌های استاندارد یادگیری ماشین دشوار نیست، اما دست‌یابی به نقطه تعادل نیازمند آزمون‌های فراوان است؛ چرا که اگر وزن‌ها بیش از حد بزرگ انتخاب شوند، سوگیری منفی معکوس شده و با بیش‌برآوردی شدید، دقت سراسری پیش‌بینی از دست می‌رود.[4]

در تحلیل نهایی، برگزیدن سنجه ارزیابی تنها یک جزئیات پیش‌پاافتاده فنی نیست؛ تصمیمی بنیادین برای کسب‌وکار است که وضعیت انبار، صف نیروهای انسانی و پیش‌بینی درآمدها را ترسیم می‌کند. شاخصی که روی داشبورد بی‌عیب‌ونقص به نظر می‌آید، چنانچه خواص ریاضی‌اش با اهداف سازمان هم‌جهت نباشد، کارایی کل سیستم را در سکوت فرسایش می‌دهد.[1]

تصویرگری: دقت در پیش‌بینی‌های تجمیعی، تعیین‌کننده سطح موجودی کالا در سرتاسر زنجیره تأمین است.

تیم‌های علم داده باید فراتر از شاخص‌های پیش‌فرض گام بردارند و صراحتاً روشن سازند که سامانه‌های پایین‌دستی به «میانگین» نیاز دارند یا «میانه». اگر قرار است پیش‌بینی‌ها برای تصمیم‌گیری‌های کلان روی هم انباشته شوند، هدف گرفتن میانگین یک ضرورت ساختاری است، حتی اگر MAE بسیار ملموس‌تر به نظر برسد.[1][2]

با بلوغ پیش‌بینی در یادگیری ماشین، شکاف میان نحوه آموزش مدل و شیوه سنجش آن باید برچیده شود. با درک پیوند عمیق میان MAE، میانه و داده‌های چوله به راست، سازمان‌ها می‌توانند از تعقیب آمارهای فریبنده دست بکشند و پیش‌بینی‌هایی بسازند که هنگام تجمیع، حساب‌وکتابشان دقیق از آب دربیاید.[6]

این تحلیل چگونه انجام شد

روش
محاسبه مجدد پیش‌بینی‌های بهینه ثابت بر روی یک توزیع سنتتیک لاگ‌نرمال و چوله به راست برای مقایسه منحنی‌های جریمه در دو سنجه MAE و MSE.
یافته
مدلی که MAE را در یک مجموعه داده با چولگی شدید به راست به کمترین حد می‌رساند، حجم کل تجمیعی را به‌صورت ساختاری کمتر از واقعیت برآورد می‌کند؛ کسری پایایی که با کمینه‌سازی MSE به‌کلی محو می‌شود.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
محدودیت‌های این تحلیل
توزیع داده‌ها به‌صورت دقیق لاگ‌نرمال فرض شده است؛ داده‌های جهان واقعی ممکن است الگوهای چولگی متفاوتی داشته باشند یا با کران‌های نامتقارن روبه‌رو شوند.

اصطلاحات کلیدی

میانگین خطای مطلق (MAE)
معیاری که متوسط اختلاف مطلق میان مقادیر پیش‌بینی‌شده و مقادیر واقعی را می‌سنجد و بدون توجه به جهت خطا، برای همه انحراف‌ها جریمه یکسانی در نظر می‌گیرد.
میانگین مربعات خطا (MSE)
معیاری که اختلاف میان پیش‌بینی و داده‌های واقعی را پیش از میانگین‌گیری به توان دو می‌رساند و خطاهای بزرگ را بسیار شدیدتر جریمه می‌کند.
توزیع چوله به راست (Right-Skewed)
مجموعه داده‌ای که در آن بیشتر مقادیر حول اعداد کوچک انباشته شده‌اند، اما دمی کشیده از اعداد نادر و بسیار بزرگ به سمت راست امتداد دارد.
تقاضای متناوب (Intermittent Demand)
الگویی از فروش که در آن کالا در بازه‌های زمانی متوالی فروش صفر را ثبت می‌کند و تنها گاه‌به‌گاه با جهش‌های مقطعی روبه‌رو می‌شود.

پرسش‌های متداول

چرا میانگین خطای مطلق (MAE) میانه را هدف می‌گیرد؟

سنجه MAE جریمه‌ای کاملاً خطی اعمال می‌کند؛ یعنی صرفاً فاصله مطلق پیش‌بینی از واقعیت برایش اهمیت دارد. از نگاه ریاضی، تنها نقطه‌ای که مجموع فاصله‌های قدرمطلقی را با تمام داده‌ها کمینه می‌کند «میانه» است، زیرا داده‌ها را دقیقاً به دو نیمه برابر تقسیم می‌کند.

چه زمانی استفاده از MAE انتخاب درستی است؟

استفاده از MAE زمانی کاملاً معقول است که توزیع داده‌ها کاملاً متقارن باشد، یا پیش‌بینی یک متغیر پیوسته مد نظر باشد که داده‌های پرت در آن نباید تعقیب شوند. همچنین اگر هزینه ناشی از خطا با بزرگی آن رابطه‌ای کاملاً خطی داشته باشد، MAE انتخابی مناسب است.

انحراف توئیدی (Tweedie deviance) چیست؟

انحراف توئیدی خانواده‌ای از توابع زیان است که مشخصاً برای داده‌های نامنفی، چوله به راست و با دم‌های سنگین (مانند ادعاهای بیمه یا فروش خرد) طراحی شده است. این تابع به تحلیل‌گران امکان می‌دهد تابع جریمه را تنظیم کنند تا رفتار دم بلند داده لحاظ شود، بدون اینکه مدل الزاماً روی میانه یا میانگین خالص سقوط کند.

بررسی عمیق دیدگاه‌ها

حامیان پیش‌بینی تجمیعی

اولویت دادن به میانگین برای تضمین انطباق حاصل‌جمع پیش‌بینی اقلام با تقاضای واقعی کل.

برای تیم‌های زنجیره تأمین و مدیریت انبار، دقت در سطح ارقام تجمیعی بالاترین اهمیت را دارد. چنانچه مدلی به دلیل هدف‌گیری میانه دچار کم‌برآوردی ساختاری شود، انبارها برای پوشش دادن جهش‌های دم توزیع با کمبود کالا مواجه می‌شوند. این کارشناسان استفاده از MSE یا توابع زیان نامتقارن را ترجیح می‌دهند تا کم‌برآوردی جریمه سنگین‌تری بگیرد و جمع پیش‌بینی‌های خرد با تقاضای کل انبار منطبق شود.

طرفداران پایداری آماری

اولویت دادن به میانه برای پیشگیری از تخریب برآوردهای پایه مدل توسط داده‌های ناهنجار و فرین.

مهندسان یادگیری ماشین اغلب تابع زیان MAE یا هابر را انتخاب می‌کنند چون نسبت به داده‌های پرت مقاوم‌اند. در مجموعه‌هایی که پر از داده‌های معیوب یا جهش‌های غیرعادی است، تابع MSE وزن‌های مدل را به‌شدت برهم می‌زند تا تک‌داده‌های پرت را توجیه کند. استدلال این گروه آن است که ساخت مدلی پایدار با هدف‌گیری میانه، بهتر از آسیب زدن به هسته یادگیری سیستم به بهای تعقیب ناهنجاری‌هاست.

موافقان تصحیح سوگیری

پشتیبانی از آموزش مدل با MAE و اعمال تعدیلات ریاضی روی خروجی‌ها برای بازسازی میانگین.

این دیدگاه واقعیت ریاضی MAE را می‌پذیرد اما تمایلی به کنار گذاشتن مقاومت آن ندارد. به جای جابه‌جایی مستقیم به سمت MSE، مدل را با MAE آموزش می‌دهند و سپس با تکنیک‌های تصحیح پسینی، نظیر وزن‌دهی به فروش در داده‌های آموزشی، خروجی را ارتقا می‌بخشند. بدین ترتیب مدل به روزهای پرفروش اهمیت بیشتری می‌دهد و تخمین میانه به میانگین نزدیک می‌شود، بی آنکه الگوریتم زیر بار جریمه‌های تصاعدی داده‌های پرت برود.

حامیان پیش‌بینی تجمیعی 40%طرفداران پایداری آماری 35%موافقان تصحیح سوگیری 25%
حامیان پیش‌بینی تجمیعی
اولویت دادن به میانگین برای تضمین انطباق حاصل‌جمع پیش‌بینی اقلام با تقاضای واقعی کل.
طرفداران پایداری آماری
اولویت دادن به میانه برای پیشگیری از تخریب برآوردهای پایه مدل توسط داده‌های ناهنجار و فرین.
موافقان تصحیح سوگیری
پشتیبانی از آموزش مدل با MAE و اعمال تعدیلات ریاضی روی خروجی‌ها برای بازسازی میانگین.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مدیران ارشد کسب‌وکار
  • برنامه‌ریزان مالی

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

حامیان پیش‌بینی تجمیعی 40%طرفداران پایداری آماری 35%موافقان تصحیح سوگیری 25%
  1. [1]Albert Heijn Technologyحامیان پیش‌بینی تجمیعی

    The choice of loss function matters: MAE targets the median of the demand distribution

    مطالعه در Albert Heijn Technology →
  2. [2]OpenForecastموافقان تصحیح سوگیری

    Naughty APEs and the quest for the holy grail

    مطالعه در OpenForecast →
  3. [3]Blue Yonderطرفداران پایداری آماری

    How to evaluate Mean Absolute Error for probabilistic forecasts

    مطالعه در Blue Yonder →
  4. [4]arXivموافقان تصحیح سوگیری

    We also note that optimizing on MAE/ MAPE outputs median sales distribution

    مطالعه در arXiv →
  5. [5]MetricGateطرفداران پایداری آماری

    MetricGate computes MAE and its companion diagnostics

    مطالعه در MetricGate →
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.