رفتن به محتوای اصلی
Koohestun
توضیح کوهستانپیش‌پردازش دادهتحلیل بده‌بستان· 5 دقیقه مطالعه· در تحلیل داده

چگونه یک داده پرت جدول رده‌بندی را زیر و رو می‌کند: شکاف ریاضی بین استانداردسازی نمره Z و نرمال‌سازی مین-مکس

هنگام تجمیع معیارهای متعدد در یک رتبه‌بندی واحد، انتخاب روش نرمال‌سازی تعیین‌کننده برنده است. نرمال‌سازی حداقل-حداکثر (مین-مکس) داده‌ها را در مرزهای ثابتی محصور می‌کند، در حالی که استانداردسازی نمره Z فاصله واقعی داده‌های پرت شدید را حفظ می‌کند و اساساً ترتیب قرارگیری نقاط داده در رتبه‌های اول را تغییر می‌دهد.

به قلم فرشید جمشیدی

حافظان واریانس 60%حامیان مرزهای سخت‌گیرانه 40%
حافظان واریانس
حفظ فواصل نسبی واقعی بین نقاط داده را اولویت می‌دهند، حتی اگر به معنای خروجی‌های نامحدود باشد.
حامیان مرزهای سخت‌گیرانه
حفظ مرزهای ریاضیاتی سخت و مقیاس‌های یکنواخت را بر حفظ واریانس اولویت می‌دهند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • حامیان مقیاس‌بندی مقاوم (میانه/دامنه بین چارکی)

در ارزیابی زنجیره تأمین در سال ۲۰۲۳ که در مجله «مرور تولید» (Manufacturing Review) منتشر شد، محققان یک شکنندگی ریاضی را مشاهده کردند که جداول رده‌بندی مدرن را دیکته می‌کند. هنگامی که چندین تأمین‌کننده بر اساس معیارهای متفاوت – هزینه به دلار، سرعت تحویل به روز، نرخ نقص به درصد – ارزیابی می‌شدند، عملکرد فوق‌العاده بالای یک تأمین‌کننده در یک معیار واحد، کل رتبه‌بندی خرید را زیر و رو کرد. داده‌های عملکرد خام تغییری نکرده بودند، اما لنز ریاضیاتی که برای تجمیع آن‌ها استفاده شده بود، تغییر کرده بود.

این مشکل اساسی در تصمیم‌گیری چندمعیاره (MCDM) و پیش‌پردازش یادگیری ماشین است. شما نمی‌توانید دلار را با روز جمع کنید. برای ترکیب آن‌ها در یک امتیاز واحد، داده‌ها باید نرمال‌سازی یا استانداردسازی شوند تا به یک مقیاس مشترک و بدون واحد تبدیل گردند. دو روش غالب برای این تبدیل، نرمال‌سازی حداقل-حداکثر (مین-مکس) و استانداردسازی نمره Z هستند، و انتخاب بین آن‌ها یک گام اداری خنثی نیست. این یک تصمیم سرمقاله‌ای است که تعیین می‌کند چه کسی برنده می‌شود.[1][2][5]

نرمال‌سازی مین-مکس روش شهودی‌تری از این دو است. این روش کمترین مقدار در یک مجموعه داده را می‌گیرد و دقیقاً آن را ۰ قرار می‌دهد، بالاترین مقدار را ۱ قرار می‌دهد و بقیه مقادیر را به طور متناسب در این بین توزیع می‌کند. فرمول به این شکل عمل می‌کند که حداقل مقدار را از مشاهده کم می‌کند، سپس بر دامنه (حداکثر منهای حداقل) تقسیم می‌نماید.[2][4]

آسیب‌پذیری این رویکرد لحظه‌ای آشکار می‌شود که یک داده پرت شدید وارد مجموعه داده شود. اگر ۹۹ تأمین‌کننده قطعه‌ای را در ۱۰ تا ۱۲ روز تحویل دهند، اما یک تأمین‌کننده ۱۵۰ روز طول بکشد، مخرج کسر فرمول مین-مکس منفجر می‌شود. تأمین‌کننده ۱۵۰ روزه تبدیل به ۱ می‌شود، و خوشه ۱۰ تا ۱۲ روزه به شدت در یک نوار کوچک بین ۰.۰۰ و ۰.۰۱ فشرده می‌شود. واریانسی که تأمین‌کنندگان عادی را از هم جدا می‌کرد، به طور ریاضیاتی از بین می‌رود.[3][5]

نرمال‌سازی مین-مکس داده‌ها را به محدوده ۰ تا ۱ محدود می‌کند و باعث می‌شود داده‌های پرت شدید، بقیه مجموعه داده را فشرده سازند.

همانطور که سباستین راشکا، محقق یادگیری ماشین، در تحلیل خود در سال ۲۰۱۴ درباره مقیاس‌بندی ویژگی‌ها اشاره کرد، نرمال‌سازی مین-مکس «داده‌ها را به یک محدوده خاص محدود می‌کند» اما مجموعه داده را نسبت به این مقادیر شدید بسیار حساس می‌سازد. هنگامی که الگوریتم پایین‌دستی به داده‌های مقیاس‌بندی شده مین-مکس نگاه می‌کند، یک ناهنجاری عظیم و یک بلوک همگن از رقبای یکسان می‌بیند که توانایی مدل برای تمایز قائل شدن بین گروه را از بین می‌برد.[4]

استانداردسازی نمره Z رویکرد کاملاً متفاوتی نسبت به مخرج کسر اتخاذ می‌کند. به جای نگاه کردن به حداکثر و حداقل مطلق، داده‌ها را حول میانگین (که آن را ۰ قرار می‌دهد) متمرکز می‌کند و آن را بر اساس انحراف معیار مقیاس‌بندی می‌کند (که واریانس را ۱ قرار می‌دهد). برای محاسبه نمره Z، میانگین را از مشاهده کم کرده و بر انحراف معیار تقسیم می‌کنید.[1][2]

استانداردسازی نمره Z رویکرد کاملاً متفاوتی نسبت به مخرج کسر اتخاذ می‌کند.

تحت استانداردسازی نمره Z، همان داده پرت ۱۵۰ روزه، بقیه داده‌ها را فشرده نمی‌کند. از آنجا که انحراف معیار با استفاده از تمام نقاط داده محاسبه می‌شود، داده پرت یک نمره Z بسیار بزرگ – شاید ۶.۵+ یا ۷.۰+ – دریافت می‌کند، در حالی که تأمین‌کنندگان ۱۰ تا ۱۲ روزه فواصل نسبی خود را از یکدیگر حفظ می‌کنند و حول ۰.۲- تا ۰.۲+ خوشه‌بندی می‌شوند.[3][5]

تفاوت اساسی در مخرج کسر نهفته است: دامنه مطلق در مقابل انحراف معیار.

به‌روزرسانی برنامه درسی ۲۰۲۶ از «آپ‌گرید» (upGrad) بر این تمایز برای مدل‌های یادگیری ماشین تأکید می‌کند. الگوریتم‌هایی که فواصل بین نقاط داده را محاسبه می‌کنند، مانند نزدیک‌ترین همسایگان K (KNN) یا ماشین‌های بردار پشتیبان (SVM)، به داده‌های استاندارد شده نیاز دارند تا از غلبه یک ویژگی با دامنه بزرگ طبیعی (مانند حقوق ۵۰۰,۰۰۰ دلاری) بر یک ویژگی با دامنه کوچک (مانند معدل ۴.۰) جلوگیری شود.[1]

آموزش «دیتاکمپ» (DataCamp) در مورد این موضوع، خط قاطعی را ترسیم می‌کند که چه زمانی باید از هر کدام استفاده کرد. استانداردسازی داده‌ها را به یک محدوده خاص محدود نمی‌کند، که آن را در برابر داده‌های پرت بسیار مقاوم‌تر می‌سازد، اما به طور معمول اعداد منفی تولید می‌کند و فاقد حداکثر تعریف شده است. نرمال‌سازی مین-مکس یک مرز سخت ۰ تا ۱ را تضمین می‌کند، که برای الگوریتم‌هایی مانند شبکه‌های عصبی که ورودی‌های محدود انتظار دارند، یا پردازش تصویر که شدت پیکسل‌ها باید به طور واضح به مقیاس ۰ تا ۲۵۵ نگاشت شوند، ضروری است.[2]

بحث میان متخصصان در پلتفرم‌هایی مانند «استک اکسچنج» (Stack Exchange) اغلب بر توزیع زیربنایی داده‌ها متمرکز است. اگر داده‌ها تقریباً از یک توزیع گوسی (منحنی زنگوله‌ای) پیروی کنند، استانداردسازی نمره Z پیش‌فرض ریاضی است. اگر توزیع کاملاً ناشناخته یا به شدت غیرگوسی باشد، نرمال‌سازی مین-مکس یک استراتژی مهار ایمن‌تر، هرچند شکننده‌تر، ارائه می‌دهد.[3]

از آنجا که نمرات Z واریانس را حفظ می‌کنند، استفاده از آن‌ها به جای نرمال‌سازی مین-مکس می‌تواند یک جدول رده‌بندی را به طور کامل تغییر دهد.

اهمیت این انتخاب ریاضی بسیار فراتر از قفسه‌های سرور است. رتبه‌بندی دانشگاه‌ها، امتیازات ESG (محیط زیستی، اجتماعی و حاکمیتی) شرکت‌ها، و رتبه‌بندی‌های اعتباری دولتی، همگی متکی بر تجمیع معیارهای متفاوت هستند. تغییر از مین-مکس به نمره Z می‌تواند یک دانشگاه متوسط را به سادگی به ۱۰ رتبه برتر منتقل کند، زیرا به موقوفه عظیم و منحصر به فرد آن اجازه داده می‌شود تا وزن کامل خود را بکشد، به جای اینکه در عدد ۱ محدود شود.[5]

معماری یک جدول رده‌بندی در مخرج کسر آن نوشته شده است. هنگامی که یک رتبه‌بندی نهایی منتشر می‌شود، مهم‌ترین متغیر به ندرت عملکرد خام رقباست. بلکه مرز ریاضیاتی است که معماران برای اعمال بر نقاط شدید انتخاب کرده‌اند.[5]

نکات کلیدی

  • نرمال‌سازی مین-مکس تمام داده‌ها را بین ۰ و ۱ محدود می‌کند و آن را نسبت به داده‌های پرت شدید بسیار حساس می‌سازد.
  • استانداردسازی نمره Z داده‌ها را حول میانگین ۰ و انحراف معیار ۱ متمرکز می‌کند و فواصل نسبی را حفظ می‌نماید.
  • الگوریتم‌هایی که به مرزهای سخت نیاز دارند، مانند شبکه‌های عصبی، اغلب از نرمال‌سازی مین-مکس استفاده می‌کنند.
  • الگوریتم‌های مبتنی بر فاصله، مانند نزدیک‌ترین همسایگان K، با استانداردسازی نمره Z عملکرد بهتری دارند تا از اعوجاج ناشی از داده‌های پرت جلوگیری شود.
  • تغییر بین این دو روش می‌تواند ترتیب نهایی رتبه‌بندی‌های تجمیع‌شده، مانند نمرات دانشگاهی یا اعتباری، را به طور کامل دگرگون کند.

بررسی عمیق دیدگاه‌ها

نرمال‌سازی مین-مکس (نرمال‌سازی محدود)

تمام داده‌ها را به اجبار در محدوده سخت ۰ تا ۱ قرار می‌دهد و مقادیر صفر را حفظ کرده و مقیاس یکنواخت را تضمین می‌کند.

مزایا: تضمین می‌کند که همه ویژگی‌ها دقیقاً مقیاس یکسانی دارند، که از نظر ریاضی برای شبکه‌های عصبی و پردازش تصویر (مانند شدت پیکسل ۰ تا ۲۵۵) مورد نیاز است. معایب: نسبت به داده‌های پرت بسیار شکننده است. یک مقدار عظیم واحد، مخرج کسر را منفجر می‌کند و ۹۹٪ باقیمانده مجموعه داده را در یک نوار میکروسکوپی فشرده کرده و واریانس را از بین می‌برد. شواهد: در الگوریتم‌های مبتنی بر فاصله، نرمال‌سازی مین-مکس با وجود داده پرت، دقت مدل را به طور قابل توجهی کاهش می‌دهد زیرا نقاط داده عادی غیرقابل تشخیص می‌شوند. زمان مناسب استفاده: زمانی که داده‌ها دارای محدودیت‌های سخت و شناخته شده بدون داده‌های پرت شدید باشند، یا زمانی که الگوریتم پایین‌دستی به شدت به ورودی محدود نیاز داشته باشد. زمان نامناسب استفاده: زمانی که مجموعه داده حاوی داده‌های پرت شدید و غیرقابل پیش‌بینی باشد.

استانداردسازی نمره Z (حفظ واریانس)

داده‌ها را حول میانگین ۰ و با انحراف معیار ۱ متمرکز می‌کند و به داده‌های پرت اجازه می‌دهد فاصله واقعی خود را حفظ کنند.

مزایا: فواصل نسبی بین نقاط داده عادی را حفظ می‌کند، حتی زمانی که یک داده پرت عظیم وجود داشته باشد. داده پرت یک نمره بالا (مثلاً ۶.۵+) دریافت می‌کند بدون اینکه واریانس ۰.۲- تا ۰.۲+ گروه را له کند. معایب: محدوده محدود تولید نمی‌کند و به طور معمول اعداد منفی تولید می‌کند، که الگوریتم‌هایی را که انتظار ورودی‌های مثبت دارند، مختل می‌کند. شواهد: تحلیل مؤلفه‌های اصلی (PCA) و الگوریتم‌های گرادیان کاهشی زمانی که ویژگی‌ها با واریانس واحد و میانگین صفر متمرکز شده‌اند، به طور قابل توجهی سریع‌تر و دقیق‌تر همگرا می‌شوند. زمان مناسب استفاده: زمانی که داده‌ها تقریباً از توزیع گوسی پیروی می‌کنند، یا زمانی که حفظ فاصله دقیق داده‌های پرت برای تحلیل حیاتی است. زمان نامناسب استفاده: زمانی که مدل پایین‌دستی به هیچ وجه نمی‌تواند اعداد منفی یا حداکثر نامحدود را تحمل کند.

چرا مهم است

هر رتبه‌بندی تجمیع‌شده‌ای – از جداول لیگ دانشگاهی گرفته تا امتیازات ESG شرکت‌ها و رتبه‌بندی‌های اعتباری – متکی بر یک فرمول ریاضی برای ترکیب معیارهای متفاوت است. انتخاب آن فرمول می‌تواند به تنهایی یک برنده را معرفی یا یک رقیب را دفن کند، حتی زمانی که داده‌های عملکردی زیربنایی کاملاً یکسان باشند.

آنچه نمی‌دانیم

  • سیستم‌های رتبه‌بندی تجاری بزرگ (مانند جداول لیگ دانشگاهی) با چه تناوبی روش‌های مقیاس‌بندی خود را سال به سال تغییر می‌دهند تا به طور مصنوعی تحرک (جابجایی رتبه) را افزایش دهند.
  • آیا روش‌های نوظهور «مقیاس‌بندی مقاوم» (Robust Scaling) که از میانه و دامنه بین چارکی استفاده می‌کنند، در نهایت جایگزین نمرات Z به عنوان پیش‌فرض صنعت خواهند شد یا خیر.

منابع

پوشش منابع

5 منبع

2 دیدگاه شناسایی‌شده

حافظان واریانس 60%حامیان مرزهای سخت‌گیرانه 40%
  1. [1]upGradحافظان واریانس

    Normalization vs Standardization in Machine Learning

    مطالعه در upGrad →
  2. [2]DataCampحامیان مرزهای سخت‌گیرانه

    Normalization vs. Standardization: Key Differences Explained

    مطالعه در DataCamp →
  3. [3]Stack Exchangeحافظان واریانس

    z-score VS min-max normalization

    مطالعه در Stack Exchange →
  4. [4]Sebastian Raschkaحامیان مرزهای سخت‌گیرانه

    About Feature Scaling and Normalization

    مطالعه در Sebastian Raschka →
  5. [5]تیم سردبیری کوهستانحافظان واریانس

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.