رفتن به محتوای اصلی
توضیح کوهستانمدل‌سازی پیش‌بینانهتوضیح و تشریح۹ شهریور ۱۴۰۵، ۷:۲۳· 5 دقیقه مطالعه· در تحلیل داده

سازوکار عملکرد مدل: مقایسه ضریب تعیین (R-Squared)، میانگین مجذور خطا (RMSE) و اعتبارسنجی متقابل

کسب امتیاز دقت بالا در مجموعه داده‌های آموزشی اغلب ناتوانی یک مدل پیش‌بینانه را در مواجهه با داده‌های دنیای واقعی پنهان می‌کند. درک نقش‌های متمایز ضریب تعیین (R-Squared)، میانگین مجذور خطا (RMSE) و اعتبارسنجی متقابل، نشان می‌دهد که دانشمندان داده چگونه قدرت پیش‌بینی واقعی را اندازه‌گیری می‌کنند.

به قلم اِلا فرجاد

مهندسان یادگیری ماشین 35%محققان کاربردی 35%آمارگران سنتی 30%
مهندسان یادگیری ماشین
تمرکز زیادی بر RMSE و معیارهای خطای مطلق دارند تا هزینه واقعی پیش‌بینی‌های نادرست را به حداقل برسانند.
محققان کاربردی
بر اعتبارسنجی متقابل و آزمون خارج از نمونه تأکید می‌کنند تا اطمینان حاصل شود که مدل‌ها برای استقرار در زمینه‌های حیاتی مانند مراقبت‌های بهداشتی ایمن هستند.
آمارگران سنتی
اولویت را به ضریب تعیین (R-squared) و قابلیت تفسیر مدل می‌دهند تا روابط زیربنایی بین متغیرها را درک کنند.

شایع‌ترین اشتباه در علم داده، باور کردن کارنامه خود مدل است. وقتی یک الگوریتم پیش‌بینی نرخ دقت ۹۹٪ را اعلام می‌کند، فرض اولیه این است که واقعیت زیربنایی را به طور کامل ترسیم کرده است. اما در عمل، مدلی که در داده‌هایی که با آن‌ها ساخته شده است بی‌نقص عمل می‌کند، اغلب به جای یادگیری نحوه پیش‌بینی آینده، در حال حفظ کردن گذشته است. این پدیده که به عنوان بیش‌برازش (Overfitting) شناخته می‌شود، دلیلی است که چرا مدل‌هایی که در آزمایشگاه عالی به نظر می‌رسند، هنگام استقرار در دنیای واقعی اغلب شکست می‌خورند.[2][7]

برای درک اینکه آمارگران و مهندسان یادگیری ماشین چگونه ارزش یک مدل را اندازه‌گیری می‌کنند، باید فراتر از خلاصه‌های تک‌عددی نگاه کنیم. ارزیابی مدل‌های پیش‌بینانه متکی بر یک سه‌گانه از بررسی‌های مکانیکی متمایز است: اندازه‌گیری نسبت واریانس توضیح داده شده، محاسبه بزرگی مطلق خطاها، و شبیه‌سازی جهل آینده از طریق تقسیم داده‌ها.[3][7]

اولین و مشهورترین این معیارها، ضریب تعیین یا R-squared است. R-squared به یک سؤال خاص پاسخ می‌دهد: چه مقدار از پراکندگی (واریانس) در متغیر هدف توسط ورودی‌های مدل توضیح داده می‌شود؟ اگر یک مدل پیش‌بینی قیمت مسکن دارای R-squared معادل ۰.۸۰ باشد، به این معنی است که ۸۰٪ از تفاوت‌های قیمت توسط متغیرهایی که مدل از آن‌ها آگاه است، مانند متراژ و موقعیت مکانی، توجیه شده است.[1][3]

R-squared میزان توضیح واریانس توسط مدل را اندازه‌گیری می‌کند، در حالی که RMSE فاصله مطلق خطاها را می‌سنجد.

تحقیقات تطبیقی اخیر نشان می‌دهد که R-squared به دلیل ارائه یک مقیاس نرمال‌شده—که همیشه بین ۰ و ۱ (یا ۰٪ و ۱۰۰٪) قرار می‌گیرد—به طور منحصر به فردی آموزنده باقی می‌ماند و آن را در انواع مختلف مجموعه‌داده‌ها قابل تفسیر می‌سازد. برخلاف سایر معیارها، این معیار فوراً به شما می‌گوید که آیا مدل شما بهتر از این است که صرفاً هر بار میانگین مقدار را حدس بزنید یا خیر.[1]

با این حال، R-squared در صورت استفاده انفرادی، یک نقص اساسی دارد: به شما نمی‌گوید که پیش‌بینی‌های شما در واقعیت چقدر با مقادیر واقعی فاصله دارند. یک مدل می‌تواند R-squared بالایی داشته باشد اما همچنان به طور سیستماتیک با حاشیه بزرگی اشتباه کند، یا می‌تواند R-squared پایینی داشته باشد اما پیش‌بینی‌هایی انجام دهد که برای استفاده عملی به اندازه کافی نزدیک باشند. علاوه بر این، افزودن متغیرهای بیشتر به یک مدل همیشه به طور مصنوعی R-squared را افزایش می‌دهد، حتی اگر آن متغیرها نویز تصادفی باشند.[3][7]

با این حال، R-squared در صورت استفاده انفرادی، یک نقص اساسی دارد: به شما نمی‌گوید که پیش‌بینی‌های شما در واقعیت چقدر با مقادیر واقعی فاصله دارند.

اینجاست که میانگین مجذور خطای ریشه (RMSE) وارد معادله می‌شود. اگر R-squared معیاری برای همبستگی و واریانس توضیح داده شده باشد، RMSE معیاری برای فاصله مطلق است. این معیار میانگین فاصله بین پیش‌بینی‌های مدل و مقادیر مشاهده شده واقعی را محاسبه می‌کند، که با همان واحدهای متغیر هدف اندازه‌گیری می‌شود.[1][3]

"مجذور" (Square) در میانگین مجذور خطای ریشه یک انتخاب ریاضی عمدی است. با مجذور کردن خطاها قبل از میانگین‌گیری، RMSE خطاهای بزرگ را به شدت جریمه می‌کند. اگر یک مدل پیش‌بینی تقاضای موجودی کالا ده بار به اندازه یک واحد خطا کند، و مدل دیگری یک بار به اندازه ده واحد خطا کند، RMSE مدل دوم را بسیار بدتر ارزیابی خواهد کرد. در زمینه‌هایی مانند تشخیص‌های پزشکی یا پیش‌بینی مالی، یک خطای بزرگ واحد اغلب بسیار فاجعه‌بارتر از مجموعه‌ای از عدم دقت‌های جزئی است.[2][3]

با این حال، حتی یک مدل با R-squared بالا و RMSE پایین نیز برای دنیای واقعی آماده نیست، اگر این معیارها با استفاده از داده‌های آموزشی محاسبه شده باشند. مدلی که پاسخ‌ها را قبل از آزمون دیده باشد، همیشه به طور مصنوعی عملکرد خوبی خواهد داشت. برای کشف اینکه آیا یک مدل واقعاً الگوهای زیربنایی را آموخته است، دانشمندان داده از تکنیکی به نام اعتبارسنجی متقابل (Cross-validation) استفاده می‌کنند.[6][7]

در اعتبارسنجی متقابل کا-تا، مجموعه داده به طور مکرر برش داده می‌شود تا مدل همیشه بر روی داده‌هایی که هرگز ندیده است، آزمایش شود.

اعتبارسنجی متقابل، نهایی‌ترین بررسی واقعیت است. به جای آموزش مدل بر روی کل مجموعه داده، داده‌ها به بخش‌های متعدد یا "تا" (folds) تقسیم می‌شوند. در رایج‌ترین رویکرد، اعتبارسنجی متقابل کا-تا (k-fold)، مدل بر روی زیرمجموعه‌ای از داده‌ها آموزش داده می‌شود و سپس بر روی بخش "نگه‌داشته‌شده" (holdout) که قبلاً هرگز ندیده است، آزمایش می‌شود.[4][6]

این فرآیند چندین بار تکرار می‌شود، به طوری که در هر دور، بخش متفاوتی به عنوان آزمون نگه‌داشته‌شده عمل می‌کند. با میانگین‌گیری عملکرد در تمام این آزمون‌های شبیه‌سازی شده دنیای واقعی، مهندسان تخمین بسیار صادقانه‌تری از نحوه عملکرد مدل بر روی داده‌های آینده و دیده نشده به دست می‌آورند. این روش به صراحت توانایی مدل در تعمیم دادن (Generalize) را آزمایش می‌کند، نه حفظ کردن.[4][5]

ضرورت این سه‌گانه—R-squared برای واریانس توضیح داده شده، RMSE برای بزرگی خطا، و اعتبارسنجی متقابل برای تعمیم‌پذیری—به طور فزاینده‌ای در دستورالعمل‌های بالینی و صنعتی مدون می‌شود. به عنوان مثال، ارزیابی مدل‌های یادگیری ماشین برای ارزش تشخیصی در مراقبت‌های بهداشتی اکنون به شدت نیازمند معیارهای اعتبارسنجی متقابل است تا از تشخیص اشتباه مطمئن بیماران توسط الگوریتم‌ها بر اساس همبستگی‌های کاذبی که در داده‌های آموزشی یافت شده‌اند، جلوگیری شود.[2][7]

هیچ معیار واحدی تصویر کاملی از آمادگی یک مدل برای استقرار در دنیای واقعی ارائه نمی‌دهد.

در نهایت، هیچ معیار واحدی نمی‌تواند تمام واقعیت یک مدل پیش‌بینانه را به تصویر بکشد. R-squared به شما می‌گوید که آیا در مسیر درست هستید، RMSE به شما می‌گوید که چقدر ممکن است بد تصادف کنید، و اعتبارسنجی متقابل به شما می‌گوید که آیا وسیله نقلیه شما واقعاً می‌تواند در جاده‌ای که قبلاً ندیده است رانندگی کند. درک این سازوکارها تمرکز را از دنبال کردن یک امتیاز عالی به سمت ساختن یک سیستم قوی و قابل اعتماد تغییر می‌دهد.[7]

نکات کلیدی

  1. مدلی که در داده‌های آموزشی خود نمره عالی می‌گیرد، اغلب دچار «بیش‌برازش» شده و در دنیای واقعی شکست خواهد خورد.
  2. R-squared میزان واریانسی را که مدل توضیح می‌دهد اندازه‌گیری می‌کند، اما اندازه مطلق خطاهای آن را نشان نمی‌دهد.
  3. RMSE به شدت خطاهای بزرگ را جریمه می‌کند، که آن را برای پیش‌بینی‌های حساس مانند مراقبت‌های بهداشتی حیاتی می‌سازد.
  4. اعتبارسنجی متقابل با آزمایش مدل بر روی داده‌هایی که هرگز ندیده است، شرایط دنیای واقعی را شبیه‌سازی می‌کند.
  5. علم داده مدرن برای سنجش دقیق قدرت پیش‌بینی واقعی یک مدل، به ترکیبی از این معیارها نیاز دارد.

چرا مهم است

از آنجایی که هوش مصنوعی و الگوریتم‌های پیش‌بینانه به طور فزاینده‌ای تشخیص‌های پزشکی، تأییدیه‌های مالی و زنجیره‌های تأمین را هدایت می‌کنند، درک نحوه ارزیابی این مدل‌ها حیاتی است. تکیه بر یک معیار ناقص می‌تواند منجر به شکست‌های فاجعه‌بار شود، به ویژه زمانی که الگوریتم‌ها با عدم قطعیت‌های دنیای واقعی مواجه می‌شوند.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

مهندسان یادگیری ماشین 35%محققان کاربردی 35%آمارگران سنتی 30%
  1. [1]PMCآمارگران سنتی

    The coefficient of determination R-squared is more informative than SMAPE, MAE, MAPE, MSE and RMSE in regression analysis evaluation

    مطالعه در PMC
  2. [2]NCBI - NIHمحققان کاربردی

    Evaluating Machine Learning Models and Their Diagnostic Value

    مطالعه در NCBI - NIH
  3. [3]NVIDIA Technical Blogمهندسان یادگیری ماشین

    A Comprehensive Overview of Regression Evaluation Metrics

    مطالعه در NVIDIA Technical Blog
  4. [4]University of Illinoisمحققان کاربردی

    Cross Validation in Python - Data Science Discovery

    مطالعه در University of Illinois
  5. [5]Statologyمحققان کاربردی

    How to Perform Cross Validation for Model Performance in R

    مطالعه در Statology
  6. [6]Courseraمحققان کاربردی

    What Is Cross-Validation in Machine Learning?

    مطالعه در Coursera
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.