سازوکار منحنی ROC و AUC: چگونه عملکرد مدلهای طبقهبندی مستقل از عدم توازن کلاسها ارزیابی میشود
هنگام ارزیابی مدلهای آماری، اگر دادهها به شدت نامتوازن باشند، دقت استاندارد کارایی خود را از دست میدهد. منحنی مشخصه عملکرد گیرنده (ROC) و مساحت زیر منحنی (AUC) سازوکاری ریاضی برای اندازهگیری قدرت تمایز واقعی ارائه میدهند، هرچند محدودیتهای آنها در عدم توازنهای شدید، به طور فزایندهای مورد بررسی قرار میگیرد.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- آمارشناسان عمومی
- ارزش AUC را به دلیل ناوردایی آستانه و ثبات ریاضی آن در مجموعهدادههای مختلف میدانند.
- محققان رویدادهای نادر
- استدلال میکنند که AUC برای دادههای بسیار نامتوازن به طور خطرناکی خوشبینانه است و معیارهای دقت-بازیابی را ترجیح میدهند.
چرا مهم است
اگر یک آزمایش پزشکی برای بیماریای که ۱ درصد جمعیت به آن مبتلا هستند، ۹۹ درصد دقت داشته باشد، ممکن است صرفاً هر بار حدس بزند «سالم» است—و در نتیجه کاملاً بیفایده باشد. درک ROC و AUC نشان میدهد که چگونه دانشمندان داده از پنهان شدن الگوریتمها پشت نمرات دقت گمراهکننده در حوزههای پرمخاطرهای مانند تشخیص تقلب و تشخیصهای پزشکی جلوگیری میکنند.
هوش مصنوعیای را تصور کنید که برای شناسایی تقلب در کارتهای اعتباری به کار گرفته شده است. تقلب نادر است—شاید یکی از هر ده هزار تراکنش. اگر الگوریتم صرفاً هر تراکنش را تأیید کند و مطلقاً هیچ موردی را علامتگذاری نکند، دقت کلی آن ۹۹٫۹۹ درصد خواهد بود. با این حال، برای بانک، این مدل کاملاً بیفایده است و میلیونها دلار در اثر سرقت از دست خواهد رفت. این تله اساسی در ارزیابی الگوریتمها است: دقت زمانی که دادههای زیربنایی به شدت نامتوازن هستند، یک توهم است. برای درک اینکه دانشمندان داده چگونه این مشکل را حل میکنند، باید فراتر از خروجی نهایی نگاه کنیم و سازوکارهای ریاضی نحوه تصمیمگیری واقعی مدلها را بررسی کنیم.[4][6]
مدلهای طبقهبندی به ندرت یک خروجی باینری ساده «بله» یا «خیر» ارائه میدهند. در عوض، آنها یک احتمال را خروجی میدهند—به عنوان مثال، ۸۵ درصد احتمال تقلب بودن یک تراکنش خاص. سپس اپراتور انسانی یا معماری سیستم باید یک آستانه طبقهبندی تعیین کند. اگر آستانه روی ۵۰ درصد تنظیم شود، هر چیزی بالاتر از آن علامتگذاری تقلب میشود. جابجایی این آستانه، کل رفتار مدل را تغییر میدهد و تعادل بین شناسایی تهدیدات واقعی و آزار دادن مشتریان قانونی را دگرگون میکند.[3]
پایین آوردن آستانه، تقلبهای واقعی بیشتری را شناسایی میکند که نرخ مثبت واقعی (True Positive Rate) را افزایش میدهد. با این حال، به طور همزمان تراکنشهای قانونی بیشتری را نیز علامتگذاری میکند و نرخ مثبت کاذب (False Positive Rate) را افزایش میدهد. منحنی مشخصه عملکرد گیرنده (ROC) یک نمودار ریاضی است که دقیقاً این بدهبستان را ترسیم میکند. این منحنی، نرخ مثبت واقعی را روی محور Y در برابر نرخ مثبت کاذب روی محور X، در تمام آستانههای ممکن، نگاشت میکند و یک نمایش بصری از قدرت تمایز مدل ایجاد میکند.[3]
مدلی که به صورت تصادفی حدس میزند، یک خط مورب مستقیم از پایین سمت چپ به بالا سمت راست نمودار تولید میکند. یک مدل کاملاً نظری، مستقیماً در امتداد محور Y به سمت نرخ مثبت واقعی ۱۰۰ درصد بالا میرود و سپس در امتداد محور X حرکت میکند. بیشتر مدلهای دنیای واقعی منحنیای را تشکیل میدهند که به سمت گوشه بالا سمت چپ خم میشود. هرچه منحنی به آن گوشه بالا سمت چپ نزدیکتر باشد، مدل در تفکیک دو کلاس بهتر عمل میکند، صرف نظر از اینکه آستانه نهایی کجا تنظیم شده است.[3]
از آنجا که خواندن بصری یک منحنی ذهنی است، آمارشناسان مساحت زیر منحنی (AUC) را محاسبه میکنند. این معیار، کل منحنی ROC را در یک عدد واحد بین ۰٫۰ و ۱٫۰ خلاصه میکند. AUC برابر با ۰٫۵ به این معنی است که مدل بهتر از پرتاب سکه نیست؛ AUC برابر با ۱٫۰ به معنای کامل بودن آن است. نکته حیاتی این است که AUC هم نسبت به مقیاس و هم نسبت به آستانه طبقهبندی ناوردا (invariant) است. این معیار کیفیت پیشبینیهای مدل را مستقل از اینکه اپراتور در نهایت چه حد نصاب احتمالی را انتخاب میکند، اندازهگیری میکند.[3]
از آنجا که خواندن بصری یک منحنی ذهنی است، آمارشناسان مساحت زیر منحنی (AUC) را محاسبه میکنند.
ادعای اصلی که از استفاده گسترده از ROC و AUC حمایت میکند، مقاومت آنها در برابر عدم توازن کلاسها است. از آنجا که نرخ مثبت واقعی و نرخ مثبت کاذب مستقل از نسبت کلی موارد مثبت به منفی محاسبه میشوند، منحنی زمانی که مجموعهداده مملو از مثالهای منفی است، به طور مصنوعی بالا نمیرود. یک مدل که روی مجموعهداده کاملاً متوازن ۵۰:۵۰ آزمایش شده است، در صورت آزمایش روی مجموعهداده ۹۹:۱، دقیقاً همان منحنی ROC را تولید خواهد کرد، با فرض اینکه توزیعهای زیربنایی کلاسها ثابت بمانند.[1][5]
با این حال، شواهدی که از AUC به عنوان یک معیار بینقص برای دادههای بسیار نامتوازن حمایت میکنند، به طور فزایندهای در ادبیات آماری مورد مناقشه قرار میگیرند. در حالی که خود معیار از نظر ریاضی دچار اشکال نمیشود، تفسیر آن میتواند در موارد حاد به طور خطرناکی گمراهکننده باشد. در مجموعهدادههایی که کلاس منفی به شدت بیشتر از کلاس مثبت است، تعداد مطلق زیادی از موارد مثبت کاذب به سختی مخرج نرخ مثبت کاذب را جابجا میکند، و باعث میشود منحنی به طور مصنوعی خوشبینانه به نظر برسد.[2][6]
این محدودیت باعث شده است که محققان در موارد عدم توازن شدید، از منحنیهای دقت-بازیابی (Precision-Recall یا PR) حمایت کنند. برخلاف ROC که به نرخ مثبت کاذب نسبت به تمام موارد منفی واقعی نگاه میکند، دقت (Precision) مستقیماً به نسبت مثبتهای واقعی به کل مثبتهای پیشبینی شده مینگرد. اگر یک مدل صد تراکنش را برای گرفتن یک کلاهبردار علامتگذاری کند، نرخ مثبت کاذب آن ممکن است همچنان در منحنی ROC عالی به نظر برسد زیرا میلیونها تراکنش وجود دارد، اما دقت آن تنها ۱ درصد ناامیدکننده خواهد بود.[2][4]
اجماع در شواهد، رویکردی دو شاخه برای ارزیابی مدل را پیشنهاد میکند. منحنیهای ROC همچنان استاندارد طلایی برای ارزیابی مدلهای عمومی و مقایسه قدرت تمایز پایه الگوریتمهای مختلف باقی میمانند. آنها دیدگاهی تمیز و استاندارد از میزان خوب بودن تفکیک کلاسها توسط مدل ارائه میدهند. اما زمانی که هزینه مثبتهای کاذب بالا باشد و کلاس اقلیت به طور استثنایی نادر باشد، محققان قویاً توصیه میکنند که AUC با مساحت زیر منحنی دقت-بازیابی (AUPRC) تکمیل شود.[1][2][4]
سازوکار منحنی ROC یک حقیقت بنیادی در علم داده را نشان میدهد: هیچ معیار واحدی کل داستان را بیان نمیکند. AUC توهم دقت را از بین میبرد و مدلها را مجبور میکند ثابت کنند که واقعاً میتوانند بین کلاسها تمایز قائل شوند، نه اینکه فقط رایجترین نتیجه را حدس بزنند. با این حال، همانطور که یادگیری ماشینی به پدیدههایی که به طور فزایندهای نادر هستند—از نشانگرهای ژنتیکی کمیاب گرفته تا نفوذهای شبکهای ظریف—میپردازد، محدودیتهای AUC به ما یادآوری میکنند که استحکام ریاضی همیشه برابر با کاربرد عملی نیست.[3][6]
نکات کلیدی
- دقت، معیار گمراهکنندهای برای مجموعهدادههای نامتوازن است، زیرا مدلها میتوانند صرفاً با حدس زدن کلاس اکثریت، نمرات بالایی کسب کنند.
- منحنی ROC نرخ مثبت واقعی را در برابر نرخ مثبت کاذب، در تمام آستانههای طبقهبندی ممکن، ترسیم میکند.
- AUC منحنی ROC را در یک نمره واحد بین ۰٫۵ تا ۱٫۰ خلاصه میکند و قدرت پیشبینی را مستقل از آستانه اندازهگیری میکند.
- از آنجا که ROC نرخها را مستقل از توزیع کلاس محاسبه میکند، از نظر ریاضی در برابر دادههای نامتوازن مقاوم است.
- محققان به طور فزایندهای هشدار میدهند که AUC همچنان میتواند عملکرد ضعیف را در عدم توازنهای شدید پنهن کند و از منحنیهای دقت-بازیابی (Precision-Recall) حمایت میکنند.
منابع
[1]PMCآمارشناسان عمومیThe receiver operating characteristic curve accurately assesses imbalanced datasets
مطالعه در PMC →
[2]arXivمحققان رویدادهای نادرA Closer Look at AUROC and AUPRC under Class Imbalance
مطالعه در arXiv →
[3]Google for Developersآمارشناسان عمومیClassification: ROC and AUC
مطالعه در Google for Developers →
[4]MachineLearningMastery.comمحققان رویدادهای نادرROC Curves and Precision-Recall Curves for Imbalanced Classification
مطالعه در MachineLearningMastery.com →
[5]Cross Validatedآمارشناسان عمومیAUC and class imbalance in training/test dataset
مطالعه در Cross Validated →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

