چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
اگرچه AUC اغلب به عنوان یک مساحت هندسی انتزاعی آموزش داده میشود، اما از نظر ریاضی دقیقاً برابر با این احتمال است که مدل، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفی رتبهبندی کند. این همارزی احتمالی، یک نمودار گیجکننده را به معیاری ملموس برای سنجش توانایی مرتبسازی تبدیل میکند.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
- ارزیابان الگوریتمی
- بر استحکام این معیار در تمام آستانههای طبقهبندی ممکن به جای یک مرز تصمیمگیری واحد تمرکز میکنند.
- نظریهپردازان آماری
- بر اثباتهای ریاضی که انتگرال هندسی را به آمارههای رتبهای ناپارامتریک متصل میکند، تأکید دارند.
- دانشمندان داده کاربردی
- برای تفسیر احتمالی به عنوان ابزاری کاربردی جهت انتقال عملکرد مدل به ذینفعان تجاری ارزش قائل هستند.
دیدگاههایی که این گزارش پوشش نداده
- ذینفعان تجاری غیرفنی که مصرفکننده این معیارها هستند
اصطلاحات کلیدی
- طبقهبند دودویی
- یک مدل یادگیری ماشین که برای دستهبندی دادهها دقیقاً در یکی از دو کلاس طراحی شده است، مانند «هرزنامه» یا «غیر هرزنامه».
- نرخ مثبت صحیح
- درصدی از نمونههای مثبت واقعی که مدل به درستی آنها را به عنوان مثبت شناسایی میکند.
- نرخ مثبت کاذب
- درصدی از نمونههای منفی واقعی که مدل به اشتباه آنها را به عنوان مثبت علامتگذاری میکند.
- آماره U ویلکاکسون-من-ویتنی
- یک آزمون آماری ناپارامتریک که برای مقایسه دو نمونه مستقل استفاده میشود و از نظر ریاضی معادل AUC است.
نکات کلیدی
- مساحت زیر منحنی ROC (یا AUC) اغلب به عنوان یک انتگرال هندسی آموزش داده میشود که تفسیر شهودی آن را دشوار میسازد.
- از نظر ریاضی، AUC دقیقاً برابر با این احتمال است که یک مدل، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفی رتبهبندی کند.
- این همارزی احتمالی، مساحت هندسی را مستقیماً به آماره U ویلکاکسون-من-ویتنی متصل میکند.
- مقدار AUC برابر با ۰٫۵۰ به این معنی است که توانایی مرتبسازی مدل معادل پرتاب سکه است، در حالی که AUC زیر ۰٫۵۰ به این معنی است که مدل دادهها را برعکس مرتب میکند.
- از آنجا که AUC به جای آستانههای مطلق بر رتبهبندی نسبی تکیه دارد، برای ارزیابی مجموعه دادههای نامتعادل بسیار قدرتمند است.
کتابهای درسی یادگیری ماشین معمولاً مساحت زیر منحنی مشخصه عملکرد سیستم (AUC-ROC) را به عنوان یک مفهوم کاملاً هندسی معرفی میکنند: فضای دوبعدی زیر خطی که نرخ مثبت صحیح را در برابر نرخ مثبت کاذب رسم میکند. این چارچوببندی باعث میشود متخصصان به یک شبکه مختصات خیره شوند و سعی کنند به طور شهودی بفهمند که مساحت ۰٫۸۵ واقعاً برای مدل آنها چه معنایی دارد. این تعریف بصری نشان میدهد که ارزیابی یک طبقهبند دودویی نیازمند محاسبه انتگرال در تمام آستانههای تصمیمگیری ممکن است؛ مفهومی که توضیح آن با زبان ساده دشوار است.[1][4]
واقعیت ریاضی بسیار ملموستر است. مقدار AUC دقیقاً معادل این احتمال است که طبقهبند به یک نمونه مثبتِ انتخابشده به صورت تصادفی، امتیاز بالاتری نسبت به یک نمونه منفیِ تصادفی اختصاص دهد. این فقط یک شکل هندسی نیست؛ بلکه معیاری برای رتبهبندی است. وقتی یک دانشمند داده مقدار AUC را ۰٫۹۲ گزارش میکند، در واقع میگوید که در ۹۲ مورد از ۱۰۰ جفتسازی تصادفیِ یک مثبت واقعی و یک منفی واقعی، مدل به درستی به نمونه مثبت امتیاز بالاتری میدهد.[5]
این تفسیر احتمالی، نیاز به درک حساب دیفرانسیل و انتگرال یا پویایی آستانهها برای فهمیدن شایستگی پایه یک مدل را از بین میبرد. همانطور که در یک اثبات فنی در سال ۲۰۱۷ که ریاضیاتِ پسزمینه این معیار را شرح میدهد، بیان شده است: «AUC برابر با این احتمال است که یک طبقهبند، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفیِ تصادفی رتبهبندی کند.» این موضوع، انتگرال هندسی را مستقیماً به آماره U ویلکاکسون-من-ویتنی (Wilcoxon-Mann-Whitney) متصل میکند؛ یک آزمون ناپارامتریک که از سال ۱۹۴۷ در آمار استفاده میشود.[5]
برای درک اینکه چگونه هندسه و احتمال با هم همسو میشوند، بررسی نحوه رسم این منحنی کمککننده است. یک طبقهبند دودویی، یک امتیاز احتمال پیوسته بین ۰٫۰ و ۱٫۰ تولید میکند. برای تبدیل این امتیاز به یک پیشبینی قطعیِ «بله» یا «خیر»، سیستم به یک آستانه نیاز دارد. اگر این آستانه روی ۰٫۵۰ تنظیم شود، هر چیزی بالاتر از آن مثبت و هر چیزی پایینتر از آن منفی در نظر گرفته میشود.[4]
جابهجا کردن این آستانه، نرخ خطاهای مدل را تغییر میدهد. کاهش آن به ۰٫۱۰ تقریباً تمام مثبتهای واقعی را شناسایی میکند (نرخ مثبت صحیح بالا) اما در عین حال هشدارهای کاذب زیادی را نیز ثبت میکند (نرخ مثبت کاذب بالا). منحنی ROC این دو نرخ را در برابر یکدیگر در تمام آستانههای ممکن از ۰٫۰ تا ۱٫۰ رسم میکند.[1]
مستندات یادگیری ماشین گوگل اشاره میکند که «AUC یک معیار کلی از عملکرد را در تمام آستانههای طبقهبندیِ ممکن ارائه میدهد.» از آنجا که این معیار روی کل منحنی انتگرال میگیرد، توانایی بنیادین مدل برای جداسازی دو کلاس را ارزیابی میکند، صرفنظر از اینکه مرز تصمیمگیری نهایی کجا ترسیم شده باشد.[1]
تبدیل این معیارِ آستانه تجمعی به یک احتمال رتبهبندی، بر مکانیک انتگرالگیری متکی است. محاسبه مساحت زیر منحنی ROC شامل جمع کردن مستطیلهایی است که توسط نرخ مثبت صحیح در هر افزایشِ نرخ مثبت کاذب تشکیل میشوند. از نظر ریاضی، این جمعبندی دقیقاً معادل شمارش دفعاتی است که یک نمونه مثبت بالاتر از یک نمونه منفی قرار میگیرد، تقسیم بر تعداد کل جفتهای ممکنِ مثبت-منفی.[5]
تبدیل این معیارِ آستانه تجمعی به یک احتمال رتبهبندی، بر مکانیک انتگرالگیری متکی است.
یک کاربرد عملی را در نظر بگیرید: یک الگوریتم تشخیص تقلب که تراکنشهای کارت اعتباری را ارزیابی میکند. اگر سیستم ۱۰٬۰۰۰ تراکنش قانونی و ۱۰۰ تراکنش جعلی را پردازش کند، ارزیابی دقت آن با استفاده از یک درصد استاندارد گمراهکننده است. مدلی که به سادگی همه چیز را تأیید کند، ۹۹٫۰۱ درصد دقت خواهد داشت، اما کاملاً بیفایده است.[6]
معیار AUC با تمرکز دقیق بر ترتیب نسبی تراکنشها، این عدم تعادل کلاسها را نادیده میگیرد. اگر مدل تشخیص تقلب دارای AUC برابر با ۰٫۹۵ باشد، یک حسابرس بانک میتواند به طور تصادفی یکی از ۱۰۰ تراکنش جعلی و یکی از ۱۰٬۰۰۰ تراکنش قانونی را انتخاب کند. در این حالت، ۹۵ درصد احتمال وجود دارد که الگوریتم به تقلب واقعی، امتیاز خطر تقلب بالاتری اختصاص داده باشد.[2]
این ویژگی، معیار مذکور را برای مجموعه دادههای نامتعادل بسیار قدرتمند میسازد. یک تحلیل در سال ۲۰۲۶ از معیارهای طبقهبندی که توسط CASRAI منتشر شده، تأکید میکند که «منحنیهای ROC و AUC ابزارهای ضروری برای ارزیابی عملکرد طبقهبندهای دودویی هستند»، دقیقاً به این دلیل که ارزیابی توانایی مرتبسازی مدل را از توزیع دادههای زیربنایی جدا میکنند.[2]
به طور مشابه، چکیده یک پژوهش اخیر که روشهای ارزیابی را بررسی کرده است، نتیجهگیری کرد که «مساحت زیر منحنی ROC سازگارترین ارزیابی را برای طبقهبندی دودویی دارد» در مقایسه با معیارهایی مانند امتیاز F1 یا دقت خام، که بسته به آستانه انتخابی و نسبت نمونههای مثبت به منفی به شدت در نوسان هستند.[3]
چارچوببندی احتمالی همچنین روشن میکند که یک امتیاز بد واقعاً به چه معناست. مقدار AUC برابر با ۰٫۵۰ نشاندهنده یک خط مورب روی نمودار ROC است. همانطور که راهنمای سال ۲۰۲۶ Displayr توضیح میدهد: «مقدار AUC برابر با ۰٫۵ نشاندهنده عدم تبعیض است، به این معنی که توانایی مدل برای تشخیص بیماران مبتلا و غیرمبتلا به بیماری یا عارضه، دقیقاً مشابه پرتاب یک سکه است.» در تفسیر رتبهبندی، احتمال ۵۰ درصدی به این معناست که وقتی از مدل خواسته میشود یک نمونه مثبت و یک نمونه منفی را مرتب کند، به صورت کورکورانه حدس میزند.[6]
مقدار AUC زیر ۰٫۵۰ نشان میدهد که مدل به طور فعال دادهها را برعکس مرتب میکند. مساحت ۰٫۳۰ به این معنی است که تنها ۳۰ درصد احتمال دارد نمونه مثبت بالاتر رتبهبندی شود، که نشان میدهد مدل به طور سیستماتیک امتیازات بالاتری را به نمونههای منفی اختصاص میدهد. معکوس کردن پیشبینیهای مدل بلافاصله به یک AUC برابر با ۰٫۷۰ منجر میشود.[4]
یک مورد استثنای ریاضی وجود دارد که بیانِ احتمالِ خالص اغلب از آن چشمپوشی میکند: امتیازات برابر. اگر طبقهبند دقیقاً همان احتمال را به هر دو نمونه مثبت و منفیِ تصادفی اختصاص دهد، محاسبه استاندارد ویلکاکسون-من-ویتنی دقیقاً ۰٫۵ امتیاز به این جفت اعطا میکند.[5]
بنابراین، تعریف کاملاً دقیق این است که AUC برابر است با احتمال اینکه یک نمونه مثبت بالاتر از یک نمونه منفی رتبهبندی شود، به علاوه نیمی از احتمال اینکه آنها دقیقاً یکسان رتبهبندی شوند. در مدلهای مدرن یادگیری ماشین که اعداد اعشاری ۳۲ بیتی تولید میکنند، برابریهای دقیق نادر هستند و همین امر باعث میشود بیان سادهشدهی احتمال در تقریباً تمام محیطهای عملیاتی به طور کاربردی دقیق باشد.[7]
با تغییر تعریف از یک مساحت هندسی به یک احتمال رتبهبندی، دانشمندان داده یک ابزار ارتباطی قدرتمند به دست میآورند. ذینفعانی که ممکن است با شنیدن نام انتگرالها و نرخهای مثبت کاذب گیج شوند، میتوانند بلافاصله ارزش سیستمی را درک کنند که در ۹ مورد از ۱۰ مورد، سیگنال را به درستی بالاتر از نویز مرتب میکند.[7]
پرسشهای متداول
آیا AUC برابر با ۰٫۵۰ خوب در نظر گرفته میشود؟
خیر. مقدار AUC برابر با ۰٫۵۰ به این معنی است که توانایی مدل برای رتبهبندی یک نمونه مثبت بالاتر از یک نمونه منفی ۵۰ درصد است؛ یعنی دقیقاً مشابه پرتاب تصادفی یک سکه.
آیا مساحت زیر منحنی میتواند منفی باشد؟
خیر، مقدار AUC بین ۰٫۰ تا ۱٫۰ متغیر است. مقدار AUC زیر ۰٫۵۰ صرفاً به این معنی است که مدل به طور سیستماتیک نمونههای منفی را بالاتر از نمونههای مثبت رتبهبندی میکند.
چرا به جای دقت استاندارد از AUC استفاده کنیم؟
دقت استاندارد میتواند در مجموعه دادههای نامتعادل (مثلاً ۹۹ درصد تراکنشهای قانونی و ۱ درصد تقلب) بسیار گمراهکننده باشد. معیار AUC توانایی مدل را برای مرتبسازی صحیح کلاسها ارزیابی میکند، صرفنظر از اینکه کلاس مثبت چقدر نادر است.
اگر مدل به دو نمونه دقیقاً یک امتیاز یکسان بدهد چه اتفاقی میافتد؟
در محاسبه احتمالی، یک امتیاز برابر، ۰٫۵ امتیاز به جفت اختصاص میدهد، به این معنی که مدل برای این برابری نیمی از امتیاز را دریافت میکند.
منابع
[1]Google for Developersارزیابان الگوریتمیClassification: ROC and AUC
مطالعه در Google for Developers →
[2]CASRAIدانشمندان داده کاربردیROC Curves and AUC: What They Actually Mean
مطالعه در CASRAI →
[3]Research Abstractنظریهپردازان آماریArea under the ROC Curve has the most consistent evaluation for binary classification
مطالعه در Research Abstract →
[4]MLU-Explainارزیابان الگوریتمیROC & AUC - MLU-Explain
مطالعه در MLU-Explain →
[5]Technical Noteنظریهپردازان آماریThe Probabilistic Interpretation of AUC
مطالعه در Technical Note →
[6]Displayrدانشمندان داده کاربردیWhat is a ROC Curve and How to Interpret It
مطالعه در Displayr →
[7]تیم سردبیری کوهستاندانشمندان داده کاربردیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →مکانیک رگرسیون
مکانیسم ضریب تعیین تعدیلشده: چگونه جریمه ریاضی متغیرهای بیربط مانع از بیشبرازش مدل میشود
10 منبع
عیبیابی رگرسیون
چگونه یک مقدار ویژه نزدیک به صفر در ماتریس طراحی، همخطی چندگانه را در رگرسیون آشکار میکند
6 منبع
جداول توافقی
چگونه فراوانی مورد انتظار در یک جدول توافقی، از ضرب مجموعهای حاشیهای تقسیم بر مجموع کل به دست میآید
6 منبع
نظریه آماری
چگونه قضیه حد مرکزی آشوب را مجبور به تبعیت از منحنی زنگولهای میکند
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





