چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
اگرچه AUC اغلب به عنوان یک مساحت هندسی انتزاعی آموزش داده میشود، اما از نظر ریاضی دقیقاً برابر با این احتمال است که مدل، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفی رتبهبندی کند. این همارزی احتمالی، یک نمودار گیجکننده را به معیاری ملموس برای سنجش توانایی مرتبسازی تبدیل میکند.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- مساحت زیر منحنی ROC (یا AUC) اغلب به عنوان یک انتگرال هندسی آموزش داده میشود که تفسیر شهودی آن را دشوار میسازد.
- از نظر ریاضی، AUC دقیقاً برابر با این احتمال است که یک مدل، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفی رتبهبندی کند.
- این همارزی احتمالی، مساحت هندسی را مستقیماً به آماره U ویلکاکسون-من-ویتنی متصل میکند.
کتابهای درسی یادگیری ماشین معمولاً مساحت زیر منحنی مشخصه عملکرد سیستم (AUC-ROC) را به عنوان یک مفهوم کاملاً هندسی معرفی میکنند: فضای دوبعدی زیر خطی که نرخ مثبت صحیح را در برابر نرخ مثبت کاذب رسم میکند.
این چارچوببندی باعث میشود متخصصان به یک شبکه مختصات خیره شوند و سعی کنند به طور شهودی بفهمند که مساحت ۰٫۸۵ واقعاً برای مدل آنها چه معنایی دارد. این تعریف بصری نشان میدهد که ارزیابی یک طبقهبند دودویی نیازمند محاسبه انتگرال در تمام آستانههای تصمیمگیری ممکن است؛ مفهومی که توضیح آن با زبان ساده دشوار است.[1][4]
واقعیت ریاضی بسیار ملموستر است. مقدار AUC دقیقاً معادل این احتمال است که طبقهبند به یک نمونه مثبتِ انتخابشده به صورت تصادفی، امتیاز بالاتری نسبت به یک نمونه منفیِ تصادفی اختصاص دهد. این فقط یک شکل هندسی نیست؛ بلکه معیاری برای رتبهبندی است. وقتی یک دانشمند داده مقدار AUC را ۰٫۹۲ گزارش میکند، در واقع میگوید که در ۹۲ مورد از ۱۰۰ جفتسازی تصادفیِ یک مثبت واقعی و یک منفی واقعی، مدل به درستی به نمونه مثبت امتیاز بالاتری میدهد.[5]
این تفسیر احتمالی، نیاز به درک حساب دیفرانسیل و انتگرال یا پویایی آستانهها برای فهمیدن شایستگی پایه یک مدل را از بین میبرد. همانطور که در یک اثبات فنی در سال ۲۰۱۷ که ریاضیاتِ پسزمینه این معیار را شرح میدهد، بیان شده است: «AUC برابر با این احتمال است که یک طبقهبند، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفیِ تصادفی رتبهبندی کند.» این موضوع، انتگرال هندسی را مستقیماً به آماره U ویلکاکسون-من-ویتنی (Wilcoxon-Mann-Whitney) متصل میکند؛ یک آزمون ناپارامتریک که از سال ۱۹۴۷ در آمار استفاده میشود.[5]
برای درک اینکه چگونه هندسه و احتمال با هم همسو میشوند، بررسی نحوه رسم این منحنی کمککننده است. یک طبقهبند دودویی، یک امتیاز احتمال پیوسته بین ۰٫۰ و ۱٫۰ تولید میکند. برای تبدیل این امتیاز به یک پیشبینی قطعیِ «بله» یا «خیر»، سیستم به یک آستانه نیاز دارد. اگر این آستانه روی ۰٫۵۰ تنظیم شود، هر چیزی بالاتر از آن مثبت و هر چیزی پایینتر از آن منفی در نظر گرفته میشود.[4]
جابهجا کردن این آستانه، نرخ خطاهای مدل را تغییر میدهد. کاهش آن به ۰٫۱۰ تقریباً تمام مثبتهای واقعی را شناسایی میکند (نرخ مثبت صحیح بالا) اما در عین حال هشدارهای کاذب زیادی را نیز ثبت میکند (نرخ مثبت کاذب بالا). منحنی ROC این دو نرخ را در برابر یکدیگر در تمام آستانههای ممکن از ۰٫۰ تا ۱٫۰ رسم میکند.[1]
مستندات یادگیری ماشین گوگل اشاره میکند که «AUC یک معیار کلی از عملکرد را در تمام آستانههای طبقهبندیِ ممکن ارائه میدهد.» از آنجا که این معیار روی کل منحنی انتگرال میگیرد، توانایی بنیادین مدل برای جداسازی دو کلاس را ارزیابی میکند، صرفنظر از اینکه مرز تصمیمگیری نهایی کجا ترسیم شده باشد.[1]
تبدیل این معیارِ آستانه تجمعی به یک احتمال رتبهبندی، بر مکانیک انتگرالگیری متکی است. محاسبه مساحت زیر منحنی ROC شامل جمع کردن مستطیلهایی است که توسط نرخ مثبت صحیح در هر افزایشِ نرخ مثبت کاذب تشکیل میشوند. از نظر ریاضی، این جمعبندی دقیقاً معادل شمارش دفعاتی است که یک نمونه مثبت بالاتر از یک نمونه منفی قرار میگیرد، تقسیم بر تعداد کل جفتهای ممکنِ مثبت-منفی.[5]
یک کاربرد عملی را در نظر بگیرید: یک الگوریتم تشخیص تقلب که تراکنشهای کارت اعتباری را ارزیابی میکند. اگر سیستم ۱۰٬۰۰۰ تراکنش قانونی و ۱۰۰ تراکنش جعلی را پردازش کند، ارزیابی دقت آن با استفاده از یک درصد استاندارد گمراهکننده است. مدلی که به سادگی همه چیز را تأیید کند، ۹۹٫۰۱ درصد دقت خواهد داشت، اما کاملاً بیفایده است.[6]
معیار AUC با تمرکز دقیق بر ترتیب نسبی تراکنشها، این عدم تعادل کلاسها را نادیده میگیرد. اگر مدل تشخیص تقلب دارای AUC برابر با ۰٫۹۵ باشد، یک حسابرس بانک میتواند به طور تصادفی یکی از ۱۰۰ تراکنش جعلی و یکی از ۱۰٬۰۰۰ تراکنش قانونی را انتخاب کند. در این حالت، ۹۵ درصد احتمال وجود دارد که الگوریتم به تقلب واقعی، امتیاز خطر تقلب بالاتری اختصاص داده باشد.[2]
این ویژگی، معیار مذکور را برای مجموعه دادههای نامتعادل بسیار قدرتمند میسازد. یک تحلیل در سال ۲۰۲۶ از معیارهای طبقهبندی که توسط CASRAI منتشر شده، تأکید میکند که «منحنیهای ROC و AUC ابزارهای ضروری برای ارزیابی عملکرد طبقهبندهای دودویی هستند»، دقیقاً به این دلیل که ارزیابی توانایی مرتبسازی مدل را از توزیع دادههای زیربنایی جدا میکنند.[2]
به طور مشابه، چکیده یک پژوهش اخیر که روشهای ارزیابی را بررسی کرده است، نتیجهگیری کرد که «مساحت زیر منحنی ROC سازگارترین ارزیابی را برای طبقهبندی دودویی دارد» در مقایسه با معیارهایی مانند امتیاز F1 یا دقت خام، که بسته به آستانه انتخابی و نسبت نمونههای مثبت به منفی به شدت در نوسان هستند.[3]
چارچوببندی احتمالی همچنین روشن میکند که یک امتیاز بد واقعاً به چه معناست. مقدار AUC برابر با ۰٫۵۰ نشاندهنده یک خط مورب روی نمودار ROC است. همانطور که راهنمای سال ۲۰۲۶ Displayr توضیح میدهد: «مقدار AUC برابر با ۰٫۵ نشاندهنده عدم تبعیض است، به این معنی که توانایی مدل برای تشخیص بیماران مبتلا و غیرمبتلا به بیماری یا عارضه، دقیقاً مشابه پرتاب یک سکه است.»
در تفسیر رتبهبندی، احتمال ۵۰ درصدی به این معناست که وقتی از مدل خواسته میشود یک نمونه مثبت و یک نمونه منفی را مرتب کند، به صورت کورکورانه حدس میزند.[6]
مقدار AUC زیر ۰٫۵۰ نشان میدهد که مدل به طور فعال دادهها را برعکس مرتب میکند. مساحت ۰٫۳۰ به این معنی است که تنها ۳۰ درصد احتمال دارد نمونه مثبت بالاتر رتبهبندی شود، که نشان میدهد مدل به طور سیستماتیک امتیازات بالاتری را به نمونههای منفی اختصاص میدهد. معکوس کردن پیشبینیهای مدل بلافاصله به یک AUC برابر با ۰٫۷۰ منجر میشود.[4]
یک مورد استثنای ریاضی وجود دارد که بیانِ احتمالِ خالص اغلب از آن چشمپوشی میکند: امتیازات برابر. اگر طبقهبند دقیقاً همان احتمال را به هر دو نمونه مثبت و منفیِ تصادفی اختصاص دهد، محاسبه استاندارد ویلکاکسون-من-ویتنی دقیقاً ۰٫۵ امتیاز به این جفت اعطا میکند.[5]
بنابراین، تعریف کاملاً دقیق این است که AUC برابر است با احتمال اینکه یک نمونه مثبت بالاتر از یک نمونه منفی رتبهبندی شود، به علاوه نیمی از احتمال اینکه آنها دقیقاً یکسان رتبهبندی شوند. در مدلهای مدرن یادگیری ماشین که اعداد اعشاری ۳۲ بیتی تولید میکنند، برابریهای دقیق نادر هستند و همین امر باعث میشود بیان سادهشدهی احتمال در تقریباً تمام محیطهای عملیاتی به طور کاربردی دقیق باشد.[7]
با تغییر تعریف از یک مساحت هندسی به یک احتمال رتبهبندی، دانشمندان داده یک ابزار ارتباطی قدرتمند به دست میآورند. ذینفعانی که ممکن است با شنیدن نام انتگرالها و نرخهای مثبت کاذب گیج شوند، میتوانند بلافاصله ارزش سیستمی را درک کنند که در ۹ مورد از ۱۰ مورد، سیگنال را به درستی بالاتر از نویز مرتب میکند.[7]
اصطلاحات کلیدی
- طبقهبند دودویی
- یک مدل یادگیری ماشین که برای دستهبندی دادهها دقیقاً در یکی از دو کلاس طراحی شده است، مانند «هرزنامه» یا «غیر هرزنامه».
- نرخ مثبت صحیح
- درصدی از نمونههای مثبت واقعی که مدل به درستی آنها را به عنوان مثبت شناسایی میکند.
- نرخ مثبت کاذب
- درصدی از نمونههای منفی واقعی که مدل به اشتباه آنها را به عنوان مثبت علامتگذاری میکند.
- آماره U ویلکاکسون-من-ویتنی
- یک آزمون آماری ناپارامتریک که برای مقایسه دو نمونه مستقل استفاده میشود و از نظر ریاضی معادل AUC است.
پرسشهای متداول
آیا AUC برابر با ۰٫۵۰ خوب در نظر گرفته میشود؟
خیر. مقدار AUC برابر با ۰٫۵۰ به این معنی است که توانایی مدل برای رتبهبندی یک نمونه مثبت بالاتر از یک نمونه منفی ۵۰ درصد است؛ یعنی دقیقاً مشابه پرتاب تصادفی یک سکه.
آیا مساحت زیر منحنی میتواند منفی باشد؟
خیر، مقدار AUC بین ۰٫۰ تا ۱٫۰ متغیر است. مقدار AUC زیر ۰٫۵۰ صرفاً به این معنی است که مدل به طور سیستماتیک نمونههای منفی را بالاتر از نمونههای مثبت رتبهبندی میکند.
چرا به جای دقت استاندارد از AUC استفاده کنیم؟
دقت استاندارد میتواند در مجموعه دادههای نامتعادل (مثلاً ۹۹ درصد تراکنشهای قانونی و ۱ درصد تقلب) بسیار گمراهکننده باشد. معیار AUC توانایی مدل را برای مرتبسازی صحیح کلاسها ارزیابی میکند، صرفنظر از اینکه کلاس مثبت چقدر نادر است.
اگر مدل به دو نمونه دقیقاً یک امتیاز یکسان بدهد چه اتفاقی میافتد؟
در محاسبه احتمالی، یک امتیاز برابر، ۰٫۵ امتیاز به جفت اختصاص میدهد، به این معنی که مدل برای این برابری نیمی از امتیاز را دریافت میکند.
بررسی عمیق دیدگاهها
متخصصان یادگیری ماشین
بر استقلال این معیار از آستانه و استحکام آن در برابر عدم تعادل کلاسها تمرکز میکنند.
برای مهندسانی که مدلها را میسازند، ارزش اصلی AUC این است که قدرت پیشبینی خام الگوریتم را قبل از اعمال منطق تجاری ارزیابی میکند. از آنجا که این معیار در تمام آستانههای ممکن انتگرال میگیرد، ثابت میکند که مدل با موفقیت نمونههای مثبت را به بالای توزیع و نمونههای منفی را به پایین آن سوق میدهد. این امر به ویژه در زمینههایی مانند تشخیص تقلب یا تشخیص بیماریهای نادر حیاتی است، جایی که نرخ دقت ۹۹ درصدی میتواند صرفاً با پیشبینی اینکه رویداد نادر هرگز رخ نمیدهد، به دست آید.
ذینفعان تجاری
بر قابلیت تفسیر تعریف رتبهبندی احتمالی نسبت به تعریف هندسی تمرکز میکنند.
از دیدگاه مدیریتی، انتگرالهای هندسی برای تصمیمگیریهای تجاری مفید نیستند. چارچوببندی احتمالی (اینکه AUC برابر با ۰٫۸۵ به این معنی است که مدل در ۸۵ درصد مواقع یک جفت مثبت و منفی را به درستی مرتب میکند) یک انتزاع ریاضی را به یک بیان ملموس از قابلیت اطمینان تبدیل میکند. این امر به تیمهای غیرفنی اجازه میدهد تا دقیقاً درک کنند که الگوریتم چقدر بهتر از حدس تصادفی عمل میکند و تصمیمگیری بهتری در مورد آماده بودن مدل برای محیط عملیاتی را تسهیل میکند.
آمارشناسان
بر همارزی با آماره U ویلکاکسون-من-ویتنی و نحوه مدیریت رتبههای برابر تمرکز میکنند.
آمارشناسان AUC را نه به عنوان یک اختراع در یادگیری ماشین، بلکه به عنوان یک نمایش بصری از آزمون ویلکاکسون-من-ویتنی میبینند که قدمت آن به دهه ۱۹۴۰ برمیگردد. از این دیدگاه، معیار مذکور یک اندازه ناپارامتریک از برابری تصادفی است. آمارشناسان بر موارد استثنایی تأکید میکنند که بیان احتمال خالص آنها را نادیده میگیرد، به ویژه اینکه چگونه این معیار امتیازات برابر را با اعطای نیمی از امتیاز مدیریت میکند و اطمینان میدهد که حتی زمانی که طبقهبند به جای احتمالات پیوسته، احتمالات گسسته تولید میکند، ریاضیات همچنان معتبر باقی میمانند.
- ارزیابان الگوریتمی
- بر استحکام این معیار در تمام آستانههای طبقهبندی ممکن به جای یک مرز تصمیمگیری واحد تمرکز میکنند.
- نظریهپردازان آماری
- بر اثباتهای ریاضی که انتگرال هندسی را به آمارههای رتبهای ناپارامتریک متصل میکند، تأکید دارند.
- دانشمندان داده کاربردی
- برای تفسیر احتمالی به عنوان ابزاری کاربردی جهت انتقال عملکرد مدل به ذینفعان تجاری ارزش قائل هستند.
دیدگاههایی که این گزارش پوشش نداده
- ذینفعان تجاری غیرفنی که مصرفکننده این معیارها هستند
منابع
[1]Google for Developersارزیابان الگوریتمیClassification: ROC and AUC
مطالعه در Google for Developers →
[2]CASRAIدانشمندان داده کاربردیROC Curves and AUC: What They Actually Mean
مطالعه در CASRAI →
[3]Research Abstractنظریهپردازان آماریArea under the ROC Curve has the most consistent evaluation for binary classification
مطالعه در Research Abstract →
[4]MLU-Explainارزیابان الگوریتمیROC & AUC - MLU-Explain
مطالعه در MLU-Explain →
[5]Technical Noteنظریهپردازان آماریThe Probabilistic Interpretation of AUC
مطالعه در Technical Note →
[6]Displayrدانشمندان داده کاربردیWhat is a ROC Curve and How to Interpret It
مطالعه در Displayr →
[7]تیم سردبیری کوهستاندانشمندان داده کاربردیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در تحلیل داده
مشاهده همه →روشهای آماری
چگونه استانداردسازی دادههای خام را به نمرات استاندارد (Z-Scores) برای شاخصهای جهانی تبدیل میکند
6 منبع
رکوردهای شطرنج
چگونه یک نابغه ۱۱ ساله شطرنج به جوانترین «استاد بزرگ زنان» تاریخ تبدیل شد؟
3 منبع
روششناسی نظرسنجی
چگونه نظرسنجیهای اعتماد عمومی در ایران انجام میشود؟ بررسی سقوط اعتماد سیاسی به ۸ درصد
3 منبع
توابع زیان
بدهبستان ریاضیاتی میان میانگین و میانه در بهینهسازی تابع زیان
4 منبع
نظرات
هر زاویه. هر روز.
اخبار تحلیل داده با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





