رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعیارهای ارزیابیمقاله تشریحی· 6 دقیقه مطالعه· در تحلیل داده

چگونه مساحت زیر منحنی ROC همان احتمال رتبه‌بندی درست یک نمونه مثبت بالاتر از نمونه منفی است

اگرچه AUC اغلب به عنوان یک مساحت هندسی انتزاعی آموزش داده می‌شود، اما از نظر ریاضی دقیقاً برابر با این احتمال است که مدل، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفی رتبه‌بندی کند. این هم‌ارزی احتمالی، یک نمودار گیج‌کننده را به معیاری ملموس برای سنجش توانایی مرتب‌سازی تبدیل می‌کند.

به قلم کوروش پاکزاد

ارزیابان الگوریتمی 40%نظریه‌پردازان آماری 30%دانشمندان داده کاربردی 30%
ارزیابان الگوریتمی
بر استحکام این معیار در تمام آستانه‌های طبقه‌بندی ممکن به جای یک مرز تصمیم‌گیری واحد تمرکز می‌کنند.
نظریه‌پردازان آماری
بر اثبات‌های ریاضی که انتگرال هندسی را به آماره‌های رتبه‌ای ناپارامتریک متصل می‌کند، تأکید دارند.
دانشمندان داده کاربردی
برای تفسیر احتمالی به عنوان ابزاری کاربردی جهت انتقال عملکرد مدل به ذی‌نفعان تجاری ارزش قائل هستند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • ذی‌نفعان تجاری غیرفنی که مصرف‌کننده این معیارها هستند

اصطلاحات کلیدی

طبقه‌بند دودویی
یک مدل یادگیری ماشین که برای دسته‌بندی داده‌ها دقیقاً در یکی از دو کلاس طراحی شده است، مانند «هرزنامه» یا «غیر هرزنامه».
نرخ مثبت صحیح
درصدی از نمونه‌های مثبت واقعی که مدل به درستی آن‌ها را به عنوان مثبت شناسایی می‌کند.
نرخ مثبت کاذب
درصدی از نمونه‌های منفی واقعی که مدل به اشتباه آن‌ها را به عنوان مثبت علامت‌گذاری می‌کند.
آماره U ویلکاکسون-من-ویتنی
یک آزمون آماری ناپارامتریک که برای مقایسه دو نمونه مستقل استفاده می‌شود و از نظر ریاضی معادل AUC است.

نکات کلیدی

  1. مساحت زیر منحنی ROC (یا AUC) اغلب به عنوان یک انتگرال هندسی آموزش داده می‌شود که تفسیر شهودی آن را دشوار می‌سازد.
  2. از نظر ریاضی، AUC دقیقاً برابر با این احتمال است که یک مدل، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفی رتبه‌بندی کند.
  3. این هم‌ارزی احتمالی، مساحت هندسی را مستقیماً به آماره U ویلکاکسون-من-ویتنی متصل می‌کند.
  4. مقدار AUC برابر با ۰٫۵۰ به این معنی است که توانایی مرتب‌سازی مدل معادل پرتاب سکه است، در حالی که AUC زیر ۰٫۵۰ به این معنی است که مدل داده‌ها را برعکس مرتب می‌کند.
  5. از آنجا که AUC به جای آستانه‌های مطلق بر رتبه‌بندی نسبی تکیه دارد، برای ارزیابی مجموعه داده‌های نامتعادل بسیار قدرتمند است.

کتاب‌های درسی یادگیری ماشین معمولاً مساحت زیر منحنی مشخصه عملکرد سیستم (AUC-ROC) را به عنوان یک مفهوم کاملاً هندسی معرفی می‌کنند: فضای دوبعدی زیر خطی که نرخ مثبت صحیح را در برابر نرخ مثبت کاذب رسم می‌کند. این چارچوب‌بندی باعث می‌شود متخصصان به یک شبکه مختصات خیره شوند و سعی کنند به طور شهودی بفهمند که مساحت ۰٫۸۵ واقعاً برای مدل آن‌ها چه معنایی دارد. این تعریف بصری نشان می‌دهد که ارزیابی یک طبقه‌بند دودویی نیازمند محاسبه انتگرال در تمام آستانه‌های تصمیم‌گیری ممکن است؛ مفهومی که توضیح آن با زبان ساده دشوار است.[1][4]

واقعیت ریاضی بسیار ملموس‌تر است. مقدار AUC دقیقاً معادل این احتمال است که طبقه‌بند به یک نمونه مثبتِ انتخاب‌شده به صورت تصادفی، امتیاز بالاتری نسبت به یک نمونه منفیِ تصادفی اختصاص دهد. این فقط یک شکل هندسی نیست؛ بلکه معیاری برای رتبه‌بندی است. وقتی یک دانشمند داده مقدار AUC را ۰٫۹۲ گزارش می‌کند، در واقع می‌گوید که در ۹۲ مورد از ۱۰۰ جفت‌سازی تصادفیِ یک مثبت واقعی و یک منفی واقعی، مدل به درستی به نمونه مثبت امتیاز بالاتری می‌دهد.[5]

این تفسیر احتمالی، نیاز به درک حساب دیفرانسیل و انتگرال یا پویایی آستانه‌ها برای فهمیدن شایستگی پایه یک مدل را از بین می‌برد. همان‌طور که در یک اثبات فنی در سال ۲۰۱۷ که ریاضیاتِ پس‌زمینه این معیار را شرح می‌دهد، بیان شده است: «AUC برابر با این احتمال است که یک طبقه‌بند، یک نمونه مثبتِ تصادفی را بالاتر از یک نمونه منفیِ تصادفی رتبه‌بندی کند.» این موضوع، انتگرال هندسی را مستقیماً به آماره U ویلکاکسون-من-ویتنی (Wilcoxon-Mann-Whitney) متصل می‌کند؛ یک آزمون ناپارامتریک که از سال ۱۹۴۷ در آمار استفاده می‌شود.[5]

برای درک اینکه چگونه هندسه و احتمال با هم همسو می‌شوند، بررسی نحوه رسم این منحنی کمک‌کننده است. یک طبقه‌بند دودویی، یک امتیاز احتمال پیوسته بین ۰٫۰ و ۱٫۰ تولید می‌کند. برای تبدیل این امتیاز به یک پیش‌بینی قطعیِ «بله» یا «خیر»، سیستم به یک آستانه نیاز دارد. اگر این آستانه روی ۰٫۵۰ تنظیم شود، هر چیزی بالاتر از آن مثبت و هر چیزی پایین‌تر از آن منفی در نظر گرفته می‌شود.[4]

یک طبقه‌بند، امتیاز پیوسته‌ای بین ۰٫۰ و ۱٫۰ اختصاص می‌دهد و برای انجام یک پیش‌بینی قطعی به یک آستانه نیاز دارد.

جابه‌جا کردن این آستانه، نرخ خطاهای مدل را تغییر می‌دهد. کاهش آن به ۰٫۱۰ تقریباً تمام مثبت‌های واقعی را شناسایی می‌کند (نرخ مثبت صحیح بالا) اما در عین حال هشدارهای کاذب زیادی را نیز ثبت می‌کند (نرخ مثبت کاذب بالا). منحنی ROC این دو نرخ را در برابر یکدیگر در تمام آستانه‌های ممکن از ۰٫۰ تا ۱٫۰ رسم می‌کند.[1]

مستندات یادگیری ماشین گوگل اشاره می‌کند که «AUC یک معیار کلی از عملکرد را در تمام آستانه‌های طبقه‌بندیِ ممکن ارائه می‌دهد.» از آنجا که این معیار روی کل منحنی انتگرال می‌گیرد، توانایی بنیادین مدل برای جداسازی دو کلاس را ارزیابی می‌کند، صرف‌نظر از اینکه مرز تصمیم‌گیری نهایی کجا ترسیم شده باشد.[1]

تبدیل این معیارِ آستانه تجمعی به یک احتمال رتبه‌بندی، بر مکانیک انتگرال‌گیری متکی است. محاسبه مساحت زیر منحنی ROC شامل جمع کردن مستطیل‌هایی است که توسط نرخ مثبت صحیح در هر افزایشِ نرخ مثبت کاذب تشکیل می‌شوند. از نظر ریاضی، این جمع‌بندی دقیقاً معادل شمارش دفعاتی است که یک نمونه مثبت بالاتر از یک نمونه منفی قرار می‌گیرد، تقسیم بر تعداد کل جفت‌های ممکنِ مثبت-منفی.[5]

تبدیل این معیارِ آستانه تجمعی به یک احتمال رتبه‌بندی، بر مکانیک انتگرال‌گیری متکی است.

یک کاربرد عملی را در نظر بگیرید: یک الگوریتم تشخیص تقلب که تراکنش‌های کارت اعتباری را ارزیابی می‌کند. اگر سیستم ۱۰٬۰۰۰ تراکنش قانونی و ۱۰۰ تراکنش جعلی را پردازش کند، ارزیابی دقت آن با استفاده از یک درصد استاندارد گمراه‌کننده است. مدلی که به سادگی همه چیز را تأیید کند، ۹۹٫۰۱ درصد دقت خواهد داشت، اما کاملاً بی‌فایده است.[6]

معیار AUC با تمرکز دقیق بر ترتیب نسبی تراکنش‌ها، این عدم تعادل کلاس‌ها را نادیده می‌گیرد. اگر مدل تشخیص تقلب دارای AUC برابر با ۰٫۹۵ باشد، یک حسابرس بانک می‌تواند به طور تصادفی یکی از ۱۰۰ تراکنش جعلی و یکی از ۱۰٬۰۰۰ تراکنش قانونی را انتخاب کند. در این حالت، ۹۵ درصد احتمال وجود دارد که الگوریتم به تقلب واقعی، امتیاز خطر تقلب بالاتری اختصاص داده باشد.[2]

مقدار AUC برابر با ۰٫۹۵ به این معنی است که ۹۵ درصد احتمال دارد یک نمونه مثبتِ تصادفی، بالاتر از یک نمونه منفیِ تصادفی قرار گیرد.

این ویژگی، معیار مذکور را برای مجموعه داده‌های نامتعادل بسیار قدرتمند می‌سازد. یک تحلیل در سال ۲۰۲۶ از معیارهای طبقه‌بندی که توسط CASRAI منتشر شده، تأکید می‌کند که «منحنی‌های ROC و AUC ابزارهای ضروری برای ارزیابی عملکرد طبقه‌بندهای دودویی هستند»، دقیقاً به این دلیل که ارزیابی توانایی مرتب‌سازی مدل را از توزیع داده‌های زیربنایی جدا می‌کنند.[2]

به طور مشابه، چکیده یک پژوهش اخیر که روش‌های ارزیابی را بررسی کرده است، نتیجه‌گیری کرد که «مساحت زیر منحنی ROC سازگارترین ارزیابی را برای طبقه‌بندی دودویی دارد» در مقایسه با معیارهایی مانند امتیاز F1 یا دقت خام، که بسته به آستانه انتخابی و نسبت نمونه‌های مثبت به منفی به شدت در نوسان هستند.[3]

چارچوب‌بندی احتمالی همچنین روشن می‌کند که یک امتیاز بد واقعاً به چه معناست. مقدار AUC برابر با ۰٫۵۰ نشان‌دهنده یک خط مورب روی نمودار ROC است. همان‌طور که راهنمای سال ۲۰۲۶ Displayr توضیح می‌دهد: «مقدار AUC برابر با ۰٫۵ نشان‌دهنده عدم تبعیض است، به این معنی که توانایی مدل برای تشخیص بیماران مبتلا و غیرمبتلا به بیماری یا عارضه، دقیقاً مشابه پرتاب یک سکه است.» در تفسیر رتبه‌بندی، احتمال ۵۰ درصدی به این معناست که وقتی از مدل خواسته می‌شود یک نمونه مثبت و یک نمونه منفی را مرتب کند، به صورت کورکورانه حدس می‌زند.[6]

مقدار AUC برابر با ۰٫۵۰ نشان‌دهنده یک خط مورب است و نشان می‌دهد توانایی رتبه‌بندی مدل بهتر از پرتاب سکه نیست.

مقدار AUC زیر ۰٫۵۰ نشان می‌دهد که مدل به طور فعال داده‌ها را برعکس مرتب می‌کند. مساحت ۰٫۳۰ به این معنی است که تنها ۳۰ درصد احتمال دارد نمونه مثبت بالاتر رتبه‌بندی شود، که نشان می‌دهد مدل به طور سیستماتیک امتیازات بالاتری را به نمونه‌های منفی اختصاص می‌دهد. معکوس کردن پیش‌بینی‌های مدل بلافاصله به یک AUC برابر با ۰٫۷۰ منجر می‌شود.[4]

یک مورد استثنای ریاضی وجود دارد که بیانِ احتمالِ خالص اغلب از آن چشم‌پوشی می‌کند: امتیازات برابر. اگر طبقه‌بند دقیقاً همان احتمال را به هر دو نمونه مثبت و منفیِ تصادفی اختصاص دهد، محاسبه استاندارد ویلکاکسون-من-ویتنی دقیقاً ۰٫۵ امتیاز به این جفت اعطا می‌کند.[5]

بنابراین، تعریف کاملاً دقیق این است که AUC برابر است با احتمال اینکه یک نمونه مثبت بالاتر از یک نمونه منفی رتبه‌بندی شود، به علاوه نیمی از احتمال اینکه آن‌ها دقیقاً یکسان رتبه‌بندی شوند. در مدل‌های مدرن یادگیری ماشین که اعداد اعشاری ۳۲ بیتی تولید می‌کنند، برابری‌های دقیق نادر هستند و همین امر باعث می‌شود بیان ساده‌شده‌ی احتمال در تقریباً تمام محیط‌های عملیاتی به طور کاربردی دقیق باشد.[7]

با تغییر تعریف از یک مساحت هندسی به یک احتمال رتبه‌بندی، دانشمندان داده یک ابزار ارتباطی قدرتمند به دست می‌آورند. ذی‌نفعانی که ممکن است با شنیدن نام انتگرال‌ها و نرخ‌های مثبت کاذب گیج شوند، می‌توانند بلافاصله ارزش سیستمی را درک کنند که در ۹ مورد از ۱۰ مورد، سیگنال را به درستی بالاتر از نویز مرتب می‌کند.[7]

پرسش‌های متداول

آیا AUC برابر با ۰٫۵۰ خوب در نظر گرفته می‌شود؟

خیر. مقدار AUC برابر با ۰٫۵۰ به این معنی است که توانایی مدل برای رتبه‌بندی یک نمونه مثبت بالاتر از یک نمونه منفی ۵۰ درصد است؛ یعنی دقیقاً مشابه پرتاب تصادفی یک سکه.

آیا مساحت زیر منحنی می‌تواند منفی باشد؟

خیر، مقدار AUC بین ۰٫۰ تا ۱٫۰ متغیر است. مقدار AUC زیر ۰٫۵۰ صرفاً به این معنی است که مدل به طور سیستماتیک نمونه‌های منفی را بالاتر از نمونه‌های مثبت رتبه‌بندی می‌کند.

چرا به جای دقت استاندارد از AUC استفاده کنیم؟

دقت استاندارد می‌تواند در مجموعه داده‌های نامتعادل (مثلاً ۹۹ درصد تراکنش‌های قانونی و ۱ درصد تقلب) بسیار گمراه‌کننده باشد. معیار AUC توانایی مدل را برای مرتب‌سازی صحیح کلاس‌ها ارزیابی می‌کند، صرف‌نظر از اینکه کلاس مثبت چقدر نادر است.

اگر مدل به دو نمونه دقیقاً یک امتیاز یکسان بدهد چه اتفاقی می‌افتد؟

در محاسبه احتمالی، یک امتیاز برابر، ۰٫۵ امتیاز به جفت اختصاص می‌دهد، به این معنی که مدل برای این برابری نیمی از امتیاز را دریافت می‌کند.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

ارزیابان الگوریتمی 40%نظریه‌پردازان آماری 30%دانشمندان داده کاربردی 30%
  1. [1]Google for Developersارزیابان الگوریتمی

    Classification: ROC and AUC

    مطالعه در Google for Developers
  2. [2]CASRAIدانشمندان داده کاربردی

    ROC Curves and AUC: What They Actually Mean

    مطالعه در CASRAI
  3. [3]Research Abstractنظریه‌پردازان آماری

    Area under the ROC Curve has the most consistent evaluation for binary classification

    مطالعه در Research Abstract
  4. [4]MLU-Explainارزیابان الگوریتمی

    ROC & AUC - MLU-Explain

    مطالعه در MLU-Explain
  5. [5]Technical Noteنظریه‌پردازان آماری

    The Probabilistic Interpretation of AUC

    مطالعه در Technical Note
  6. [6]Displayrدانشمندان داده کاربردی

    What is a ROC Curve and How to Interpret It

    مطالعه در Displayr
  7. [7]تیم سردبیری کوهستاندانشمندان داده کاربردی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.