رفتن به محتوای اصلی
Koohestun
توضیح کوهستانیادگیری ماشینگزارش تشریحی· 5 دقیقه مطالعه· در متا

چگونه «دقت» و «فراخوانی» هشدارهای واقعی را از خطاهای کاذب در سیستم‌های طبقه‌بندی جدا می‌کنند

در حالی که بروشورهای تبلیغاتی معمولاً فقط روی یک معیار «صحت» برای مدل‌های هوش مصنوعی مانور می‌دهند، طبقه‌بندی در دنیای واقعی نیازمند ایجاد تعادل بین تشخیص رویدادهای واقعی و هزینه هشدارهای کاذب است. درک تنش ریاضی بین «دقت» و «فراخوانی» نشان می‌دهد که چرا یک مدل نمی‌تواند بدون سبک‌سنگین کردن این دو، همزمان هر دو را بهینه‌سازی کند.

به قلم دلناز نورانی

طرفداران فراخوانی بالا 50%طرفداران دقت بالا 50%
طرفداران فراخوانی بالا
اولویت دادن به شناسایی هر مورد احتمالی از یک هدف، و پذیرش هشدارهای کاذب به عنوان هزینه ضروری ایمنی.
طرفداران دقت بالا
اولویت دادن به قابل اعتماد بودن هشدارها، با این استدلال که مثبت‌های کاذب بیش از حد منجر به خستگی از هشدار و کنار گذاشتن سیستم می‌شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کاربران نهایی که تحت تأثیر مثبت‌های کاذب (خطاهای تشخیص) الگوریتمی قرار می‌گیرند.

برای بیمارستانی که یک ابزار تشخیصی هوش مصنوعی را مستقر می‌کند، سیستم باید هر تومور احتمالی را شناسایی کند، حتی اگر به قیمت علامت‌گذاری ناهنجاری‌های خوش‌خیم برای بررسی انسانی تمام شود. برای یک ارائه‌دهنده ایمیل که اسپم‌ها را فیلتر می‌کند، سیستم هرگز نباید یک پیام معتبر را به پوشه هرزنامه بفرستد، حتی اگر به معنای نفوذ چند تلاش فیشینگ به صندوق ورودی باشد. این دو موقعیت، نشان‌دهنده تنش ریاضی بنیادین در قلب طبقه‌بندی یادگیری ماشین هستند: انتخاب بین از دست دادن هدف و چوپان دروغگو شدن.[2]

وقتی فروشندگان هوش مصنوعی سیستم‌های طبقه‌بندی جدید را در سال ۲۰۲۶ به بازار عرضه می‌کنند، اغلب روی یک معیار دهان‌پرکن مانور می‌دهند: صحت (Accuracy). یک فروشنده ممکن است ادعا کند الگوریتم جدید تعدیل محتوا یا سیستم تشخیص تقلب آن‌ها «۹۹٪ صحت» دارد. با این حال، دانشمندان داده، صحت را یک معیار به‌شدت فریبنده می‌دانند، به‌ویژه در سناریوهای دنیای واقعی که رویداد مورد نظر نادر است.[3]

یک مجموعه داده مالی را در نظر بگیرید که در آن تنها ۱ از هر ۱۰٬۰۰۰ تراکنش کارت اعتباری جعلی است. یک مدل یادگیری ماشین که بدون هیچ تحلیل واقعی، برای تک‌تک تراکنش‌ها خروجی «معتبر» تولید کند، به صحت ۹۹٫۹۹٪ دست خواهد یافت. این مدل از نظر ریاضی بسیار دقیق است، اما برای هدف مورد نظرش کاملاً بی‌فایده است. به همین دلیل است که مهندسان برای ارزیابی توانایی واقعی یک مدل به دو معیار متمایز تکیه می‌کنند: دقت (Precision) و فراخوانی (Recall).[5]

«دقت» میزان قابل اعتماد بودن یک هشدار مثبت را می‌سنجد. این معیار یک سوال مشخص می‌پرسد: از بین تمام مواردی که مدل به عنوان مثبت علامت‌گذاری کرده، چند مورد واقعاً مثبت بوده‌اند؟ اگر یک فیلتر اسپم دارای دقت ۰٫۹۰ باشد، به این معنی است که ۹۰٪ از ایمیل‌هایی که به پوشه هرزنامه فرستاده واقعاً اسپم بوده‌اند، در حالی که ۱۰٪ پیام‌های معتبری بوده‌اند که به اشتباه به عنوان مثبت کاذب علامت‌گذاری شده‌اند.[4]

ماتریس درهم‌ریختگی (Confusion Matrix) چهار پیامد احتمالی هر تصمیم در طبقه‌بندی باینری را نشان می‌دهد.

در مقابل، «فراخوانی» پوشش سیستم را اندازه‌گیری می‌کند. این معیار می‌پرسد: از بین تمام موارد مثبت واقعی که در دنیای واقعی وجود دارند، مدل چند مورد را با موفقیت پیدا کرده است؟ اگر یک ابزار غربالگری پزشکی دارای فراخوانی ۰٫۹۵ باشد، یعنی ۹۵٪ از تومورهای واقعی را با موفقیت شناسایی کرده است، اما ۵٪ از آن‌ها را از دست داده که به عنوان منفی کاذب ثبت می‌شوند.[2]

تنش بین این دو معیار، نقص یک الگوریتم خاص نیست؛ بلکه یک جبر ریاضی است. سیستم‌های طبقه‌بندی ذاتاً پاسخ‌های باینری «بله» یا «خیر» تولید نمی‌کنند. در عوض، آن‌ها یک امتیاز احتمال بین ۰٫۰ و ۱٫۰ ارائه می‌دهند. اپراتور سیستم باید یک آستانه تصمیم‌گیری — که اغلب به طور پیش‌فرض روی ۰٫۵ تنظیم می‌شود — تعیین کند تا آن احتمال را به یک خروجی باینری تبدیل کند.[1]

تنش بین این دو معیار، نقص یک الگوریتم خاص نیست؛ بلکه یک جبر ریاضی است.

پایین آوردن آستانه به ۰٫۳ به این معنی است که مدل موارد بیشتری را به عنوان مثبت علامت‌گذاری می‌کند. این کار فراخوانی را افزایش می‌دهد، زیرا این تور گسترده‌تر، اهداف واقعی بیشتری را به دام می‌اندازد. با این حال، این تور گسترده‌تر ناگزیر هشدارهای کاذب بیشتری را نیز به همراه دارد و دقت را پایین می‌آورد. بالا بردن آستانه به ۰٫۸ دقیقاً اثر معکوس دارد: دقت بالا می‌رود زیرا مدل تنها واضح‌ترین اهداف را علامت‌گذاری می‌کند، اما فراخوانی به شدت افت می‌کند زیرا موارد ظریف‌تر از دست می‌روند.[3]

مستندات scikit-learn، که یک منبع بنیادین برای یادگیری ماشین مبتنی بر پایتون است، خاطرنشان می‌کند: «سیستمی با فراخوانی بالا اما دقت پایین، نتایج زیادی برمی‌گرداند، اما بیشتر برچسب‌های پیش‌بینی‌شده آن در مقایسه با برچسب‌های آموزشی نادرست هستند. سیستمی با دقت بالا اما فراخوانی پایین دقیقاً برعکس است؛ نتایج بسیار کمی برمی‌گرداند، اما بیشتر برچسب‌های پیش‌بینی‌شده آن درست هستند.»[1]

نمودار دقت-فراخوانی نشان می‌دهد که چگونه افزایش پوشش یک مدل، ناگزیر از اعتبار هشدارهای آن می‌کاهد.

برای ارزیابی یک مدل بدون گمراه شدن توسط این اثر الاکلنگی، مهندسان از امتیاز F1 استفاده می‌کنند. امتیاز F1 میانگین همساز (هارمونیک) دقت و فراخوانی است و یک معیار واحد ارائه می‌دهد که اختلاف‌های شدید بین این دو را جریمه می‌کند. امتیاز F1 در بهترین حالت به ۱٫۰ و در بدترین حالت به ۰٫۰ می‌رسد و نمی‌توان آن را با حدس زدن کلاس اکثریت در یک مجموعه داده نامتوازن، به طور مصنوعی بالا برد.[5]

انتخاب اینکه آستانه در کجا تنظیم شود، کاملاً به هزینه خطاهای دنیای واقعی بستگی دارد. در کشف الکترونیکی (eDiscovery) برای پرونده‌های حقوقی، از دست دادن یک سند حیاتی می‌تواند به قیمت باخت در دادگاه تمام شود، بنابراین سیستم‌ها برای فراخوانی بالا تنظیم می‌شوند. چارچوب ComplexDiscovery در سال ۲۰۱۵ توضیح می‌دهد: «در کشف الکترونیکی، فراخوانی اغلب در اولویت قرار می‌گیرد تا اطمینان حاصل شود که هیچ سند بالقوه مرتبطی در طول فرآیند بررسی از قلم نمی‌افتد.»[4]

برعکس، در تعدیل خودکار محتوا در پلتفرم‌های اجتماعی، مثبت‌های کاذب هزینه عملیاتی سنگینی به همراه دارند. اگر یک پلتفرم الگوریتم خود را برای فراخوانی بالا تنظیم کند تا هر قطعه از محتوای ناقض قوانین را بگیرد، ناگزیر هزاران پست معتبر را حذف خواهد کرد که باعث واکنش منفی کاربران و درخواست‌های تجدیدنظر دستی می‌شود. بنابراین، پلتفرم‌های مصرف‌کننده اغلب سیستم را برای دقت بالاتر تنظیم می‌کنند و می‌پذیرند که برخی از محتواهای ناقض قوانین آنلاین باقی بمانند.[2]

بده‌بستان بین دقت و فراخوانی، واقعیت پنهان در پس ادبیات بازاریابی هوش مصنوعی را برملا می‌کند. وقتی شرکتی ادعا می‌کند سیستم آن‌ها «۹۸٪ از تهدیدات را می‌گیرد»، آن‌ها در حال نقل‌قول از فراخوانی هستند در حالی که درباره تعداد هشدارهای کاذبی که سیستم برای رسیدن به آن عدد تولید می‌کند، سکوت کرده‌اند. ارزیابی واقعی نیازمند ترسیم کل منحنی دقت-فراخوانی است تا رفتار مدل در تمام آستانه‌های ممکن درک شود.[1]

تصمیم‌گیری درباره اینکه در کجای آن منحنی عمل کنیم، یک مطلق ریاضی نیست. این یک تصمیم تجاری، عملیاتی و گاهی اخلاقی درباره این است که یک سازمان تمایل بیشتری به تحمل کدام نوع از شکست دارد؛ تصمیمی که برای همیشه در یک سیستم ریاضی رمزگذاری می‌شود.[6]

نکات کلیدی

  • صحت (Accuracy) برای مدل‌های طبقه‌بندی، زمانی که رویداد هدف نادر باشد، یک معیار فریبنده است.
  • «دقت» (Precision) میزان قابل اعتماد بودن یک هشدار مثبت را می‌سنجد، در حالی که «فراخوانی» (Recall) پوشش سیستم را اندازه‌گیری می‌کند.
  • پایین آوردن آستانه تصمیم‌گیری یک مدل، فراخوانی را افزایش می‌دهد اما با تولید هشدارهای کاذب بیشتر، ناگزیر دقت را پایین می‌آورد.
  • امتیاز F1 با ایجاد تعادل بین دقت و فراخوانی، ارزیابی صادقانه‌تری از توانایی واقعی یک مدل ارائه می‌دهد.
  • سازمان‌ها باید بر اساس اینکه هشدارهای کاذب هزینه بیشتری در دنیای واقعی دارند یا تشخیص‌های از دست رفته، آستانه خود را تعیین کنند.

چرا مهم است

هر تصمیم خودکاری — از اینکه ایمیلی به پوشه اسپم برود تا اینکه اسکن پزشکی یک تومور را تشخیص دهد — به یک آستانه ریاضی وابسته است. درک این بده‌بستان به سازمان‌ها اجازه می‌دهد تا فریب هیاهوی فروشندگان را نخورند و سیستم‌های هوش مصنوعی را با میزان تحمل ریسک واقعی خود همسو کنند.

منابع

پوشش منابع

6 منبع

2 دیدگاه شناسایی‌شده

طرفداران فراخوانی بالا 50%طرفداران دقت بالا 50%
  1. [1]scikit-learn

    Precision-Recall — scikit-learn 1.9.1 documentation

    مطالعه در scikit-learn
  2. [2]Openlayerطرفداران فراخوانی بالا

    Precision and Recall in Machine Learning

    مطالعه در Openlayer
  3. [3]PlotStudio AIطرفداران دقت بالا

    Precision Recall Tradeoff Explained for Data Scientists

    مطالعه در PlotStudio AI
  4. [4]ComplexDiscoveryطرفداران فراخوانی بالا

    Understanding Precision and Recall

    مطالعه در ComplexDiscovery
  5. [5]GeeksforGeeksطرفداران دقت بالا

    Precision and Recall in Machine Learning

    مطالعه در GeeksforGeeks
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.