رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمعیارهای طبقه‌بندیتوضیح و تشریح· 5 دقیقه مطالعه· در تحلیل داده

چرا معیار F1 (اف-وان) عدم توازن شدید بین دقت (Precision) و فراخوانی (Recall) را در یادگیری ماشین جریمه می‌کند؟

معیار F1 با محاسبه میانگین هارمونیک به جای میانگین ساده، مدل‌های طبقه‌بندی را وادار می‌کند تا بین مثبت‌های کاذب و منفی‌های کاذب تعادل برقرار کنند و الگوریتم‌هایی را که با پیش‌بینی بیش از حد یک کلاس خاص «تقلب» می‌کنند، افشا می‌سازد.

به قلم الوین شادمهر

طرفداران معیار متوازن 45%تنظیم‌کنندگان آستانه 30%شکاکان به قابلیت تفسیر 25%
طرفداران معیار متوازن
استدلال می‌کنند که معیار F1 تنها معیار پایه قابل اعتماد برای ارزیابی مدل‌ها بر روی مجموعه‌داده‌های نامتوازن است، جایی که دقت ساده گمراه‌کننده است.
تنظیم‌کنندگان آستانه
تأکید می‌کنند که معیار استاندارد F1 صرفاً یک نقطه شروع است و مدل‌های عملیاتی باید از انواع F-بتا برای وزن‌دهی فراخوانی یا دقت بر اساس هزینه‌های تجاری خاص استفاده کنند.
شکاکان به قابلیت تفسیر
اشاره می‌کنند که میانگین هارمونیک از نظر ریاضی درست است اما در عمل مبهم است و نمی‌تواند به یک احتمال دنیای واقعی که ذی‌نفعان غیرفنی درک کنند، نگاشت شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • نظریه‌پردازان یادگیری حساس به هزینه
  • کاربران نهایی غیرفنی

نکات کلیدی

  • معیار F1 مدل‌های طبقه‌بندی را با محاسبه میانگین هارمونیک دقت و فراخوانی ارزیابی می‌کند.
  • برخلاف میانگین ساده، میانگین هارمونیک به شدت الگوریتم‌هایی را جریمه می‌کند که در هر یک از این دو معیار نمره‌ای نزدیک به صفر کسب می‌کنند.
  • این معیار برای مجموعه‌داده‌های نامتوازن ضروری است، جایی که یک مدل می‌تواند با حدس زدن صرفاً کلاس اکثریت در هر بار، به دقت ۹۹٪ دست یابد.
  • دانشمندان داده می‌توانند فرمول را به معیار F-بتا تنظیم کنند تا مثبت‌های کاذب یا منفی‌های کاذب را بر اساس هزینه‌های تجاری، وزن‌دهی سنگین‌تری نمایند.

در سال ۱۹۷۹، در چهارمین کنفرانس بین‌المللی ذخیره‌سازی و بازیابی اطلاعات در بوستون، سی. جی. ون رایزبرگن (C.J. van Rijsbergen)، دانشمند علوم کامپیوتر، یک تابع ریاضی را برای حل یک مشکل رو به رشد در بازیابی خودکار متن معرفی کرد. محققان در تلاش بودند تا سیستمی را ارزیابی کنند که اسناد بسیار مرتبطی را باز می‌گرداند اما بیشتر آرشیو را از دست می‌داد، در مقابل سیستمی که همه چیز را باز می‌گرداند اما کاربر را زیر انبوهی از اطلاعات بی‌ارزش دفن می‌کرد. معیاری که او پیشنهاد کرد، که در ابتدا «معیار E» (E-measure) نامیده می‌شد، پایه‌ای را بنا نهاد که دانشمندان داده امروزی برای ارزیابی مدل‌های طبقه‌بندی از آن استفاده می‌کنند.[5]

تنش اصلی در هر وظیفه طبقه‌بندی—چه شناسایی ایمیل‌های اسپم، تشخیص بیماری‌ها، یا علامت‌گذاری رأی‌دهندگان احتمالی در یک نظرسنجی سیاسی—بین دو معیار رقیب قرار دارد: دقت (Precision) و فراخوانی (Recall). دقت، کیفیت پیش‌بینی‌های مثبت را اندازه‌گیری می‌کند. اگر یک مدل نظرسنجی ۱۰۰ پاسخ‌دهنده را به عنوان رأی‌دهنده احتمالی علامت‌گذاری کند و ۹۰ نفر از آن‌ها واقعاً رأی داده باشند، دقت ۹۰٪ است.[2]

در مقابل، فراخوانی، کمیت کلاس مثبت واقعی را که مدل با موفقیت شناسایی کرده است، اندازه‌گیری می‌کند. اگر در آن جمعیت مورد بررسی ۲۰۰ رأی‌دهنده واقعی وجود داشته باشد و مدل تنها ۹۰ نفر از آن‌ها را پیدا کرده باشد، فراخوانی ۴۵٪ است. یک مدل می‌تواند به راحتی با طبقه‌بندی کردن تک تک پاسخ‌دهندگان به عنوان رأی‌دهنده احتمالی، به فراخوانی ۱۰۰٪ دست یابد، اما دقت آن به نرخ مشارکت پایه سقوط خواهد کرد.[3]

راه‌حل واضح برای ارزیابی عملکرد کلی یک مدل ممکن است میانگین‌گیری از این دو عدد به نظر برسد. اما میانگین حسابی شکست‌های فاجعه‌بار را پنهان می‌کند. اگر یک الگوریتم تشخیص تقلب با علامت‌گذاری تنها یک تراکنش تقلبی بسیار آشکار از میان ۱۰,۰۰۰ تراکنش، به دقت ۱۰۰٪ دست یابد، فراخوانی آن ۰.۰۱٪ است. میانگین حسابی ۱۰۰٪ و ۰.۰۱٪، عدد قابل قبول ۵۰.۰۰۵٪ است که این واقعیت را پنهان می‌کند که مدل عملاً بی‌فایده است.[6]

میانگین هارمونیک به شدت مدل‌هایی را جریمه می‌کند که یک معیار را به حداکثر می‌رسانند در حالی که در معیار دیگر کاملاً شکست می‌خورند.

برای جلوگیری از این حفره ریاضی، چارچوب ون رایزبرگن بر میانگین هارمونیک تکیه دارد، که به شدت عدم توازن‌های شدید را جریمه می‌کند. معیار F1 به این صورت محاسبه می‌شود: ۲ ضربدر حاصل‌ضرب دقت و فراخوانی، تقسیم بر مجموع دقت و فراخوانی.[2][5]

اعمال میانگین هارمونیک بر مثال تشخیص تقلب، توهم عملکرد را از بین می‌برد. معیار F1 برای مدلی با دقت ۱.۰ و فراخوانی ۰.۰۰۰۱، نه ۰.۵۰، بلکه ۰.۰۰۰۱۹ است—نمره‌ای نزدیک به صفر که به درستی شکست الگوریتم در یافتن اکثریت قریب به اتفاق کلاس هدف را منعکس می‌کند.[6]

اعمال میانگین هارمونیک بر مثال تشخیص تقلب، توهم عملکرد را از بین می‌برد.

این ویژگی باعث می‌شود که معیار F1 به استاندارد ارزیابی پیش‌فرض برای مجموعه‌داده‌های نامتوازن تبدیل شود. در تحلیل‌های نظرسنجی مدرن، ممکن است یک نظرسنجی تلاش کند تا یک زیرگروه جمعیتی نادر را که تنها ۲٪ از رأی‌دهندگان را تشکیل می‌دهد، شناسایی کند. دقت (صرفاً شمارش پیش‌بینی‌های صحیح) در اینجا شکست می‌خورد، زیرا مدلی که کورکورانه برای همه «نه» پیش‌بینی می‌کند، ۹۸٪ دقیق خواهد بود در حالی که به طور کامل جمعیت هدف را از دست داده است.[3]

مستندات Scikit-learn، که کتابخانه استاندارد یادگیری ماشین پایتون است، مرزهای این معیار را به صراحت تعریف می‌کند: «امتیاز F1 را می‌توان به عنوان میانگین هارمونیک دقت و فراخوانی تفسیر کرد، جایی که بهترین مقدار F1 به ۱ و بدترین مقدار آن به ۰ می‌رسد.»[4]

دستیابی به نمره کامل ۱.۰ مستلزم ۱۰۰٪ دقت و ۱۰۰٪ فراخوانی است، یک ایده آل نظری که به ندرت خارج از داده‌های آموزشی بیش‌برازش‌شده (overfitted) دیده می‌شود. در عمل، دانشمندان داده در یک منحنی مصالحه سخت حرکت می‌کنند. هرچه آستانه طبقه‌بندی برای گرفتن نمونه‌های مثبت بیشتر پایین‌تر آورده شود—که فراخوانی را افزایش می‌دهد—مدل به ناچار مثبت‌های کاذب بیشتری را نیز در بر می‌گیرد و دقت را کاهش می‌دهد.[2]

هرچه یک مدل آستانه خود را برای گرفتن نمونه‌های مثبت بیشتر پایین می‌آورد، به ناچار مثبت‌های کاذب بیشتری را نیز در بر می‌گیرد.

با وجود فراگیر بودن، معیار F1 به دلیل فقدان قابلیت تفسیر شهودی مورد انتقاد قرار گرفته است. مقاله‌ای در سال ۲۰۲۱ که توسط مؤسسه ملی بهداشت (NIH) منتشر شد، اشاره کرد که در حالی که محققان به راحتی دقت را به عنوان درصدی از حدس‌های صحیح درک می‌کنند، خود میانگین هارمونیک به یک احتمال ملموس در دنیای واقعی نگاشت نمی‌شود. نویسندگان یک تبدیل «F*» را برای تبدیل نمره به یک نسبت قابل تفسیرتر پیشنهاد کردند، اگرچه هنوز جایگزین فرمول اصلی نشده است.[1]

معیار استاندارد F1 همچنین فرض می‌کند که دقت و فراخوانی به یک اندازه مهم هستند، که به ندرت در محیط‌های کاربردی صادق است. در تشخیص‌های بالینی، یک منفی کاذب—از دست دادن تشخیص سرطان—هزینه انسانی بسیار بالاتری نسبت به یک مثبت کاذب دارد که منجر به تجویز یک نمونه‌برداری غیرضروری می‌شود.[1]

برای تطبیق با هزینه‌های نامتقارن، می‌توان فرمول را به «معیار F-بتا» (F-beta score) تعمیم داد. با تنظیم پارامتر بتا، توسعه‌دهندگان می‌توانند فراخوانی را بالاتر از دقت وزن‌دهی کنند (ایجاد معیار F2) یا دقت را بالاتر از فراخوانی (معیار F0.5). این امر اجازه می‌دهد تا جریمه ریاضی با هدف تجاری یا بالینی خاص مدل همسو شود.[4]

معیار تعمیم‌یافته F-بتا به توسعه‌دهندگان اجازه می‌دهد تا جریمه ریاضی را بر اساس هزینه واقعی مثبت‌های کاذب در مقابل منفی‌های کاذب تنظیم کنند.

پذیرش گسترده این معیارها در سال ۱۹۹۲، زمانی که کنفرانس بازیابی متن (TREC) معیار F را برای ارزیابی الگوریتم‌های جستجو استانداردسازی کرد، شتاب گرفت. از آن زمان، این معیار از بازیابی اطلاعات به یادگیری عمیق، بینایی کامپیوتر و تحلیل‌های پیش‌بینانه مهاجرت کرده و به عنوان محافظ اصلی در برابر مدل‌هایی عمل می‌کند که یاد می‌گیرند معیارهای دقت ساده را دور بزنند.[5]

هنگامی که یک تیم علم داده، مدل طبقه‌بندی را در محیط عملیاتی (Production) مستقر می‌کند، آستانه نهایی به ندرت تنها بر اساس بالاترین نمره F1 تنظیم می‌شود. در عوض، واحد تجاری که هزینه یک مثبت کاذب را متحمل می‌شود، کف دقت قابل قبول را دیکته می‌کند و الگوریتم را وادار می‌سازد تا فراخوانی را در آن مرز ریاضی سختگیرانه به حداکثر برساند.[6]

چرا مهم است

از آنجا که سیستم‌های طبقه‌بندی خودکار به طور فزاینده‌ای در تشخیص‌های پزشکی، تأیید وام‌ها و مدل‌های نظرسنجی سیاسی نقش دارند، فرمول ریاضی مورد استفاده برای ارزیابی دقت آن‌ها تعیین می‌کند که آیا این سیستم‌ها واقعاً در دنیای واقعی کار می‌کنند یا صرفاً از حفره‌های آماری سوءاستفاده می‌نمایند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

طرفداران معیار متوازن 45%تنظیم‌کنندگان آستانه 30%شکاکان به قابلیت تفسیر 25%
  1. [1]PMC (National Institutes of Health)شکاکان به قابلیت تفسیر

    F*: an interpretable transformation of the F-measure

    مطالعه در PMC (National Institutes of Health) →
  2. [2]DataCampطرفداران معیار متوازن

    F1 Score in Machine Learning: A Balanced Metric for Precision and Recall

    مطالعه در DataCamp →
  3. [3]Openlayerطرفداران معیار متوازن

    F1 Score: Precision-Recall Balance

    مطالعه در Openlayer →
  4. [4]Scikit-learnتنظیم‌کنندگان آستانه

    sklearn.metrics.f1_score — scikit-learn documentation

    مطالعه در Scikit-learn →
  5. [5]arXivتنظیم‌کنندگان آستانه

    A Note on Using the F-Measure for Evaluating Record Linkage Algorithms

    مطالعه در arXiv →
  6. [6]تیم سردبیری کوهستانتنظیم‌کنندگان آستانه

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.