چرا معیار F1 (اف-وان) عدم توازن شدید بین دقت (Precision) و فراخوانی (Recall) را در یادگیری ماشین جریمه میکند؟
معیار F1 با محاسبه میانگین هارمونیک به جای میانگین ساده، مدلهای طبقهبندی را وادار میکند تا بین مثبتهای کاذب و منفیهای کاذب تعادل برقرار کنند و الگوریتمهایی را که با پیشبینی بیش از حد یک کلاس خاص «تقلب» میکنند، افشا میسازد.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
- طرفداران معیار متوازن
- استدلال میکنند که معیار F1 تنها معیار پایه قابل اعتماد برای ارزیابی مدلها بر روی مجموعهدادههای نامتوازن است، جایی که دقت ساده گمراهکننده است.
- تنظیمکنندگان آستانه
- تأکید میکنند که معیار استاندارد F1 صرفاً یک نقطه شروع است و مدلهای عملیاتی باید از انواع F-بتا برای وزندهی فراخوانی یا دقت بر اساس هزینههای تجاری خاص استفاده کنند.
- شکاکان به قابلیت تفسیر
- اشاره میکنند که میانگین هارمونیک از نظر ریاضی درست است اما در عمل مبهم است و نمیتواند به یک احتمال دنیای واقعی که ذینفعان غیرفنی درک کنند، نگاشت شود.
دیدگاههایی که این گزارش پوشش نداده
- نظریهپردازان یادگیری حساس به هزینه
- کاربران نهایی غیرفنی
نکات کلیدی
- معیار F1 مدلهای طبقهبندی را با محاسبه میانگین هارمونیک دقت و فراخوانی ارزیابی میکند.
- برخلاف میانگین ساده، میانگین هارمونیک به شدت الگوریتمهایی را جریمه میکند که در هر یک از این دو معیار نمرهای نزدیک به صفر کسب میکنند.
- این معیار برای مجموعهدادههای نامتوازن ضروری است، جایی که یک مدل میتواند با حدس زدن صرفاً کلاس اکثریت در هر بار، به دقت ۹۹٪ دست یابد.
- دانشمندان داده میتوانند فرمول را به معیار F-بتا تنظیم کنند تا مثبتهای کاذب یا منفیهای کاذب را بر اساس هزینههای تجاری، وزندهی سنگینتری نمایند.
در سال ۱۹۷۹، در چهارمین کنفرانس بینالمللی ذخیرهسازی و بازیابی اطلاعات در بوستون، سی. جی. ون رایزبرگن (C.J. van Rijsbergen)، دانشمند علوم کامپیوتر، یک تابع ریاضی را برای حل یک مشکل رو به رشد در بازیابی خودکار متن معرفی کرد. محققان در تلاش بودند تا سیستمی را ارزیابی کنند که اسناد بسیار مرتبطی را باز میگرداند اما بیشتر آرشیو را از دست میداد، در مقابل سیستمی که همه چیز را باز میگرداند اما کاربر را زیر انبوهی از اطلاعات بیارزش دفن میکرد. معیاری که او پیشنهاد کرد، که در ابتدا «معیار E» (E-measure) نامیده میشد، پایهای را بنا نهاد که دانشمندان داده امروزی برای ارزیابی مدلهای طبقهبندی از آن استفاده میکنند.[5]
تنش اصلی در هر وظیفه طبقهبندی—چه شناسایی ایمیلهای اسپم، تشخیص بیماریها، یا علامتگذاری رأیدهندگان احتمالی در یک نظرسنجی سیاسی—بین دو معیار رقیب قرار دارد: دقت (Precision) و فراخوانی (Recall). دقت، کیفیت پیشبینیهای مثبت را اندازهگیری میکند. اگر یک مدل نظرسنجی ۱۰۰ پاسخدهنده را به عنوان رأیدهنده احتمالی علامتگذاری کند و ۹۰ نفر از آنها واقعاً رأی داده باشند، دقت ۹۰٪ است.[2]
در مقابل، فراخوانی، کمیت کلاس مثبت واقعی را که مدل با موفقیت شناسایی کرده است، اندازهگیری میکند. اگر در آن جمعیت مورد بررسی ۲۰۰ رأیدهنده واقعی وجود داشته باشد و مدل تنها ۹۰ نفر از آنها را پیدا کرده باشد، فراخوانی ۴۵٪ است. یک مدل میتواند به راحتی با طبقهبندی کردن تک تک پاسخدهندگان به عنوان رأیدهنده احتمالی، به فراخوانی ۱۰۰٪ دست یابد، اما دقت آن به نرخ مشارکت پایه سقوط خواهد کرد.[3]
راهحل واضح برای ارزیابی عملکرد کلی یک مدل ممکن است میانگینگیری از این دو عدد به نظر برسد. اما میانگین حسابی شکستهای فاجعهبار را پنهان میکند. اگر یک الگوریتم تشخیص تقلب با علامتگذاری تنها یک تراکنش تقلبی بسیار آشکار از میان ۱۰,۰۰۰ تراکنش، به دقت ۱۰۰٪ دست یابد، فراخوانی آن ۰.۰۱٪ است. میانگین حسابی ۱۰۰٪ و ۰.۰۱٪، عدد قابل قبول ۵۰.۰۰۵٪ است که این واقعیت را پنهان میکند که مدل عملاً بیفایده است.[6]
برای جلوگیری از این حفره ریاضی، چارچوب ون رایزبرگن بر میانگین هارمونیک تکیه دارد، که به شدت عدم توازنهای شدید را جریمه میکند. معیار F1 به این صورت محاسبه میشود: ۲ ضربدر حاصلضرب دقت و فراخوانی، تقسیم بر مجموع دقت و فراخوانی.[2][5]
اعمال میانگین هارمونیک بر مثال تشخیص تقلب، توهم عملکرد را از بین میبرد. معیار F1 برای مدلی با دقت ۱.۰ و فراخوانی ۰.۰۰۰۱، نه ۰.۵۰، بلکه ۰.۰۰۰۱۹ است—نمرهای نزدیک به صفر که به درستی شکست الگوریتم در یافتن اکثریت قریب به اتفاق کلاس هدف را منعکس میکند.[6]
اعمال میانگین هارمونیک بر مثال تشخیص تقلب، توهم عملکرد را از بین میبرد.
این ویژگی باعث میشود که معیار F1 به استاندارد ارزیابی پیشفرض برای مجموعهدادههای نامتوازن تبدیل شود. در تحلیلهای نظرسنجی مدرن، ممکن است یک نظرسنجی تلاش کند تا یک زیرگروه جمعیتی نادر را که تنها ۲٪ از رأیدهندگان را تشکیل میدهد، شناسایی کند. دقت (صرفاً شمارش پیشبینیهای صحیح) در اینجا شکست میخورد، زیرا مدلی که کورکورانه برای همه «نه» پیشبینی میکند، ۹۸٪ دقیق خواهد بود در حالی که به طور کامل جمعیت هدف را از دست داده است.[3]
مستندات Scikit-learn، که کتابخانه استاندارد یادگیری ماشین پایتون است، مرزهای این معیار را به صراحت تعریف میکند: «امتیاز F1 را میتوان به عنوان میانگین هارمونیک دقت و فراخوانی تفسیر کرد، جایی که بهترین مقدار F1 به ۱ و بدترین مقدار آن به ۰ میرسد.»[4]
دستیابی به نمره کامل ۱.۰ مستلزم ۱۰۰٪ دقت و ۱۰۰٪ فراخوانی است، یک ایده آل نظری که به ندرت خارج از دادههای آموزشی بیشبرازششده (overfitted) دیده میشود. در عمل، دانشمندان داده در یک منحنی مصالحه سخت حرکت میکنند. هرچه آستانه طبقهبندی برای گرفتن نمونههای مثبت بیشتر پایینتر آورده شود—که فراخوانی را افزایش میدهد—مدل به ناچار مثبتهای کاذب بیشتری را نیز در بر میگیرد و دقت را کاهش میدهد.[2]
با وجود فراگیر بودن، معیار F1 به دلیل فقدان قابلیت تفسیر شهودی مورد انتقاد قرار گرفته است. مقالهای در سال ۲۰۲۱ که توسط مؤسسه ملی بهداشت (NIH) منتشر شد، اشاره کرد که در حالی که محققان به راحتی دقت را به عنوان درصدی از حدسهای صحیح درک میکنند، خود میانگین هارمونیک به یک احتمال ملموس در دنیای واقعی نگاشت نمیشود. نویسندگان یک تبدیل «F*» را برای تبدیل نمره به یک نسبت قابل تفسیرتر پیشنهاد کردند، اگرچه هنوز جایگزین فرمول اصلی نشده است.[1]
معیار استاندارد F1 همچنین فرض میکند که دقت و فراخوانی به یک اندازه مهم هستند، که به ندرت در محیطهای کاربردی صادق است. در تشخیصهای بالینی، یک منفی کاذب—از دست دادن تشخیص سرطان—هزینه انسانی بسیار بالاتری نسبت به یک مثبت کاذب دارد که منجر به تجویز یک نمونهبرداری غیرضروری میشود.[1]
برای تطبیق با هزینههای نامتقارن، میتوان فرمول را به «معیار F-بتا» (F-beta score) تعمیم داد. با تنظیم پارامتر بتا، توسعهدهندگان میتوانند فراخوانی را بالاتر از دقت وزندهی کنند (ایجاد معیار F2) یا دقت را بالاتر از فراخوانی (معیار F0.5). این امر اجازه میدهد تا جریمه ریاضی با هدف تجاری یا بالینی خاص مدل همسو شود.[4]
پذیرش گسترده این معیارها در سال ۱۹۹۲، زمانی که کنفرانس بازیابی متن (TREC) معیار F را برای ارزیابی الگوریتمهای جستجو استانداردسازی کرد، شتاب گرفت. از آن زمان، این معیار از بازیابی اطلاعات به یادگیری عمیق، بینایی کامپیوتر و تحلیلهای پیشبینانه مهاجرت کرده و به عنوان محافظ اصلی در برابر مدلهایی عمل میکند که یاد میگیرند معیارهای دقت ساده را دور بزنند.[5]
هنگامی که یک تیم علم داده، مدل طبقهبندی را در محیط عملیاتی (Production) مستقر میکند، آستانه نهایی به ندرت تنها بر اساس بالاترین نمره F1 تنظیم میشود. در عوض، واحد تجاری که هزینه یک مثبت کاذب را متحمل میشود، کف دقت قابل قبول را دیکته میکند و الگوریتم را وادار میسازد تا فراخوانی را در آن مرز ریاضی سختگیرانه به حداکثر برساند.[6]
چرا مهم است
از آنجا که سیستمهای طبقهبندی خودکار به طور فزایندهای در تشخیصهای پزشکی، تأیید وامها و مدلهای نظرسنجی سیاسی نقش دارند، فرمول ریاضی مورد استفاده برای ارزیابی دقت آنها تعیین میکند که آیا این سیستمها واقعاً در دنیای واقعی کار میکنند یا صرفاً از حفرههای آماری سوءاستفاده مینمایند.
منابع
[1]PMC (National Institutes of Health)شکاکان به قابلیت تفسیرF*: an interpretable transformation of the F-measure
مطالعه در PMC (National Institutes of Health) →
[2]DataCampطرفداران معیار متوازنF1 Score in Machine Learning: A Balanced Metric for Precision and Recall
مطالعه در DataCamp →
[3]Openlayerطرفداران معیار متوازنF1 Score: Precision-Recall Balance
مطالعه در Openlayer →
[4]Scikit-learnتنظیمکنندگان آستانهsklearn.metrics.f1_score — scikit-learn documentation
مطالعه در Scikit-learn →
[5]arXivتنظیمکنندگان آستانهA Note on Using the F-Measure for Evaluating Record Linkage Algorithms
مطالعه در arXiv →
[6]تیم سردبیری کوهستانتنظیمکنندگان آستانهتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →تنگه هرمز
تحلیل دادههای ترافیک دریایی: چگونه نوسانات عبور کشتیها از تنگه هرمز اندازهگیری میشود
5 منبع
نوسانات ارزی
تحلیل دادههای نوسان نرخ ارز: عملکرد ۱۲ ماهه ریال در برابر دلار و یورو
4 منبع
معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





