چرا توافق درصد ساده در دادههای نامتوازن شکست میخورد و چگونه کاپای کوهن آن را اصلاح میکند
توافق درصد ساده با نادیده گرفتن احتمال حدس زدن تصادفی پاسخ یکسان توسط دو ارزیاب، میزان قابلیت اطمینان را بیش از حد واقعی نشان میدهد. کاپای کوهن (Cohen's Kappa) این نویز پایه را به صورت ریاضی حذف میکند و معیاری سختگیرانهتر و تعدیلشده بر اساس شانس برای ارزیابیهای انسانی و هوش مصنوعی ارائه میدهد.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- ارزیابان یادگیری ماشین
- تمرکز بر محکزنی هوش مصنوعی در برابر خطوط پایه انسانی در مجموعهدادههای نامتوازن.
- تشخیصدهندگان بالینی
- تمرکز بر قابلیت اطمینان بین ارزیابان در میان متخصصان پزشکی که شرایط را تشخیص میدهند.
- روششناسان آماری
- تمرکز بر محدودیتهای ریاضی، مانند پارادوکس کاپا و وابستگی به شیوع.
دیدگاههایی که این گزارش پوشش نداده
- اپراتورهای پلتفرمهای برونسپاری جمعی (Crowdsourcing) که به جای معیارهای تعدیلشده بر اساس شانس، به اجماع اکثریت آرا متکی هستند.
- 0.81–1.00
- آستانه برای توافق تقریباً کامل
- 0
- نمرهای که نشاندهنده توافق برابر با شانس است
- 2
- حداکثر ارزیابانی که کاپای کوهن میتواند ارزیابی کند
- −1 to 1
- مقیاس استاندارد شده آمار
نکات کلیدی
- توافق درصد ساده با نادیده گرفتن شانس تصادفی، نمرات قابلیت اطمینان را در مجموعهدادههای نامتوازن به طور مصنوعی افزایش میدهد.
- کاپای کوهن احتمال توافق تصادفی را به صورت ریاضی از نمره نهایی قابلیت اطمینان حذف میکند.
- این معیار در مقیاس استاندارد شده از ۱- تا ۱ عمل میکند، و نمرات بالای ۰٫۸۰ قوی در نظر گرفته میشوند.
- «پارادوکس کاپا» میتواند زمانی که یک دسته به شدت نادر است، نمرات را به طور مصنوعی کاهش دهد.
چرا مهم است
از آنجایی که سیستمهای خودکار به طور فزایندهای وظایف ذهنی مانند تعدیل محتوا و غربالگری پزشکی را بر عهده میگیرند، اتکا به نرخهای توافق خام، شکستهای حیاتی در مجموعهدادههای نامتوازن را پنهان میکند. درک معیارهای تعدیلشده بر اساس شانس تضمین میکند که سازمانها مدلهای معیوب را بر اساس نمرات قابلیت اطمینان متورم مستقر نکنند.
در اکتبر ۲۰۲۳، هنگامی که مدلهای زبان بزرگ شروع به جایگزینی حاشیهنویسان انسانی در خطوط لوله برچسبگذاری داده کردند، چارچوبهای ارزیابی به یک دیوار ریاضی برخورد کردند. تیمها نرخ توافق ۹۰ درصدی بین ارزیابان هوش مصنوعی و انسانی را در وظایفی مانند تشخیص گفتار سمی گزارش میکردند، اما مدلها همچنان در محیط عملیاتی شکست میخوردند. نقص نه در مدلها، بلکه در معیار بود. توافق درصد ساده با نادیده گرفتن احتمال حدس زدن تصادفی پاسخ یکسان توسط دو ارزیاب، میزان قابلیت اطمینان را بیش از حد واقعی نشان میدهد.[6]
برای حل این مشکل، تیمهای علوم داده معیاری را که توسط جیکوب کوهن در سال ۱۹۶۰ منتشر شده بود، احیا کردند: کاپای کوهن (Cohen's Kappa). این آمار قابلیت اطمینان بین ارزیابان را برای موارد دستهبندیشده اندازهگیری میکند، اما برخلاف درصد خام، نویز پایه شانس تصادفی را به صورت ریاضی حذف میکند. مجله آسیبشناسی دهان و فک و صورت (Journal of Oral and Maxillofacial Pathology) اشاره میکند: «کاپا معیاری برای این تفاوت است که استاندارد شده تا در مقیاس ۱- تا ۱ قرار گیرد، جایی که ۱ توافق کامل، ۰ دقیقاً همان چیزی است که به صورت تصادفی انتظار میرود، و مقادیر منفی نشاندهنده توافقی کمتر از شانس است.»[1]
این سازوکار بر دو احتمال متمایز متکی است. اولی توافق نسبی مشاهده شده در میان ارزیابان است که به عنوان متغیرهای احتمال مشاهده شده مشخص میشود. دومی احتمال فرضی توافق تصادفی است که با استفاده از دادههای مشاهده شده برای محاسبه احتمالات انتخاب تصادفی یک دسته معین توسط هر ناظر محاسبه میشود. خود فرمول ساده است: توافق مشاهده شده منهای توافق تصادفی، تقسیم بر یک منهای توافق تصادفی.[2][4]
مجموعهدادهای متشکل از ۱۰۰ بررسی مشتری را در نظر بگیرید که در آن ۹۰ مورد مثبت و ۱۰ مورد منفی هستند. اگر دو ارزیاب به سادگی هر بار بدون خواندن متن «مثبت» را حدس بزنند، توافق مشاهده شده آنها ۹۰٪ است. تحت معیار درصد ساده، این شبیه به اجماع تقریباً کامل به نظر میرسد. با این حال، از آنجایی که مجموعهداده به شدت نامتوازن است، احتمال توافق آنها به صورت تصادفی نیز بسیار بالا است.[7]
هنگامی که کاپای کوهن در این سناریوی دقیق اعمال میشود، توهم اجماع فرو میریزد. توافق تصادفی ۰٫۸۲ محاسبه میشود. قرار دادن این مقدار در فرمول، نمره کاپای ۰٫۴۴ را به دست میدهد. بنابراین، نرخ توافق خام ۹۰ درصدی به چیزی تنزل مییابد که آمارشناسان آن را صرفاً توافق «متوسط» طبقهبندی میکنند.[1][7]
هنگامی که کاپای کوهن در این سناریوی دقیق اعمال میشود، توهم اجماع فرو میریزد.
این جریمه ریاضی دلیلی است که این معیار به استاندارد ارزیابی توهمات هوش مصنوعی و وظایف طبقهبندی تبدیل شده است. به گفته گالیله (Galileo)، یک پلتفرم ارزیابی هوش مصنوعی، «کاپای کوهن به ویژه زمانی مفید است که مجموعهداده نامتوازن باشد، زیرا احتمال توافق ارزیابان به صورت تصادفی را در نظر میگیرد.»[6]
تفسیر نمره حاصل بر آستانههای تعیین شده متکی است. نمره زیر صفر نشاندهنده عدم توافق است، ۰٫۰۱ تا ۰٫۲۰ اندک، ۰٫۲۱ تا ۰٫۴۰ منصفانه، ۰٫۴۱ تا ۰٫۶۰ متوسط، ۰٫۶۱ تا ۰٫۸۰ قابل توجه، و ۰٫۸۱ تا ۱٫۰۰ تقریباً کامل است. دانشمندان داده Built In هشدار میدهند که «مقدار کاپای ۰٫۸ یا بالاتر به طور کلی نشاندهنده توافق خوب در نظر گرفته میشود، اما این آستانه میتواند بسته به حوزه خاص مطالعه متفاوت باشد.»[1][3]
با وجود کاربردش، این آمار محدودیتهای شناخته شدهای دارد. این معیار منحصراً برای دو ارزیاب طراحی شده است که موارد یکسانی را ارزیابی میکنند. اگر پروژهای به سه یا چند حاشیهنویس نیاز داشته باشد، محققان باید به کاپای فلیس (Fleiss' Kappa) روی آورند، که تعمیمی از فرمول است که ارزیابان متعدد را در یک مجموعهداده جای میدهد.[5]
علاوه بر این، کاپا به شدت به شیوع وضعیت زمینهای حساس است. در مجموعهدادههایی که یک دسته به شدت نادر است، مقدار توافق تصادفی آنقدر بالا میرود که حتی یک عدم توافق بین ارزیابان میتواند نمره کاپا را نزدیک به صفر کاهش دهد. این پدیده، که به عنوان «پارادوکس کاپا» شناخته میشود، آمارشناسان را مجبور میکند تا برای درک قابلیت اطمینان واقعی ارزیابان، هم توافق خام و هم مقدار کاپا را در کنار هم بررسی کنند.[2]
پذیرش کاپای کوهن در خطوط لوله یادگیری ماشین مدرن نشان میدهد که چگونه یک آمار روانشناختی ۶۰ ساله همچنان مؤثرترین دفاع در برابر توهم اجماع است. همانطور که سیستمهای خودکار وظایف برچسبگذاری ذهنی را بر عهده میگیرند، سؤال دیگر این نیست که چند وقت یکبار دو سیستم با هم توافق میکنند، بلکه این است که چند وقت یکبار با هم توافق میکنند در حالی که نباید توافق کنند.[6][7]
بررسی عمیق دیدگاهها
توافق درصد ساده
نسبت خام ارزیابیهای منطبق به کل ارزیابیها.
**مزایا:** توافق درصد ساده شهودی، از نظر محاسباتی ارزان و برای ذینفعان غیرفنی به راحتی قابل درک است. این معیار فقط به تعداد کل توافقات تقسیم بر تعداد کل مشاهدات نیاز دارد. **معایب:** احتمال پایه حدس زدن تصادفی را به طور کامل نادیده میگیرد. در مجموعهدادههای بسیار نامتوازن (مانند تشخیص کلاهبرداری که در آن ۹۹٪ تراکنشها قانونی هستند)، دو ارزیابی که کورکورانه هر بار «قانونی» را حدس میزنند، به توافق ۹۹٪ میرسند و به دروغ قابلیت اطمینان بالا را نشان میدهند. **مناسب برای زمانی که:** مجموعهداده در تمام دستهها کاملاً متوازن است و ریسک خطاهای مثبت کاذب یا منفی کاذب پایین است. **نامناسب برای زمانی که:** کلاسها نامتوازن هستند یا ارزیابی شامل دستهبندی ذهنی و پرخطر است.
کاپای کوهن
یک معیار تعدیلشده بر اساس شانس که توافقی را که میتواند به صورت تصادفی رخ دهد، به صورت ریاضی جریمه میکند.
**مزایا:** کاپای کوهن نویز شانس تصادفی را حذف میکند و بازتابی بسیار سختگیرانهتر و دقیقتر از اجماع واقعی ارائه میدهد. با محاسبه احتمال مورد انتظار توافق بر اساس مجموع نهایی تصمیمات هر ارزیاب، توافق عمدی را جدا میکند. **معایب:** این معیار منحصراً به دو ارزیاب محدود میشود و به شدت به «پارادوکس کاپا» حساس است، جایی که شیوع بسیار زیاد یا کم یک دسته میتواند نمره را به طور مصنوعی کاهش دهد، حتی زمانی که ارزیابان بسیار دقیق هستند. **مناسب برای زمانی که:** دو ارزیاب دادههای دستهبندیشده را ارزیابی میکنند، به ویژه در تشخیصهای پزشکی، کدگذاری روانشناختی، یا محکزنی مدل هوش مصنوعی در مجموعهدادههای نامتوازن. **نامناسب برای زمانی که:** سه یا چند ارزیاب وجود دارد (که نیاز به کاپای فلیس دارد) یا دادهها به جای دستهبندی، پیوسته هستند.
منابع
[1]Journal of Oral and Maxillofacial Pathologyتشخیصدهندگان بالینیInterrater reliability: the kappa statistic
مطالعه در Journal of Oral and Maxillofacial Pathology →
[2]Statistics How Toروششناسان آماریCohen's Kappa Statistic
مطالعه در Statistics How To →
[3]Built Inارزیابان یادگیری ماشینCohen's Kappa Explained
مطالعه در Built In →
[4]Statistics Calculatorروششناسان آماریCohen's Kappa: Measuring Inter-Rater Agreement
مطالعه در Statistics Calculator →
[5]WikipediaCohen's kappa
مطالعه در Wikipedia →
[6]Galileoارزیابان یادگیری ماشینEnhancing AI Evaluation with Cohen's Kappa Metric
مطالعه در Galileo →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →تنگه هرمز
تحلیل دادههای ترافیک دریایی: چگونه نوسانات عبور کشتیها از تنگه هرمز اندازهگیری میشود
5 منبع
نوسانات ارزی
تحلیل دادههای نوسان نرخ ارز: عملکرد ۱۲ ماهه ریال در برابر دلار و یورو
4 منبع
معیارهای ارزیابی
چگونه مساحت زیر منحنی ROC همان احتمال رتبهبندی درست یک نمونه مثبت بالاتر از نمونه منفی است
7 منبع
ریاضیات پیشبینی
چگونه پهنای مخروط عدم قطعیت با جذر زمان پیشبینی افزایش مییابد
6 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





