رفتن به محتوای اصلی
Koohestun
توضیح کوهستانقابلیت اطمینان بین ارزیابانمقایسه معیارها· 4 دقیقه مطالعه· در تحلیل داده

چرا توافق درصد ساده در داده‌های نامتوازن شکست می‌خورد و چگونه کاپای کوهن آن را اصلاح می‌کند

توافق درصد ساده با نادیده گرفتن احتمال حدس زدن تصادفی پاسخ یکسان توسط دو ارزیاب، میزان قابلیت اطمینان را بیش از حد واقعی نشان می‌دهد. کاپای کوهن (Cohen's Kappa) این نویز پایه را به صورت ریاضی حذف می‌کند و معیاری سخت‌گیرانه‌تر و تعدیل‌شده بر اساس شانس برای ارزیابی‌های انسانی و هوش مصنوعی ارائه می‌دهد.

به قلم ندا وزیری

ارزیابان یادگیری ماشین 40%تشخیص‌دهندگان بالینی 40%روش‌شناسان آماری 20%
ارزیابان یادگیری ماشین
تمرکز بر محک‌زنی هوش مصنوعی در برابر خطوط پایه انسانی در مجموعه‌داده‌های نامتوازن.
تشخیص‌دهندگان بالینی
تمرکز بر قابلیت اطمینان بین ارزیابان در میان متخصصان پزشکی که شرایط را تشخیص می‌دهند.
روش‌شناسان آماری
تمرکز بر محدودیت‌های ریاضی، مانند پارادوکس کاپا و وابستگی به شیوع.

دیدگاه‌هایی که این گزارش پوشش نداده

  • اپراتورهای پلتفرم‌های برون‌سپاری جمعی (Crowdsourcing) که به جای معیارهای تعدیل‌شده بر اساس شانس، به اجماع اکثریت آرا متکی هستند.
0.81–1.00
آستانه برای توافق تقریباً کامل
0
نمره‌ای که نشان‌دهنده توافق برابر با شانس است
2
حداکثر ارزیابانی که کاپای کوهن می‌تواند ارزیابی کند
−1 to 1
مقیاس استاندارد شده آمار

نکات کلیدی

  • توافق درصد ساده با نادیده گرفتن شانس تصادفی، نمرات قابلیت اطمینان را در مجموعه‌داده‌های نامتوازن به طور مصنوعی افزایش می‌دهد.
  • کاپای کوهن احتمال توافق تصادفی را به صورت ریاضی از نمره نهایی قابلیت اطمینان حذف می‌کند.
  • این معیار در مقیاس استاندارد شده از ۱- تا ۱ عمل می‌کند، و نمرات بالای ۰٫۸۰ قوی در نظر گرفته می‌شوند.
  • «پارادوکس کاپا» می‌تواند زمانی که یک دسته به شدت نادر است، نمرات را به طور مصنوعی کاهش دهد.

چرا مهم است

از آنجایی که سیستم‌های خودکار به طور فزاینده‌ای وظایف ذهنی مانند تعدیل محتوا و غربالگری پزشکی را بر عهده می‌گیرند، اتکا به نرخ‌های توافق خام، شکست‌های حیاتی در مجموعه‌داده‌های نامتوازن را پنهان می‌کند. درک معیارهای تعدیل‌شده بر اساس شانس تضمین می‌کند که سازمان‌ها مدل‌های معیوب را بر اساس نمرات قابلیت اطمینان متورم مستقر نکنند.

در اکتبر ۲۰۲۳، هنگامی که مدل‌های زبان بزرگ شروع به جایگزینی حاشیه‌نویسان انسانی در خطوط لوله برچسب‌گذاری داده کردند، چارچوب‌های ارزیابی به یک دیوار ریاضی برخورد کردند. تیم‌ها نرخ توافق ۹۰ درصدی بین ارزیابان هوش مصنوعی و انسانی را در وظایفی مانند تشخیص گفتار سمی گزارش می‌کردند، اما مدل‌ها همچنان در محیط عملیاتی شکست می‌خوردند. نقص نه در مدل‌ها، بلکه در معیار بود. توافق درصد ساده با نادیده گرفتن احتمال حدس زدن تصادفی پاسخ یکسان توسط دو ارزیاب، میزان قابلیت اطمینان را بیش از حد واقعی نشان می‌دهد.[6]

برای حل این مشکل، تیم‌های علوم داده معیاری را که توسط جیکوب کوهن در سال ۱۹۶۰ منتشر شده بود، احیا کردند: کاپای کوهن (Cohen's Kappa). این آمار قابلیت اطمینان بین ارزیابان را برای موارد دسته‌بندی‌شده اندازه‌گیری می‌کند، اما برخلاف درصد خام، نویز پایه شانس تصادفی را به صورت ریاضی حذف می‌کند. مجله آسیب‌شناسی دهان و فک و صورت (Journal of Oral and Maxillofacial Pathology) اشاره می‌کند: «کاپا معیاری برای این تفاوت است که استاندارد شده تا در مقیاس ۱- تا ۱ قرار گیرد، جایی که ۱ توافق کامل، ۰ دقیقاً همان چیزی است که به صورت تصادفی انتظار می‌رود، و مقادیر منفی نشان‌دهنده توافقی کمتر از شانس است.»[1]

این سازوکار بر دو احتمال متمایز متکی است. اولی توافق نسبی مشاهده شده در میان ارزیابان است که به عنوان متغیرهای احتمال مشاهده شده مشخص می‌شود. دومی احتمال فرضی توافق تصادفی است که با استفاده از داده‌های مشاهده شده برای محاسبه احتمالات انتخاب تصادفی یک دسته معین توسط هر ناظر محاسبه می‌شود. خود فرمول ساده است: توافق مشاهده شده منهای توافق تصادفی، تقسیم بر یک منهای توافق تصادفی.[2][4]

در یک مجموعه‌داده نامتوازن، نرخ توافق خام ۹۰٪ می‌تواند پس از حذف شانس، به نمره کاپای ۰٫۴۴ کاهش یابد.

مجموعه‌داده‌ای متشکل از ۱۰۰ بررسی مشتری را در نظر بگیرید که در آن ۹۰ مورد مثبت و ۱۰ مورد منفی هستند. اگر دو ارزیاب به سادگی هر بار بدون خواندن متن «مثبت» را حدس بزنند، توافق مشاهده شده آنها ۹۰٪ است. تحت معیار درصد ساده، این شبیه به اجماع تقریباً کامل به نظر می‌رسد. با این حال، از آنجایی که مجموعه‌داده به شدت نامتوازن است، احتمال توافق آنها به صورت تصادفی نیز بسیار بالا است.[7]

هنگامی که کاپای کوهن در این سناریوی دقیق اعمال می‌شود، توهم اجماع فرو می‌ریزد. توافق تصادفی ۰٫۸۲ محاسبه می‌شود. قرار دادن این مقدار در فرمول، نمره کاپای ۰٫۴۴ را به دست می‌دهد. بنابراین، نرخ توافق خام ۹۰ درصدی به چیزی تنزل می‌یابد که آمارشناسان آن را صرفاً توافق «متوسط» طبقه‌بندی می‌کنند.[1][7]

هنگامی که کاپای کوهن در این سناریوی دقیق اعمال می‌شود، توهم اجماع فرو می‌ریزد.

این جریمه ریاضی دلیلی است که این معیار به استاندارد ارزیابی توهمات هوش مصنوعی و وظایف طبقه‌بندی تبدیل شده است. به گفته گالیله (Galileo)، یک پلتفرم ارزیابی هوش مصنوعی، «کاپای کوهن به ویژه زمانی مفید است که مجموعه‌داده نامتوازن باشد، زیرا احتمال توافق ارزیابان به صورت تصادفی را در نظر می‌گیرد.»[6]

تفسیر نمره حاصل بر آستانه‌های تعیین شده متکی است. نمره زیر صفر نشان‌دهنده عدم توافق است، ۰٫۰۱ تا ۰٫۲۰ اندک، ۰٫۲۱ تا ۰٫۴۰ منصفانه، ۰٫۴۱ تا ۰٫۶۰ متوسط، ۰٫۶۱ تا ۰٫۸۰ قابل توجه، و ۰٫۸۱ تا ۱٫۰۰ تقریباً کامل است. دانشمندان داده Built In هشدار می‌دهند که «مقدار کاپای ۰٫۸ یا بالاتر به طور کلی نشان‌دهنده توافق خوب در نظر گرفته می‌شود، اما این آستانه می‌تواند بسته به حوزه خاص مطالعه متفاوت باشد.»[1][3]

آمارشناسان عموماً نمره کاپای بالاتر از ۰٫۸۰ را نشان‌دهنده قابلیت اطمینان قوی بین ارزیابان می‌دانند.

با وجود کاربردش، این آمار محدودیت‌های شناخته شده‌ای دارد. این معیار منحصراً برای دو ارزیاب طراحی شده است که موارد یکسانی را ارزیابی می‌کنند. اگر پروژه‌ای به سه یا چند حاشیه‌نویس نیاز داشته باشد، محققان باید به کاپای فلیس (Fleiss' Kappa) روی آورند، که تعمیمی از فرمول است که ارزیابان متعدد را در یک مجموعه‌داده جای می‌دهد.[5]

علاوه بر این، کاپا به شدت به شیوع وضعیت زمینه‌ای حساس است. در مجموعه‌داده‌هایی که یک دسته به شدت نادر است، مقدار توافق تصادفی آنقدر بالا می‌رود که حتی یک عدم توافق بین ارزیابان می‌تواند نمره کاپا را نزدیک به صفر کاهش دهد. این پدیده، که به عنوان «پارادوکس کاپا» شناخته می‌شود، آمارشناسان را مجبور می‌کند تا برای درک قابلیت اطمینان واقعی ارزیابان، هم توافق خام و هم مقدار کاپا را در کنار هم بررسی کنند.[2]

پذیرش کاپای کوهن در خطوط لوله یادگیری ماشین مدرن نشان می‌دهد که چگونه یک آمار روان‌شناختی ۶۰ ساله همچنان مؤثرترین دفاع در برابر توهم اجماع است. همانطور که سیستم‌های خودکار وظایف برچسب‌گذاری ذهنی را بر عهده می‌گیرند، سؤال دیگر این نیست که چند وقت یکبار دو سیستم با هم توافق می‌کنند، بلکه این است که چند وقت یکبار با هم توافق می‌کنند در حالی که نباید توافق کنند.[6][7]

بررسی عمیق دیدگاه‌ها

توافق درصد ساده

نسبت خام ارزیابی‌های منطبق به کل ارزیابی‌ها.

**مزایا:** توافق درصد ساده شهودی، از نظر محاسباتی ارزان و برای ذینفعان غیرفنی به راحتی قابل درک است. این معیار فقط به تعداد کل توافقات تقسیم بر تعداد کل مشاهدات نیاز دارد. **معایب:** احتمال پایه حدس زدن تصادفی را به طور کامل نادیده می‌گیرد. در مجموعه‌داده‌های بسیار نامتوازن (مانند تشخیص کلاهبرداری که در آن ۹۹٪ تراکنش‌ها قانونی هستند)، دو ارزیابی که کورکورانه هر بار «قانونی» را حدس می‌زنند، به توافق ۹۹٪ می‌رسند و به دروغ قابلیت اطمینان بالا را نشان می‌دهند. **مناسب برای زمانی که:** مجموعه‌داده در تمام دسته‌ها کاملاً متوازن است و ریسک خطاهای مثبت کاذب یا منفی کاذب پایین است. **نامناسب برای زمانی که:** کلاس‌ها نامتوازن هستند یا ارزیابی شامل دسته‌بندی ذهنی و پرخطر است.

کاپای کوهن

یک معیار تعدیل‌شده بر اساس شانس که توافقی را که می‌تواند به صورت تصادفی رخ دهد، به صورت ریاضی جریمه می‌کند.

**مزایا:** کاپای کوهن نویز شانس تصادفی را حذف می‌کند و بازتابی بسیار سخت‌گیرانه‌تر و دقیق‌تر از اجماع واقعی ارائه می‌دهد. با محاسبه احتمال مورد انتظار توافق بر اساس مجموع نهایی تصمیمات هر ارزیاب، توافق عمدی را جدا می‌کند. **معایب:** این معیار منحصراً به دو ارزیاب محدود می‌شود و به شدت به «پارادوکس کاپا» حساس است، جایی که شیوع بسیار زیاد یا کم یک دسته می‌تواند نمره را به طور مصنوعی کاهش دهد، حتی زمانی که ارزیابان بسیار دقیق هستند. **مناسب برای زمانی که:** دو ارزیاب داده‌های دسته‌بندی‌شده را ارزیابی می‌کنند، به ویژه در تشخیص‌های پزشکی، کدگذاری روان‌شناختی، یا محک‌زنی مدل هوش مصنوعی در مجموعه‌داده‌های نامتوازن. **نامناسب برای زمانی که:** سه یا چند ارزیاب وجود دارد (که نیاز به کاپای فلیس دارد) یا داده‌ها به جای دسته‌بندی، پیوسته هستند.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

ارزیابان یادگیری ماشین 40%تشخیص‌دهندگان بالینی 40%روش‌شناسان آماری 20%
  1. [1]Journal of Oral and Maxillofacial Pathologyتشخیص‌دهندگان بالینی

    Interrater reliability: the kappa statistic

    مطالعه در Journal of Oral and Maxillofacial Pathology
  2. [2]Statistics How Toروش‌شناسان آماری

    Cohen's Kappa Statistic

    مطالعه در Statistics How To
  3. [3]Built Inارزیابان یادگیری ماشین

    Cohen's Kappa Explained

    مطالعه در Built In
  4. [4]Statistics Calculatorروش‌شناسان آماری

    Cohen's Kappa: Measuring Inter-Rater Agreement

    مطالعه در Statistics Calculator
  5. [5]Wikipedia

    Cohen's kappa

    مطالعه در Wikipedia
  6. [6]Galileoارزیابان یادگیری ماشین

    Enhancing AI Evaluation with Cohen's Kappa Metric

    مطالعه در Galileo
  7. [7]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.