رفتن به محتوای اصلی
Koohestun
توضیح کوهستانانصاف الگوریتمیمقایسه معیارها· 6 دقیقه مطالعه· در فناوری

چرا معیار «فرصت برابر» در هوش مصنوعی خطاهای مثبت کاذب را لاپوشانی می‌کند، اما «شانس برابر» مچشان را می‌گیرد؟

با اینکه هر دو معیار برای صدور گواهی «انصاف» در مدل‌های یادگیری ماشین استفاده می‌شوند، معیار «فرصت برابر» خطاهای مثبت کاذب را نادیده می‌گیرد. این یعنی الگوریتم‌ها می‌توانند گروه‌های اقلیت را به‌طور نامتناسبی جریمه کنند؛ چیزی که معیار «شانس برابر» صراحتاً جلوی آن را می‌گیرد.

به قلم دلناز نورانی

توسعه‌دهندگان تجاری هوش مصنوعی 40%پژوهشگران انصاف هوش مصنوعی 40%اخلاق‌گرایان بالینی 20%
توسعه‌دهندگان تجاری هوش مصنوعی
معیار «فرصت برابر» را ترجیح می‌دهند زیرا برآورده کردن آن از نظر محاسباتی آسان‌تر است و دقت کلی مدل را کاهش نمی‌دهد.
پژوهشگران انصاف هوش مصنوعی
از معیار «شانس برابر» در محیط‌های پرخطر دفاع می‌کنند تا مطمئن شوند تاوان خطاهای مثبت کاذب به‌طور مساوی توزیع می‌شود.
اخلاق‌گرایان بالینی
استدلال می‌کنند که معیارهای انصاف باید آسیب‌های پزشکی واقعی ناشی از خطاهای مثبت کاذب را در نظر بگیرند، نه فقط برابری آماری را.

دیدگاه‌هایی که این گزارش پوشش نداده

  • افرادی که مستقیماً از خطاهای مثبت کاذب الگوریتمی آسیب دیده‌اند
  • مسئولان تطبیق قانونی که وظیفه دارند از انتخاب این معیارها در دادگاه دفاع کنند

نکات کلیدی

  1. معیار «فرصت برابر» ایجاب می‌کند که مدل، افراد واجد شرایط را با نرخی یکسان در تمام گروه‌های جمعیتی به‌درستی شناسایی کند.
  2. از آنجا که این معیار تنها «نرخ مثبت واقعی» را می‌سنجد، خطاهای مثبت کاذب را به‌کل نادیده می‌گیرد.
  3. «شانس برابر» معیار سخت‌گیرانه‌تری است که می‌طلبد هم نرخ مثبت واقعی و هم نرخ مثبت کاذب در بین گروه‌ها یکسان باشد.
  4. برآورده کردن معیار «شانس برابر» اغلب نیازمند کاهش مصنوعی دقت کلی مدل است؛ به همین دلیل، بسیاری از توسعه‌دهندگان تجاری در عمل به همان معیار «فرصت برابر» بسنده می‌کنند.

در دسامبر ۲۰۱۶، در مرکز همایش‌های بین‌المللی بارسلونا و در جریان کنفرانس سیستم‌های پردازش اطلاعات عصبی (NIPS)، پژوهشگرانی به نام‌های موریتز هارت، اریک پرایس و ناتان سربرو مقاله‌ای ۱۴ صفحه‌ای ارائه کردند که نحوه سنجش سوگیری الگوریتمی در صنعت فناوری را برای همیشه تغییر داد. آن‌ها یک چارچوب ریاضی دقیق را برای ارزیابی این موضوع معرفی کردند که آیا یک مدل یادگیری ماشین با گروه‌های مختلف جمعیتی منصفانه رفتار می‌کند یا خیر؛ آن هم بدون اینکه مدل مجبور باشد آن ویژگی‌های جمعیتی را کاملاً نادیده بگیرد. این مقاله دو معیار متمایز را تدوین کرد که از آن زمان به پایه و اساس مطلق حسابرسی الگوریتمی در سراسر صنعت جهانی نرم‌افزار تبدیل شده‌اند: «فرصت برابر» و «شانس برابر». پیش از این انتشار، توسعه‌دهندگان برای کمّی‌سازی مفهوم «انصاف» به شکلی که بتوان آن را در یک تابع هدف برنامه‌نویسی کرد، با مشکل مواجه بودند.[1]

وقتی یک فروشنده سازمانیِ هوش مصنوعی با آب‌وتاپ ادعا می‌کند که مدل جدید استخدامی، وام‌دهی یا تشخیص پزشکی‌اش «گواهی انصاف» دارد، تقریباً همیشه به یکی از این دو تعریف ریاضی خاص تکیه کرده است. اما تفاوت بین آن‌ها صرفاً آکادمیک یا لغوی نیست. این تفاوت دقیقاً تعیین می‌کند که مدل مجاز است چه نوع خطاهایی را زیر فرش پنهان کند و مهم‌تر از آن، کدام گروه جمعیتی در نهایت باید تاوان این خطاهای پنهان را در دنیای واقعی بپردازد. درک این شکاف برای هر کسی که یادگیری ماشین را در محیط‌های پرخطر پیاده‌سازی می‌کند، حیاتی است.[2][3]

برای درک تفاوت بین این دو استاندارد، ابتدا باید نگاهی بیندازیم به اینکه مدل‌های یادگیری ماشین در عمل چگونه شکست می‌خورند. در یک سیستم طبقه‌بندی دودویی — مانند الگوریتمی که تصمیم می‌گیرد درخواست وام مسکن را تایید یا رد کند — مدل دو نوع اشتباه کاملاً متفاوت مرتکب می‌شود. می‌تواند وام را از کسی که با موفقیت آن را بازپرداخت می‌کرد دریغ کند (که به آن «منفی کاذب» می‌گویند)، یا می‌تواند به کسی وام بدهد که در نهایت نکول می‌کند (که به آن «مثبت کاذب» می‌گویند).[4]

معیار «فرصت برابر» منحصراً روی کلاس مثبتِ پیش‌بینی‌ها تمرکز دارد. این معیار ایجاب می‌کند که «نرخ مثبت واقعی» از نظر ریاضی در تمام گروه‌های جمعیتیِ محافظت‌شده، فارغ از اندازه‌شان، کاملاً یکسان باشد. اگر یک مدل وام‌دهی ۱۰۰۰ متقاضی واقعاً واجد شرایط از گروه الف و ۱۰۰۰ متقاضی واقعاً واجد شرایط از گروه ب را ارزیابی کند، معیار فرصت برابر حکم می‌کند که الگوریتم باید دقیقاً درصد یکسانی از افراد هر دو گروه را تایید کند تا مطمئن شود هیچ گروهی به‌طور ناعادلانه رد نمی‌شود.[1][5]

معیار «فرصت برابر» تنها پیش‌بینی‌های مثبت را محدود می‌کند، در حالی که «شانس برابر» هم خطاهای مثبت و هم منفی را متوازن می‌سازد.

در عمل، این یعنی اگر مدل به‌طور نامتناسبی اعضای واجد شرایط یک گروه اقلیت را رد کند، به‌شدت جریمه می‌شود. برای یک الگوریتم استخدامی شرکتی، برآورده کردن محدودیت فرصت برابر تضمین می‌کند که نامزدهای «خوب» از هر پیشینه‌ای، شانس آماری برابری برای انتخاب شدن دارند. این معیار برای بخش‌های تطبیق قانونی شرکت‌ها بسیار جذاب است، زیرا دستیابی به آن از نظر محاسباتی نسبتاً آسان است و کاملاً با تعریف شهودی و عامیانه از انصاف همخوانی دارد: پاداش دادن برابر به شایستگی واقعی.[5]

با این حال، معیار فرصت برابر دارای یک نقطه کور ریاضیِ عمدی و بسیار پرهزینه است. طبق مستندات رسمی Fairlearn: «فرصت برابر نسخه تقلیل‌یافته‌ای از شانس برابر است که تنها انتظارات مشروط را در رابطه با برچسب‌های مثبت در نظر می‌گیرد.» این معیار کلاس منفی (وای=۰) را کاملاً نادیده می‌گیرد؛ به این معنی که «نرخ مثبت کاذب» را نمی‌سنجد، ردیابی نمی‌کند و اصلاً به آن اهمیتی نمی‌دهد. یک مدل می‌تواند از این آزمون انصاف با موفقیت کامل بیرون بیاید، در حالی که در سمت دیگرِ ماتریس درهم‌ریختگی به طرز فاجعه‌باری شکست خورده است.[1][7]

با این حال، معیار فرصت برابر دارای یک نقطه کور ریاضیِ عمدی و بسیار پرهزینه است.

این دقیقاً همان جایی است که «شانس برابر» به عنوان جایگزینی سخت‌گیرانه‌تر و جامع‌تر وارد میدان می‌شود. شانس برابر نسخه سخت‌گیرانه‌تر و کاملاً تحقق‌یافته از محدودیت انصاف است. این معیار می‌طلبد که یک مدل یادگیری ماشین به‌طور همزمان به نرخ مثبت واقعی برابر و نرخ مثبت کاذب برابر در تمام گروه‌های جمعیتی محافظت‌شده دست یابد. با نظارت بر هر دو محور ماتریس درهم‌ریختگی، این معیار هیچ فضایی برای نابرابری‌های آماری پنهان در نحوه برخورد الگوریتم با سوژه‌های فاقد شرایط یا کلاس منفی باقی نمی‌گذارد.[4][7]

تحت استاندارد شانس برابر، یک مدل نمی‌تواند صرفاً درصد یکسانی از متقاضیان واجد شرایط را تایید کند؛ بلکه باید دقیقاً درصد یکسانی از متقاضیان فاقد شرایط را نیز در تمام گروه‌ها به‌اشتباه تایید کند. همان‌طور که MetricGate اشاره می‌کند: «شانس برابر می‌پذیرد که نرخ‌های پایه ممکن است به‌طور مشروعی متفاوت باشند، اما تقاضا دارد که خطاهای مدل به‌طور مساوی توزیع شوند.» این معیار توزیع خطای مدل را مجبور می‌کند تا کاملاً متقارن باشد و تضمین می‌کند که بار آماریِ طبقه‌بندیِ اشتباه، به‌طور نامتناسبی روی دوش یک گروه جمعیتی خاص نیفتد.[4]

تفاوت عملی بین این دو معیار در پیاده‌سازی‌های پرخطر، مانند ارزیابی ریسک در عدالت کیفری، کشف تقلب مالی یا پیش‌بینی‌های بالینی سلامت، به‌شدت آشکار می‌شود. اگر وظیفه یک الگوریتم پزشکی پیش‌بینی این باشد که کدام بیماران بیمارستان به مراقبت‌های پیشگیرانه فوری نیاز دارند، یک مثبت کاذب به این معناست که یک بیمار سالم آزمایش‌های غیرضروری و گرانی دریافت می‌کند، در حالی که یک منفی کاذب یعنی یک بیمار واقعاً بدحال بدون درمان به خانه فرستاده می‌شود. هزینه این خطاها با سلامت انسان سنجیده می‌شود، نه فقط با کارایی محاسباتی.[6]

اگر آن مدل پیش‌بینی پزشکی فقط برای «فرصت برابر» بهینه‌سازی شده باشد، تضمین می‌کند که بیماران واقعاً بدحال در گروه الف و گروه ب دقیقاً با نرخ یکسانی شناسایی شوند. اما از نظر قانونی به مدل اجازه می‌دهد تا نرخ مثبت کاذب ۴۰ درصدی برای گروه الف و نرخ مثبت کاذب تنها ۵ درصدی برای گروه ب تولید کند. در این حالت، گروه الف در معرض مداخلات پزشکی غیرضروری و بالقوه تهاجمیِ بسیار بیشتری قرار می‌گیرد، با این حال مدل همچنان تحت استاندارد فرصت برابر رسماً به عنوان مدلی «منصفانه» گواهی می‌گیرد.[3][6]

یک مدل می‌تواند معیار «فرصت برابر» را برآورده کند، در حالی که تمام خطاهای مثبت کاذب خود را منحصراً روی یک گروه جمعیتی متمرکز کرده است.

معیار «شانس برابر» با محدود کردن نابرابری در هر دو سرِ طیف پیش‌بینی، صراحتاً از این سناریو جلوگیری می‌کند. اما این سخت‌گیری با هزینه عملیاتی سنگینی برای توسعه‌دهندگان سیستم همراه است. از آنجا که این معیار هر دو محور مثبت واقعی و مثبت کاذب را به‌طور همزمان محدود می‌کند، برآورده کردن ریاضیِ شانس برابر بدون کاهش مصنوعیِ دقت پیش‌بینی کلی مدل در تمام سطوح، به‌شدت دشوار است.[4]

وقتی نرخ‌های پایه — یعنی شیوع زمینه‌ای یک شرایط یا پیامد خاص — بین دو گروه جمعیتی تفاوت چشمگیری داشته باشد، برآورده کردن شانس برابر اغلب ایجاب می‌کند که الگوریتم عمداً پیش‌بینی‌های بدتری برای گروه اکثریت انجام دهد تا فقط نرخ خطاها را متوازن کند. همان‌طور که پژوهشگران حوزه انصاف اشاره می‌کنند، یک مدل می‌تواند در مجموع ۹۰ درصد دقت داشته باشد، اما همچنان انواع مختلفی از اشتباهات را به‌طور سیستماتیک برای گروه‌های مختلف مرتکب شود. این بده‌بستانِ اجتناب‌ناپذیر در دقت، دقیقاً همان دلیلی است که بسیاری از توسعه‌دهندگان تجاری هوش مصنوعی در سیستم‌های عملیاتی خود بی‌سروصدا به همان معیار «فرصت برابر» پناه می‌برند.[2][7]

انتخاب بین این دو معیار در نهایت کاملاً به هزینه واقعیِ یک مثبت کاذب در یک حوزه خاص بستگی دارد. در فیلتر اسپم مصرف‌کننده، یک مثبت کاذب صرفاً آزاردهنده است و همین باعث می‌شود معیار فرصت برابر کاملاً کافی باشد. اما در یک سیستم تشخیص چهره که توسط مجریان قانون استفاده می‌شود، یک مثبت کاذب مستقیماً به دستگیری اشتباه منجر می‌شود. در آن محیط‌های پرخطر، پذیرش هر چیزی کمتر از «شانس برابر»، یک انتخاب آگاهانه است تا اجازه دهیم یک گروه جمعیتی خاص، بدترین اشتباهات سیستم را به دوش بکشد.[4]

Y = 1
محدودیت فرصت برابر (فقط برچسب‌های مثبت)
Y = 0
محدودیت مضاعف شانس برابر (برچسب‌های منفی)
90%
دقت کلی که همچنان می‌تواند نابرابری‌های شدید در مثبت کاذب را پنهان کند

بررسی عمیق دیدگاه‌ها

فرصت برابر (برابری نرخ مثبت واقعی)

استانداردی تقلیل‌یافته که تضمین می‌کند افراد واجد شرایط از تمام گروه‌ها با نرخی یکسان انتخاب شوند.

فرصت برابر از نظر ریاضی با این محدودیت تعریف می‌شود که نرخ مثبت واقعی باید در بین ویژگی‌های محافظت‌شده یکسان باشد. اگر وظیفه یک مدل یافتن نامزدهای واجد شرایط باشد، این معیار تضمین می‌کند که یک نامزد واجد شرایط از یک گروه اقلیت، دقیقاً همان احتمال انتخاب شدن را دارد که یک نامزد واجد شرایط از گروه اکثریت. از آنجا که این معیار نرخ مثبت کاذب را نادیده می‌گیرد، از نظر محاسباتی سبک‌تر است و به‌ندرت توسعه‌دهندگان را مجبور می‌کند عملکرد مدل را روی گروه اکثریت به‌طور مصنوعی کاهش دهند. این معیار برای محیط‌های کم‌خطر که در آن‌ها خطاهای مثبت کاذب جریمه چندانی ندارند، ترجیح داده می‌شود.

شانس برابر (برابری نرخ مثبت واقعی و مثبت کاذب)

استانداردی سخت‌گیرانه که تضمین می‌کند هم مزایا و هم تاوان پیش‌بینی‌های یک مدل به‌طور مساوی توزیع شوند.

شانس برابر با محدود کردن همزمان نرخ مثبت واقعی و نرخ مثبت کاذب، یک توزیع خطای متقارن را اعمال می‌کند. این معیار می‌پذیرد که در سیستم‌های پرخطر — مانند ارزیابی ریسک عدالت کیفری یا تشخیص‌های پزشکی — یک مثبت کاذب می‌تواند به اندازه یک منفی کاذب مخرب باشد. با الزام به اینکه مدل باید روی افراد فاقد شرایط در تمام گروه‌ها با نرخ یکسانی اشتباه کند، از اینکه سیستم عدم قطعیت آماری خود را روی دوش یک گروه جمعیتی خاص بیندازد، جلوگیری می‌کند. با این حال، برآورده کردن این معیار اغلب توسعه‌دهندگان را مجبور می‌کند دقت کلی مدل را کاهش دهند، که این امر تنشی بین انصاف مطلق و قدرت پیش‌بینی ایجاد می‌کند.

آنچه نمی‌دانیم

  • اینکه مقررات پیش‌روی هوش مصنوعی در اتحادیه اروپا و ایالات متحده، دقیقاً کدام معیار انصاف را برای پیاده‌سازی‌های پرخطر به لحاظ قانونی الزامی و استاندارد خواهند کرد.
  • آیا چارچوب‌های ریاضی جدید می‌توانند مشکل افت دقت را که ذاتاً با اجرای معیار «شانس برابر» در هویت‌های متقاطع چندگانه گره خورده است، حل کنند یا خیر.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان تجاری هوش مصنوعی 40%پژوهشگران انصاف هوش مصنوعی 40%اخلاق‌گرایان بالینی 20%
  1. [1]NIPSپژوهشگران انصاف هوش مصنوعی

    Equality of Opportunity in Supervised Learning

    مطالعه در NIPS
  2. [2]Google for Developersتوسعه‌دهندگان تجاری هوش مصنوعی

    Machine Learning Glossary: Metrics

    مطالعه در Google for Developers
  3. [3]PMCاخلاق‌گرایان بالینی

    What Is Fair? Defining Fairness in Machine Learning for Health

    مطالعه در PMC
  4. [4]MetricGateپژوهشگران انصاف هوش مصنوعی

    Fairness Metrics: Parity vs Equal Odds

    مطالعه در MetricGate
  5. [5]Google for Developersتوسعه‌دهندگان تجاری هوش مصنوعی

    Fairness: Equality of opportunity

    مطالعه در Google for Developers
  6. [6]PMCاخلاق‌گرایان بالینی

    Reporting of Fairness Metrics in Clinical Risk Prediction Models Used for Precision Health: Scoping Review

    مطالعه در PMC
  7. [7]Fairlearnپژوهشگران انصاف هوش مصنوعی

    Fairness in Machine Learning

    مطالعه در Fairlearn
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.