چرا معیار «فرصت برابر» در هوش مصنوعی خطاهای مثبت کاذب را لاپوشانی میکند، اما «شانس برابر» مچشان را میگیرد؟
با اینکه هر دو معیار برای صدور گواهی «انصاف» در مدلهای یادگیری ماشین استفاده میشوند، معیار «فرصت برابر» خطاهای مثبت کاذب را نادیده میگیرد. این یعنی الگوریتمها میتوانند گروههای اقلیت را بهطور نامتناسبی جریمه کنند؛ چیزی که معیار «شانس برابر» صراحتاً جلوی آن را میگیرد.
به قلم دلناز نورانی
این خبر را به اشتراک بگذارید
- توسعهدهندگان تجاری هوش مصنوعی
- معیار «فرصت برابر» را ترجیح میدهند زیرا برآورده کردن آن از نظر محاسباتی آسانتر است و دقت کلی مدل را کاهش نمیدهد.
- پژوهشگران انصاف هوش مصنوعی
- از معیار «شانس برابر» در محیطهای پرخطر دفاع میکنند تا مطمئن شوند تاوان خطاهای مثبت کاذب بهطور مساوی توزیع میشود.
- اخلاقگرایان بالینی
- استدلال میکنند که معیارهای انصاف باید آسیبهای پزشکی واقعی ناشی از خطاهای مثبت کاذب را در نظر بگیرند، نه فقط برابری آماری را.
دیدگاههایی که این گزارش پوشش نداده
- افرادی که مستقیماً از خطاهای مثبت کاذب الگوریتمی آسیب دیدهاند
- مسئولان تطبیق قانونی که وظیفه دارند از انتخاب این معیارها در دادگاه دفاع کنند
نکات کلیدی
- معیار «فرصت برابر» ایجاب میکند که مدل، افراد واجد شرایط را با نرخی یکسان در تمام گروههای جمعیتی بهدرستی شناسایی کند.
- از آنجا که این معیار تنها «نرخ مثبت واقعی» را میسنجد، خطاهای مثبت کاذب را بهکل نادیده میگیرد.
- «شانس برابر» معیار سختگیرانهتری است که میطلبد هم نرخ مثبت واقعی و هم نرخ مثبت کاذب در بین گروهها یکسان باشد.
- برآورده کردن معیار «شانس برابر» اغلب نیازمند کاهش مصنوعی دقت کلی مدل است؛ به همین دلیل، بسیاری از توسعهدهندگان تجاری در عمل به همان معیار «فرصت برابر» بسنده میکنند.
در دسامبر ۲۰۱۶، در مرکز همایشهای بینالمللی بارسلونا و در جریان کنفرانس سیستمهای پردازش اطلاعات عصبی (NIPS)، پژوهشگرانی به نامهای موریتز هارت، اریک پرایس و ناتان سربرو مقالهای ۱۴ صفحهای ارائه کردند که نحوه سنجش سوگیری الگوریتمی در صنعت فناوری را برای همیشه تغییر داد. آنها یک چارچوب ریاضی دقیق را برای ارزیابی این موضوع معرفی کردند که آیا یک مدل یادگیری ماشین با گروههای مختلف جمعیتی منصفانه رفتار میکند یا خیر؛ آن هم بدون اینکه مدل مجبور باشد آن ویژگیهای جمعیتی را کاملاً نادیده بگیرد. این مقاله دو معیار متمایز را تدوین کرد که از آن زمان به پایه و اساس مطلق حسابرسی الگوریتمی در سراسر صنعت جهانی نرمافزار تبدیل شدهاند: «فرصت برابر» و «شانس برابر». پیش از این انتشار، توسعهدهندگان برای کمّیسازی مفهوم «انصاف» به شکلی که بتوان آن را در یک تابع هدف برنامهنویسی کرد، با مشکل مواجه بودند.[1]
وقتی یک فروشنده سازمانیِ هوش مصنوعی با آبوتاپ ادعا میکند که مدل جدید استخدامی، وامدهی یا تشخیص پزشکیاش «گواهی انصاف» دارد، تقریباً همیشه به یکی از این دو تعریف ریاضی خاص تکیه کرده است. اما تفاوت بین آنها صرفاً آکادمیک یا لغوی نیست. این تفاوت دقیقاً تعیین میکند که مدل مجاز است چه نوع خطاهایی را زیر فرش پنهان کند و مهمتر از آن، کدام گروه جمعیتی در نهایت باید تاوان این خطاهای پنهان را در دنیای واقعی بپردازد. درک این شکاف برای هر کسی که یادگیری ماشین را در محیطهای پرخطر پیادهسازی میکند، حیاتی است.[2][3]
برای درک تفاوت بین این دو استاندارد، ابتدا باید نگاهی بیندازیم به اینکه مدلهای یادگیری ماشین در عمل چگونه شکست میخورند. در یک سیستم طبقهبندی دودویی — مانند الگوریتمی که تصمیم میگیرد درخواست وام مسکن را تایید یا رد کند — مدل دو نوع اشتباه کاملاً متفاوت مرتکب میشود. میتواند وام را از کسی که با موفقیت آن را بازپرداخت میکرد دریغ کند (که به آن «منفی کاذب» میگویند)، یا میتواند به کسی وام بدهد که در نهایت نکول میکند (که به آن «مثبت کاذب» میگویند).[4]
معیار «فرصت برابر» منحصراً روی کلاس مثبتِ پیشبینیها تمرکز دارد. این معیار ایجاب میکند که «نرخ مثبت واقعی» از نظر ریاضی در تمام گروههای جمعیتیِ محافظتشده، فارغ از اندازهشان، کاملاً یکسان باشد. اگر یک مدل وامدهی ۱۰۰۰ متقاضی واقعاً واجد شرایط از گروه الف و ۱۰۰۰ متقاضی واقعاً واجد شرایط از گروه ب را ارزیابی کند، معیار فرصت برابر حکم میکند که الگوریتم باید دقیقاً درصد یکسانی از افراد هر دو گروه را تایید کند تا مطمئن شود هیچ گروهی بهطور ناعادلانه رد نمیشود.[1][5]
در عمل، این یعنی اگر مدل بهطور نامتناسبی اعضای واجد شرایط یک گروه اقلیت را رد کند، بهشدت جریمه میشود. برای یک الگوریتم استخدامی شرکتی، برآورده کردن محدودیت فرصت برابر تضمین میکند که نامزدهای «خوب» از هر پیشینهای، شانس آماری برابری برای انتخاب شدن دارند. این معیار برای بخشهای تطبیق قانونی شرکتها بسیار جذاب است، زیرا دستیابی به آن از نظر محاسباتی نسبتاً آسان است و کاملاً با تعریف شهودی و عامیانه از انصاف همخوانی دارد: پاداش دادن برابر به شایستگی واقعی.[5]
با این حال، معیار فرصت برابر دارای یک نقطه کور ریاضیِ عمدی و بسیار پرهزینه است. طبق مستندات رسمی Fairlearn: «فرصت برابر نسخه تقلیلیافتهای از شانس برابر است که تنها انتظارات مشروط را در رابطه با برچسبهای مثبت در نظر میگیرد.» این معیار کلاس منفی (وای=۰) را کاملاً نادیده میگیرد؛ به این معنی که «نرخ مثبت کاذب» را نمیسنجد، ردیابی نمیکند و اصلاً به آن اهمیتی نمیدهد. یک مدل میتواند از این آزمون انصاف با موفقیت کامل بیرون بیاید، در حالی که در سمت دیگرِ ماتریس درهمریختگی به طرز فاجعهباری شکست خورده است.[1][7]
با این حال، معیار فرصت برابر دارای یک نقطه کور ریاضیِ عمدی و بسیار پرهزینه است.
این دقیقاً همان جایی است که «شانس برابر» به عنوان جایگزینی سختگیرانهتر و جامعتر وارد میدان میشود. شانس برابر نسخه سختگیرانهتر و کاملاً تحققیافته از محدودیت انصاف است. این معیار میطلبد که یک مدل یادگیری ماشین بهطور همزمان به نرخ مثبت واقعی برابر و نرخ مثبت کاذب برابر در تمام گروههای جمعیتی محافظتشده دست یابد. با نظارت بر هر دو محور ماتریس درهمریختگی، این معیار هیچ فضایی برای نابرابریهای آماری پنهان در نحوه برخورد الگوریتم با سوژههای فاقد شرایط یا کلاس منفی باقی نمیگذارد.[4][7]
تحت استاندارد شانس برابر، یک مدل نمیتواند صرفاً درصد یکسانی از متقاضیان واجد شرایط را تایید کند؛ بلکه باید دقیقاً درصد یکسانی از متقاضیان فاقد شرایط را نیز در تمام گروهها بهاشتباه تایید کند. همانطور که MetricGate اشاره میکند: «شانس برابر میپذیرد که نرخهای پایه ممکن است بهطور مشروعی متفاوت باشند، اما تقاضا دارد که خطاهای مدل بهطور مساوی توزیع شوند.» این معیار توزیع خطای مدل را مجبور میکند تا کاملاً متقارن باشد و تضمین میکند که بار آماریِ طبقهبندیِ اشتباه، بهطور نامتناسبی روی دوش یک گروه جمعیتی خاص نیفتد.[4]
تفاوت عملی بین این دو معیار در پیادهسازیهای پرخطر، مانند ارزیابی ریسک در عدالت کیفری، کشف تقلب مالی یا پیشبینیهای بالینی سلامت، بهشدت آشکار میشود. اگر وظیفه یک الگوریتم پزشکی پیشبینی این باشد که کدام بیماران بیمارستان به مراقبتهای پیشگیرانه فوری نیاز دارند، یک مثبت کاذب به این معناست که یک بیمار سالم آزمایشهای غیرضروری و گرانی دریافت میکند، در حالی که یک منفی کاذب یعنی یک بیمار واقعاً بدحال بدون درمان به خانه فرستاده میشود. هزینه این خطاها با سلامت انسان سنجیده میشود، نه فقط با کارایی محاسباتی.[6]
اگر آن مدل پیشبینی پزشکی فقط برای «فرصت برابر» بهینهسازی شده باشد، تضمین میکند که بیماران واقعاً بدحال در گروه الف و گروه ب دقیقاً با نرخ یکسانی شناسایی شوند. اما از نظر قانونی به مدل اجازه میدهد تا نرخ مثبت کاذب ۴۰ درصدی برای گروه الف و نرخ مثبت کاذب تنها ۵ درصدی برای گروه ب تولید کند. در این حالت، گروه الف در معرض مداخلات پزشکی غیرضروری و بالقوه تهاجمیِ بسیار بیشتری قرار میگیرد، با این حال مدل همچنان تحت استاندارد فرصت برابر رسماً به عنوان مدلی «منصفانه» گواهی میگیرد.[3][6]
معیار «شانس برابر» با محدود کردن نابرابری در هر دو سرِ طیف پیشبینی، صراحتاً از این سناریو جلوگیری میکند. اما این سختگیری با هزینه عملیاتی سنگینی برای توسعهدهندگان سیستم همراه است. از آنجا که این معیار هر دو محور مثبت واقعی و مثبت کاذب را بهطور همزمان محدود میکند، برآورده کردن ریاضیِ شانس برابر بدون کاهش مصنوعیِ دقت پیشبینی کلی مدل در تمام سطوح، بهشدت دشوار است.[4]
وقتی نرخهای پایه — یعنی شیوع زمینهای یک شرایط یا پیامد خاص — بین دو گروه جمعیتی تفاوت چشمگیری داشته باشد، برآورده کردن شانس برابر اغلب ایجاب میکند که الگوریتم عمداً پیشبینیهای بدتری برای گروه اکثریت انجام دهد تا فقط نرخ خطاها را متوازن کند. همانطور که پژوهشگران حوزه انصاف اشاره میکنند، یک مدل میتواند در مجموع ۹۰ درصد دقت داشته باشد، اما همچنان انواع مختلفی از اشتباهات را بهطور سیستماتیک برای گروههای مختلف مرتکب شود. این بدهبستانِ اجتنابناپذیر در دقت، دقیقاً همان دلیلی است که بسیاری از توسعهدهندگان تجاری هوش مصنوعی در سیستمهای عملیاتی خود بیسروصدا به همان معیار «فرصت برابر» پناه میبرند.[2][7]
انتخاب بین این دو معیار در نهایت کاملاً به هزینه واقعیِ یک مثبت کاذب در یک حوزه خاص بستگی دارد. در فیلتر اسپم مصرفکننده، یک مثبت کاذب صرفاً آزاردهنده است و همین باعث میشود معیار فرصت برابر کاملاً کافی باشد. اما در یک سیستم تشخیص چهره که توسط مجریان قانون استفاده میشود، یک مثبت کاذب مستقیماً به دستگیری اشتباه منجر میشود. در آن محیطهای پرخطر، پذیرش هر چیزی کمتر از «شانس برابر»، یک انتخاب آگاهانه است تا اجازه دهیم یک گروه جمعیتی خاص، بدترین اشتباهات سیستم را به دوش بکشد.[4]
- Y = 1
- محدودیت فرصت برابر (فقط برچسبهای مثبت)
- Y = 0
- محدودیت مضاعف شانس برابر (برچسبهای منفی)
- 90%
- دقت کلی که همچنان میتواند نابرابریهای شدید در مثبت کاذب را پنهان کند
بررسی عمیق دیدگاهها
فرصت برابر (برابری نرخ مثبت واقعی)
استانداردی تقلیلیافته که تضمین میکند افراد واجد شرایط از تمام گروهها با نرخی یکسان انتخاب شوند.
فرصت برابر از نظر ریاضی با این محدودیت تعریف میشود که نرخ مثبت واقعی باید در بین ویژگیهای محافظتشده یکسان باشد. اگر وظیفه یک مدل یافتن نامزدهای واجد شرایط باشد، این معیار تضمین میکند که یک نامزد واجد شرایط از یک گروه اقلیت، دقیقاً همان احتمال انتخاب شدن را دارد که یک نامزد واجد شرایط از گروه اکثریت. از آنجا که این معیار نرخ مثبت کاذب را نادیده میگیرد، از نظر محاسباتی سبکتر است و بهندرت توسعهدهندگان را مجبور میکند عملکرد مدل را روی گروه اکثریت بهطور مصنوعی کاهش دهند. این معیار برای محیطهای کمخطر که در آنها خطاهای مثبت کاذب جریمه چندانی ندارند، ترجیح داده میشود.
شانس برابر (برابری نرخ مثبت واقعی و مثبت کاذب)
استانداردی سختگیرانه که تضمین میکند هم مزایا و هم تاوان پیشبینیهای یک مدل بهطور مساوی توزیع شوند.
شانس برابر با محدود کردن همزمان نرخ مثبت واقعی و نرخ مثبت کاذب، یک توزیع خطای متقارن را اعمال میکند. این معیار میپذیرد که در سیستمهای پرخطر — مانند ارزیابی ریسک عدالت کیفری یا تشخیصهای پزشکی — یک مثبت کاذب میتواند به اندازه یک منفی کاذب مخرب باشد. با الزام به اینکه مدل باید روی افراد فاقد شرایط در تمام گروهها با نرخ یکسانی اشتباه کند، از اینکه سیستم عدم قطعیت آماری خود را روی دوش یک گروه جمعیتی خاص بیندازد، جلوگیری میکند. با این حال، برآورده کردن این معیار اغلب توسعهدهندگان را مجبور میکند دقت کلی مدل را کاهش دهند، که این امر تنشی بین انصاف مطلق و قدرت پیشبینی ایجاد میکند.
آنچه نمیدانیم
- اینکه مقررات پیشروی هوش مصنوعی در اتحادیه اروپا و ایالات متحده، دقیقاً کدام معیار انصاف را برای پیادهسازیهای پرخطر به لحاظ قانونی الزامی و استاندارد خواهند کرد.
- آیا چارچوبهای ریاضی جدید میتوانند مشکل افت دقت را که ذاتاً با اجرای معیار «شانس برابر» در هویتهای متقاطع چندگانه گره خورده است، حل کنند یا خیر.
منابع
[1]NIPSپژوهشگران انصاف هوش مصنوعیEquality of Opportunity in Supervised Learning
مطالعه در NIPS →
[2]Google for Developersتوسعهدهندگان تجاری هوش مصنوعیMachine Learning Glossary: Metrics
مطالعه در Google for Developers →
[3]PMCاخلاقگرایان بالینیWhat Is Fair? Defining Fairness in Machine Learning for Health
مطالعه در PMC →
[4]MetricGateپژوهشگران انصاف هوش مصنوعیFairness Metrics: Parity vs Equal Odds
مطالعه در MetricGate →
[5]Google for Developersتوسعهدهندگان تجاری هوش مصنوعیFairness: Equality of opportunity
مطالعه در Google for Developers →
[6]PMCاخلاقگرایان بالینیReporting of Fairness Metrics in Clinical Risk Prediction Models Used for Precision Health: Scoping Review
مطالعه در PMC →
[7]Fairlearnپژوهشگران انصاف هوش مصنوعیFairness in Machine Learning
مطالعه در Fairlearn →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در فناوری
مشاهده همه →Space Architecture
منظومههای ماهوارهای چگونه کار میکنند و چرا برای فناوری فضایی حیاتی هستند؟
3 منبع
پایداری فضا
زبالههای فضایی: تهدیدی فزاینده برای آینده اکتشافات فضایی و راههای مقابله با آن
5 منبع
آیرودینامیک
چرا مجذور سرعت، تعیینکننده تمام بدهبستانها در پرواز آیرودینامیک است؟
7 منبع
فناوری نمایشگر
حل گلوگاه انتقال انبوه MicroLED توسط شرکت نوپای دانشگاهی، نوید نمایشگرهای ارزانتر و روشنتر برای گجتها
4 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





