چگونه مقادیر SHAP پیشبینی یک مدل جعبهسیاه را به سهم هر ویژگی تجزیه میکنند
مقادیر SHAP با بهکارگیری نظریه بازیهای همکارانه سال ۱۹۵۳ در یادگیری ماشین نوین، بهدقت مشخص میکنند که هر متغیر تا چه حد یک پیشبینی خاص را از میانگین پایه منحرف میکند. این روش، الگوریتمهای مبهم را وادار میکند تا برای هر تصمیمی که میگیرند، یک گزارش ریاضیاتی سازگار در سطح ویژگیها ارائه دهند.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- مدافعان شفافیت الگوریتمی
- تمرکز آنها بر حق برخورداری از توضیح و انطباق با مقررات است و SHAP را بهعنوان ردپای حسابرسی ضروری برای تصمیمات خودکار میبینند.
- شکاکان استنتاج علی
- نسبت به خلط اهمیت ویژگی در SHAP با علیت در دنیای واقعی هشدار میدهند و تاکید میکنند که SHAP مدل را توضیح میدهد، نه جهان را.
- دانشمندان داده کاربردی
- برای SHAP عمدتاً بهعنوان یک ابزار تشخیصی جهت اشکالزدایی مدل، انتخاب ویژگی و اعتمادسازی با ذینفعان تجاری ارزش قائل هستند.
دیدگاههایی که این گزارش پوشش نداده
- حقوقدانانی که مرزهای دقیق یک توضیح قانونی کافی را تحت قانون هوش مصنوعی اتحادیه اروپا تعریف میکنند.
- کاربران نهایی که تحت تاثیر تصمیمات خودکار قرار میگیرند و به ترجمه خروجیهای SHAP به زبان ساده نیاز دارند.
نکات کلیدی
- روش SHAP از نظریه بازیهای همکارانه سال ۱۹۵۳ برای توضیح پیشبینیهای یادگیری ماشین نوین استفاده میکند.
- این روش خروجی یک مدل را به سهمهای دقیق و جمعپذیر ویژگیها تجزیه میکند.
- محاسبه دقیق SHAP نیازمند زمان نمایی است که استفاده از آن را در دادههای با ابعاد بالا محدود میکند.
- الگوریتم TreeSHAP این پیچیدگی را برای مدلهای گروهی به زمان چندجملهای کاهش میدهد.
- روش SHAP منطق داخلی مدل را توضیح میدهد، نه روابط علی در دنیای واقعی را.
وقتی یک مهندس یادگیری ماشین مدل گرادیان بوستینگ (gradient boosting) را برای تایید یا رد یک وام مستقر میکند، با یک ضربالاجل نظارتی سختگیرانه روبهرو میشود: لحظهای که مدل درخواست را رد میکند، مهندس باید فوراً توضیح دهد که دقیقاً کدام متغیرها باعث این تصمیم شدهاند. سالهاست که مدلهای پیچیده گروهی (ensemble) و شبکههای عصبی عمیق مانند جعبههای سیاه عمل میکنند و پیشبینیهایی با دقت بالا ارائه میدهند، بدون اینکه هیچگونه گزارش داخلی از نحوه وزندهی به دادههای ورودی ارائه کنند. این ابهام، تیمهای علم داده را در یک دوراهی همیشگی میان دقت مدل و قابلیت تفسیر آن گرفتار کرده بود. معرفی SHAP در سال ۲۰۱۷ یک راهحل ریاضیاتی برای این تنگنا ارائه داد و به ارزیابان ابزاری استاندارد داد تا خروجی هر مدلی را به سهم دقیق هر ویژگی تجزیه کنند.[1][7]
پایه و اساس SHAP بر نظریه بازیهای همکارانه، بهویژه مقدار شاپلی (Shapley value) که توسط ریاضیدان لوید شاپلی در سال ۱۹۵۳ معرفی شد، استوار است. شاپلی بهدنبال روشی از نظر ریاضیاتی عادلانه برای توزیع کل پاداش در میان ائتلافی از بازیکنان بود که سهم نابرابری در یک بازی داشتند. در زمینه یادگیری ماشین، «بازی» همان وظیفه پیشبینی برای یک نمونه واحد است، «پاداش» تفاوت میان پیشبینی واقعی و میانگین پیشبینیها در کل مجموعه داده است، و «بازیکنان» مقادیر تکتک ویژگیها هستند.[1][2]
اسکات لوندبرگ و سو-این لی مقاله بنیادین SHAP را در کنفرانس NeurIPS سال ۲۰۱۷ منتشر کردند. آنها نشان دادند که SHAP بهطور منحصربهفردی سه ویژگی مهم ریاضیاتی را برآورده میکند: دقت محلی، فقدان و سازگاری. لوندبرگ و لی نوشتند: «ما SHAP را بهعنوان یک رویکرد یکپارچه برای توضیح خروجی هر مدل یادگیری ماشین پیشنهاد میکنیم.» آنها خاطرنشان کردند که چارچوبشان با موفقیت ۶ روش تفسیری پیشین، از جمله LIME و DeepLIFT را یکپارچه کرده است.[1]
دقت محلی تضمین میکند که مجموع سهم ویژگیها دقیقاً برابر با تفاوت میان خروجی مدل برای آن پیشبینی خاص و مقدار موردانتظار پایه است. اگر مدلی قیمت یک خانه را ۳۰۰,۰۰۰ دلار پیشبینی کند در حالی که میانگین پایه ۲۵۰,۰۰۰ دلار است، مجموع مقادیر SHAP برای آن خانه خاص دقیقاً برابر با ۵۰,۰۰۰+ دلار خواهد بود. این ویژگی جمعپذیری اطمینان میدهد که هیچ بخشی از پیشبینی بدون توضیح باقی نمیماند و گزارش کاملی از منطق الگوریتم برای آن ردیف خاص از دادهها ارائه میدهد.[1][2]
سازگاری، دومین ویژگی اصلی، حکم میکند که اگر مدلی تغییر کند بهطوری که یک ویژگی خاص تاثیر بیشتری بر پیشبینی نهایی داشته باشد، مقدار SHAP آن ویژگی کاهش نخواهد یافت. کریستوف مولنار، نویسنده کتاب «یادگیری ماشین قابلتفسیر»، بر اهمیت این تضمین تاکید میکند: «مقدار شاپلی، میانگین سهم حاشیهای یک مقدارِ ویژگی در میان تمام ائتلافهای ممکن است.» بدون وجود سازگاری، یک مدلساز نمیتواند اعتماد کند که آیا امتیاز اهمیت یک ویژگی واقعاً وزن واقعی آن را در الگوریتم منعکس میکند یا خیر.[2]
محدودیت اصلی محاسبه دقیق SHAP، هزینه محاسباتی آن است. از آنجا که الگوریتم باید سهم حاشیهای یک ویژگی را در میان تمام ترکیبهای ممکن از سایر ویژگیها ارزیابی کند، پیچیدگی زمانی بهصورت نمایی با مرتبه (O(2^F مقیاس مییابد که در آن F نشاندهنده تعداد ویژگیهاست. برای یک مجموعه داده با تنها ۲۰ ویژگی، الگوریتم باید ۱,۰۴۸,۵۷۶ ائتلاف متمایز را برای یک پیشبینی واحد ارزیابی کند، که این امر رویکرد دقیق ریاضیاتی را برای مجموعه دادههای مدرن و با ابعاد بالا غیرممکن میسازد.[2][4]
برای عبور از این تنگنای نمایی، پژوهشگران تقریبهای خاصِ مدل را توسعه دادند. پرکاربردترین آنها TreeSHAP است؛ الگوریتمی که بهطور خاص برای مدلهای گروهی مبتنی بر درخت مانند XGBoost و Random Forests بهینهسازی شده است. TreeSHAP پیچیدگی محاسباتی را از زمان نمایی به زمان چندجملهای کاهش میدهد و با مرتبه (O(TLD^2 مقیاس مییابد که در آن T تعداد درختها، L حداکثر تعداد برگها و D حداکثر عمق درخت است.[2][4]
برای عبور از این تنگنای نمایی، پژوهشگران تقریبهای خاصِ مدل را توسعه دادند.
این بهینهسازی به دانشمندان داده اجازه میدهد تا مقادیر SHAP را برای میلیونها ردیف در عرض چند ثانیه (بهجای چند سال) محاسبه کنند. دن بکر، در یک آموزش Kaggle در سال ۲۰۲۳، اشاره میکند که مقادیر SHAP تاثیر داشتن یک مقدار معین برای یک ویژگی مشخص را در مقایسه با پیشبینیای که در صورت داشتن یک مقدار پایه برای آن ویژگی انجام میدادیم، محاسبه میکنند. این مقدار پایه معمولاً میانگین مجموعه دادههای آموزشی است و بهعنوان نقطه لنگری عمل میکند که تمام انحرافات تکتک ویژگیها نسبت به آن سنجیده میشوند.[5]
این روششناسی بهطور فزایندهای فراتر از دادههای جدولی استاندارد به کار میرود. یک مطالعه در سال ۲۰۲۴ که در مجله Agronomy منتشر شد، از مقادیر SHAP برای تفسیر مدلهای یادگیری ماشین در پیشبینی محتوای پروتئین خام در مراتع علف تامانی استفاده کرد. با نگاشت مقادیر SHAP، پژوهشگران توانستند دقیقاً مشخص کنند که کدام متغیرهای محیطی و طیفی باعث پیشبینیهای پروتئین شدهاند و بدین ترتیب یک مدل کشاورزی مبهم را به یک ابزار تشخیصی شفاف تبدیل کردند که متخصصان کشاورزی میتوانند از آن برای تنظیم مدیریت مزرعه استفاده کنند.[3]
با وجود دقت ریاضیاتی، SHAP محدودیتهای خاصی در زمینه استنتاج علی دارد. بالا بودن مقدار SHAP نشان میدهد که یک ویژگی تاثیر شدیدی بر پیشبینی مدل داشته است، اما ثابت نمیکند که آن ویژگی در دنیای واقعی علت بروز آن نتیجه است. اگر یک مدل بر یک متغیر جایگزین تکیه کند - مانند استفاده از کد پستی برای استنتاج درآمد - مقدار SHAP بهدرستی تصمیم مدل را به کد پستی نسبت میدهد، حتی اگر خود کد پستی علت رفتار مالی زمینهای نباشد.[2][6]
علاوه بر این، مقادیر SHAP نسبت به ویژگیهای همبسته بسیار حساس هستند. وقتی دو متغیر همبستگی شدیدی دارند، مدل ممکن است بهطور دلخواه اهمیت را میان آنها تقسیم کند، یا تمام وزن را به یکی اختصاص دهد و به دیگری هیچ وزنی ندهد. الگوریتم SHAP صادقانه گزارش خواهد داد که مدل چگونه این وزن را توزیع کرده است، که این امر میتواند ارزیاب را به اشتباه بیندازد و او تصور کند یک ویژگی کاملاً نامربوط است، در حالی که آن ویژگی صرفاً واریانس مشترکی با ویژگی دیگری دارد.[2][6]
تفسیر مقدار پایه نیز عدم قطعیتهایی را به همراه دارد. از آنجا که مقادیر SHAP نشاندهنده انحراف از مقدار موردانتظار مجموعه دادههای پسزمینه هستند، تغییر مجموعه دادههای پسزمینه اساساً مقادیر SHAP بهدستآمده را تغییر میدهد. ارزیابان باید با دقت یک نمونه پسزمینه معرف را انتخاب کنند، زیرا استفاده از یک پایه اریب منجر به توضیحاتی میشود که قابلتعمیم به جمعیت گستردهتر نیستند.[4][5]
در شرایطی که چارچوبهای نظارتی مانند قانون هوش مصنوعی اتحادیه اروپا بهطور فزایندهای شفافیت الگوریتمی را الزامی میکنند، اتکا به SHAP بهعنوان یک سازوکار انطباق در حال شتاب گرفتن است. توانایی تولید توضیحات در سطح نمونه، «حق برخورداری از توضیح» را برای تصمیمات خودکار برآورده میکند و یک ردپای حسابرسی از نظر ریاضیاتی معتبر برای مدلهایی فراهم میکند که در غیر این صورت استقرار آنها در بخشهایی مانند مالی، مراقبتهای بهداشتی و عدالت کیفری از نظر قانونی غیرممکن بود.[6][7]
مرز بعدی برای SHAP شامل مقیاسپذیری این روششناسی برای هوش مصنوعی مولد و مدلهای زبانی بزرگ است. در حالی که چارچوب سال ۲۰۱۷ با موفقیت قابلیت تفسیر دادههای جدولی و تصویری را یکپارچه کرد، بهکارگیری نظریه بازیهای همکارانه برای میلیاردها پارامتر نیازمند تکنیکهای تقریب جدیدی است. تا زمانی که این روشها به بلوغ برسند، SHAP بهعنوان استاندارد قطعی برای تجزیه پیشبینیهای دادههای ساختاریافته باقی میماند و جعبههای سیاه را وادار میکند تا عملکرد دقیق ریاضیاتی خود را نشان دهند.[1][7]
چرا مهم است
در شرایطی که نهادهای نظارتی بهطور فزایندهای خواستار شفافیت سیستمهای خودکار هستند، SHAP ردپای حسابرسی ریاضیاتی لازم برای استقرار الگوریتمهای پیچیده در حوزههای حساسی مانند مالی و مراقبتهای بهداشتی را فراهم میکند. این روش، شکاف میان مدلهای جعبهسیاه با دقت بالا و نیاز انسان به تصمیمات قابلتوضیح را پر میکند.
بررسی عمیق دیدگاهها
دانشمندان داده کاربردی
تمرکز بر استفاده از SHAP برای اشکالزدایی مدلها و اعتمادسازی با ذینفعان.
برای متخصصانی که مدلها را در محیط عملیاتی مستقر میکنند، SHAP عمدتاً بهعنوان یک ابزار تشخیصی و ارتباطی عمل میکند. با جداسازی دقیق میزان سهم یک ویژگی خاص در یک پیشبینی واحد، دانشمندان داده میتوانند نشت دادهها را شناسایی کنند، تصمیمگیریهای جانبدارانه را تشخیص دهند و انتخابهای الگوریتمی پیچیده را برای ذینفعان غیرفنی توضیح دهند. توسعه TreeSHAP بهویژه برای این گروه تحولآفرین بود، زیرا به آنها اجازه داد تا توضیحات دقیق مبتنی بر نظریه بازیها را در مدلهای گرادیان بوستینگ (مانند XGBoost و LightGBM) که در وظایف دادههای جدولی غالب هستند، به کار ببرند.
شکاکان استنتاج علی
هشدار نسبت به خلط اهمیت ویژگی در SHAP با علیت در دنیای واقعی.
آمارشناسان و پژوهشگران استنتاج علی غالباً هشدار میدهند که SHAP مدل را توضیح میدهد، نه واقعیت زیربنایی را. اگر یک مدل یادگیری ماشین برای انجام پیشبینی بر یک همبستگی کاذب یا یک متغیر جایگزین تکیه کند، مقادیر SHAP صادقانه همان اتکا را گزارش میدهند. این وفاداری به مدل میتواند ناخواسته رهبران کسبوکار را به اشتباه بیندازد تا بر اساس اهمیت مشاهدهشده ویژگیها، مداخلات علی انجام دهند. شکاکان تاکید میکنند که اگرچه SHAP یک گزارش کامل از منطق داخلی الگوریتم است، اما نمیتواند جایگزین کارآزماییهای تصادفی کنترلشده یا مدلهای علی ساختاری در هنگام تعیین خطمشی شود.
منابع
[1]NeurIPSمدافعان شفافیت الگوریتمیA Unified Approach to Interpreting Model Predictions
مطالعه در NeurIPS →
[2]Interpretable Machine Learningشکاکان استنتاج علی18 SHAP – Interpretable Machine Learning
مطالعه در Interpretable Machine Learning →
[3]MDPIدانشمندان داده کاربردیInterpreting Machine Learning Models with SHAP Values: Application to Crude Protein Prediction in Tamani Grass Pastures
مطالعه در MDPI →
[4]SHAP documentationدانشمندان داده کاربردیWelcome to the SHAP documentation — SHAP latest documentation
مطالعه در SHAP documentation →
[5]Kaggleدانشمندان داده کاربردیSHAP (SHapley Additive exPlanations)
مطالعه در Kaggle →
[6]GeeksforGeeksدانشمندان داده کاربردیLeveraging SHAP Values for Model Insights and Enhanced Performance
مطالعه در GeeksforGeeks →
[7]تیم سردبیری کوهستانمدافعان شفافیت الگوریتمیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در تحلیل داده
مشاهده همه →هوش مصنوعی در زلزلهشناسی
دقت یادگیری عمیق در برابر مدل ETAS در پیشبینی پسلرزهها
6 منبع
روششناسی نظرسنجی
چگونه برازش متناسب تکرارشونده، نمونههای نظرسنجی را با آمارهای جمعیتی همسو میکند
5 منبع
مدلسازی آماری
چگونه تابع پیوند، پیشبین خطی را به برآمد مورد انتظار در مدلهای خطی تعمیمیافته متصل میکند
8 منبع
تحلیل دادههای بصری
چگونه ۱۰۰ میلیون نقاشی کودکان، دو دهه از روندهای فرهنگی را آشکار میکند
4 منبع
هر زاویه. هر روز.
دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





