نویز حریم خصوصی تفاضلی، دقت هوش مصنوعی را برای اقلیتها به شکلی نامتناسب کاهش میدهد
نویز ریاضیاتی که برای ایمنسازی مدلهای یادگیری ماشین تزریق میشود، به طور سیستماتیک دقت را برای جمعیتهای کمترنماینده کاهش میدهد و ما را مجبور به یک انتخاب مستقیم میان حریم خصوصی دادهها و انصاف الگوریتمی میکند.
به قلم رسول توکلی
این خبر را به اشتراک بگذارید
- پژوهشگران انصاف الگوریتمی
- استدلال میکنند که مکانیسمهای حریم خصوصی نباید به طور نامتناسب زیرگروههای اقلیت را مجازات کنند و بر اندازهگیری و کاهش تأثیرات نابرابر تمرکز دارند.
- متخصصان بالینی و هوش مصنوعی
- بر بدهبستانهای عملی در استقرارهای دنیای واقعی تمرکز دارند و الزامات حریم خصوصی بیمار را در برابر دقت تشخیصی متوازن میکنند.
- تحلیلگران سیستمها و سیاستگذاری
- پیامدهای ساختاری و نظارتیِ بدهبستان میان حریم خصوصی و انصاف را برای نهادها و اعتماد عمومی بررسی میکنند.
دیدگاههایی که این گزارش پوشش نداده
- جوامع حاشیهنشینی که از دادههایشان محافظت میشود اما دقت مدل برای آنها کاهش مییابد.
- قانونگذارانی که بدون در نظر گرفتن بدهبستانهای مربوط به انصاف، در حال تدوین قوانین حریم خصوصی هستند.
بررسی عمیق دیدگاهها
دیدگاه پژوهشگران انصاف
تضمینهای حریم خصوصی در صورتی که به طور سیستماتیک عملکرد را برای گروههای حاشیهنشین کاهش دهند، غیرقابلقبول هستند.
پژوهشگرانی که بر برابری الگوریتمی تمرکز دارند، استدلال میکنند که حریم خصوصی تفاضلی به عنوان یک تقویتکننده برای سوگیریهای موجود عمل میکند. از آنجا که نقاط داده اقلیت از پیش کمیاب هستند، مدل برای یادگیری ویژگیهای آنها به گرادیانهای متمایزشان متکی است. وقتی DP-SGD این گرادیانها را برش میدهد و نویز یکنواخت اضافه میکند، در عمل سیگنال اقلیت را پاک کرده و سیگنال اضافی اکثریت را دستنخورده باقی میگذارد. این گروه اصرار دارند که اگر پیادهسازی ریاضیاتی حریم خصوصی فعالانه به جمعیتهایی که در برابر تبعیض الگوریتمی آسیبپذیرترند صدمه بزند، نمیتوان آن را به عنوان یک فضیلت مطلق در نظر گرفت.
دیدگاه مدافعان حریم خصوصی
تضمینهای ریاضیاتی حریم خصوصی برای جلوگیری از استخراج دادههای شخصی حساس، غیرقابلمذاکره هستند.
مهندسان حریم خصوصی تأکید میکنند که بدون مکانیسمهایی مانند حریم خصوصی تفاضلی، مدلهای یادگیری ماشین اساساً موتورهای حفظکردنی هستند که میتوان با مهندسی معکوس، دادههای آموزشی آنها را فاش کرد. آنها استدلال میکنند که افت دقت برای گروههای اقلیت، هرچند تأسفبار است، اما یک واقعیت ریاضیاتی ناشی از حجم نمونههای کوچک است، نه نقصی در خود چارچوب حریم خصوصی. از این منظر، راهحل این نیست که بودجه حریم خصوصی را تضعیف کنیم کاری که دادههای اقلیت را در معرض استخراج مخرب قرار میدهد بلکه باید دادههای معرفتری جمعآوری کنیم یا پیش از آموزش از تقویت مصنوعی دادهها بهره ببریم.
دیدگاه متخصصان بالینی
این بدهبستان باید به صورت پویا و بر اساس خطرات خاص هر استقرار مدیریت شود.
در زمینههایی مانند تصویربرداری پزشکی، متخصصان تنش میان حریم خصوصی و انصاف را به عنوان یک مشکل مدیریت ریسک میبینند. آنها اذعان دارند که حریم خصوصی تفاضلیِ سختگیرانه (اپسیلون پایین) دقت تشخیصی را برای شرایط نادر از بین میبرد، که از نظر بالینی غیرقابلقبول است. با این حال، آنها با الزامات نظارتی سختگیرانهای برای محافظت از دادههای بیماران نیز روبرو هستند. این گروه از بودجههای حریم خصوصی متوسط (اپسیلون بالاتر) حمایت میکنند که سطح پایهای از امنیت را بدون به خطر انداختن کارایی مدل فراهم میکند و میپذیرند که حریم خصوصی ریاضیاتی کامل با ارائه مراقبتهای بهداشتی قابلاعتماد ناسازگار است.
چرا مهم است
در حالی که دولتها و شرکتها برای رعایت قوانین حفاظت از دادهها به سوی اجرای حریم خصوصی تفاضلی میشتابند، ناخواسته سیستمهای هوش مصنوعی خود را برای گروههای حاشیهنشین کمدقتتر میکنند. درک این بدهبستان ریاضیاتی برای سیاستگذاران و مهندسانی که در تلاش برای استقرار سیستمهای امن و در عین حال عادلانه هستند، امری حیاتی است.
مهندسان حریم خصوصی استدلال میکنند که بدون تضمینهای ریاضیاتی مانند حریم خصوصی تفاضلی (Differential Privacy)، مدلهای یادگیری ماشین ناگزیر دادههای حساس پزشکی، مالی و شخصی افرادی را که برای آموزش آنها استفاده شدهاند، فاش خواهند کرد. در مقابل، پژوهشگران حوزه انصاف الگوریتمی پاسخ میدهند که تزریق نویز آماریِ لازم برای ایمنسازی این دادهها، به طور سیستماتیک دقت مدل را برای زیرگروههای اقلیت کاهش میدهد و در عمل همان جمعیتهایی را مجازات میکند که تلاشهای انصاف الگوریتمی قصد محافظت از آنها را دارند. این دو اولویت اکنون در پیادهسازیهای واقعی، از سرشماری ۲۰۲۰ ایالات متحده گرفته تا الگوریتمهای تشخیصی بیمارستانها، با یکدیگر در تضاد قرار گرفتهاند و نهادها را مجبور میکنند تا انتخاب کنند کدام آسیب را بیشتر میپذیرند.[1][3][6]
حریم خصوصی تفاضلی که برای نخستین بار در سال ۲۰۰۶ مطرح شد، اکنون به استاندارد طلایی حفاظت از دادهها در صنعت فناوری تبدیل شده است. این چارچوب با تزریق نویز آماریِ کالیبرهشده به یک مجموعه داده یا فرآیند آموزش مدل عمل میکند و تضمین میدهد که خروجی نهایی، صرفنظر از اینکه دادههای یک فرد خاص در آن گنجانده شده یا حذف شده باشد، تغییر معناداری نخواهد کرد. شرکتهای بزرگ فناوری و نهادهای دولتی برای انتشار آمار یا استقرار مدلها بدون افشای سوابق شخصی در برابر حملات شناسایی هویت، به این تضمین ریاضیاتی تکیه میکنند.[5]
در یادگیری عمیق، این محافظت معمولاً از طریق الگوریتمی به نام کاهش گرادیان تصادفی با حریم خصوصی تفاضلی یا DP-SGD پیادهسازی میشود. در طول آموزش، DP-SGD دو عملیات حیاتی انجام میدهد: ابتدا گرادیانها را برش میدهد (یعنی محدود میکند که هر نقطه داده منفرد تا چه حد میتواند پارامترهای مدل را بهروزرسانی کند) و سپس به آن بهروزرسانیها نویز تصادفی اضافه میکند. این کار مانع از آن میشود که شبکه عصبی نمونههای خاص، مانند یک چهره منحصربهفرد یا یک بیماری نادر را حفظ کند و در نتیجه دادههای آموزشی را در برابر حملات استخراج داده ایمن میسازد.[1][5]
با این حال، مکانیسمهای برش و افزودن نویز بر همه دادهها تأثیر یکسانی ندارند. از آنجا که زیرگروههای اقلیت و نمونههای غیرمعمول به طور طبیعی در طول آموزش گرادیانهای بزرگتری تولید میکنند (زیرا مدل برای یادگیری ویژگیهای آنها بیشتر تقلا میکند)، برش گرادیان به شکلی نامتناسب تأثیر آنها را سرکوب میکند. در ادامه، نویز یکنواختی که به مدل اضافه میشود، سیگنالهای از پیش تضعیفشده این جمعیتهای کوچکتر را کاملاً در خود غرق میکند. نتیجه ریاضیاتی این است که مدل ویژگیهای اکثریت را به اندازهای خوب یاد میگیرد که بر نویز غلبه کند، اما در ثبت الگوهای لازم برای طبقهبندی دقیق اقلیتها ناکام میماند.[1][2]
یوجین باگداساریان و همکارانش در دانشگاه کرنل برای نخستین بار در سال ۲۰۱۹ این تأثیر نابرابر را نشان دادند. تحقیقات آنها ثابت کرد که وقتی حریم خصوصی تفاضلی روی یک مدل تشخیص جنسیت اعمال میشود، افت دقت برای چهرههای دارای پوست تیرهتر بسیار بیشتر از چهرههای دارای پوست روشنتر است. این پژوهشگران دریافتند که اگر یک مدل استاندارد از پیش دارای سطح پایهای از سوگیری باشد، اعمال حریم خصوصی تفاضلی آن بیانصافی را تشدید میکند و سناریویی میسازد که در آن گروههایی که کمترین نمایندگی را دارند، سنگینترین هزینه تضمین حریم خصوصی را میپردازند.[1]
این بدهبستان زمانی که در حوزه مراقبتهای بهداشتی اعمال میشود، به یک مسئله ایمنی حیاتی بدل میگردد. مطالعهای در سال ۲۰۲۴ که در مخزن مؤسسه ملی بهداشت (NIH) منتشر شد، اثرات آموزشِ حافظ حریم خصوصی را بر مدلهای مقیاسبزرگ هوش مصنوعی مورد استفاده در تصویربرداری پزشکی ارزیابی کرد. پژوهشگران به سرپرستی زیلر و طیبی آراسته خاطرنشان کردند که حساسیت بالای دادههای پزشکی، محافظت از حریم خصوصی را الزامی میکند، اما افت دقت ناشی از آن در یک محیط بالینی خطرناک است. نویسندگان نوشتند: استفاده از حریم خصوصی تفاضلی همچنین دو بدهبستان بنیادین ایجاد میکند. اولی بدهبستان حریم خصوصی-کارایی است، یعنی کاهش دقت تشخیصی زمانی که تضمینهای قویتر حریم خصوصی مورد نیاز است. بدهبستان دیگر میان حریم خصوصی و انصاف است.[3]
این بدهبستان زمانی که در حوزه مراقبتهای بهداشتی اعمال میشود، به یک مسئله ایمنی حیاتی بدل میگردد.
شدت این افت دقت توسط پارامتر بودجه حریم خصوصی که با نام اپسیلون شناخته میشود، کنترل میگردد. مقدار اپسیلون پایینتر، حریم خصوصی قویتری فراهم میکند اما نیازمند نویز بیشتری است، در حالی که اپسیلون بالاتر اجازه نویز کمتری را میدهد اما تضمین حریم خصوصی را تضعیف میکند. مطالعه تصویربرداری پزشکی نشان داد که در یک بودجه حریم خصوصی متوسط با اپسیلون ۸.۰، عملکرد مدل خصوصی روی یک مجموعه داده تشخیصی از نظر آماری ضعیفتر از خط پایه غیرخصوصی نبود. با این حال، هرچه مقدار اپسیلون برای ارائه تضمینهای سختگیرانهتر کاهش مییابد، مدل در تشخیص دقیق موارد پیچیده و زیرگروههای خاص بیماران با چالشهای فزایندهای روبرو میشود.[3]
یک مرور دامنهای که در اوایل سال ۲۰۲۶ توسط محمدی و همکارانش منتشر شد، ۷۴ مطالعه درباره حریم خصوصی تفاضلی در یادگیری عمیق پزشکی را بررسی کرد. این مرور نشان داد که اگرچه DP-SGD عملکرد قابلقبول بالینی را در اپسیلون حدود ۱۰ حفظ میکند، اما افت دقت در اپسیلون ۱، بهویژه در مجموعه دادههای کوچکتر یا ناهمگن، بسیار چشمگیر میشود. علاوه بر این، این بررسی خاطرنشان کرد که تنها اقلیتی از این ۷۴ مطالعه اصلاً به ارزیابی انصاف پرداخته بودند و همانهایی هم که این کار را کرده بودند، غالباً گزارش دادند که حریم خصوصی تفاضلی شکافهای عملکردی میان زیرگروهها را گسترش داده است.[6]
مؤسسه ملی استاندارد و فناوری (NIST) نیز این تأثیر نابرابر را در ارزیابیهای خود بازتولید کرده است. بر اساس گزارش سپتامبر ۲۰۲۶ نشریه صنعتی Securing.ai، مؤسسه NIST دقت طبقهبند را روی دادههای سرشماری ایالات متحده در مقادیر مختلف اپسیلون رسم کرد. ارقام این آژانس نشان داد که نویز مورد نیاز برای حریم خصوصی تفاضلی، دقت گروههای نژادی اقلیت را بسیار بیشتر از نژاد اکثریت کاهش میدهد. این گزارش تأکید کرد که بودجه حریم خصوصی که در آن یک مدل بالینی هنوز به طور مؤثر کار میکند، غالباً همان بودجهای است که NIST آسیبپذیری آن را در برابر نشت دادهها نشان داده است.[6]
دانشمندان علوم کامپیوتر نظری شروع به ترسیم مرزهای این مشکل کردهاند و ثابت نمودهاند که این صرفاً یک نقص در پیادهسازی نیست، بلکه یک محدودیت بنیادین ریاضیاتی است. تحقیقات ارائهشده در کنفرانس مشترک بینالمللی هوش مصنوعی نشان داد که وقتی یک مجموعه داده دارای توزیع دنبالهدار است به این معنی که شامل زیرگروههای کوچک و متمایز بسیاری است ساخت یک الگوریتم یادگیری که به طور همزمان بسیار دقیق، کاملاً خصوصی و برای جمعیتهای اقلیت به طور برابر عادلانه باشد، از نظر ریاضی غیرممکن است. این سه ویژگی یک مرز پارتو را تشکیل میدهند، به این معنی که بهبود در یکی، لزوماً نیازمند افت در حداقل یکی از دو مورد دیگر است.[4]
برای پیمایش این مرز، پژوهشگران در حال توسعه مکانیسمهای حریم خصوصی تفاضلیِ آگاه از انصاف هستند. مقالهای در سال ۲۰۲۳ که توسط انجمن کامپیوتر IEEE منتشر شد، تکنیکهای برش تطبیقی را پیشنهاد کرد که محدودیتهای گرادیان را بر اساس عضویت در گروه تنظیم میکنند و تلاش دارند جریمه نویز را متناسبتر توزیع کنند. رویکردهای دیگر شامل کاهش الزامات دقت کلی مدل برای حفظ برابری میان گروهها، یا استفاده از تولید دادههای مصنوعی برای افزایش مصنوعی بازنمایی زیرگروههای اقلیت پیش از شروع آموزشِ حافظ حریم خصوصی است.[2][4]
با وجود این راهکارهای فنی، تنش اصلی همچنان یک تصمیم سیاستی است تا یک مسئله صرفاً ریاضیاتی. نهادهایی که سیستمهای یادگیری ماشین را مستقر میکنند، باید بودجههای حریم خصوصی خود را به صراحت تعریف کرده و نابرابریهای ناشی از آن را بپذیرند. برای مثال، اداره سرشماری ایالات متحده یک محصول نمایشی برای فایل بازتوزیع حوزههای انتخاباتی ۲۰۲۰ با بودجه از دست دادن حریم خصوصیِ اپسیلون ۱۲.۲ منتشر کرد تا میان الزام قانونی برای محرمانگی و نیاز به شمارش دقیق جمعیتشناختی که در اجرای قانون حقوق رأیدهندگان استفاده میشود، تعادل ایجاد کند.[6]
مرحله بعدی این کشمکش احتمالاً به جای آزمایشگاههای علوم کامپیوتر، در حسابرسیهای نظارتی رخ خواهد داد. با اجرای ارزیابیهای اجباریِ تأثیر الگوریتمی توسط حوزههای قضایی، سازمانها باید دقیقاً مستند کنند که چقدر از دقت کاربران اقلیت را قربانی کردهاند تا بتوانند ادعا کنند سیستمهایشان با قوانین حریم خصوصی سازگار است. عامل تعیینکننده برای استقرارهای آینده این خواهد بود که آیا قانونگذاران یک تضمین ریاضیاتی حریم خصوصی را به عنوان یک دفاع قانونی معتبر برای گسترش شکاف عملکردی جمعیتشناختی میپذیرند یا خیر.[7]
نکات کلیدی
- حریم خصوصی تفاضلی با برش گرادیانها و تزریق نویز آماری در طول فرآیند یادگیری، از دادههای آموزشی محافظت میکند.
- این نویز به شکلی نامتناسب دقت مدل را برای زیرگروههای اقلیت کاهش میدهد، زیرا سیگنالهای دادهای کوچکتر آنها به راحتی در میان نویز محو میشوند.
- این تاثیر نابرابر در سیستمهای تشخیص چهره، تصویربرداری پزشکی و دادههای جمعیتشناختی سرشماری ایالات متحده مشاهده شده است.
- تحقیقات نظری ثابت میکند که به حداکثر رساندن همزمان حریم خصوصی، دقت و انصاف برای مجموعه دادههای دارای توزیع دنبالهدار از نظر ریاضی غیرممکن است.
منابع
[1]arXivپژوهشگران انصاف الگوریتمیDifferential Privacy Has Disparate Impact on Model Accuracy
مطالعه در arXiv →
[2]IEEE Computer Societyپژوهشگران انصاف الگوریتمیFairness-Aware Differential Privacy: A Fairly Proportional Noise Mechanism
مطالعه در IEEE Computer Society →
[3]PMCمتخصصان بالینی و هوش مصنوعیPreserving fairness and diagnostic accuracy in private large-scale AI models for medical imaging
مطالعه در PMC →
[4]IJCAIپژوهشگران انصاف الگوریتمیDecision Making with Differential Privacy under a Fairness Lens
مطالعه در IJCAI →
[5]arXivپژوهشگران انصاف الگوریتمیDifferential Privacy and Fairness in Decisions and Learning Tasks: A Survey
مطالعه در arXiv →
[6]Securing.aiمتخصصان بالینی و هوش مصنوعیSecuring Data Labeling Through Differential Privacy
مطالعه در Securing.ai →
[7]تیم سردبیری کوهستانتحلیلگران سیستمها و سیاستگذاریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در دیدگاهها
مشاهده همه →فیزیک باتری
حد نرنست: چرا جدول تناوبی، و نه مهندسی، مرز نهایی چگالی انرژی باتریها را تعیین میکند
5 منبع
فیزیک اپتیک
حد آبه: چرا طول موج نور، و نه کیفیت عدسی، مرز مطلق وضوح تصویر را تعیین میکند؟
7 منبع
روش علمی
چگونه «همکاری خصمانه» دانشمندان رقیب را وادار میکند تا نظریههایشان را با هم آزمایش کنند
6 منبع
همسویی چندگانه
چگونه خاورمیانه در حال مهندسی اولین قطب ژئوپلیتیک «پساغربی» جهان است؟
6 منبع
هر زاویه. هر روز.
دریافت دیدگاهها اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





