رفتن به محتوای اصلی
Koohestun
توضیح کوهستانحریم خصوصی تفاضلیبسته شواهد· 5 دقیقه مطالعه· در تحلیل داده

بسته شواهد: بده‌بستان‌های دقت و کارایی در حریم خصوصی تفاضلی

حریم خصوصی تفاضلی با تزریق نویز کالیبره‌شده به مجموعه‌داده‌ها، ناشناس ماندن افراد را از نظر ریاضی تضمین می‌کند؛ اما بودجه حریم خصوصیِ انتخاب‌شده تعیین می‌کند که در این فرآیند چه مقدار از کارایی تحلیلی داده‌ها از بین می‌رود. بررسی پیاده‌سازی‌های دولتی و تجاری نشان‌دهنده تفاوت‌های فاحشی در میزان نویزی است که نهادها حاضر به پذیرش آن هستند.

به قلم اِلا فرجاد

مدافعان حریم خصوصی رمزنگاری‌شده 35%پژوهشگران تجربی 35%مجریان تجاری 30%
مدافعان حریم خصوصی رمزنگاری‌شده
استدلال می‌کنند که تضمین‌های مطلق ریاضی در برابر بازسازی پایگاه داده، فارغ از هزینه‌ای که برای کارایی داده‌ها دارد، ضروری است.
پژوهشگران تجربی
بر این باورند که تزریق بیش از حد نویز، کارایی داده‌های عمومی را برای سیاست‌گذاری، اجرای حقوق مدنی و تحلیل‌های جمعیتی از بین می‌برد.
مجریان تجاری
جمع‌آوری مداوم داده‌ها و آموزش مدل‌ها را در اولویت قرار می‌دهند و از بودجه‌های روزانه بالای اپسیلون برای حفظ کارایی در عین ارائه قابلیت انکار موجه استفاده می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • وکلای حقوق مدنی
  • برنامه‌ریزان دولت‌های محلی

در ۱۲ اوت ۲۰۲۱، اداره سرشماری ایالات متحده داده‌های مربوط به بازتوزیع مناطق برای سرشماری سال ۲۰۲۰ را منتشر کرد؛ این نخستین باری بود که یک آژانس آماری ملی، روش‌های سنتی ناشناس‌سازی را با حریم خصوصی تفاضلی جایگزین می‌کرد. این تغییر، نحوه انتشار داده‌های جمعیتی را به‌طور بنیادین دگرگون ساخت و از جابه‌جایی سوابق فردی، به تزریق نویز کالیبره‌شده ریاضی در شمارش‌های کلی روی آورد.

این سازوکار بر پارامتری به نام «اپسیلون» (epsilon) یا همان بودجه از دست رفتن حریم خصوصی متکی است. حریم خصوصی تفاضلی که در سال ۲۰۰۶ طی مقاله‌ای توسط سینتیا دوورک (Cynthia Dwork) و همکارانش به‌طور رسمی تعریف شد، یک الگوریتم خاص نیست، بلکه یک تضمین ریاضی است. دوورک در این باره نوشت: «حریم خصوصی تفاضلی تضمین می‌کند که حذف یا اضافه‌شدن یک مورد منفرد در پایگاه داده، تأثیر قابل‌توجهی بر نتیجه هیچ تحلیلی نخواهد گذاشت.»[3]

اندازه پارامتر اپسیلون، بده‌بستان دقیق میان حریم خصوصی و کارایی را تعیین می‌کند. اپسیلونِ پایین‌تر با تزریق نویز بیشتر، تضمین‌های قوی‌تری برای حریم خصوصی فراهم می‌کند، اما کارایی آماری داده‌ها را کاهش می‌دهد. در مقابل، اپسیلونِ بالاتر دقت داده‌های اولیه را حفظ می‌کند، اما سوابق فردی را در برابر حملات بازسازی پایگاه داده آسیب‌پذیر می‌سازد.[1]

برای داده‌های بازتوزیع مناطق در سال ۲۰۲۰، اداره سرشماری پس از آنکه آزمایش‌های اولیه با بودجه‌های پایین‌تر منجر به اعوجاج شدید در شمارش جمعیت مناطق روستایی شد، در نهایت روی اپسیلون ۱۹.۶۱ به توافق رسید. این رقم نشان‌دهنده یک بودجه حریم خصوصی سراسری و مادام‌العمر برای آن محصولات داده‌ای خاص است؛ به این معنا که نویز به‌گونه‌ای کالیبره شده بود تا از کل مجموعه‌داده به‌طور هم‌زمان محافظت کند.

بودجه‌های روزانه حریم خصوصی در بخش تجاری می‌توانند به‌سرعت از بودجه‌های مادام‌العمری که آژانس‌های آماری دولتی استفاده می‌کنند، فراتر روند.

معرفی این نویز، واکنش فوری پژوهشگرانی را در پی داشت که به داده‌های دقیق جمعیتی متکی هستند. در تحلیلی که در سال ۲۰۲۲ توسط انجمن اقتصادی آمریکا منتشر شد، پژوهشگرانی به سرپرستی استیون راگلز (Steven Ruggles) استدلال کردند که پیاده‌سازی اداره سرشماری، کارایی ریزداده‌ها را از بین برده است. راگلز خاطرنشان کرد: «نویز تزریق‌شده، داده‌ها را برای پژوهش‌های دقیق جمعیتی، به‌ویژه برای مناطق جغرافیایی کوچک و جمعیت اقلیت‌ها، غیرقابل استفاده می‌کند.»[4]

این اعوجاج به‌طور یکنواخت در میان جمعیت‌ها توزیع نمی‌شود. از آنجا که حریم خصوصی تفاضلی مقدار مطلق و ثابتی از نویز را بر اساس حساسیت پرس‌وجو تزریق می‌کند، خطای نسبی برای جمعیت‌های کوچک بسیار بزرگ، اما برای جمعیت‌های بزرگ ناچیز است. افزودن ۵۰ فرد خیالی به شهری با ۱۰۰ نفر جمعیت، ترکیب جمعیتی آن را ۵۰ درصد تغییر می‌دهد؛ در حالی که افزودن ۵۰ نفر به شهری با ۱۰۰,۰۰۰ نفر جمعیت، آن را تنها ۰.۰۵ درصد تغییر می‌دهد.[1]

هرچه بودجه حریم خصوصی (اپسیلون) به صفر نزدیک‌تر می‌شود، نویز تزریق‌شده بر سیگنال غلبه کرده و کارایی تحلیلی داده‌ها را از بین می‌برد.

در حالی که اداره سرشماری از یک مدل متمرکز و سراسری از حریم خصوصی تفاضلی استفاده می‌کند، شرکت‌های تجاری فناوری نسخه محلی آن را به کار می‌گیرند. در حریم خصوصی تفاضلی محلی، نویز پیش از آنکه داده‌ها به سرورهای شرکت برسند، روی دستگاه کاربر تزریق می‌شود. اپل این رویکرد را در macOS و iOS ادغام کرد تا آمارهای استفاده را بدون ردیابی کاربران فردی جمع‌آوری کند.[2]

در حالی که اداره سرشماری از یک مدل متمرکز و سراسری از حریم خصوصی تفاضلی استفاده می‌کند، شرکت‌های تجاری فناوری نسخه محلی آن را به کار می‌گیرند.

با این حال، بودجه‌های حریم خصوصی مورد استفاده نهادهای تجاری در مقیاسی کاملاً متفاوت عمل می‌کنند. مستندات پژوهشی یادگیری ماشین اپل، جزئیات بودجه‌های روزانه اپسیلون را شرح می‌دهد که می‌تواند برای انواع خاصی از داده‌های macOS تا ۱۴ نیز برسد. از آنجا که مقادیر اپسیلون در صورت انجام پرس‌وجوهای متعدد روی یک موضوع واحد به‌طور ریاضی با هم جمع (مرکب) می‌شوند، بودجه روزانه ۱۴ به‌سرعت در طول زمان انباشته می‌شود.[2]

این اثر مرکب، محدودیت اصلی حریم خصوصی تفاضلی را در جمع‌آوری مداوم داده‌ها آشکار می‌سازد. تحلیل ما از این پیاده‌سازی‌های متفاوت نشان می‌دهد که یک شرکت فناوری که با اپسیلون روزانه ۱۴ فعالیت می‌کند، در کمتر از ۴۸ ساعت از بودجه مادام‌العمر ۱۹.۶۱ اداره سرشماری که هر ده سال یک‌بار استفاده می‌شود، فراتر می‌رود.[5]

این اختلاف، شکافی بنیادین را در نحوه کاربرد این اصطلاح در بخش‌های مختلف برجسته می‌کند. آژانس‌های دولتی از حریم خصوصی تفاضلی برای دفاع در برابر حملات هدفمند و در سطح دولت-ملت برای بازسازی مجموعه‌داده‌های ایستا استفاده می‌کنند که آن‌ها را مجبور به اتخاذ بودجه‌های سخت‌گیرانه و محدود می‌کند. در مقابل، نهادهای تجاری از آن برای فراهم کردن قابلیت انکار موجه در جمع‌آوری مداوم تله‌متری بهره می‌برند و دقت مدل را بر ناشناس ماندن رمزنگاری‌شده در درازمدت ترجیح می‌دهند.[5]

حریم خصوصی تفاضلی سراسری برای افزودن نویز به یک متولی مرکزی متکی است، در حالی که حریم خصوصی تفاضلی محلی، نویز را پیش از ارسال، روی دستگاه خود کاربر اضافه می‌کند.

برای کاهش از دست رفتنِ مرکبِ حریم خصوصی، شرکت‌ها اغلب به درهم‌ریزی داده‌ها و شناسه‌های موقت متکی هستند تا پیوند میان پرس‌وجوهای متوالی روزانه را بشکنند. اپل بیان می‌کند که در پیاده‌سازی خود، آدرس‌های IP را حذف کرده و فراداده‌ها را پاک می‌کند تا اطمینان حاصل کند که «نویز اضافه‌شده به داده‌های امروز یک کاربر، نمی‌تواند از نظر ریاضی به نویز اضافه‌شده در فردا مرتبط شود.»[2]

با وجود بده‌بستان‌های مربوط به کارایی، دقت ریاضی حریم خصوصی تفاضلی آن را به تنها دفاع شناخته‌شده در برابر حملات مدرنِ بازسازی پایگاه داده تبدیل می‌کند. روش‌های سنتی مانند k-ناشناسی و جابه‌جایی داده‌ها، بارها در برابر مدل‌های یادگیری ماشین که چندین مجموعه‌داده عمومی را با هم تطبیق می‌دهند، شکست خورده‌اند.[3]

اکنون بحث‌ها بر استانداردسازی نحوه گزارش و زمینه‌سازی اپسیلون متمرکز است. بدون یک خط پایه استاندارد، مقایسه اپسیلون ۲ روی یک دستگاه محلی با اپسیلون ۱۹.۶۱ در یک پایگاه داده سرشماری سراسری، از نظر ریاضی بی‌معنی است. مرحله بعدی پژوهش‌های حریم خصوصی، بر توسعه الگوریتم‌هایی تمرکز دارد که به همان تضمین‌های رمزنگاری دست یابند، در حالی که تنها به کسری از نویز تزریق‌شده نیاز داشته باشند.[1]

نکات کلیدی

  • حریم خصوصی تفاضلی با تزریق نویز کالیبره‌شده ریاضی به پرس‌وجوهای تجمیعی، از مجموعه‌داده‌ها محافظت می‌کند.
  • بودجه از دست رفتن حریم خصوصی که با نام اپسیلون شناخته می‌شود، بده‌بستان دقیق میان ناشناس ماندن و دقت داده‌ها را تعیین می‌کند.
  • اداره سرشماری آمریکا برای داده‌های بازتوزیع مناطق در سال ۲۰۲۰، از یک اپسیلون سراسری و مادام‌العمر ۱۹.۶۱ استفاده کرد.
  • پیاده‌سازی‌های تجاری اغلب از بودجه‌های روزانه اپسیلون استفاده می‌کنند که به‌سرعت مرکب می‌شوند و کارایی داده‌ها را بر ناشناس ماندن سخت‌گیرانه در درازمدت ترجیح می‌دهند.

بررسی عمیق دیدگاه‌ها

آژانس‌های آماری

تمرکز بر جلوگیری از بازسازی پایگاه داده است و حاضرند مقداری از دقت در سطح خرد را فدای تضمین‌های مطلق ریاضی کنند.

برای آژانس‌های آماری ملی، مدل تهدید شامل یک دولت-ملت یا یک مهاجم با بودجه کلان است که تلاش می‌کند یک حمله کامل برای بازسازی پایگاه داده انجام دهد. از آنجا که ثابت شده روش‌های سنتی ناشناس‌سازی مانند جابه‌جایی داده‌ها در برابر یادگیری ماشین مدرن آسیب‌پذیرند، این آژانس‌ها حریم خصوصی تفاضلی را تنها دفاع معتبر از نظر ریاضی می‌دانند. آن‌ها حاضرند اعوجاج ناشی از آن در ریزداده‌های جمعیت‌های کوچک را به‌عنوان هزینه‌ای ضروری برای انجام وظایف قانونی خود در قبال محافظت از محرمانگی پاسخ‌دهندگان بپذیرند.

پژوهشگران جمعیتی

استدلال می‌کنند که نویز بیش از حد، کارایی داده‌های عمومی را برای سیاست‌گذاری و اجرای حقوق مدنی از بین می‌برد.

پژوهشگران تجربی و اقتصاددانان استدلال می‌کنند که نویز تزریق‌شده توسط حریم خصوصی تفاضلی با اپسیلون پایین، اساساً کارایی داده‌ها را از بین می‌برد. آن‌ها اشاره می‌کنند که چون نویز به‌جای نسبی بودن، مطلق است، به‌طور نامتناسبی ترکیب جمعیتی مناطق روستایی و اقلیت‌ها را مخدوش می‌کند. آن‌ها استدلال می‌کنند که این اعوجاج، ترسیم دقیق حوزه‌های رأی‌گیری، تخصیص بودجه فدرال یا انجام پژوهش‌های اپیدمیولوژیک قابل‌اعتماد در جوامع کوچک را تقریباً غیرممکن می‌سازد.

پیاده‌سازی‌های تجاری فناوری

جمع‌آوری مداوم داده‌ها و آموزش مدل‌ها را در اولویت قرار داده و از بودجه‌های روزانه بالای اپسیلون برای حفظ کارایی استفاده می‌کنند.

شرکت‌های فناوری از حریم خصوصی تفاضلی عمدتاً برای فراهم کردن قابلیت انکار موجه استفاده می‌کنند، در حالی که به جمع‌آوری مقادیر عظیمی از داده‌های تله‌متری برای مدل‌های یادگیری ماشین ادامه می‌دهند. با استفاده از حریم خصوصی تفاضلی محلی با بودجه‌های روزانه بالای اپسیلون، آن‌ها اطمینان حاصل می‌کنند که داده‌ها برای آموزش الگوریتم‌ها بسیار دقیق باقی می‌مانند. آن‌ها استدلال می‌کنند که با حذف شناسه‌ها و درهم‌ریزی داده‌ها، خطر ریاضیِ مرکبِ بودجه‌های روزانه بالا در عمل کاهش می‌یابد، حتی اگر تضمین‌های سخت‌گیرانه رمزنگاری در طول زمان تضعیف شوند.

چرا مهم است

با روی آوردن نهادهای بیشتر به حریم خصوصی تفاضلی، مقدار دقیق بودجه حریم خصوصی تعیین می‌کند که آیا داده‌های نهایی بازتابی بسیار دقیق از واقعیت هستند یا صرفاً یک تقریبِ مبهمِ ریاضی. درک این بده‌بستان برای هر کسی که به مجموعه‌داده‌های عمومی متکی است یا داده‌های تله‌متری شخصی خود را به شرکت‌های فناوری می‌سپارد، حیاتی است.

آنچه نمی‌دانیم

  • اینکه آیا الگوریتم‌های آینده می‌توانند با نویز تزریق‌شده بسیار کمتری به همان تضمین‌های رمزنگاری دست یابند یا خیر.
  • دادگاه‌ها چگونه اعتبار قانونی داده‌های سرشماریِ دارای حریم خصوصی تفاضلی را برای اجرای قانون حقوق رأی‌دهندگان تفسیر خواهند کرد.
  • میزان واقعی از دست رفتن انباشته حریم خصوصی برای کاربرانی که در معرض ردیابی مداوم حریم خصوصی تفاضلی محلی در چندین دستگاه تجاری قرار دارند، چقدر است.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

مدافعان حریم خصوصی رمزنگاری‌شده 35%پژوهشگران تجربی 35%مجریان تجاری 30%
  1. [1]Harvard University Privacy Tools Projectمدافعان حریم خصوصی رمزنگاری‌شده

    A Primer on Differential Privacy

    مطالعه در Harvard University Privacy Tools Project
  2. [2]Apple Machine Learning Researchمجریان تجاری

    Learning with Privacy at Scale

    مطالعه در Apple Machine Learning Research
  3. [3]Association for Computing Machineryمدافعان حریم خصوصی رمزنگاری‌شده

    Calibrating Noise to Sensitivity in Private Data Analysis

    مطالعه در Association for Computing Machinery
  4. [4]American Economic Associationپژوهشگران تجربی

    The Implications of Differential Privacy for Census Bureau Data

    مطالعه در American Economic Association
  5. [5]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت تحلیل داده اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.