نرخ تطبیق ۹۸.۹ درصدی: پایگاههای داده هشینگ ادراکی چگونه محتوای غیرقانونی شناختهشده را شناسایی و حذف میکنند
الگوریتمهای هشینگ ادراکی روزانه میلیاردها فایل آپلودی را اسکن میکنند تا با تطبیق ویژگیهای بصری بهجای دادههای دقیق فایل، تصاویر غیرقانونی شناختهشده را شناسایی کنند. اگرچه این سیستمها در به دام انداختن فایلهای دستنخورده بسیار کارآمدند، اما پژوهشگران هشدار میدهند که مهاجمان با استفاده از تغییرات بصری جزئی، بهطور فزایندهای میتوانند این فیلترها را دور بزنند.
به قلم ایمان شریعتی
این خبر را به اشتراک بگذارید
- تیمهای اعتماد و ایمنی پلتفرمها
- استدلال میکنند که هشینگ ادراکی تنها راه مقیاسپذیر برای پردازش روزانه میلیاردها آپلود بدون خواندن پیامهای کاربران است.
- پژوهشگران امنیت و حریم خصوصی
- استدلال میکنند که شکنندگی الگوریتمهای هشینگ فعلی، آنها را به وعدهای توخالی تبدیل کرده است که بهراحتی توسط بازیگران مخرب دور زده میشود.
- مدافعان ایمنی کودکان
- بر ضرورت حفظ پایگاههای داده متمرکز برای به دام انداختن فایلهای دستنخورده، علیرغم محدودیتهای فنی، تمرکز دارند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان محتوای مستقلی که توسط هشدارهای مثبت کاذب علامتگذاری شدهاند
- توسعهدهندگان پروتکلهای متنباز
نکات کلیدی
- الگوریتمهای هشینگ ادراکی مانند PhotoDNA تصاویر غیرقانونی را با تحلیل ویژگیهای بصری بهجای دادههای دقیق فایل شناسایی میکنند.
- این سیستمها در برابر تغییرات استانداردی مانند تغییر اندازه یا فشردهسازی، به نرخ تطبیق ۹۸.۹ درصدی دست مییابند.
- پژوهشگران ثابت کردهاند که افزودن کمتر از ۱ درصد نویز ریاضی نامرئی میتواند این فیلترها را بهطور کامل دور بزند.
- هجوم تصاویر تولیدشده توسط هوش مصنوعی، پایگاههای دادهای را که به تصاویر پایه تأییدشده توسط انسان متکی هستند، تحت فشار قرار داده است.
- پلتفرمها در حال بررسی هشهای عصبی مبتنی بر یادگیری عمیق هستند که در برابر فرار مقاومترند، اما به قدرت محاسباتی بسیار بیشتری نیاز دارند.
در ۲۵ آوریل ۲۰۱۶، مهندسان سازمان ایمنی کودکان Thorn یک تحلیل فنی از سیستم PhotoDNA مایکروسافت منتشر کردند و نشان دادند که چگونه یک تصویر غیرقانونی میتواند از نظر ریاضی به یک شبکه خاکستری تقلیل یابد. این الگوریتم بهجای تحلیل تصویر همانند یک انسان، رنگها را حذف کرده، اندازه فایل را تغییر داده و شدت پیکسلهای مجاور را برای تولید یک امضای دیجیتال منحصربهفرد نقشهبرداری میکند.[4]
این امضا همان «هش ادراکی» (perceptual hash) است. سالها پلتفرمهای دیجیتال برای شناسایی فایلها به هشهای رمزنگاریشده مانند MD5 یا SHA-256 متکی بودند. هشهای رمزنگاریشده بهشدت حساس هستند؛ تغییر تنها یک پیکسل در یک عکس با وضوح بالا، رشته الفبایی-عددی حاصل را کاملاً تغییر میدهد. اگر کاربری یک تصویر ممنوعه را دانلود کند، یک ردیف از پیکسلهای آن را ببرد و دوباره آپلود کند، فیلتر رمزنگاری آن را بهعنوان یک فایل کاملاً جدید و بیخطر ثبت میکند.
هشینگ ادراکی دقیقاً برای حل همین شکنندگی مهندسی شد. همانطور که در مجله Journal of Online Trust and Safety بهتفصیل آمده است، الگوریتمهایی مانند PhotoDNA و pHash بهجای کد باینری زیربنایی، ویژگیهای بصری یک تصویر را ارزیابی میکنند. با تمرکز بر دادههای با فرکانس پایین — یعنی اشکال و کنتراستهای کلی که یک عکس را تعریف میکنند — این هش حتی در صورت فشردهسازی، تغییر اندازه یا تغییر رنگ جزئی تصویر، ثابت میماند.
مکانیسم این کار بر یک عملیات ریاضی به نام تبدیل کسینوسی گسسته (DCT) استوار است. وقتی تصویری وارد صف بررسی میشود، سیستم آن را به یک مربع خاکستری ۳۲ در ۳۲ پیکسل تبدیل میکند. الگوریتم DCT تصویر را به مجموعهای از فرکانسها و دامنهها تفکیک کرده و جزئیات با فرکانس بالا را که نشاندهنده لبههای تیز یا نویز هستند، دور میریزد. سپس سیستم مقدار میانه فرکانسهای باقیمانده را محاسبه کرده و بسته به اینکه هر بلوک بالاتر یا پایینتر از آن میانگین قرار گیرد، مقدار ۱ یا ۰ را به آن اختصاص میدهد.[1]
خروجی کار یک رشته از بیتهاست — که اغلب ۶۴ یا ۲۵۶ کاراکتر طول دارد. برای تعیین اینکه آیا تصویر جدید آپلودشده با یک محتوای غیرقانونی شناختهشده مطابقت دارد یا خیر، پایگاه داده این دو رشته را با استفاده از معیاری به نام فاصله همینگ (Hamming distance) مقایسه میکند. این فاصله بهسادگی تعداد موقعیتهایی را که بیتها در آنها تفاوت دارند میشمارد. اگر فاصله همینگ از یک آستانه از پیش تعیینشده کمتر باشد، سیستم فایل آپلودی را بهعنوان یک مورد تطبیقیافته علامتگذاری میکند.[1]
در عمل، این مکانیسم در برابر تلاشهای ساده برای دور زدن فیلترها به دقت قابلتوجهی دست مییابد. نهاد تنظیمکننده ارتباطات بریتانیا (Ofcom) در بررسی اجمالی خود از فناوری هشینگ ادراکی خاطرنشان میکند که این سیستمها در مواجهه با تغییرات استاندارد کاربران، مانند افزودن واترمارک یا ذخیره یک فایل JPEG با کیفیت پایینتر، بهطور معمول به نرخ تطبیق ۹۸.۹ درصدی میرسند.[1]
این نرخ اثربخشی بالا، ستون فقرات ایمنی آنلاین مدرن را تشکیل میدهد. مرکز ملی کودکان گمشده و مورد سوءاستفاده قرار گرفته (NCMEC) یک مرکز تبادل متمرکز از هشهایی که نشاندهنده محتوای شناختهشده سوءاستفاده جنسی از کودکان (CSAM) هستند، نگهداری میکند. شبکههای اجتماعی، ارائهدهندگان فضای ذخیرهسازی ابری و پیامرسانها روزانه میلیاردها بار از این پایگاه داده استعلام میگیرند و فایلها را پیش از آنکه در فیدهای عمومی ظاهر شوند، بهطور خودکار رهگیری و گزارش میکنند.[4]
این نرخ اثربخشی بالا، ستون فقرات ایمنی آنلاین مدرن را تشکیل میدهد.
با این حال، قابلیتی که شرکتهای فناوری آن را بهعنوان یک سپر نفوذناپذیر بازاریابی میکنند، در حال نشان دادن ترکهای ساختاری شدیدی است. پژوهشگران کالج امپریال لندن اخیراً یافتههایی را منتشر کردهاند که نشان میدهد این مکانیسمهای تشخیص میتوانند بهطور سیستماتیک دور زده شوند. این پژوهشگران با تأکید بر یک آسیبپذیری بنیادین در نحوه پردازش دادههای بصری توسط این الگوریتمها، نتیجه گرفتند: «مکانیسمهای پیشنهادی برای تشخیص محتوای غیرقانونی بهراحتی قابل دور زدن هستند.»[2]
این آسیبپذیری ریشه در اختلالات خصمانه (adversarial perturbations) دارد. یک مقاله پیشچاپ که در ژوئن ۲۰۲۴ در arXiv با عنوان «ارزیابی امنیت خصمانه الگوریتمهای کاربردی هشینگ ادراکی» منتشر شد، دقیقاً نشان داد که سیستمهای مبتنی بر آستانه چقدر شکنندهاند. با اعمال لایهای از نویز ریاضی روی یک تصویر — تغییر مقادیر پیکسلها به میزان کمتر از ۱ درصد — مهاجمان میتوانند الگوریتم DCT را مجبور کنند تا هشی کاملاً متفاوت را محاسبه کند.[3]
برای یک ناظر انسانی، تصویر تغییریافته کاملاً مشابه نسخه اصلی به نظر میرسد. اما برای الگوریتم هشینگ، این نویز نامرئی فاصله همینگ را به بسیار فراتر از آستانه تطبیق میراند. پژوهشگران arXiv دریافتند که این اختلالات هدفمند، نرخ تشخیص هشهای ادراکی استاندارد را تقریباً به صفر میرسانند و به محتوای غیرقانونی شناختهشده اجازه میدهند تا بهطور کامل از فیلترهای خودکار عبور کنند.[3]
پلتفرمها نمیتوانند بهسادگی با افزایش فاصله همینگ مجاز، تور خود را تنگتر کنند. اگر یک پایگاه داده واریانس ۳۰ درصدی بین هشها را بهعنوان یک تطبیق بپذیرد، نرخ مثبت کاذب (false positive) بهشدت افزایش مییابد. سیستمی که بیشازحد آزادانه پیکربندی شده باشد، شروع به علامتگذاری تصاویر مناظر بیابانی بهعنوان محتوای غیرقانونی میکند، صرفاً به این دلیل که خط افق و پروفایل کنتراست مشابهی با یک تصویر ممنوعه دارند.
هجوم هوش مصنوعی مولد، فشار بر این معماری را دوچندان کرده است. در نامهای به تاریخ ۱ ژانویه ۲۰۲۶ خطاب به NCMEC، مرکز اینترنت و جامعه استنفورد تأثیر آماری تصاویر CSAM تولیدشده توسط هوش مصنوعی را بر اکوسیستم گزارشدهی تحلیل کرد. از آنجا که هشینگ ادراکی به پایگاه دادهای از تصاویر پایه شناختهشده و تأییدشده توسط انسان متکی است، نمیتواند بهطور پیشگیرانه صحنههای کاملاً جدید و تولیدشده بهصورت مصنوعی را تشخیص دهد.
پژوهشگران استنفورد خاطرنشان کردند که حجم عظیم محتوای تولیدشده توسط هوش مصنوعی تهدیدی برای غلبه بر تحلیلگران انسانی است که برای تأیید و هش کردن تصاویر جدید مورد نیازند. یک پایگاه داده هش ادراکی ذاتاً واکنشی است؛ این سیستم تنها چیزی را میشناسد که قبلاً به آن آموزش داده شده است. وقتی سرعت تولید محتوا از تأیید دستی پیشی میگیرد، نرخ پوشش واقعی سیستم بهشدت افت میکند.
برای مقابله با این تاکتیکهای فرار، صنعت بهآرامی در حال چرخش بهسوی هشینگ عصبی (neural hashing) است — استفاده از مدلهای یادگیری عمیق برای استخراج ویژگیهای معنایی بهجای تکیه بر تبدیلات فرکانسی خشک. هشهای عصبی در برابر نویزهای خصمانه مقاومترند، اما برای اجرا در مقیاس میلیاردها آپلود روزانه، به قدرت محاسباتی بسیار بیشتری نیاز دارند.[2][5]
گذار به هشینگ مبتنی بر هوش مصنوعی همچنین ابهام جدیدی را وارد خط لوله نظارت بر محتوا میکند. درحالیکه ریاضیات تبدیل کسینوسی گسسته شفاف و قابل پیشبینی است، شبکههای عصبی مانند جعبههای سیاه عمل میکنند و توضیح اینکه دقیقاً چرا یک تصویر خاص علامتگذاری شده است را برای پلتفرمها دشوار میسازند. با ادامه تلاش مهاجمان برای بهبود اختلالات خود، فیلترهای خودکاری که از اینترنت محافظت میکنند مجبور خواهند شد پیشبینیپذیری را فدای مقاومت کنند.[5]
اصطلاحات کلیدی
- هشینگ ادراکی
- الگوریتمی که یک امضای دیجیتال را بر اساس ویژگیهای بصری تصویر تولید میکند و به آن اجازه میدهد تا عکس را حتی در صورت تغییر، شناسایی کند.
- هش رمزنگاریشده
- یک تابع ریاضی که فایل را به یک رشته منحصربهفرد از کاراکترها تبدیل میکند و اگر حتی یک بایت از فایل اصلی تغییر کند، کاملاً دگرگون میشود.
- تبدیل کسینوسی گسسته (DCT)
- یک عملیات ریاضی که تصویر را به بخشهایی با فرکانسهای مختلف تفکیک کرده و نویزهای با فرکانس بالا را دور میریزد تا بر ساختار بصری اصلی تمرکز کند.
- اختلال خصمانه
- تغییرات کوچک و محاسبهشده از نظر ریاضی که روی پیکسلهای یک تصویر اعمال میشوند و برای چشم انسان نامرئی هستند، اما الگوریتم را مجبور به طبقهبندی اشتباه فایل میکنند.
- فاصله همینگ
- معیاری برای اندازهگیری تفاوت بین دو رشته با طول برابر، که با شمارش تعداد موقعیتهایی که نمادهای متناظر در آنها متفاوت هستند، محاسبه میشود.
آنچه نمیدانیم
- دقیقاً چه درصدی از محتوای غیرقانونی که در حال حاضر در پلتفرمهای بزرگ دستبهدست میشود، با اختلالات خصمانه برای فرار از تشخیص تغییر یافته است.
- شرکتهای شبکههای اجتماعی با چه سرعتی قادر خواهند بود از هشینگ ادراکی سنتی به هشینگ عصبی مقاومتر در مقیاس وسیع گذر کنند.
- آیا هزینه محاسباتی هشهای یادگیری عمیق، پلتفرمهای کوچکتر را مجبور خواهد کرد تا اسکن خودکار را بهطور کامل کنار بگذارند یا خیر.
چرا مهم است
تمام پلتفرمهای بزرگ شبکههای اجتماعی برای فیلتر کردن خودکار محتوای غیرقانونی پیش از رسیدن به دست کاربران، به هشینگ ادراکی وابستهاند. درک محدودیتهای ریاضی این فناوری توضیح میدهد که چرا محتوای ممنوعه همچنان از فیلترها عبور میکند و چرا تصاویر تولیدشده توسط هوش مصنوعی تهدیدی برای فروپاشی زیرساختهای فعلی نظارت بر محتوا محسوب میشوند.
منابع
[1]Ofcomتیمهای اعتماد و ایمنی پلتفرمهاOverview of Perceptual Hashing Technology
مطالعه در Ofcom →
[2]Imperial College Londonپژوهشگران امنیت و حریم خصوصیProposed mechanisms to detect illegal content can be easily evaded, study finds
مطالعه در Imperial College London →
[3]arXivپژوهشگران امنیت و حریم خصوصیAssessing the Adversarial Security of Practical Perceptual Hashing Algorithms
مطالعه در arXiv →
[4]Thorn.orgتیمهای اعتماد و ایمنی پلتفرمهاMicrosoft's PhotoDNA: Leading the Fight Against Child Sexual Abuse Imagery
مطالعه در Thorn.org →
[5]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



