رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمقاومت هوش مصنوعیگزارش تشریحی· 11 دقیقه مطالعه· در هوش مصنوعی

نقطه کور ریاضیاتی در ایمنی هوش مصنوعی: هنجارهای Lp چگونه بودجه‌های اختلال خصمانه را تعریف می‌کنند

مدل‌های یادگیری ماشین با استفاده از محدودیت‌های دقیق ریاضیاتی در میزان تغییرات مجاز یک تصویر، در برابر حملات خصمانه محافظت می‌شوند. با این حال، پژوهشگران درمی‌یابند که این مرزهای ریاضیاتی قادر به درک ادراک انسانی نیستند و مدل‌های به‌ظاهر مقاوم را در برابر تغییرات ساده فضایی آسیب‌پذیر رها می‌کنند.

به قلم اِلا فرجاد

منتقدان همخوانی ادراکی 35%پژوهشگران حملات چند-هنجاری 35%حامیان مقاومت ریاضیاتی 30%
منتقدان همخوانی ادراکی
پژوهشگرانی که استدلال می‌کنند هنجارهای ریاضیاتی در درک واقعیت بصری انسان ناکام هستند.
پژوهشگران حملات چند-هنجاری
تیم‌های امنیتی که بر شکستن دفاع‌های تک-هنجاری با استفاده از استراتژی‌های اختلال ترکیبی تمرکز دارند.
حامیان مقاومت ریاضیاتی
پژوهشگرانی که بر تضمین‌های امنیتی قابل‌اثبات از طریق مرزهای دقیق ریاضیاتی تمرکز دارند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مهندسان سخت‌افزاری که هزینه محاسباتی آموزش‌های چند-هنجاری را مدیریت می‌کنند
  • قانون‌گذارانی که در تلاش برای استانداردسازی گواهینامه‌های ایمنی هوش مصنوعی هستند

در معماری هوش مصنوعی مدرن، تفاوت بین یک تصویر بی‌خطر و یک حمله هدفمند می‌تواند به کوچکی تغییر در ۴ درصد از پیکسل‌های تصویر باشد. وقتی یک مدل یادگیری ماشین یک ورودی بصری را پردازش می‌کند، اشیاء را آن‌گونه که انسان می‌بیند درک نمی‌کند؛ بلکه آن را به شکل یک ماتریس عظیم و چندبعدی از مقادیر عددی رنگ‌ها می‌بیند. یک نمونه خصمانه با تغییر ریاضیاتی و بسیار ظریف همین مقادیر خاص ایجاد می‌شود تا مدل را وادار به یک اشتباه فاجعه‌بار در دسته‌بندی کند، در حالی که این تغییرات برای چشم انسان کاملاً نامرئی باقی می‌مانند. این دستکاری نامرئی، هسته اصلی یادگیری ماشین خصمانه را تشکیل می‌دهد.[1]

برای کنترل و مطالعه این تغییرات نامرئی، پژوهشگران ایمنی هوش مصنوعی به یک مفهوم بنیادین به نام «بودجه اختلال» (perturbation budget) تکیه می‌کنند. این بودجه مانند یک افسار دقیق ریاضیاتی عمل می‌کند و دقیقاً مشخص می‌کند که یک مهاجم تا چه حد مجاز است یک تصویر ورودی را تغییر دهد پیش از آنکه مکانیزم دفاعی، حمله را نامعتبر یا به‌راحتی قابل‌تشخیص ارزیابی کند. بدون یک بودجه مشخص، مهاجم می‌تواند به‌سادگی تصویر یک تابلوی ایست را به‌طور کامل با تصویر تابلوی محدودیت سرعت جایگزین کند. این بودجه، حمله را مجبور می‌کند تا ظریف باقی بماند و این محدودیت دنیای واقعی را شبیه‌سازی کند که یک دستکاری خصمانه باید ضمن فریب دادن سیستم الگوریتمی، از سوءظن انسان نیز در امان بماند.[3]

ابزار استاندارد برای اندازه‌گیری این بودجه اختلال، هنجار $L_p$ است؛ خانواده‌ای از توابع ریاضیاتی که برای کمّی کردن فاصله بین تصویر بی‌خطر اصلی و نسخه دستکاری‌شده خصمانه آن طراحی شده‌اند. با محدود کردن هنجار $L_p$ در زیر یک آستانه مشخص، پژوهشگران تلاش می‌کنند تضمین کنند که نمونه خصمانه از نظر ادراکی با منبع اصلی یکسان باقی می‌ماند. این هنجارها یک معیار استاندارد و قابل‌اندازه‌گیری ارائه می‌دهند که به جامعه جهانی پژوهشگران یادگیری ماشین اجازه می‌دهد مکانیزم‌های دفاعی و استراتژی‌های حمله مختلف را به‌طور عینی با یکدیگر مقایسه کنند.[1][4]

شهودی‌ترینِ این معیارهای ریاضیاتی، هنجار $L_0$ است. این معیار به‌سادگی تعداد کل پیکسل‌هایی را که تغییر کرده‌اند می‌شمارد، فارغ از اینکه رنگ هر یک از آن‌ها چقدر شدید تغییر کرده باشد. یک حمله محدودشده با $L_0$ ممکن است ۹۹ درصد از یک تابلوی ایست را کاملاً دست‌نخورده باقی بگذارد، اما چند پیکسل با کنتراست بالا را در مکان‌های بسیار خاص و بهینه‌شده از نظر ریاضیاتی قرار دهد تا سیستم بینایی یک خودروی خودران را متقاعد کند که در حال نگاه کردن به یک شیء کاملاً متفاوت است. از آنجا که این روش پیکسل‌های بسیار کمی را تغییر می‌دهد، ساختار کلی تصویر دست‌نخورده باقی می‌ماند.[3]

سه هنجار اصلی ریاضیاتی که برای اندازه‌گیری بودجه اختلال خصمانه استفاده می‌شوند.

در حالی که حملات $L_0$ بسیار واقع‌گرایانه هستند و اجرای آن‌ها در دنیای فیزیکی نسبتاً آسان است — که اغلب به شکل برچسب‌های فیزیکی روی علائم رانندگی یا دستگاه‌های جعل بیومتریک ظاهر می‌شوند — بهینه‌سازی دفاع در برابر آن‌ها برای مدافعان به‌شدت دشوار است. ماهیت گسسته و باینری شمارش پیکسل‌ها به‌راحتی به ریاضیات گرادیان پیوسته و همواری که برای آموزش شبکه‌های عصبی عمیقِ مقاوم نیاز است، ترجمه نمی‌شود. در نتیجه، پژوهشگران اغلب در ساخت دفاع‌های خودکاری که بتوانند به‌طور قابل‌اعتمادی اختلالات $L_0$ را بدون کاهش دقت کلی مدل روی داده‌های تمیز دفع کنند، با مشکل مواجه می‌شوند.[3]

به دلیل همین دشواری‌های محاسباتی، جامعه ایمنی هوش مصنوعی به‌طور گسترده‌ای حول یک معیار متفاوت گرد هم آمده است: هنجار $L_\infty$ (ال-بی‌نهایت). هنجار $L_\infty$ به جای شمارش تعداد مطلق پیکسل‌های تغییریافته، حداکثر تغییر اعمال‌شده روی هر پیکسل منفرد را در کل ماتریس تصویر اندازه‌گیری می‌کند. اگر بودجه روی یک مقدار خاص تنظیم شود، هیچ پیکسلی نمی‌تواند بیشتر از آن مقدار دقیق تغییر کند، و این اطمینان حاصل می‌شود که اختلال به‌طور یکنواخت و نامحسوس در سراسر میدان دید پخش شده است.[1][3]

یک تحلیل منتشرشده در سال ۲۰۲۱ در نشریه Towards Data Science خاطرنشان می‌کند: «حملات ال-بی‌نهایت به دلیل سادگی و راحتی ریاضیاتی در بهینه‌سازی مقاوم، بیشتر از همه مورد مطالعه قرار می‌گیرند.» با تعیین یک بودجه سخت‌گیرانه $L_\infty$ — مانند اینکه هیچ پیکسلی اجازه نداشته باشد بیشتر از ۸ واحد از ۲۵۵ مقدار استاندارد رنگ تغییر کند — مدافعان می‌توانند از نظر ریاضیاتی گواهی دهند که یک شبکه عصبی در برابر هر حمله ممکنی که در آن آستانه نامرئی قرار می‌گیرد، مقاوم است. این تضمین ریاضیاتی، $L_\infty$ را به استاندارد طلایی برای بنچمارک‌های مقاومت آکادمیک تبدیل کرده است.[3]

سومین معیار رایج مورد استفاده در این حوزه، هنجار $L_2$ است که فاصله اقلیدسی بین تصاویر اصلی و مختل‌شده را اندازه‌گیری می‌کند. این معیار انرژی کلی اختلال را محاسبه می‌کند و به مهاجم اجازه می‌دهد تغییرات کوچک زیادی در سراسر تصویر یا چند تغییر بزرگ در نواحی متمرکز ایجاد کند، به شرطی که مجموع مجذور تفاوت‌ها زیر بودجه تعیین‌شده باقی بماند. هنجار $L_2$ ریشه عمیقی در پردازش سیگنال سنتی و جبر خطی دارد و آن را به ابزاری آشنا برای مهندسانی تبدیل می‌کند که در حال گذار به یادگیری عمیق هستند.[3]

سال‌هاست که آموزش خصمانه — فرآیند پرهزینه محاسباتیِ حمله مداوم به یک مدل در طول فاز آموزش تا یاد بگیرد در برابر آن دستکاری‌های خاص مقاومت کند — به‌شدت به این هنجارهای $L_p$ متکی بوده است. مدلی که به‌طور گسترده در برابر حملات $L_\infty$ آموزش دیده باشد، در نهایت در برابر آن‌ها بسیار مقاوم می‌شود، الزامات ریاضیاتی برای صدور گواهینامه را برآورده می‌کند و به توسعه‌دهندگان اجازه می‌دهد ادعا کنند سیستم آن‌ها در برابر دستکاری‌های خصمانه نامحسوس امن است. این فرآیند شامل تولید بدترین نمونه‌ها در هر مرحله از آموزش و وادار کردن مدل به دسته‌بندی صحیح آن‌هاست، که عملاً مرزهای تصمیم‌گیری را که مهاجمان معمولاً از آن‌ها سوءاستفاده می‌کنند، هموار می‌سازد.[2]

با این حال، حجم فزاینده‌ای از پژوهش‌های تجربی نشان می‌دهد که این اتکا به راحتیِ ریاضیاتی، یک نقطه کور خطرناک و سیستماتیک در ایمنی هوش مصنوعی ایجاد کرده است. مسئله اصلی این است که هنجارهای $L_p$ در واقع با شباهت ادراکی انسان همخوانی ندارند. در حالی که این توابع ریاضیاتی در محدود کردن تفاوت‌های عددی مطلق بین دو ماتریس عالی عمل می‌کنند، اما در درک اینکه قشر بینایی انسان چگونه اشکال، لبه‌ها و معنای مفهومی را پردازش می‌کند، کاملاً ناکام هستند. یک اختلال بزرگ از نظر ریاضیاتی ممکن است برای انسان نامرئی باشد، در حالی که یک اختلال بسیار کوچک ریاضیاتی می‌تواند تصویر را کاملاً مبهم کند.[1][4]

با این حال، حجم فزاینده‌ای از پژوهش‌های تجربی نشان می‌دهد که این اتکا به راحتیِ ریاضیاتی، یک نقطه کور خطرناک و سیستماتیک در ایمنی هوش مصنوعی ایجاد کرده است.

پژوهشگران در یک بررسی انتقادی از مقاومت خصمانه خاطرنشان کردند: «فرض هنجار Lp در هسته فرمول‌بندی فعلی قرار دارد. با این حال، این فرض همیشه معتبر نیست.» یک تغییر فضایی ساده، مانند چرخاندن تصویر به اندازه دو درجه یا جابجایی آن به اندازه سه پیکسل به سمت چپ، یک فاصله عظیم $L_p$ ایجاد می‌کند زیرا مقدار عددی تقریباً تک‌تک پیکسل‌ها به‌طور همزمان تغییر می‌کند. با این وجود، یک ناظر انسانی به‌سختی متوجه این تفاوت می‌شود و شیء جابجاشده را بدون هیچ تردیدی به‌راحتی تشخیص می‌دهد. از آنجا که مدل‌ها برای مقاومت در برابر تغییرات کوچک $L_p$ آموزش دیده‌اند، اغلب در برابر این جابجایی‌های فضایی ساده به‌شدت آسیب‌پذیر باقی می‌مانند.[4]

برعکس، یک مهاجم می‌تواند تصویری را دستکاری کند تا باعث اختلال شدید در ادراک انسان شود، در حالی که یک اختلال هنجار $L_p$ بسیار کوچک را حفظ می‌کند. یک مطالعه در سال ۲۰۱۸ از دانشگاه کارنگی ملون این گسست را به‌وضوح نشان داد: وقتی تنها ۴ درصد از پیکسل‌ها در تصاویر استاندارد اعداد تغییر داده شدند تا به یک فاصله کوچک $L_0$ دست یابند، تشخیص انسانی به تنها ۳ درصد سقوط کرد. بودجه ریاضیاتی به‌شدت رعایت شده بود، اما معنای مفهومی تصویر برای ناظران انسانی کاملاً از بین رفته بود. این ثابت می‌کند که بهینه‌سازی برای یک هنجار ریاضیاتی تضمین نمی‌کند که تصویر حاصل از نظر ادراکی معتبر باقی بماند.[1]

پژوهشگران کارنگی ملون نتیجه گرفتند: «نزدیکی بین دو تصویر بر اساس یک هنجار Lp، برای اینکه آن تصاویر از نظر ادراکی مشابه باشند، نه شرط لازم است و نه کافی.» این گسست بنیادین بدان معناست که مدل‌هایی که به‌عنوان مقاومِ ریاضیاتی گواهی شده‌اند، اغلب در حال دفاع در برابر مدل تهدید کاملاً اشتباهی هستند. آن‌ها در برابر نوع بسیار خاصی از نویز عددی که انسان نمی‌تواند ببیند سخت شده‌اند، اما در برابر تغییرات ساختاری که انسان‌ها به‌راحتی نادیده می‌گیرند، شکننده باقی می‌مانند. در نتیجه، گواهینامه‌های ارائه‌شده توسط آموزش $L_\infty$ امنیت عملی اندکی در محیط‌های پویا و واقعی ارائه می‌دهند.[1]

این آسیب‌پذیری زمانی به‌طور آشکار نمایان می‌شود که مدل‌های آموزش‌دیده برای مقاومت در برابر یک نوع هنجار خاص، در معرض هنجار دیگری قرار گیرند. یک شبکه عصبی که در برابر اختلالات $L_\infty$ سخت شده است، اغلب در برابر حملات $L_0$ یا $L_2$ به‌طور فاجعه‌باری آسیب‌پذیر باقی می‌مانند. از آنجا که دفاع برای یک محدودیت ریاضیاتی خاص بیش از حد بهینه‌سازی شده است، در را برای مهاجمانی که به‌سادگی معیار متفاوتی را برای اندازه‌گیری بودجه اختلال خود انتخاب می‌کنند، کاملاً باز می‌گذارد. این امر یک پویایی موش‌وگربه‌وار ایجاد می‌کند که در آن ایمن‌سازی یک بردار، ذاتاً بردار دیگری را تضعیف می‌کند.[2]

مدل‌هایی که برای مقاومت در برابر یک هنجار ریاضیاتی خاص آموزش دیده‌اند، اغلب در برابر سایر هنجارها به‌شدت آسیب‌پذیر باقی می‌مانند.

در سال ۲۰۲۰، پژوهشگرانی که در Proceedings of Machine Learning Research مقاله منتشر کردند، دقیقاً همین حالت شکست را برجسته ساختند و نشان دادند که مقاومت خصمانه در برابر یک مدل تهدید خاص $L_p$ معمولاً به سایر هنجارها منتقل نمی‌شود. مهاجمی که می‌داند یک سیستم اختصاصی به‌شدت در برابر نویز $L_\infty$ دفاع می‌شود، می‌تواند به‌سادگی الگوریتم بهینه‌سازی خود را برای تولید یک حمله $L_2$ تغییر دهد، دفاع‌های گران‌قیمت را کاملاً دور بزند و مدل را با کمترین تلاش وادار به دسته‌بندی اشتباه کند. این فقدان انتقال‌پذیری همچنان یکی از مهم‌ترین موانع در استقرار سیستم‌های امن یادگیری ماشین است.[2]

برای رفع این نقص حیاتی، این حوزه به‌آرامی در حال حرکت به سمت دفاع‌های چند-هنجاری است. پیشنهادهای معماری اخیر تلاش می‌کنند مدل‌ها را در برابر ترکیبی از چندین مدل اختلال آموزش دهند و شبکه را مجبور کنند ویژگی‌های مقاوم و تعمیم‌یافته‌ای را بیاموزد که بتوانند به‌طور همزمان از حملات $L_0$، $L_2$ و $L_\infty$ جان سالم به در ببرند. با قرار دادن مدل در معرض تنوع گسترده‌تری از محدودیت‌های ریاضیاتی در طول فاز آموزش، پژوهشگران امیدوارند شکاف‌های به‌جامانده از بهینه‌سازی تک-هنجاری را پر کنند. با این حال، این رویکرد هزینه محاسباتی آموزش را به‌طور تصاعدی افزایش می‌دهد و نیازمند خوشه‌های عظیمی از پردازنده‌های گرافیکی برای تولید و دفاع همزمان در برابر چندین بردار حمله است.[2][6]

در سال ۲۰۲۴، تیم‌های پژوهشی دفاع‌های خصمانه عمیقی را پیشنهاد دادند که به‌طور خاص در برابر حملات چندسطحی $L_p$ طراحی شده بودند و اذعان داشتند که دشمنان در دنیای واقعی خود را به یک محدودیت ریاضیاتی واحد محدود نمی‌کنند. همزمان، تیم‌های دیگر حملات اختلال چندگانه‌ای را توسعه داده‌اند که پیکسل‌های مختلف را تحت هنجارهای مختلف $L_p$ به‌طور همزمان بهینه می‌کنند و نمونه‌های خصمانه بسیار تهاجمی ایجاد می‌کنند که به‌راحتی دفاع‌های استاندارد و تک-هنجاری را در هم می‌شکنند. مسابقه تسلیحاتی بین مهاجمان و مدافعان چند-هنجاری به‌سرعت در حال شتاب گرفتن است و مرزهای آنچه را که سخت‌افزارهای فعلی می‌توانند در طول فاز آموزش شبیه‌سازی کنند، جابجا می‌کند.[6][8]

با حرکت صنعت به سمت سیستم‌های پیچیده چندوجهی، خطرات این بحث ریاضیاتی به‌طور تصاعدی در حال افزایش است. مدل‌های بینایی-زبانی که متن و تصاویر با وضوح بالا را به‌طور همزمان پردازش می‌کنند، در سال ۲۰۲۶ با سرعت فزاینده‌ای در حال استقرار هستند و راه خود را به جریان‌های کاری سازمانی و برنامه‌های کاربردی مصرف‌کنندگان باز می‌کنند. این معماری‌های گسترده، سطوح حمله کاملاً جدید و بسیار پیچیده‌ای را معرفی می‌کنند که بودجه‌های تک-هنجاری هرگز برای محافظت از آن‌ها طراحی نشده بودند. از آنجا که آن‌ها دو وجه متمایز را به هم پیوند می‌دهند، یک اختلال خصمانه در ورودی بصری می‌تواند مدل را وادار به تولید متن مخرب یا توهمی کند.[10]

آموزش مدل‌ها در برابر چندین هنجار اختلال به‌طور همزمان، نیازمند منابع محاسباتی عظیمی است.

یک مطالعه در سال ۲۰۲۴ روی مدل‌های پیش‌آموزش‌دیده بینایی-زبانی، شکنندگی این سیستم‌های جدید را آشکار کرد. پژوهشگران نشان دادند که یک اختلال خصمانه سراسری واحد — که با دقت در یک بودجه سخت‌گیرانه $L_p$ ساخته شده است — می‌تواند توانایی مدل را برای همسو کردن تصاویر با توضیحات متنی صحیح آن‌ها در طیف گسترده‌ای از وظایف پایین‌دستی با موفقیت به خطر بیندازد. یک الگوی نویز واحد و محدودشده از نظر ریاضیاتی، برای شکستن پل معنایی بین بینایی و زبان کافی بود و ثابت کرد که مشکل بودجه اختلال همگام با اندازه مدل مقیاس‌پذیر می‌شود.[7]

با ادغام عمیق‌تر سیستم‌های هوش مصنوعی در زیرساخت‌های حیاتی، تعریف بنیادین بودجه اختلال باید تکامل یابد. اتکای صرف به راحتی ریاضیاتی هنجار $L_\infty$ دیگر برای تضمین ایمنی در محیط‌هایی که جان انسان‌ها یا داده‌های حساس در خطر است، کافی نیست. صنعت باید از معیارهایی که محاسبه آن‌ها آسان است فراتر رود و معیارهایی را بپذیرد که واقعاً منعکس‌کننده واقعیت هستند، حتی اگر بهینه‌سازی آن‌ها از نظر محاسباتی ناامیدکننده باشد.[4][5]

نسل بعدی مقاومت خصمانه نیازمند بودجه‌های اختلالِ آگاه از آسیب‌پذیری خواهد بود که به‌جای اعمال یک محدودیت ریاضیاتی کلی در سراسر هر پیکسل، به‌طور پویا با ویژگی‌های معنایی خاص یک تصویر سازگار شوند. تا زمانی که معیارهای مورد استفاده برای آموزش سیستم‌های هوش مصنوعی به‌طور دقیق ظرافت‌های پیچیده بینایی انسان را منعکس نکنند، شکاف بین مقاومت گواهی‌شده ریاضیاتی و امنیت در دنیای واقعی به‌طور خطرناکی باز خواهد ماند. آینده ایمنی هوش مصنوعی به آموزش الگوریتم‌هایی بستگی دارد که نه تنها پیکسل‌ها را بشمارند، بلکه واقعاً آن‌ها را ببینند.[5][9]

نکات کلیدی

  • بودجه‌های اختلال خصمانه، حد و مرز ریاضیاتی میزان تغییرات مجاز یک تصویر برای فریب دادن هوش مصنوعی را تعیین می‌کنند.
  • جامعه ایمنی هوش مصنوعی به‌شدت به هنجار $L_\infty$ متکی است، زیرا برای بهینه‌سازی مقاوم از نظر ریاضیاتی مناسب و راحت است.
  • پژوهش‌ها نشان می‌دهند که هنجارهای $L_p$ با ادراک بصری انسان همخوانی ندارند و یک احساس امنیت کاذب ایجاد می‌کنند.
  • مدل‌هایی که برای مقاومت در برابر یک هنجار ریاضیاتی خاص آموزش دیده‌اند، اغلب در برابر حملاتی که از هنجار متفاوتی استفاده می‌کنند، به‌شدت آسیب‌پذیر باقی می‌مانند.
  • صنعت در حال حرکت به سمت دفاع‌های چند-هنجاری است، هرچند آموزش آن‌ها به قدرت محاسباتی بسیار بیشتری نیاز دارد.

اصطلاحات کلیدی

بودجه اختلال
حد و مرز دقیق ریاضیاتی در مورد اینکه یک مهاجم تا چه حد مجاز است یک ورودی را تغییر دهد پیش از آنکه حمله نامعتبر تلقی شود.
هنجار $L_p$
خانواده‌ای از توابع ریاضیاتی که برای اندازه‌گیری فاصله یا تفاوت بین یک تصویر اصلی و نسخه دستکاری‌شده آن استفاده می‌شوند.
هنجار $L_0$
معیاری که تعداد کل پیکسل‌های تغییریافته را می‌شمارد، فارغ از اینکه بزرگی این تغییر چقدر باشد.
هنجار $L_2$
معیاری که فاصله اقلیدسی یا انرژی کلی اختلال را در سراسر تصویر محاسبه می‌کند.
آموزش خصمانه
یک تکنیک دفاعی که در آن یک مدل در طول فاز آموزش به‌طور مداوم مورد حمله قرار می‌گیرد تا یاد بگیرد دستکاری‌های خاص را تشخیص داده و در برابر آن‌ها مقاومت کند.

پرسش‌های متداول

نمونه خصمانه چیست؟

نمونه خصمانه ورودی‌ای مانند یک تصویر است که عمداً با نویز ظریف و اغلب نامرئی تغییر یافته است تا باعث شود یک مدل یادگیری ماشین دچار اشتباه شود.

هنجار $L_\infty$ چه چیزی را اندازه‌گیری می‌کند؟

هنجار $L_\infty$ حداکثر میزان تغییر اعمال‌شده روی هر پیکسل منفرد در یک تصویر را اندازه‌گیری می‌کند و تضمین می‌کند که هیچ بخشی از تصویر فراتر از یک حد سخت‌گیرانه تغییر نکرده است.

چرا پژوهشگران از هنجار $L_\infty$ استفاده می‌کنند؟

این هنجار برای آموزش مدل‌های مقاوم از نظر ریاضیاتی راحت است و به پژوهشگران اجازه می‌دهد تضمین‌های دقیق ریاضیاتی محاسبه کنند که یک مدل در برابر هر حمله‌ای در آن بودجه خاص مقاومت خواهد کرد.

چرا هنجار $L_\infty$ ناقص در نظر گرفته می‌شود؟

زیرا با ادراک انسان همخوانی ندارد. یک تغییر بزرگ از نظر ریاضیاتی، مانند جابجایی یک تصویر به اندازه دو پیکسل، به‌راحتی توسط انسان نادیده گرفته می‌شود اما دفاع‌های $L_\infty$ را می‌شکند، در حالی که یک تغییر کوچک ریاضیاتی می‌تواند معنای تصویر را از بین ببرد.

منابع

پوشش منابع

11 منبع

3 دیدگاه شناسایی‌شده

منتقدان همخوانی ادراکی 35%پژوهشگران حملات چند-هنجاری 35%حامیان مقاومت ریاضیاتی 30%
  1. [1]arXivحامیان مقاومت ریاضیاتی

    On the Suitability of $L_p$-norms for Creating and Preventing Adversarial Examples

    مطالعه در arXiv →
  2. [2]Proceedings of Machine Learning Researchپژوهشگران حملات چند-هنجاری

    Adversarial Robustness Against the Union of Multiple Perturbation Models

    مطالعه در Proceedings of Machine Learning Research →
  3. [3]Towards Data Scienceحامیان مقاومت ریاضیاتی

    A Practical Guide To Adversarial Robustness

    مطالعه در Towards Data Science →
  4. [4]Mediumمنتقدان همخوانی ادراکی

    Is current research on adversarial robustness addressing the right problem?

    مطالعه در Medium →
  5. [5]arXivحامیان مقاومت ریاضیاتی

    $L_p$-norm Distortion-Efficient Adversarial Attack

    مطالعه در arXiv →
  6. [6]arXivحامیان مقاومت ریاضیاتی

    Deep Adversarial Defense Against Multilevel-Lp Attacks

    مطالعه در arXiv →
  7. [7]arXivحامیان مقاومت ریاضیاتی

    One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models

    مطالعه در arXiv →
  8. [8]arXivحامیان مقاومت ریاضیاتی

    Multiple Perturbation Attack: Attack Pixelwise Under Different $\ell_p$-norms For Better Adversarial Performance

    مطالعه در arXiv →
  9. [9]arXivحامیان مقاومت ریاضیاتی

    Constrained Adversarial Perturbation

    مطالعه در arXiv →
  10. [10]Hugging Face Blog

    Accelerating vision-language models with LFM2.5-VL-DSpark

    مطالعه در Hugging Face Blog →
  11. [11]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.