رفتن به محتوای اصلی
کوهستان
بررسی عمیق کوهستانیادگیری ماشین خصمانهامنیت هوش مصنوعی· 13 دقیقه مطالعه· در هوش مصنوعی

چگونه گذار به هوش مصنوعی زاینده سطح حملات خصمانه در یادگیری ماشین را وارونه کرد

طبقه‌بندی جامع مؤسسه ملی استاندارد و فناوری آمریکا (NIST) نشان می‌دهد که برخلاف مدل‌های سنتی هوش مصنوعی پیش‌بین که آسیب‌پذیری آن‌ها عمدتاً در مرحله آموزش متمرکز است، مدل‌های زاینده سطح حمله کاملاً متفاوتی را در مرحله استقرار و بهره‌برداری آشکار می‌کنند. دفاع در برابر این حملات مستلزم مدیریت یک مصالحه ریاضی ناگزیر میان تاب‌آوری خصمانه و دقت پایه مدل است.

به قلم الوین شادمهر

اعداد کلیدی

11
دسته‌های حمله به هوش مصنوعی پیش‌بین
10
دسته‌های حمله به هوش مصنوعی زاینده
< 1,000
تعداد پرس‌وجوهای لازم برای فرار در مدل جعبه‌سیاه
80,000
تلاش‌های ثبت‌شده برای فریب سامانه ID.me در سال ۲۰۲۰

امنیت نرم‌افزار به شیوه سنتی بر اصلاح نقص‌های قطعی در کد متکی است؛ درست شبیه به تعمیر قفل شکسته یک در. در مقابل، یادگیری ماشین خصمانه ماهیتی کاملاً متفاوت دارد: این حوزه از بنیادهای آماری شیوه یادگیری مدل‌ها بهره‌برداری می‌کند و بدون تغییر دادن حتی یک خط کد، همان سازوکار بهینه‌سازی ریاضی سیستم را علیه خودش به کار می‌گیرد.[2]

مؤسسه ملی استاندارد و فناوری آمریکا (NIST) در مارس ۲۰۲۵ با انتشار سندی با شناسه «NIST AI 100-2e2025» ساختار این عرصه را صورتبندی کرد. این گزارش جامع که تحت عنوان «یادگیری ماشین خصمانه: آرایه‌شناسی و واژگان حملات و روش‌های کاهش ریسک» تدوین شده، آسیب‌پذیری‌های ذاتی سیستم‌های مدرن هوش مصنوعی را ترسیم کرده است.[1]

نویسندگان گزارش نایست می‌نویسند: «ماهیت آماری و مبتنی بر داده سیستم‌های یادگیری ماشین، بردارهای تهاجمی جدیدی را فراتر از تهدیدهای پیش‌روی سیستم‌های نرم‌افزاری سنتی، علیه امنیت، حریم خصوصی و ایمنی این سامانه‌ها می‌گشاید.» این گزارش جامع، تهدیدهای یادشده را در هر دو پارادایم پیش‌بین و زاینده دسته‌بندی می‌کند.[1]

برخلاف رمزنگاری نوین که به الگوریتم‌هایی با امنیت اثبات‌پذیر از منظر نظریه اطلاعات متکی است، یادگیری ماشین از هرگونه برهان ریاضی امنیت بی‌بهره است. الگوریتم‌هایی که امروز موتور محرک هوش مصنوعی هستند، کاملاً تجربی‌اند و نه به دلیل برخورداری از تاب‌آوری تضمین‌شده، بلکه صرفاً به این دلیل به کار گرفته شده‌اند که روی مجموعه‌داده‌های اعتبارسنجی به دقت بالایی دست یافته‌اند.[1]

فقدان چنین تضامین ریاضی به این معناست که دفاع از سیستم‌های هوش مصنوعی، یک مسابقه تسلیحاتی تماماً تجربی است. همان‌طور که نایست اشاره می‌کند، بسیاری از سازوکارهای دفاعی صرفاً به این دلیل پیاده‌سازی می‌شوند که در عمل کارآمد به نظر می‌رسند؛ رویکردی که سیستم‌ها را در برابر نوآوری‌ها و تکامل شگردهای مهاجمان آسیب‌پذیر باقی می‌گذارد.[1]

تعریف اهداف حملات خصمانه

آرایه‌شناسی نایست حملات یادگیری ماشین خصمانه را در قالب سه هدف بنیادین تفکیک می‌کند: اختلال در دسترسی‌پذیری، نقض یکپارچگی، و به خطر افتادن حریم خصوصی. هر یک از این اهداف، ویژگی عملیاتی خاصی از سیستم یادگیری ماشین را نشانه می‌گیرد؛ از پایداری عملکردی پایه تا حفاظت از داده‌های حساس آموزشی.[1]

آرایه‌شناسی نایست حملات خصمانه را در قالب سه هدف عملیاتی کلیدی دسته‌بندی می‌کند.

هدف از اختلال در دسترسی‌پذیری، تنزل بی‌رویه و فراگیر عملکرد مدل است تا در عمل امکان استفاده از آن سلب شود. در این سناریوها، خروجی خاصی مد نظر مهاجم نیست؛ بلکه هدف صرفاً غیرقابل‌اعتماد کردن کامل سیستم و تولید نرخ خطای بسیار بالا برای کاربران مجاز است.[1]

نقض یکپارچگی حمله‌ای با دقت بالا است که مدل را وادار می‌کند برخلاف اهداف از پیش‌تعیین‌شده‌اش عمل کرده و پیش‌بینی‌هایی همسو با خواست مهاجم ارائه دهد. برای مثال، مهاجم ممکن است سیستم بینایی ماشین یک خودروی خودران را به‌گونه‌ای دستکاری کند که تابلوی «ایست» را به عنوان تابلوی «حداکثر سرعت مجاز» طبقه‌بندی کند و سبب بروز حادثه شود.[1]

رخنه در حریم خصوصی به نشت ناخواسته اطلاعات محرمانه از سیستم منجر می‌شود. پژوهشگران نایست توضیح می‌دهند: «در حملات حریم خصوصی، مهاجمان ممکن است در پی کسب اطلاعاتی درباره داده‌های آموزشی یا ساختار درونی خود مدل یادگیری ماشین باشند»؛ موضوعی که دارایی‌های انحصاری سازمانی و سوابق هویتی و پزشکی افراد را در معرض تهدیدی جدی قرار می‌دهد.[1]

مهاجمان برای تحقق این اهداف، قابلیت‌های مشخصی را در سراسر چرخه حیات یادگیری ماشین فعال می‌کنند. چارچوب نایست شش سطح دسترسی و قابلیت اصلی را شناسایی کرده است؛ از کنترل مستقیم بر داده‌های آموزشی و پارامترهای مدل گرفته تا دسترسی صرف به ارسال پرس‌وجو در مرحله استقرار نهایی.[1]

سطح حمله در هوش مصنوعی پیش‌بین

هوش مصنوعی پیش‌بین، که عمدتاً شامل مدل‌های دسته‌بندی و رگرسیون است، از دیرباز شالوده کاربردهای صنعتی را تشکیل داده است. آرایه‌شناسی نایست ۱۱ زیرمجموعه حمله مجزا را علیه سیستم‌های پیش‌بین برمی‌شمارد که بخش اعظم آن‌ها در مرحله آموزش—جایی که مدل مرزهای تصمیم‌گیری ریاضی خود را ترسیم می‌کند—متمرکز شده‌اند.[1][2]

حملات فرار یا گریز، بارزترین تهدید علیه مدل‌های پیش‌بینِ مستقر به شمار می‌روند. در حمله فرار، مهاجم «نمونه‌های خصمانه» تولید می‌کند؛ داده‌هایی که با تغییرات بسیار جزئی دستکاری شده‌اند تا مدل فریب بخورد و دسته‌بندی را به طبقه‌ای نامربوط که خواست مهاجم است تغییر دهد.[1]

گذار به مدل‌های زاینده، کانون تمرکز سطح حملات خصمانه را از مرحله آموزش به مرحله استقرار منتقل کرده است.

پیشینه حملات فرار به دهه‌ها پیش بازمی‌گردد؛ نمونه‌های نخستین آن به سال ۱۹۸۸ و پژوهش‌های کرنز و لی مربوط می‌شود، و سپس در سال ۲۰۰۴ پژوهشگران نشان دادند که می‌توان با تولید ورودی‌های خصمانه، دسته‌بندی‌کننده‌های خطی فیلترهای اولیه هرزنامه را به سادگی دور زد.[1]

این تهدید در سال ۲۰۱۳ پس از کشف غیرمنتظره محققان اوج گرفت؛ آن‌ها دریافتند که شبکه‌های عصبی عمیق مورد استفاده در طبقه‌بندی تصاویر به سادگی دستکاری‌پذیرند. مهاجمان با بهره‌گیری از بهینه‌سازی مبتنی بر گرادیان توانستند نمونه‌های خصمانه‌ای بسازند که در چشم انسان کاملاً طبیعی به نظر می‌رسیدند اما هوش مصنوعی را یکسره فریب می‌دادند.[1]

این اغتشاش‌های ریاضی به‌گونه‌ای طراحی و بهینه‌سازی می‌شوند که توسط بینایی انسان قابل تشخیص نباشند. چشم انسان تصویر یک گربه را به‌درستی تشخیص می‌دهد، اما مدل یادگیری ماشین با پردازش مقادیر پیکسل‌هایی که در حد جزئی تغییر یافته‌اند، همان تصویر را با قاطعیت یک رایانه رومیزی دسته‌بندی می‌کند.[1]

فرار در جهان واقعی

حملات فرار سامانه‌های جهان واقعی را فراتر از محیط‌های آزمایشگاهی هدف گرفته‌اند. در نیمه دوم سال ۲۰۲۰، سرویس احراز هویت چهره ID.me بیش از ۸۰ هزار تلاش برای فریب گام‌های تایید هویت کاربران در سازمان‌های اشتغال چند ایالت آمریکا را ثبت کرد.[1]

هدف از این حملات، سوءاستفاده مالی و دریافت متقلبانه مستمری‌های بیکاری دوران همه‌گیری بود. بعداً در سال ۲۰۲۲، دادستان‌های فدرال فردی را متهم کردند که توانسته بود گواهینامه‌های رانندگی جعلی را از طریق گریم‌های فیزیکی مختلف در سامانه ID.me تایید کند و ۲.۵ میلیون دلار کلاهبرداری انجام دهد.[1]

زیرساخت‌های امنیت سایبری نیز به همین اندازه آسیب‌پذیرند. پژوهشگرانی که یک سامانه تجاری شناسایی صفحات فیشینگ را بررسی می‌کردند دریافتند که از میان ۴۶۰۰ نمونه‌ای که سیستم درباره آن‌ها ابراز تردید کرده بود، ۱۰۰ مورد نمونه‌های خصمانه تعمدی بودند که مهاجمان صرفاً با برش و پوشاندن بخش‌هایی از تصویر، فیلترهای امنیتی را دور زده بودند.[1]

حملات فرار جعبه‌سیاه بدون نیاز به دانستن ساختار درونی مدل و صرفاً با واکاوی پاسخ‌های دریافتی به پرس‌وجوها شکل می‌گیرند.

حملات فرار جعبه‌سیاه نمایانگر یک مدل تهدید بسیار محتمل و واقعی هستند که در آن مهاجم هیچ شناختی از معماری درونی مدل ندارد. در این سناریو، مهاجم با ارسال مکرر پرس‌وجو به مدل و بررسی امتیازهای اطمینان یا برچسب‌های خروجی، ورودی خصمانه را گام‌به‌گام و تکرارشونده صیقل می‌دهد.[1]

نویسندگان گزارش نایست متذکر می‌شوند: «چالش اساسی در ساخت نمونه‌های خصمانه در شرایط جعبه‌سیاه، کاهش تعداد پرس‌وجوهای لازم از مدل است.» با این حال، تکنیک‌های بهینه‌سازی نوین می‌توانند با کمتر از ۱۰۰۰ پرس‌وجو، طبقه‌بندی‌کننده‌های تجاری را فریب دهند و همین امر حمله به رابط‌های ابری تجاری (API) را بسیار مقرون‌به‌صرفه کرده است.[1]

تهدید مسموم‌سازی در مرحله آموزش

در حالی که حملات فرار مرحله استقرار را هدف می‌گیرند، حملات مسموم‌سازی مدل را در نخستین گام‌های آموزش آلوده می‌کنند. در مسموم‌سازی داده، مهاجم بخشی از داده‌های آموزشی را با افزودن یا دستکاری نمونه‌ها پیش از پردازش توسط الگوریتم آلوده می‌سازد و مسیر یادگیری را بنیاداً منحرف می‌کند.[1]

نخستین حمله مسموم‌سازی شناخته‌شده در سال ۲۰۰۶ علیه یک سیستم تولید امضای بدافزارها رخ داد. از آن زمان تاکنون، محققان نشان داده‌اند که مهاجمی با منابع مالی محدود می‌تواند بخش ناچیزی از مجموعه‌داده‌های عمومی مورد نیاز آموزش را کنترل کرده و مسموم‌سازی را در مقیاس وسیع اینترنت پیاده کند.[1]

حملات مسموم‌سازی درپشتی (Backdoor) به شکل استثنایی مخفیانه‌اند؛ آن‌ها مدل را وادار می‌کنند که تنها در مواجهه با ورودی‌های حاوی یک نشانگر یا «تریگر» خاص دچار اشتباه محاسباتی شود. این شیوه که نخستین بار در سال ۲۰۱۷ با چارچوب BadNets معرفی شد، با افزودن یک پچ پیکسلی کوچک به تصاویر آموزشی، به مدل یاد می‌دهد که الگوی مذکور را به طبقه‌ای دلخواه ربط دهد.[1]

گزارش نایست تصریح می‌کند: «دسته‌بندی‌کننده یاد می‌گیرد تریگر را به طبقه هدف مرتبط کند و در نتیجه هر تصویری که این تریگر را داشته باشد اشتباه دسته‌بندی می‌شود.» در جریان استفاده روزمره، عملکرد مدل کاملاً بی‌نقص است تا زمانی که همان تریگر پنهان به آن ارائه شود.[1]

تصویرگری: مدل‌های هوش مصنوعی زاینده اصولاً از طریق درگاه ورودی پرامپت‌های زبان طبیعی مورد نفوذ قرار می‌گیرند.

این تریگرها لزوماً مصنوعات دیجیتالی نیستند. پژوهشگران موفق شده‌اند سامانه‌های تشخیص چهره را با استفاده از اشیای فیزیکی نظیر عینک‌های آفتابی ویژه یا گوشواره مسموم کنند؛ هنگامی که کاربر از این عینک یا گوشواره استفاده می‌کند، مدل آسیب‌دیده به وی دسترسی غیرمجاز اعطا می‌کند.[1]

تغییر پارادایم با هوش مصنوعی زاینده

فراگیری ناگهانی هوش مصنوعی زاینده، به‌ویژه مدل‌های زبانی بزرگ، چشم‌انداز امنیت خصمانه را دگرگون کرده است. آرایه‌شناسی نایست ۱۰ طبقه حمله متمایز را برای سیستم‌های زاینده فهرست می‌کند که از جابه‌جایی کامل کانون تهدید از فاز آموزش به مرحله استقرار حکایت دارد.[1][2]

از آنجا که مدل‌های زبانی بزرگ روی مجموعه‌داده‌های بی‌نهایت حجیم و توسط شمار اندکی از ابرسازمان‌ها پیش‌آموزش می‌بینند، اغلب مهاجمان دسترسی لازم برای مسموم کردن مرحله آموزش را ندارند. در عوض، آن‌ها حملات خود را متوجه اصلی‌ترین درگاه تعامل با سیستم یعنی اعلان‌ها و پرامپت‌های متنی زبان طبیعی کرده‌اند.[2]

حملات تزریق پرامپت مستقیم در پی باطل کردن دستورالعمل‌های مبنا و حفاظ‌های ایمنی مدل هستند. مهاجم با تدوین ورودی‌های زبانی خاص، ربات گفتگوگر را وادار می‌کند آموزش‌های هم‌ترازی خود را نادیده گرفته و محتوای خطرناک، مغرضانه یا ممنوعه‌ای را که صراحتاً از ارائه آن منع شده تولید کند.[1]

طبیعت گسسته واژگان، مهار این حملات را دشوارتر می‌سازد. گزارش نایست در تحلیل یک حمله مبتنی بر هنر اسکی (ASCII-art) توضیح می‌دهد: «فاصله معنایی میان دو پرامپت عملاً صفر است و باید با هر دو یکسان برخورد می‌شد»، اما مدل آن‌ها را کاملاً متفاوت تفسیر و اجرا کرده است.[1]

با اتصال هوش مصنوعی زاینده به زیرساخت‌ها و نرم‌افزارهای پیرامونی، حملات تزریق پرامپت غیرمستقیم به تهدیدی به مراتب سهمگین‌تر بدل می‌شوند. در این حملات، فرامین مخرب درون منابع داده خارجی نظیر صفحات وب یا اسناد پنهان می‌شوند؛ داده‌هایی که مدل در خلال عملکرد عادی خود آن‌ها را بازخوانی و پردازش می‌کند.[1]

تزریق پرامپت غیرمستقیم از سازوکار مدل برای فراخوانی و تحلیل داده‌های خارجی سوءاستفاده می‌کند.

خطرات حریم خصوصی و استخراج اطلاعات

مدل‌های زاینده در برابر نقض حریم خصوصی، به‌ویژه «استخراج داده‌های آموزشی»، بسیار آسیب‌پذیرند. از آنجا که این مدل‌ها الگوهای آماری را از توده‌های عظیم داده حفظ می‌کنند، مهاجمان می‌توانند با ارسال پرس‌وجوهای مهندسی‌شده، مدل را وادار به بازگو کردن کلمه‌به‌کلمه اطلاعات محرمانه شخصی یا کدهای اختصاصی کنند.[1]

حملات استنتاج عضویت به مهاجم امکان می‌دهند متوجه شود آیا داده یا سندی مشخص در آموزش مدل به کار رفته است یا خیر. با تحلیل توزیع احتمالات و امتیازهای اطمینان خروجی، مهاجم می‌تواند حضور نام یا پرونده فردی خاص را در مجموعه‌ای محرمانه نظیر یک پرونده بیمارستانی فاش سازد.[1]

حملات استخراج مدل، مالکیت معنوی توسعه‌دهندگان را هدف قرار می‌دهند. یک مهاجم می‌تواند با ارسال سازمان‌یافته پرس‌وجوها به یک مدل تجاری و ذخیره خروجی‌ها، یک مدل جایگزین را با کسری بسیار ناچیز از هزینه اولیه تحقیق و توسعه، مشابه با مدل اصلی بازتولید کند.[1]

بهره‌گیری از معماری «تولید مبتنی بر بازیابی» (RAG) مجراهای حریم خصوصی نوینی ایجاد می‌کند. هنگامی که به یک مدل زبانی بزرگ برای پاسخ‌گویی به کارکنان، دسترسی به پایگاه‌داده شرکتی داده می‌شود، یک حمله تزریق پرامپت می‌تواند مدل را فریب دهد تا اسناد حساس داخلی را به یک سرور خارجی بفرستد.[1]

نویسندگان گزارش نایست هشدار می‌دهند: «آسیب‌پذیری‌های سیستم‌های هوش مصنوعی زاینده ممکن است سطح حمله گسترده‌ای در زمینه حریم خصوصی داده‌های کاربران یا اطلاعات مالکیتی معماری مدل‌ها ایجاد کند»؛ هشداری که با تجهیز این سیستم‌ها به قابلیت کنشگری خودکار دوچندان می‌شود.[1]

محدودیت‌های دفاع‌های کنونی

دفاع در برابر یادگیری ماشین خصمانه همچنان چالشی حل‌نشده باقی مانده است. گزارش نایست چندین راهبرد دفاعی از جمله آموزش خصمانه، هموارسازی تصادفی، و اعتبارسنجی صوری را بررسی می‌کند، اما هم‌زمان تأکید دارد که تک‌تک این روش‌ها با تنگناهای نظری و عملی روبه‌رو هستند.[1]

نتایج قضایای ناممکن‌بودن ریاضی ثابت می‌کنند که بهینه‌سازی تاب‌آوری خصمانه عموماً به افت دقت پایه مدل می‌انجامد.

آموزش خصمانه مستلزم تولید مکرر نمونه‌های دستکاری‌شده و گنجاندن مجدد آن‌ها با برچسب‌های صحیح در فرآیند یادگیری است. هرچند این شیوه مدل را در برابر الگوهای شناخته‌شده مقاوم‌تر می‌کند، اما از نظر محاسباتی بسیار سنگین است و اغلب در برابر روش‌های دستکاری بدیع و پیش‌بینی‌نشده ناکام می‌ماند.[1]

هموارسازی تصادفی، یک طبقه‌بندی‌کننده معمولی را از طریق ارزیابی پیش‌بینی‌های آن تحت نویز گاوسی، به مدلی با تاب‌آوری قابل‌اثبات تبدیل می‌کند. این رویکرد اگرچه تضامینی ریاضی در برابر دسته‌ای از حملات فرار می‌دهد، اما معمولاً از دقت مدل روی داده‌های طبیعی و دست‌نخورده می‌کاهد.[1]

اعتبارسنجی صوری با استدلال‌های منطق ریاضی تلاش می‌کند اثبات کند یک شبکه عصبی تحت شروط مشخص رفتاری صحیح خواهد داشت. با این حال به تعبیر نایست، این فنون «به دلیل مقیاس‌ناپذیری، بار محاسباتی سرسام‌آور، و محدودیت در پشتیبانی از انواع عملیات جبری با موانع جدی روبه‌رو هستند.»[1]

در مقابله با حملات مسموم‌سازی، مدافعان به پاک‌سازی داده‌های آموزشی متوسل می‌شوند. این روش‌ها پیش از آغاز یادگیری، داده‌ها را پالایش کرده و نمونه‌های پرت را حذف می‌کنند؛ با این حال، حملات مسموم‌سازی تمیزبرچسب به‌گونه‌ای طراحی می‌شوند که کاملاً از دید این فیلترهای آماری پنهان بمانند.[1]

موازنه میان تاب‌آوری و دقت

بنیادی‌ترین بن‌بست در یادگیری ماشین خصمانه، مصالحه ذاتی میان تاب‌آوری و دقت است. قضایای ناممکن‌بودن ریاضی نشان داده‌اند که بهینه‌سازی یک مدل برای ایستادگی در برابر دستکاری خصمانه، تقریباً همواره عملکرد آن را در سناریوهای عادی و سالم تضعیف می‌کند.[1]

این موازنه ناگزیر، سازمان‌ها را وادار به اتخاذ تصمیم‌های دشوار در زمینه مدیریت ریسک می‌کند. مدلی که در برابر نویز خصمانه تاب‌آور است، اگر با افت دقت پایه از ۹۹ درصد به ۸۵ درصد مواجه شود، شاید دیگر برای کاربردهای تجاری، اداری یا تشخیصی پزشکی توجیه‌پذیر نباشد.[1]

یک مدل پایه آلوده می‌تواند هزاران سامانه شرکتی پایین‌دستی را در سراسر زنجیره تأمین نرم‌افزار به خطر بیندازد.

ابعاد غول‌پیکر سامانه‌های هوش مصنوعی امروزی این محدودیت‌ها را تشدید می‌کند. مدل‌های زبانی صدها میلیارد پارامتر دارند و روی تریلیون‌ها توکن آموزش می‌بینند؛ موضوعی که پاک‌سازی دقیق داده‌ها یا اثبات صوری را در چارچوب توان سخت‌افزارهای فعلی ناممکن می‌سازد.[1]

افزون بر این، حرکت به سمت مدل‌های چندوجهی—که هم‌زمان متن، تصویر و صدا را پردازش می‌کنند—آسیب‌پذیری‌های پیچیده‌تری پدید می‌آورد. با آنکه فرضیاتی مبنی بر افزایش تاب‌آوری در مدل‌های چندوجهی وجود دارد، شواهد دیگری نشان می‌دهند که هماهنگی حملات در چند بستر داده به طور هم‌زمان می‌تواند سد دفاعی آن‌ها را در هم بشکند.[1]

گزارش نایست نتیجه می‌گیرد: «هیچ برهان امنیتی مبتنی بر نظریه اطلاعات برای الگوریتم‌های پرکاربرد یادگیری ماشین مدرن وجود ندارد.» تا زمان دستیابی به چنین شواهدی، ایمن‌سازی هوش مصنوعی مستلزم رویکرد دفاع چندلایه است؛ رویکردی که پیش‌فرض خود را بر رخنه قطعی به هسته مدل‌ها بنا می‌نهد.[1]

تأمین امنیت زنجیره تأمین هوش مصنوعی

تمرکز ساخت مدل‌ها در دست چند شرکت انگشت‌شمار، امنیت هوش مصنوعی را به معضل زنجیره تأمین بدل کرده است. از آنجا که توسعه مدل‌های مرزی نیازمند سرمایه مالی و پردازشی عظیمی است، بیشتر نهادها ناگزیرند مدل‌های پایه از‌پیش‌آموزش‌دیده را از مخازن متن‌باز بارگیری یا از طریق رابط‌های تجاری فراخوانی کنند.[1]

تمرکز ساخت مدل‌ها در دست چند شرکت انگشت‌شمار، امنیت هوش مصنوعی را به معضل زنجیره تأمین بدل کرده است.

این وابستگی ساختاری یک «نقطه شکست منفرد» ایجاد می‌کند. اگر مهاجمی با موفقیت یک درپشتی در مدل پایه متن‌باز پرکاربردی تعبیه کند، تمامی برنامه‌ها و سامانه‌های پایین‌دستی که اقدام به تنظیم دقیق (Fine-tuning) یا استقرار آن مدل می‌کنند، حامل همان رخنه پنهان خواهند بود.[1]

شناسایی این درپشتی‌های معماری کاری طاقت‌فرساست. این دستکاری‌های پنهان می‌توانند به‌گونه‌ای تعبیه شوند که حتی پس از بازآموزی روی داده‌های تمیز در شرکت‌های پایین‌دستی باقی بمانند و تا زمان ظاهر شدن تریگر مخصوص در محیط واقعی، خاموش و نامرئی بمانند.[1]

برای مدیریت این مخاطرات، سازمان‌ها باید سازوکارهای دقیق رهگیری اصالت داده و آزمون‌های یکپارچگی را برای دارایی‌های یادگیری ماشین به اجرا بگذارند. تلقی کردن شبکه عصبی به عنوان جعبه‌ای مات و قابل اعتماد، در شرایطی که وزن‌های درونی مدل می‌توانند نیات تخریبی در بر داشته باشند، دیگر ممکن نیست.[1]

آرایه‌شناسی نایست زیربنای واژگانی یکپارچه‌ای برای تحقق این هدف فراهم آورده است. این چارچوب با استانداردسازی مفاهیم یادگیری ماشین خصمانه، محققان، مهندسان و مدافعان سایبری را قادر می‌سازد در برابر چشم‌اندازی از تهدیدها که روزبه‌روز خودکارتر و پیچیده‌تر می‌شوند، پاسخی هماهنگ ارائه دهند.[1]

در نهایت، امنیت سامانه‌های مبتنی بر هوش مصنوعی را نمی‌توان صرفاً با اتکا به تصحیح درونی خود مدل‌ها تضمین کرد. این هدف به معماری جامع سیستمی نیاز دارد؛ ساختاری که در آن مؤلفه یادگیری ماشین ایزوله باشد، ورودی‌هایش مداوم پایش شود و خروجی‌هایش پیش از هر اقدام عملیاتی در جهان واقعی، مستقل ارزیابی گردد.[2]

آنچه نمی‌دانیم

  • آیا روش‌های اعتبارسنجی صوری از نظر توان محاسباتی روزی امکان پوشش مدل‌هایی با صدها میلیارد پارامتر را خواهند یافت یا خیر.
  • گسترش شتابان جریان‌های داده‌های چندوجهی چه تأثیری بر اثربخشی تدابیر پالایش و پاک‌سازی داده‌ها خواهد گذاشت.
  • نقطه بحرانی دقیق در بده‌بستان میان تاب‌آوری خصمانه و دقت پایه که پس از آن مدل از نظر تجاری در سطح بنگاه‌ها فاقد توجیه می‌شود کجاست.

نکات کلیدی

  • یادگیری ماشین خصمانه بر پایه سازوکارهای آماری یادگیری مدل‌ها عمل می‌کند و تدابیر سنتی امنیت نرم‌افزار را بدون دستکاری کد دور می‌زند.
  • آسیب‌پذیری‌های هوش مصنوعی پیش‌بین به شکل عمده در مرحله آموزش متمرکزند؛ جایی که مهاجم از مسموم‌سازی داده برای تخریب مرزهای تصمیم‌گیری استفاده می‌کند.
  • هوش مصنوعی زاینده سطح حمله را به فاز استقرار منتقل کرده و با تزریق پرامپت و استخراج داده، دیوارهای ایمنی و هم‌ترازی مدل را ناکام می‌گذارد.
  • راهکارهای دفاعی کنونی با یک بن‌بست ریاضی مواجه‌اند: ارتقای تاب‌آوری خصمانه تقریباً در تمام موارد موجب کاهش دقت پایه مدل می‌شود.
  • متمرکز شدن توسعه مدل‌های پایه ریسک زنجیره تأمین بزرگی به وجود آورده است؛ به طوری که یک مدل آلوده می‌تواند هزاران برنامه پایین‌دستی را به خطر بیندازد.
پژوهشگران امنیت هوش مصنوعی 50%توسعه‌دهندگان و مهندسان مدل‌ها 30%سازمان‌ها و کسب‌وکارهای پذیرنده 20%
پژوهشگران امنیت هوش مصنوعی
تمرکز بر کشف آسیب‌پذیری‌های نظری در سطح الگوریتم و تلاش برای تدوین اثبات‌های ریاضی برای پایداری و تاب‌آوری مدل‌ها.
توسعه‌دهندگان و مهندسان مدل‌ها
ایجاد توازن میان هزینه تاب‌آوری خصمانه با ضرورت حفظ دقت عملیاتی بالا برای بقای تجاری محصول.
سازمان‌ها و کسب‌وکارهای پذیرنده
تمرکز بر پایش امنیت زنجیره تأمین نرم‌افزاری و ادغام ایمن مدل‌های پایه بیرونی در جریان‌های کاری داخلی.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مدافعان و کنشگران توسعه هوش مصنوعی متن‌باز
  • بیمه‌گران و ارزیابان ریسک بیمه سایبری

منابع

پوشش منابع

2 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران امنیت هوش مصنوعی 50%توسعه‌دهندگان و مهندسان مدل‌ها 30%سازمان‌ها و کسب‌وکارهای پذیرنده 20%
  1. [1]NISTپژوهشگران امنیت هوش مصنوعی

    Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations (NIST AI 100-2e2025)

    مطالعه در NIST →
  2. [2]تیم سردبیری کوهستانسازمان‌ها و کسب‌وکارهای پذیرنده

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.