حمله ترزینزدایی چیست و مدلهای زبانی چگونه در برابر دور زدن ایمنی محافظت میشوند؟
تزریق پرامپت و ترزینزدایی به مهاجمان اجازه میدهند کنترل هوش مصنوعی را در دست بگیرند. با خودمختار شدن این مدلها، شرکتها در حال توسعه طبقهبندهای امنیتی و حالتهای قرنطینه برای مهار این تهدیدات هستند.
به قلم کوروش پاکزاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- تزریق پرامپت با پنهان کردن دستورات مخرب در دادههای ورودی، هوش مصنوعی را فریب میدهد تا قوانین ایمنی خود را نقض کند.
- حملات پیشرفته اکنون از عبارات منطقی پیچیده و کرمهای خودتکثیرشونده برای دور زدن فیلترهای مبتنی بر کلمات کلیدی استفاده میکنند.
- شرکتها برای دفاع، به طبقهبندهای نظارتی و حالتهای قرنطینهای روی آوردهاند که دسترسی هوش مصنوعی به ابزارهای خارجی را قطع میکند.
زمانی که شرکت آنتروپیک (Anthropic) مدلهای بدون گاردریل خود را در برابر پرامپتهای خصمانه آزمایش کرد، سدهای ایمنی در ۸۶ درصد مواقع شکسته شدند. این رقم نشاندهنده مقیاس چالشی است که امروزه به عنوان «ترزینزدایی» (Jailbreak) یا دور زدن ایمنی مدلهای زبانی بزرگ شناخته میشود.[2]
در معماری این مدلها، هیچ مرز ساختاری مشخصی بین دستورات کاربر و دادههای پردازشی وجود ندارد. این درهمتنیدگی به این معناست که یک مدل زبانی، هر متنی را که دریافت میکند، صرفاً به عنوان ادامه منطقی یک الگو میبیند و تلاش میکند آن را تکمیل کند.
مهاجمان از همین ویژگی استفاده میکنند تا با پنهان کردن دستورات مخرب در میان کلمات عادی، مدل را فریب دهند. این تکنیک که «تزریق پرامپت» (Prompt Injection) نام دارد، اکنون به عنوان خطرناکترین آسیبپذیری هوش مصنوعی در فهرست سال ۲۰۲۵ بنیاد OWASP در رتبه نخست قرار گرفته است.
مکانیسم تزریق مستقیم و غیرمستقیم
تزریق پرامپت به دو شکل اصلی رخ میدهد. در تزریق مستقیم، کاربر مستقیماً دستوری را تایپ میکند که قوانین ایمنی مدل را دور میزند؛ مثلاً از هوش مصنوعی میخواهد در قالب یک شخصیت داستانی، دستورالعمل ساخت مواد خطرناک را ارائه دهد.
اما خطرناکترین نوع، تزریق غیرمستقیم (Indirect Prompt Injection) است. در این روش، دستور مخرب در محتوای شخص ثالث — مانند یک وبسایت، ایمیل یا سند متنی — پنهان میشود و منتظر میماند تا هوش مصنوعی آن را پردازش کند.
زمانی که کاربر از هوش مصنوعی میخواهد آن سند را خلاصه کند، مدل زبانی دستور پنهان را دریافت کرده و آن را اجرا میکند. این روش میتواند باعث شود هوش مصنوعی اطلاعات حساس کاربر را سرقت کرده و به سرور مهاجم ارسال کند.[1]
تکامل حملات؛ از کرمهای خودتکثیرشونده تا منطق
با تبدیل شدن چتباتها به «عاملهای هوش مصنوعی» که به ابزارهایی مانند ایمیل و مرورگر دسترسی دارند، شعاع تخریب حملات گسترش یافته است. در سپتامبر ۲۰۲۶، شرکت OpenAI شواهدی از یک نوع جدید تزریق پرامپت منتشر کرد که مانند یک «کرم کامپیوتری» عمل میکند.
این پرامپتهای خودتکثیرشونده، پس از آلوده کردن یک عامل هوش مصنوعی، به آن دستور میدهند که همان کد مخرب را در ایمیلها یا پیامهای بعدی خود کپی کند. به این ترتیب، حمله میتواند به سرعت در میان سیستمهای متصل به هم پخش شود.
همزمان، پژوهشگران دانشگاهی در آوریل ۲۰۲۶ روشی به نام LogiBreak را معرفی کردند. این روش نشان داد که فیلترهای ایمنی فعلی بیشتر بر اساس کلمات کلیدی کار میکنند. مهاجمان با ترجمه درخواستهای مخرب به عبارات منطقی، توانستند گاردریلهای ایمنی را به طور کامل دور بزنند.
دفاع از طریق طبقهبندهای قانوناساسیمحور
برای مقابله با این تهدیدات، سازندگان مدلهای پایه به راهکارهای چندلایهای روی آوردهاند. یکی از موثرترین روشها، استفاده از «طبقهبندهای قانوناساسیمحور» (Constitutional Classifiers) است که توسط آنتروپیک در اوایل سال ۲۰۲۶ بهروزرسانی شد.[2]
این سیستمها، مدلهای کوچکتری هستند که ورودیها و خروجیهای مدل اصلی را بر اساس یک مجموعه قوانین نوشتهشده به زبان طبیعی نظارت میکنند. این طبقهبندها توانستند نرخ موفقیت حملات ترزینزدایی را از ۸۶ درصد به ۴.۴ درصد کاهش دهند.[2]
با این حال، این لایه امنیتی اضافی هزینه محاسباتی را تا ۲۳.۷ درصد افزایش میدهد. همچنین گاهی باعث میشود مدل به اشتباه از پاسخ دادن به سوالات کاملاً بیخطر نیز خودداری کند که به آن امتناع بیشازحد (Over-refusal) میگویند.[2]
حالت قرنطینه و محدودسازی دسترسیها
از آنجا که هیچ مدل زبانی در برابر تزریق پرامپت کاملاً نفوذناپذیر نیست، دفاع نهایی در سطح سیستم اعمال میشود. در فوریه ۲۰۲۶، OpenAI قابلیتی به نام «حالت قرنطینه» (Lockdown Mode) را برای کاربران سازمانی و شخصی با ریسک بالا معرفی کرد.[1]
این رویکرد به جای تلاش برای هوشمندتر کردن مدل در تشخیص فریب، دسترسیهای فیزیکی آن را قطع میکند. هنگامی که حالت قرنطینه فعال میشود، قابلیتهایی مانند دسترسی زنده به وب و اتصال به ابزارهای خارجی غیرفعال میشوند.[1]
در این حالت، حتی اگر یک پرامپت مخرب موفق به فریب مدل شود، هوش مصنوعی ابزاری برای استخراج دادهها نخواهد داشت. این نشان میدهد که در دنیای هوش مصنوعی عاملمحور، امنیت قطعی تنها با محدود کردن عاملیت به دست میآید.[1]
اصطلاحات کلیدی
- تزریق پرامپت (Prompt Injection)
- تکنیکی که در آن مهاجم دستورات مخربی را در ورودیهای هوش مصنوعی پنهان میکند تا رفتار مدل را تغییر دهد.
- ترزینزدایی (Jailbreak)
- دور زدن عمدی محدودیتها و گاردریلهای ایمنی یک مدل زبانی برای وادار کردن آن به تولید محتوای ممنوعه.
- طبقهبندهای قانوناساسیمحور (Constitutional Classifiers)
- مدلهای نظارتی کوچکی که خروجیهای هوش مصنوعی را بر اساس مجموعهای از قوانین ایمنی نوشتهشده بررسی و فیلتر میکنند.
- هوش مصنوعی عاملمحور (Agentic AI)
- سیستمهای هوش مصنوعی که علاوه بر تولید متن، میتوانند از ابزارهایی مانند مرورگر وب یا ایمیل برای انجام وظایف استفاده کنند.
پرسشهای متداول
تفاوت تزریق مستقیم و غیرمستقیم پرامپت چیست؟
در تزریق مستقیم، خود کاربر دستور مخرب را تایپ میکند. اما در تزریق غیرمستقیم، دستور در یک وبسایت یا فایل پنهان میشود و زمانی که هوش مصنوعی آن محتوا را میخواند، آلوده میشود.
آیا پرامپتهای مخرب میتوانند مانند ویروس پخش شوند؟
بله، پژوهشگران نشان دادهاند که «کرمهای هوش مصنوعی» میتوانند عاملهای خودمختار را مجبور کنند تا کدهای مخرب را در ایمیلها یا پیامهای خروجی خود کپی کرده و به سیستمهای دیگر ارسال کنند.
حالت قرنطینه (Lockdown Mode) چگونه از کاربران محافظت میکند؟
این حالت با غیرفعال کردن دسترسی زنده به اینترنت و ابزارهای خارجی، تضمین میکند که حتی اگر هوش مصنوعی فریب بخورد، نتواند اطلاعات حساس کاربر را به سرورهای مهاجمان ارسال کند.
بررسی عمیق دیدگاهها
پژوهشگران امنیت سایبری
معتقدند مدلهای زبانی ذاتاً قادر به تفکیک دستور از داده نیستند و این یک نقص معماری غیرقابل حل است.
از دیدگاه کارشناسان امنیتی و سازمانهایی مانند OWASP، مشکل تزریق پرامپت با آموزش بیشتر مدلها حل نمیشود. معماری ترانسفورمرها به گونهای است که تمام متن ورودی را به عنوان یک دنباله یکپارچه پردازش میکند. بنابراین، هرگز نمیتوان به طور قطعی به مدل آموخت که بخشی از متن یک «دستور معتمد» است و بخش دیگر صرفاً «دادههای غیرقابل اعتماد» است. آنها استدلال میکنند که امنیت واقعی تنها با اعمال کنترلهای سختگیرانه در خارج از خود مدل زبانی امکانپذیر است.
توسعهدهندگان هوش مصنوعی
تمرکز خود را بر ساخت طبقهبندهای داخلی و آموزش خصمانه برای فیلتر کردن اکثریت قریب به اتفاق حملات گذاشتهاند.
شرکتهایی مانند آنتروپیک و OpenAI بر این باورند که میتوان با استفاده از خود هوش مصنوعی، بر نقاط ضعف آن غلبه کرد. رویکرد آنها که در سیستمهایی مانند «طبقهبندهای قانوناساسیمحور» دیده میشود، استفاده از مدلهای ناظر برای ارزیابی مداوم ورودیها و خروجیهاست. اگرچه آنها میپذیرند که این روشها بینقص نیستند و هزینه محاسباتی را افزایش میدهند، اما معتقدند که میتوانند بیش از ۹۵ درصد حملات را بدون از بین بردن کارایی و انعطافپذیری مدل، خنثی کنند.
خریداران سازمانی
حاضرند برای تضمین امنیت دادههای خود، از قابلیتهای پیشرفته هوش مصنوعی چشمپوشی کرده و دسترسیها را محدود کنند.
برای مدیران فناوری اطلاعات در سازمانهای بزرگ، وعدههای مربوط به بهبود درک معنایی مدلها کافی نیست. زمانی که یک عامل هوش مصنوعی به پایگاه داده مشتریان یا سیستم ایمیل شرکت متصل میشود، حتی یک درصد احتمال نفوذ نیز غیرقابل قبول است. به همین دلیل، این گروه به شدت از راهکارهای قطعی مانند «حالت قرنطینه» استقبال میکنند. آنها ترجیح میدهند هوش مصنوعی نتواند به صورت زنده در وب جستجو کند، اما در عوض مطمئن باشند که هیچ پرامپت مخربی نمیتواند دادههای محرمانه شرکت را به سرقت ببرد.
- پژوهشگران امنیت سایبری
- معتقدند مدلهای زبانی ذاتاً قادر به تفکیک دستور از داده نیستند و این یک نقص معماری غیرقابل حل است.
- توسعهدهندگان هوش مصنوعی
- تمرکز خود را بر ساخت طبقهبندهای داخلی و آموزش خصمانه برای فیلتر کردن اکثریت قریب به اتفاق حملات گذاشتهاند.
- خریداران سازمانی
- حاضرند برای تضمین امنیت دادههای خود، از قابلیتهای پیشرفته هوش مصنوعی چشمپوشی کرده و دسترسیها را محدود کنند.
دیدگاههایی که این گزارش پوشش نداده
- قانونگذاران دولتی
- کاربران عادی آسیبدیده
منابع
[1]OpenAIتوسعهدهندگان هوش مصنوعیLockdown Mode in ChatGPT
مطالعه در OpenAI →
[2]Anthropicتوسعهدهندگان هوش مصنوعیDefending against universal jailbreaks with Constitutional Classifiers
مطالعه در Anthropic →
[3]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →مدلهای درآمدی هوش مصنوعی مولد: شرکتهای فناوری چگونه از این فناوری سودآوری میکنند؟
6 منبع
مدلهای فرانتیر
گوگل مدل هوش مصنوعی Gemini 4 Argon را با خروجی یک میلیون توکن معرفی کرد
5 منبع
هوش مصنوعی مولد
هوش مصنوعی مولد چیست و چگونه کار میکند؟ راهنمای جامع برای مبتدیان
4 منبع
مقاومت هوش مصنوعی
نقطه کور ریاضیاتی در ایمنی هوش مصنوعی: هنجارهای Lp چگونه بودجههای اختلال خصمانه را تعریف میکنند
11 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





