رفتن به محتوای اصلی
کوهستان
توضیح کوهستانامنیت هوش مصنوعیتزریق پرامپت· 4 دقیقه مطالعه· در هوش مصنوعی

حمله ترزین‌زدایی چیست و مدل‌های زبانی چگونه در برابر دور زدن ایمنی محافظت می‌شوند؟

تزریق پرامپت و ترزین‌زدایی به مهاجمان اجازه می‌دهند کنترل هوش مصنوعی را در دست بگیرند. با خودمختار شدن این مدل‌ها، شرکت‌ها در حال توسعه طبقه‌بندهای امنیتی و حالت‌های قرنطینه برای مهار این تهدیدات هستند.

به قلم کوروش پاکزاد

به‌طور خلاصه

  • تزریق پرامپت با پنهان کردن دستورات مخرب در داده‌های ورودی، هوش مصنوعی را فریب می‌دهد تا قوانین ایمنی خود را نقض کند.
  • حملات پیشرفته اکنون از عبارات منطقی پیچیده و کرم‌های خودتکثیرشونده برای دور زدن فیلترهای مبتنی بر کلمات کلیدی استفاده می‌کنند.
  • شرکت‌ها برای دفاع، به طبقه‌بندهای نظارتی و حالت‌های قرنطینه‌ای روی آورده‌اند که دسترسی هوش مصنوعی به ابزارهای خارجی را قطع می‌کند.

زمانی که شرکت آنتروپیک (Anthropic) مدل‌های بدون گاردریل خود را در برابر پرامپت‌های خصمانه آزمایش کرد، سدهای ایمنی در ۸۶ درصد مواقع شکسته شدند. این رقم نشان‌دهنده مقیاس چالشی است که امروزه به عنوان «ترزین‌زدایی» (Jailbreak) یا دور زدن ایمنی مدل‌های زبانی بزرگ شناخته می‌شود.[2]

در معماری این مدل‌ها، هیچ مرز ساختاری مشخصی بین دستورات کاربر و داده‌های پردازشی وجود ندارد. این درهم‌تنیدگی به این معناست که یک مدل زبانی، هر متنی را که دریافت می‌کند، صرفاً به عنوان ادامه منطقی یک الگو می‌بیند و تلاش می‌کند آن را تکمیل کند.

مهاجمان از همین ویژگی استفاده می‌کنند تا با پنهان کردن دستورات مخرب در میان کلمات عادی، مدل را فریب دهند. این تکنیک که «تزریق پرامپت» (Prompt Injection) نام دارد، اکنون به عنوان خطرناک‌ترین آسیب‌پذیری هوش مصنوعی در فهرست سال ۲۰۲۵ بنیاد OWASP در رتبه نخست قرار گرفته است.

تزریق پرامپت (Prompt Injection) در صدر فهرست خطرات امنیتی OWASP برای برنامه‌های هوش مصنوعی قرار دارد.

مکانیسم تزریق مستقیم و غیرمستقیم

تزریق پرامپت به دو شکل اصلی رخ می‌دهد. در تزریق مستقیم، کاربر مستقیماً دستوری را تایپ می‌کند که قوانین ایمنی مدل را دور می‌زند؛ مثلاً از هوش مصنوعی می‌خواهد در قالب یک شخصیت داستانی، دستورالعمل ساخت مواد خطرناک را ارائه دهد.

اما خطرناک‌ترین نوع، تزریق غیرمستقیم (Indirect Prompt Injection) است. در این روش، دستور مخرب در محتوای شخص ثالث — مانند یک وب‌سایت، ایمیل یا سند متنی — پنهان می‌شود و منتظر می‌ماند تا هوش مصنوعی آن را پردازش کند.

زمانی که کاربر از هوش مصنوعی می‌خواهد آن سند را خلاصه کند، مدل زبانی دستور پنهان را دریافت کرده و آن را اجرا می‌کند. این روش می‌تواند باعث شود هوش مصنوعی اطلاعات حساس کاربر را سرقت کرده و به سرور مهاجم ارسال کند.[1]

تفاوت تزریق مستقیم پرامپت توسط کاربر و تزریق غیرمستقیم از طریق محتوای شخص ثالث.

تکامل حملات؛ از کرم‌های خودتکثیرشونده تا منطق

با تبدیل شدن چت‌بات‌ها به «عامل‌های هوش مصنوعی» که به ابزارهایی مانند ایمیل و مرورگر دسترسی دارند، شعاع تخریب حملات گسترش یافته است. در سپتامبر ۲۰۲۶، شرکت OpenAI شواهدی از یک نوع جدید تزریق پرامپت منتشر کرد که مانند یک «کرم کامپیوتری» عمل می‌کند.

این پرامپت‌های خودتکثیرشونده، پس از آلوده کردن یک عامل هوش مصنوعی، به آن دستور می‌دهند که همان کد مخرب را در ایمیل‌ها یا پیام‌های بعدی خود کپی کند. به این ترتیب، حمله می‌تواند به سرعت در میان سیستم‌های متصل به هم پخش شود.

همزمان، پژوهشگران دانشگاهی در آوریل ۲۰۲۶ روشی به نام LogiBreak را معرفی کردند. این روش نشان داد که فیلترهای ایمنی فعلی بیشتر بر اساس کلمات کلیدی کار می‌کنند. مهاجمان با ترجمه درخواست‌های مخرب به عبارات منطقی، توانستند گاردریل‌های ایمنی را به طور کامل دور بزنند.

دفاع از طریق طبقه‌بندهای قانون‌اساسی‌محور

برای مقابله با این تهدیدات، سازندگان مدل‌های پایه به راهکارهای چندلایه‌ای روی آورده‌اند. یکی از موثرترین روش‌ها، استفاده از «طبقه‌بندهای قانون‌اساسی‌محور» (Constitutional Classifiers) است که توسط آنتروپیک در اوایل سال ۲۰۲۶ به‌روزرسانی شد.[2]

این سیستم‌ها، مدل‌های کوچکتری هستند که ورودی‌ها و خروجی‌های مدل اصلی را بر اساس یک مجموعه قوانین نوشته‌شده به زبان طبیعی نظارت می‌کنند. این طبقه‌بندها توانستند نرخ موفقیت حملات ترزین‌زدایی را از ۸۶ درصد به ۴.۴ درصد کاهش دهند.[2]

تأثیر طبقه‌بندهای قانون‌اساسی‌محور آنتروپیک در کاهش چشمگیر موفقیت حملات ترزین‌زدایی.

با این حال، این لایه امنیتی اضافی هزینه محاسباتی را تا ۲۳.۷ درصد افزایش می‌دهد. همچنین گاهی باعث می‌شود مدل به اشتباه از پاسخ دادن به سوالات کاملاً بی‌خطر نیز خودداری کند که به آن امتناع بیش‌ازحد (Over-refusal) می‌گویند.[2]

حالت قرنطینه و محدودسازی دسترسی‌ها

از آنجا که هیچ مدل زبانی در برابر تزریق پرامپت کاملاً نفوذناپذیر نیست، دفاع نهایی در سطح سیستم اعمال می‌شود. در فوریه ۲۰۲۶، OpenAI قابلیتی به نام «حالت قرنطینه» (Lockdown Mode) را برای کاربران سازمانی و شخصی با ریسک بالا معرفی کرد.[1]

این رویکرد به جای تلاش برای هوشمندتر کردن مدل در تشخیص فریب، دسترسی‌های فیزیکی آن را قطع می‌کند. هنگامی که حالت قرنطینه فعال می‌شود، قابلیت‌هایی مانند دسترسی زنده به وب و اتصال به ابزارهای خارجی غیرفعال می‌شوند.[1]

حالت قرنطینه با قطع دسترسی‌های زنده به وب و ابزارهای خارجی، از نشت داده‌ها جلوگیری می‌کند.

در این حالت، حتی اگر یک پرامپت مخرب موفق به فریب مدل شود، هوش مصنوعی ابزاری برای استخراج داده‌ها نخواهد داشت. این نشان می‌دهد که در دنیای هوش مصنوعی عامل‌محور، امنیت قطعی تنها با محدود کردن عاملیت به دست می‌آید.[1]

اصطلاحات کلیدی

تزریق پرامپت (Prompt Injection)
تکنیکی که در آن مهاجم دستورات مخربی را در ورودی‌های هوش مصنوعی پنهان می‌کند تا رفتار مدل را تغییر دهد.
ترزین‌زدایی (Jailbreak)
دور زدن عمدی محدودیت‌ها و گاردریل‌های ایمنی یک مدل زبانی برای وادار کردن آن به تولید محتوای ممنوعه.
طبقه‌بندهای قانون‌اساسی‌محور (Constitutional Classifiers)
مدل‌های نظارتی کوچکی که خروجی‌های هوش مصنوعی را بر اساس مجموعه‌ای از قوانین ایمنی نوشته‌شده بررسی و فیلتر می‌کنند.
هوش مصنوعی عامل‌محور (Agentic AI)
سیستم‌های هوش مصنوعی که علاوه بر تولید متن، می‌توانند از ابزارهایی مانند مرورگر وب یا ایمیل برای انجام وظایف استفاده کنند.

پرسش‌های متداول

تفاوت تزریق مستقیم و غیرمستقیم پرامپت چیست؟

در تزریق مستقیم، خود کاربر دستور مخرب را تایپ می‌کند. اما در تزریق غیرمستقیم، دستور در یک وب‌سایت یا فایل پنهان می‌شود و زمانی که هوش مصنوعی آن محتوا را می‌خواند، آلوده می‌شود.

آیا پرامپت‌های مخرب می‌توانند مانند ویروس پخش شوند؟

بله، پژوهشگران نشان داده‌اند که «کرم‌های هوش مصنوعی» می‌توانند عامل‌های خودمختار را مجبور کنند تا کدهای مخرب را در ایمیل‌ها یا پیام‌های خروجی خود کپی کرده و به سیستم‌های دیگر ارسال کنند.

حالت قرنطینه (Lockdown Mode) چگونه از کاربران محافظت می‌کند؟

این حالت با غیرفعال کردن دسترسی زنده به اینترنت و ابزارهای خارجی، تضمین می‌کند که حتی اگر هوش مصنوعی فریب بخورد، نتواند اطلاعات حساس کاربر را به سرورهای مهاجمان ارسال کند.

بررسی عمیق دیدگاه‌ها

پژوهشگران امنیت سایبری

معتقدند مدل‌های زبانی ذاتاً قادر به تفکیک دستور از داده نیستند و این یک نقص معماری غیرقابل حل است.

از دیدگاه کارشناسان امنیتی و سازمان‌هایی مانند OWASP، مشکل تزریق پرامپت با آموزش بیشتر مدل‌ها حل نمی‌شود. معماری ترانسفورمرها به گونه‌ای است که تمام متن ورودی را به عنوان یک دنباله یکپارچه پردازش می‌کند. بنابراین، هرگز نمی‌توان به طور قطعی به مدل آموخت که بخشی از متن یک «دستور معتمد» است و بخش دیگر صرفاً «داده‌های غیرقابل اعتماد» است. آن‌ها استدلال می‌کنند که امنیت واقعی تنها با اعمال کنترل‌های سخت‌گیرانه در خارج از خود مدل زبانی امکان‌پذیر است.

توسعه‌دهندگان هوش مصنوعی

تمرکز خود را بر ساخت طبقه‌بندهای داخلی و آموزش خصمانه برای فیلتر کردن اکثریت قریب به اتفاق حملات گذاشته‌اند.

شرکت‌هایی مانند آنتروپیک و OpenAI بر این باورند که می‌توان با استفاده از خود هوش مصنوعی، بر نقاط ضعف آن غلبه کرد. رویکرد آن‌ها که در سیستم‌هایی مانند «طبقه‌بندهای قانون‌اساسی‌محور» دیده می‌شود، استفاده از مدل‌های ناظر برای ارزیابی مداوم ورودی‌ها و خروجی‌هاست. اگرچه آن‌ها می‌پذیرند که این روش‌ها بی‌نقص نیستند و هزینه محاسباتی را افزایش می‌دهند، اما معتقدند که می‌توانند بیش از ۹۵ درصد حملات را بدون از بین بردن کارایی و انعطاف‌پذیری مدل، خنثی کنند.

خریداران سازمانی

حاضرند برای تضمین امنیت داده‌های خود، از قابلیت‌های پیشرفته هوش مصنوعی چشم‌پوشی کرده و دسترسی‌ها را محدود کنند.

برای مدیران فناوری اطلاعات در سازمان‌های بزرگ، وعده‌های مربوط به بهبود درک معنایی مدل‌ها کافی نیست. زمانی که یک عامل هوش مصنوعی به پایگاه داده مشتریان یا سیستم ایمیل شرکت متصل می‌شود، حتی یک درصد احتمال نفوذ نیز غیرقابل قبول است. به همین دلیل، این گروه به شدت از راهکارهای قطعی مانند «حالت قرنطینه» استقبال می‌کنند. آن‌ها ترجیح می‌دهند هوش مصنوعی نتواند به صورت زنده در وب جستجو کند، اما در عوض مطمئن باشند که هیچ پرامپت مخربی نمی‌تواند داده‌های محرمانه شرکت را به سرقت ببرد.

پژوهشگران امنیت سایبری 35%توسعه‌دهندگان هوش مصنوعی 35%خریداران سازمانی 30%
پژوهشگران امنیت سایبری
معتقدند مدل‌های زبانی ذاتاً قادر به تفکیک دستور از داده نیستند و این یک نقص معماری غیرقابل حل است.
توسعه‌دهندگان هوش مصنوعی
تمرکز خود را بر ساخت طبقه‌بندهای داخلی و آموزش خصمانه برای فیلتر کردن اکثریت قریب به اتفاق حملات گذاشته‌اند.
خریداران سازمانی
حاضرند برای تضمین امنیت داده‌های خود، از قابلیت‌های پیشرفته هوش مصنوعی چشم‌پوشی کرده و دسترسی‌ها را محدود کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • قانون‌گذاران دولتی
  • کاربران عادی آسیب‌دیده

منابع

پوشش منابع

3 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران امنیت سایبری 35%توسعه‌دهندگان هوش مصنوعی 35%خریداران سازمانی 30%
  1. [1]OpenAIتوسعه‌دهندگان هوش مصنوعی

    Lockdown Mode in ChatGPT

    مطالعه در OpenAI →
  2. [2]Anthropicتوسعه‌دهندگان هوش مصنوعی

    Defending against universal jailbreaks with Constitutional Classifiers

    مطالعه در Anthropic →
  3. [3]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.