رفتن به محتوای اصلی
توضیح کوهستانامنیت عامل‌های هوش مصنوعیتوضیح و تحلیل۹ شهریور ۱۴۰۵، ۸:۲۸· 5 دقیقه مطالعه· در فناوری

مکانیسم مسموم‌سازی حافظه عامل‌های هوش مصنوعی: چگونه حملات خفته سیستم‌های خودکار را فاسد می‌کنند

در حالی که سیستم‌های هوش مصنوعی از چت‌بات‌های بدون حالت به عامل‌های خودکار تکامل می‌یابند، مهاجمان در حال تغییر تمرکز از تزریق‌های موقت دستور (Prompt Injection) به مسموم‌سازی دائمی حافظه هستند؛ دستورالعمل‌های خفته‌ای را در پایگاه‌های داده برداری (Vector Databases) می‌کارند که هفته‌ها بعد اجرا می‌شوند.

به قلم دلناز نورانی

محققان تهدید 45%مدافعان سازمانی 35%معماران سیستم‌های هوش مصنوعی 20%
محققان تهدید
استدلال می‌کنند که حافظه دائمی اساساً مدل‌های امنیتی سنتی را در هم می‌شکند، زیرا حمله را از اجرا جدا می‌کند.
مدافعان سازمانی
بر چالش عملیاتی تشخیص حافظه مسموم بدون از بین بردن کارایی سیستم‌های RAG و جریان‌های کاری خودکار تمرکز دارند.
معماران سیستم‌های هوش مصنوعی
بر نیاز به اصول معماری جدید، مانند دروازه‌های حافظه و تشخیص انحراف باور، برای ایمن‌سازی عامل‌های حالت‌دار تأکید می‌کنند.

نکات کلیدی

  1. مسموم‌سازی حافظه، پایگاه‌های داده برداری دائمی مورد استفاده توسط عامل‌های هوش مصنوعی خودکار را هدف قرار می‌دهد.
  2. برخلاف تزریق دستور، حملات حافظه از نظر زمانی جدا هستند و مدت‌ها پس از تزریق اولیه اجرا می‌شوند.
  3. محموله‌های خفته در ۶۰٪ تا ۸۹٪ ارزیابی‌ها با موفقیت رفتار عامل را هدایت می‌کنند.
  4. دفاع در برابر این حملات نیازمند دروازه‌های حافظه و ردیابی منشأ زمینه است، نه صرفاً فیلترهای ورودی.

اغلب تیم‌های امنیتی آسیب‌پذیری‌های هوش مصنوعی را مانند باگ‌های نرم‌افزاری سنتی در نظر می‌گیرند و فرض می‌کنند که اگر ورودی را فیلتر کرده و خروجی را پاکسازی کنید، سیستم ایمن است. آن‌ها «تزریق دستور» (Prompt Injection) را به عنوان یک ترفند ساده می‌بینند که در آن کاربر عبارت «دستورالعمل‌های قبلی را نادیده بگیر» را تایپ می‌کند تا چت‌بات حرفی نامربوط بزند یا از یک محدودیت ایمنی عبور کند. در این مدل ذهنی، تهدید کاملاً در جلسه فعال محدود شده و به محض بستن تب مرورگر توسط کاربر، از بین می‌رود.[4][7]

اما شواهد نشان می‌دهد که این مدل ذهنی به طرز خطرناکی منسوخ شده است. با تکامل سیستم‌های هوش مصنوعی از چت‌بات‌های بدون حالت به عامل‌های خودکار که به پایگاه‌های داده سازمانی، کلاینت‌های ایمیل و APIهای خارجی دسترسی دارند، سطح تهدید به طور اساسی تغییر کرده است. خطر دیگر فقط مربوط به آنچه یک مدل زبان در لحظه می‌گوید نیست، بلکه مربوط به چیزی است که یک سیستم خودکار در طول زمان و حین عملکرد مستقل خود به آن باور پیدا می‌کند.[1][2]

این تغییر ناشی از یک آسیب‌پذیری ساختاری است که به عنوان مسموم‌سازی حافظه (Memory Poisoning) شناخته می‌شود. برخلاف تزریق دستور سنتی که موقتی و محدود به جلسه است، مسموم‌سازی حافظه حالت دائمی عامل را هدف قرار می‌دهد. این حمله، زمینه بلندمدت ذخیره‌شده در پایگاه‌های داده برداری یا فهرست‌های تولید مبتنی بر بازیابی (RAG) را فاسد می‌کند و دستورالعمل‌های مخرب را مستقیماً در زیربنای دانش عامل جاسازی می‌نماید.[5]

فروشندگان فناوری به شدت این سیستم‌های حافظه دائمی را به عنوان «هوش مصنوعی شخصی‌سازی‌شده» یا «یادگیری مستمر» بازاریابی می‌کنند و دستیاران دیجیتالی را وعده می‌دهند که ترجیحات کاربر را در طول هفته‌ها و ماه‌ها به خاطر می‌آورند. اما آنچه در واقعیت عرضه شده، یک نقص معماری عمیق است: عامل، پایگاه داده حافظه خارجی خود را به عنوان یک منبع حقیقت که به طور ضمنی قابل اعتماد است، در نظر می‌گیرد و فاقد اعتبارسنجی معنایی لازم برای تمایز بین یک تعامل مشروع گذشته و یک دستورالعمل مخرب کاشته‌شده است.[8]

ارزیابی‌های اخیر نرخ موفقیت بالایی را برای تزریق و اجرای محموله‌های حافظه خفته در مدل‌های هوش مصنوعی حالت‌دار نشان می‌دهند.

مکانیسم یک حمله مسموم‌سازی حافظه «خفته» کاملاً متکی بر جداسازی زمانی است. مهاجم نیازی به تعامل مستقیم با عامل یا دور زدن فیلترهای ورودی بلادرنگ ندارد. در عوض، آن‌ها یک محموله مخرب را در یک سند خارجی، یک صفحه وب یا یک ایمیل جاسازی می‌کنند که انتظار می‌رود عامل در طول وظایف عادی خود آن را پردازش کند.[3]

هنگامی که عامل آن سند را پردازش می‌کند – شاید خلاصه‌سازی یک فایل PDF که در یک درایو مشترک سازمانی بارگذاری شده است – ناآگاهانه محموله را جذب می‌کند. این دستورالعمل بی‌سروصدا در حافظه بلندمدت عامل نوشته می‌شود. جلسه به پایان می‌رسد، وظیفه اولیه با موفقیت کامل می‌شود و مهاجم بدون فعال کردن هیچ هشدار فوری، صحنه را ترک می‌کند.[6]

هنگامی که عامل آن سند را پردازش می‌کند – شاید خلاصه‌سازی یک فایل PDF که در یک درایو مشترک سازمانی بارگذاری شده است – ناآگاهانه محموله را جذب می‌کند.

روزها یا هفته‌ها بعد، ممکن است یک کاربر کاملاً متفاوت سؤالی از عامل بپرسد که به طور معنایی حافظه مسموم‌شده را فعال کند. عامل زمینه فاسد شده را بازیابی می‌کند، فرض می‌کند که این یک دستورالعمل عملیاتی معتبر یا یک واقعیت تأیید شده است و اقدام مورد نظر مهاجم را اجرا می‌کند، گویی که در حال پیروی از برنامه‌نویسی اصلی خود است.[3]

ارزیابی‌های آکادمیک اخیر از این خط لوله خفته، نرخ موفقیت نگران‌کننده‌ای را نشان می‌دهد که از سوءاستفاده‌های سنتی امنیت سایبری پیشی می‌گیرد. محققانی که دستیاران مدل زبان بزرگ حالت‌دار را آزمایش کردند، دریافتند که حافظه‌های خصمانه در مدل‌های پیشرو مانند GPT-5.5 در ۹۹٫۸٪ (نود و نه ممیز هشت دهم درصد) از تلاش‌ها با موفقیت در پایگاه داده نوشته شده‌اند.[3]

برخلاف تزریق دستور سنتی، مسموم‌سازی حافظه رویداد تزریق را از رویداد اجرا با فاصله روزها یا هفته‌ها جدا می‌کند.

نکته مهم‌تر این است که هنگامی که آن حافظه‌های مسموم در جلسات آینده بازیابی شدند، با موفقیت عامل را به سمت اجرای اقدامات خودکار مورد نظر مهاجم در ۶۰٪ تا ۸۹٪ ارزیابی‌ها هدایت کردند. این سم فقط غیرفعال نمی‌ماند؛ بلکه به محض فراخوانی، فعالانه تصمیم‌گیری‌های بعدی را ربوده و کنترل می‌کند.[3]

جامعه امنیت سایبری در تلاش است تا این تهدید را رسمی کند. در حالی که چارچوب‌های قبلی عمدتاً بر تزریق دستور بلادرنگ تمرکز داشتند، ۱۰ آسیب‌پذیری برتر OWASP برای برنامه‌های عامل هوش مصنوعی که به تازگی منتشر شده است، مسموم‌سازی حافظه و زمینه را به صراحت به عنوان ASI06 طبقه‌بندی می‌کند و آن را به عنوان یک دسته ریسک متمایز و جدی به رسمیت می‌شناسد.[5]

این طبقه‌بندی، تشدید ریسک را هنگام معرفی قابلیت خودکار به یک مدل آسیب‌پذیر برجسته می‌کند. یک حافظه مسموم در یک چت‌بات بدون حالت ممکن است منجر به یک پاسخ توهمی یا افشای دستور سیستم شود. اما یک حافظه مسموم در یک عامل خودکار دارای اعتبارنامه‌های API می‌تواند منجر به خروج غیرمجاز داده‌ها، تغییر تراکنش‌های مالی یا انتشار حمله در میان عامل‌های دیگر شود.[1]

دفاع در برابر این امر مستلزم یک تغییر معماری اساسی است. فایروال‌های شبکه سنتی و تعدیل ورودی بلادرنگ کافی نیستند، زیرا محموله مخرب اغلب در مرحله تزریق شبیه متنی معقول و بی‌ضرر به نظر می‌رسد و تنها زمانی که با یک زمینه آینده ترکیب می‌شود، ماهیت مخرب خود را آشکار می‌کند.[6][7]

۱۰ آسیب‌پذیری برتر OWASP برای برنامه‌های عامل هوش مصنوعی، مسموم‌سازی حافظه را رسماً به عنوان یک آسیب‌پذیری حیاتی برای سیستم‌های خودکار طبقه‌بندی می‌کند.

تیم‌های امنیتی اکنون در حال بررسی «دروازه‌های حافظه» (Memory Gateways) و ردیابی منشأ زمینه هستند—سیستم‌هایی که برای ایزوله‌سازی بخش‌های حافظه، اعمال زوال زمانی بر زمینه ذخیره‌شده و نظارت بر عامل‌ها برای «انحراف باور» (Belief Drift) قبل از اجازه دادن به آن‌ها برای اقدام در محیط‌های عملیاتی طراحی شده‌اند.[2][8]

تا زمانی که این اصول دفاعی به بلوغ برسند، سازمان‌هایی که هوش مصنوعی خودکار را مستقر می‌کنند باید بپذیرند که حافظه یک عامل، آسیب‌پذیرترین سطح حمله آن است. معیار واقعی امنیت یک عامل فقط این نیست که امروز چگونه با یک دستور مخرب برخورد می‌کند، بلکه این است که آیا می‌توان به آنچه فردا به خاطر می‌آورد، اعتماد کرد یا خیر.[1][8]

اصطلاحات کلیدی

مسموم‌سازی حافظه
یک حمله امنیت سایبری که در آن دستورالعمل‌های مخرب به فضای ذخیره‌سازی بلندمدت یک عامل هوش مصنوعی تزریق می‌شود و تصمیمات خودکار آینده آن را فاسد می‌کند.
تزریق دستور
تکنیکی که برای دستکاری یک مدل هوش مصنوعی مولد با پنهان کردن دستورات مخرب به عنوان ورودی مشروع کاربر در طول یک جلسه فعال استفاده می‌شود.
پایگاه داده برداری
یک سیستم ذخیره‌سازی تخصصی که توسط عامل‌های هوش مصنوعی برای ذخیره و بازیابی اطلاعات معنایی استفاده می‌شود و به عنوان حافظه بلندمدت عامل عمل می‌کند.
تولید مبتنی بر بازیابی (RAG)
یک معماری هوش مصنوعی که داده‌های خارجی را از یک پایگاه داده برای ارائه زمینه قبل از تولید پاسخ، واکشی می‌کند.
جداسازی زمانی
جدایی در زمان بین زمانی که یک حمله کاشته می‌شود (تزریق) و زمانی که واقعاً فعال می‌شود (اجرا).

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

محققان تهدید 45%مدافعان سازمانی 35%معماران سیستم‌های هوش مصنوعی 20%
  1. [1]VentureBeatمدافعان سازمانی

    AI agents that pass authentication can still drift, expose data, or get memory-poisoned

    مطالعه در VentureBeat
  2. [2]VentureBeatمدافعان سازمانی

    AI agents need their own identity before they need a gateway

    مطالعه در VentureBeat
  3. [3]arXivمحققان تهدید

    Hidden in Memory: Sleeper Memory Poisoning in LLM Agents

    مطالعه در arXiv
  4. [4]Wikipedia

    Prompt injection

    مطالعه در Wikipedia
  5. [5]OWASP Foundationمحققان تهدید

    OWASP GenAI Security Project

    مطالعه در OWASP Foundation
  6. [6]Palo Alto Networksمدافعان سازمانی

    What is a Prompt Injection Attack?

    مطالعه در Palo Alto Networks
  7. [7]IBMمدافعان سازمانی

    What is prompt injection?

    مطالعه در IBM
  8. [8]تیم سردبیری کوهستانمعماران سیستم‌های هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.