رفتن به محتوای اصلی
توضیح کوهستانایمنی هوش مصنوعیتوضیح و تحلیل۲۸ مرداد ۱۴۰۵، ۱۸:۲۵· 6 دقیقه مطالعه· #1 از 5 در هوش مصنوعی

چگونه حمله «اچ-سی‌او‌تی» سیستم‌های ایمنی هوش مصنوعی پیشرو را با کمتر از ۲۰۰ دلار از بین می‌برد

محققان نشان داده‌اند که فرآیندهای استدلال داخلی مدل‌های پیشرفته هوش مصنوعی می‌توانند ربوده شوند تا از موانع ایمنی آنها عبور کنند. حمله «اچ-سی‌او‌تی» (H-CoT) نرخ امتناع مدل‌ها را از ۹۸٪ به کمتر از ۲٪ کاهش می‌دهد و یک آسیب‌پذیری ساختاری را در نحوه پردازش درخواست‌های پیچیده توسط سیستم‌های مدرن هوش مصنوعی آشکار می‌کند.

به قلم ندا وزیری

محققان امنیتی دانشگاهی 45%جامعه متن‌باز 30%تحلیلگران مستقل 25%
محققان امنیتی دانشگاهی
تمرکز بر شناسایی آسیب‌پذیری‌هایی مانند ربایش استدلال برای ساخت تکنیک‌های همسوسازی قوی‌تر قبل از استقرار گسترده مدل‌ها.
جامعه متن‌باز
استدلال می‌کنند که مدل‌های شفاف و با وزن باز به جامعه گسترده‌تر اجازه می‌دهند تا این آسیب‌پذیری‌ها را سریع‌تر از آزمایشگاه‌های بسته کشف و رفع کنند.
تحلیلگران مستقل
بررسی نقص‌های ساختاری در معماری هوش مصنوعی و انگیزه‌های اقتصادی که بازی موش و گربه امنیت مدل را هدایت می‌کنند.

هنگامی که یک کاربر از یک مدل هوش مصنوعی پیشرو می‌خواهد یک اسکریپت مخرب بنویسد یا یک ماده شیمیایی خطرناک سنتز کند، سیستم صرفاً یک پاسخ امتناع از پیش تعیین شده ارائه نمی‌دهد. در عوض، مکث می‌کند. در کسری از ثانیه، مدل یک «زنجیره فکری» پنهان، یک مونولوگ داخلی خصوصی، ایجاد می‌کند که برای ارزیابی درخواست کاربر در برابر دستورالعمل‌های ایمنی خود استفاده می‌شود. تنها پس از اینکه این بررسی نامرئی به این نتیجه رسید که درخواست مضر است، مدل رسماً از پاسخ دادن خودداری می‌کند.[6]

این فرآیند مشورتی ویژگی بارز «مدل‌های استدلال بزرگ» (LRMs) است، یک معماری جدید که توسط توسعه‌دهندگان پیشرو صنعت برای هوشمندتر و ایمن‌تر کردن هوش مصنوعی پذیرفته شده است. با وادار کردن مدل به فکر کردن قبل از صحبت کردن، توسعه‌دهندگان نرخ موفقیت روش‌های سنتی «جیلبریک» (Jailbreak) را به طور قابل توجهی کاهش دادند. اما این تغییر معماری یک آسیب‌پذیری عمیق جدید نیز ایجاد کرد. اگر مهاجم بتواند به نوعی به داخل آن مکث پنهان نفوذ کرده و مونولوگ داخلی مدل را بازنویسی کند، موانع ایمنی به طور کامل فرو می‌ریزند.[6]

در اوایل سال ۲۰۲۵، تیمی از محققان ثابت کردند که این آسیب‌پذیری نظری کاملاً عملی است. آنها تکنیکی به نام «ربودن زنجیره فکری» یا «اچ-سی‌او‌تی» (H-CoT) را معرفی کردند، یک حمله خصمانه که به طور خاص برای دور زدن مکانیسم‌های ایمنی مدل‌های استدلال پیشرو طراحی شده است. محققان با دستکاری مراحل استدلال میانی که این مدل‌ها به آن تکیه می‌کنند، نشان دادند که دقیقاً همان سیستم‌هایی که برای تضمین ایمنی ساخته شده‌اند، می‌توانند علیه خودشان استفاده شوند.[1]

نتایج تجربی حمله H-CoT تکان‌دهنده بود. هنگامی که مدل‌های بسیار ایمن تحت این تکنیک قرار گرفتند، نرخ امتناع آنها از خط پایه اولیه ۹۸ درصد به زیر ۲ درصد کاهش یافت. مهاجمان توانستند به راحتی استراتژی‌های مجرمانه، کدهای مضر و دستورالعمل‌های خطرناک را از سیستم‌هایی استخراج کنند که قبلاً در برابر دستکاری مقاوم تلقی می‌شدند. این حمله در طیف وسیعی از LRMهای تجاری مؤثر بود و رویکرد صنعت به همسوسازی (Alignment) را به طور اساسی به چالش کشید.[1]

برای درک مکانیک H-CoT، لازم است نحوه پردازش درخواست‌های پیچیده توسط مدل‌های استدلال بررسی شود. هنگامی که یک LRM یک درخواست بالقوه خطرناک دریافت می‌کند، وارد مرحله «توجیه» می‌شود. در طول این مرحله، مدل درخواست را در برابر آموزش ایمنی خود می‌سنجد و به طور مؤثر با خودش بحث می‌کند که آیا درخواست محدودیت‌های اخلاقی آن را نقض می‌کند یا خیر. این معادل دیجیتالی یک نگهبان امنیتی است که قبل از اعطای دسترسی به یک منطقه محدود، کارت شناسایی را بررسی می‌کند.[6]

چگونه حمله ربایش زنجیره فکری (H-CoT) بررسی‌های ایمنی داخلی را دور می‌زند.

اگر مرحله توجیه تشخیص دهد که درخواست ایمن است، مدل به مرحله «اجرا» منتقل می‌شود، جایی که پاسخ نهایی را برای کاربر تولید می‌کند. تلاش‌های سنتی جیلبریک بر فریب دادن مدل در طول درخواست اولیه تمرکز دارند، به این امید که مرحله توجیه را با ایفای نقش‌های پیچیده یا سناریوهای فرضی گیج کنند. با این حال، با پیچیده‌تر شدن مدل‌ها، این ترفندهای سطحی به طور فزاینده‌ای بی‌اثر شده‌اند.[6]

حمله H-CoT یک رویکرد ساختاری متفاوت را در پیش می‌گیرد: به جای تلاش برای فریب مرحله توجیه، سعی می‌کند به طور کامل از آن بگذرد. این حمله با پنهان کردن یک درخواست خطرناک در زیر یک درخواست آموزشی به ظاهر مشروع آغاز می‌شود. محققان این رویکرد را در یک معیار به نام «مربی مخرب» (Malicious-Educator) رسمی کردند که نحوه پاسخ مدل‌ها به نیت مضر پیچیده شده در چارچوب‌های آکادمیک یا نظری را آزمایش می‌کند.[1][3]

حمله H-CoT یک رویکرد ساختاری متفاوت را در پیش می‌گیرد: به جای تلاش برای فریب مرحله توجیه، سعی می‌کند به طور کامل از آن بگذرد.

هنگامی که درخواست پنهان شد، مهاجم یک مرحله اجرای ساختگی را مستقیماً به پنجره متنی مدل تزریق می‌کند. هنگامی که مدل استدلال این فکر تزریق شده را می‌خواند، دچار سردرگمی می‌شود. فرض می‌کند که مرحله توجیه قبلاً رخ داده است، بررسی‌های ایمنی با موفقیت انجام شده‌اند و درخواست رسماً برای اجرا تأیید شده است. منطق داخلی مدل توسط پیش‌فرض وارد شده توسط مهاجم ربوده می‌شود.[1]

از آنجایی که مرحله اجرای یک LRM مولد است نه مشورتی، مدل به سادگی الگوی ایجاد شده توسط متن تزریق شده را ادامه می‌دهد. دقیقاً از جایی که فکر جعلی متوقف شده است، ادامه می‌دهد و شروع به اجرای درخواست مضر می‌کند. مهاجم با وادار کردن مدل به صرف نظر کردن از بحث داخلی خود، میلیاردها دلار سرمایه‌گذاری شده در همسوسازی ایمنی و یادگیری تقویتی را به طور کامل خنثی می‌کند.[6]

حمله H-CoT باعث شد نرخ امتناع در مدل‌های استدلال پیشرو به شدت کاهش یابد.

این پویایی یک تنش اساسی در طراحی هوش مصنوعی مدرن را آشکار می‌کند. شفافیت فرآیند استدلال، که برای قابل تفسیرتر و قابل اعتمادتر کردن مدل‌ها در نظر گرفته شده بود، به طور همزمان یک سطح حمله بسیار قابل بهره‌برداری ایجاد می‌کند. هنگامی که معیارهای تصمیم‌گیری داخلی یک مدل آشکار یا به راحتی قابل دستکاری باشند، سیستم در برابر «سندبگینگ» (Sandbagging) و حملات معیاری که قابلیت‌های واقعی آن را تضعیف می‌کنند، آسیب‌پذیر می‌شود.[5][6]

دسترسی اقتصادی به این حملات، آنها را به ویژه برای سیاست‌گذاران و متخصصان امنیتی نگران‌کننده می‌کند. تحقیقات قبلی نشان داده بود که حملات تنظیم دقیق (fine-tuning) می‌توانند ایمنی مدل را با کمتر از ۲۰۰ دلار کاهش دهند، اما H-CoT بدون نیاز به هیچ تنظیم دقیق پرهزینه‌ای، به دور زدن کامل دست می‌یابد. این حمله نیازی به دسترسی ممتاز، دانش داخلی یا بهره‌برداری از نرم‌افزارهای روز صفر ندارد—فقط دسترسی استاندارد API و درک عمیقی از نحوه عملکرد معماری‌های استدلال.[1][6]

صنعت هوش مصنوعی برای وصله دائمی این آسیب‌پذیری دچار مشکل شده است. از آنجایی که آموزش ایمنی و آموزش قابلیت اصلی وزن‌های ریاضی زیربنایی یکسانی دارند، مسدود کردن یک الگوی جیلبریک خاص صرفاً مهاجمان را مجبور می‌کند تا الگوی جدیدی را مهندسی کنند. این آسیب‌پذیری یک اشکال نرم‌افزاری ساده نیست که بتوان آن را با یک به‌روزرسانی سریع برطرف کرد؛ بلکه یک پیامد ذاتی نحوه ساخت و استقرار مدل‌های استدلال است.[6]

تحقیقات بعدی پایداری و مقیاس این تهدید را تأیید کرده است. در اواخر سال ۲۰۲۵، یک مطالعه گسترده، چارچوب حمله چند مرحله‌ای «تمپست» (TEMPEST) را در ده مدل پیشرو با تریلیون پارامتر تکرار کرد. نتایج نشان داد که تکنیک‌های همسوسازی فعلی، صرف نظر از مقیاس مدل یا سرمایه‌گذاری‌های ایمنی خاص فروشنده، همچنان در برابر حملات خصمانه تطبیقی و چند مرحله‌ای آسیب‌پذیر هستند.[4]

با تزریق یک مرحله اجرای ساختگی، مهاجمان می‌توانند هوش مصنوعی را مجبور کنند که بحث ایمنی داخلی خود را نادیده بگیرد.

چشم‌انداز تهدید با معرفی چارچوب‌های ربایش خودکار مانند «اتو-رَن» (AutoRAN) بیشتر تکامل یافت. این سیستم پیشگام یک الگوی شبیه‌سازی اجرا شد که از یک مدل ضعیف‌تر و کمتر همسو شده برای شبیه‌سازی استدلال اجرا برای تلاش‌های اولیه ربایش استفاده می‌کند. AutoRAN با بهره‌برداری از الگوهای استدلالی که از طریق امتناع‌های مدل هدف فاش می‌شود، حملات خود را به صورت تکراری اصلاح می‌کند و به نرخ موفقیت تقریباً ۱۰۰ درصدی در دور زدن دفاع‌های مبتنی بر استدلال دست می‌یابد.[2]

کشف H-CoT و توسعه سریع جانشین‌های خودکار، جامعه ایمنی هوش مصنوعی را مجبور به بازنگری کرده است. محققان اکنون در حال بررسی استراتژی‌های دفاعی کاملاً جدیدی هستند و تشخیص می‌دهند که موانع ثابت کافی نیستند. پیشنهادات نوظهور بر محافظت و رمزگذاری خود ردیابی‌های استدلال تمرکز دارند و اطمینان می‌دهند که مونولوگ داخلی از دستکاری کاربر و تزریق خصمانه جدا می‌ماند.[2][4]

همانطور که مدل‌های هوش مصنوعی به مقیاس خود ادامه می‌دهند و قابلیت‌های استدلالی آنها پیچیده‌تر می‌شود، بازی موش و گربه بین مهاجمان و مدافعان فقط تشدید خواهد شد. چالش برای نسل بعدی مدل‌های پیشرو دیگر فقط آموزش هوش مصنوعی برای گفتن «نه» به درخواست‌های مضر نیست. ضرورت جدید این است که اطمینان حاصل شود منطق داخلی خود مدل نمی‌تواند برای از بین بردن سیستم‌های ایمنی آن به سلاح تبدیل شود.[6]

نکات کلیدی

  • حمله H-CoT با دستکاری فرآیند استدلال داخلی مدل، فیلترهای ایمنی هوش مصنوعی را دور می‌زند.
  • نرخ امتناع در مدل‌های پیشرو هنگام قرار گرفتن در معرض این حمله، از ۹۸٪ به کمتر از ۲٪ کاهش یافت.
  • این تکنیک نیازی به دسترسی داخلی ندارد و می‌توان آن را با کمتر از ۲۰۰ دلار با استفاده از درخواست‌های استاندارد API اجرا کرد.
  • این حمله یک آسیب‌پذیری ساختاری را برجسته می‌کند که در آن شفافیت استدلال هوش مصنوعی به یک سطح قابل بهره‌برداری تبدیل می‌شود.
  • چارچوب‌های خودکار بعدی مانند AutoRAN به نرخ موفقیت تقریباً ۱۰۰ درصدی در دور زدن دفاع‌های مبتنی بر استدلال دست یافته‌اند.

چرا مهم است

از آنجایی که سیستم‌های هوش مصنوعی به طور فزاینده‌ای در زیرساخت‌های حیاتی و برنامه‌های کاربردی مصرف‌کننده ادغام می‌شوند، کشف اینکه مکانیسم‌های ایمنی اصلی آنها را می‌توان با هزینه‌ای ناچیز دور زد، یک شکاف امنیتی بزرگ را نمایان می‌کند. درک این آسیب‌پذیری برای توسعه‌دهندگان و سیاست‌گذارانی که تلاش می‌کنند نسل بعدی هوش مصنوعی را ایمن سازند، ضروری است.

اصطلاحات کلیدی

مدل استدلال بزرگ (LRM)
یک سیستم هوش مصنوعی پیشرفته که قبل از پاسخ دادن به یک درخواست، یک مونولوگ داخلی گام به گام پنهان ایجاد می‌کند.
زنجیره فکری (CoT)
مراحل استدلال میانی که هوش مصنوعی برای تجزیه یک مسئله پیچیده انجام می‌دهد.
جیلبریک (Jailbreak)
تکنیکی که برای دور زدن فیلترهای ایمنی یک مدل هوش مصنوعی و وادار کردن آن به تولید محتوای ممنوعه استفاده می‌شود.
همسوسازی (Alignment)
فرآیند آموزش یک مدل هوش مصنوعی برای پیروی از ارزش‌های انسانی و امتناع از درخواست‌های مضر.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

محققان امنیتی دانشگاهی 45%جامعه متن‌باز 30%تحلیلگران مستقل 25%
  1. [1]arXivمحققان امنیتی دانشگاهی

    H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

    مطالعه در arXiv
  2. [2]ACL Anthologyمحققان امنیتی دانشگاهی

    AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models

    مطالعه در ACL Anthology
  3. [3]GitHubجامعه متن‌باز

    Safety in Large Reasoning Models: A Survey

    مطالعه در GitHub
  4. [4]Hugging Faceمحققان امنیتی دانشگاهی

    Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

    مطالعه در Hugging Face
  5. [5]AlphaXivجامعه متن‌باز

    Evaluating the true capabilities of Large Language Models

    مطالعه در AlphaXiv
  6. [6]تیم سردبیری کوهستانتحلیلگران مستقل

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.