نقص حیاتی در API به مدلهای هوش مصنوعی ضعیفتر اجازه داد تا استدلال و اسرار پنهان مدلهای پیشرو را رمزگشایی کنند
یک آسیبپذیری که اخیراً فاش شده است، به محققان اجازه داد تا با بازپخش دادهها از طریق مدلهای ضعیفتر همان ارائهدهندگان، استدلال رمزگذاری شده «زنجیره فکری» (chain-of-thought) را از مدلهای هوش مصنوعی سطح بالا استخراج کنند و کلیدهای API و رمزهای عبور پنهان را افشا سازند.
به قلم کیان راد
این خبر را به اشتراک بگذارید
- محققان امنیتی
- استدلال میکنند که این آسیبپذیری یک شکست اساسی در طراحی API را نشان میدهد تا یک مسئله همسوسازی خاص هوش مصنوعی.
- ارائهدهندگان مدلهای هوش مصنوعی
- بر استقرار سریع اقدامات کاهشی سمت سرور و حفظ معماریهای API بدون حالت (stateless) تمرکز دارند.
- توسعهدهندگان سازمانی
- نگرانی خود را در مورد مسئولیت پنهان به اشتراکگذاری گزارشهای عامل و نیاز به پاکسازی پیشفرض بهتر ابراز میکنند.
در میان ۶٬۷۰۸ مسیر عامل عمومی که از گیتهاب (GitHub) و هاگینگ فیس (Hugging Face) جمعآوری شده بودند، محققان اخیراً ۳۱۵٬۳۲۰ بلوک «تفکر» جاسازی شده را رمزگشایی کردند که قرار بود توسط ارائهدهندگان پیشرو هوش مصنوعی جهان به صورت رمزنگاری شده مهر و موم شوند. در داخل این بلوکها، تیم تحقیقاتی گنجینهای از اطلاعات حساس را یافت که توسعهدهندگان هرگز قصد به اشتراکگذاری آنها را نداشتند، از جمله ۶۲ کلید API فعال، ۳۳ رمز عبور و دهها آدرس ایمیل شخصی. این افشاگری نتیجه یک هک پیچیده دولتی یا یک پیشرفت اساسی در رمزنگاری نبود، بلکه یک آسیبپذیری ساختاری در نحوه مدیریت مونولوگهای داخلی توسط مدلهای پیشرو هوش مصنوعی بود. محققان با بهرهبرداری از این نقص، نشان دادند که ردیابیهای استدلالی پنهان پیشرفتهترین مدلهای موجود در بازار کاملاً قابل خواندن هستند و سربار پروتکل مبهم را به یک مسئولیت بزرگ برای توسعهدهندگان سازمانی تبدیل میکنند.[3][4]
آسیبپذیری معماری که اخیراً در APIهای اوپنایآی (OpenAI)، آنتروپیک (Anthropic) و گوگل فاش شد، به هر کسی که دسترسی اولیه به API داشت اجازه میداد تا استدلال پنهان «زنجیره فکری» را از مدلهای هوش مصنوعی سطح بالا استخراج کند. این حمله بر یک مکانیسم فوقالعاده ساده متکی بود: گرفتن یک بلوک استدلالی رمزگذاری شده که توسط یک مدل پرچمدار (مانند Claude Opus ۴.۸ یا GPT-۵.۶) تولید شده بود و تغذیه آن به یک مدل خواهر/برادر ارزانتر و ضعیفتر از همان ارائهدهنده. از آنجایی که API بلوک رمزگذاری شده را بدون تأیید اینکه کدام مدل آن را ایجاد کرده است، میپذیرفت، مهاجمان میتوانستند مدل ضعیفتر را مجبور کنند تا افکار پنهان را به صورت متن ساده خروجی دهد. این بازپخش بین مدلی (cross-model replay) به طور مؤثری از حفاظتهای سختگیرانه مالکیت معنوی و فیلترهای ایمنی که ارائهدهندگان میلیونها دلار برای ساخت آنها در سیستمهای پرچمدار خود هزینه کرده بودند، عبور کرد.[1]
مکانیسم پشت این استخراج، یک سهلانگاری ساده در استقرار بود تا یک شکست در الگوریتمهای رمزنگاری زیربنایی. بستههای استدلالی رمزگذاری شده که توسط APIهای ارائهدهنده بازگردانده میشدند، با استفاده از یک کلید جهانی و در سطح ارائهدهنده تأیید اعتبار میشدند. نکته مهم این بود که آنها به صورت رمزنگاری شده به یک حساب کاربری خاص، یک شناسه جلسه منحصر به فرد یا یک رده مدل خاص محدود نشده بودند. ارائهدهندگان این سیستم را به این شکل طراحی کردند تا زمینه مکالمه چند مرحلهای را بدون حالت (statelessly) حفظ کنند و وضعیت رمزگذاری شده را برای ذخیره و بازگرداندن در درخواست بعدی، به برنامه مشتری (Client) تحویل دهند. با این حال، با عدم محدود کردن محل بازپخش این وضعیت، آنها ناخواسته سیستمی ایجاد کردند که در آن هر مدل معتبری در اکوسیستم میتوانست افکار هر مدل دیگری را رمزگشایی و پردازش کند.[3]

از آنجایی که مدلهای سبکتر فاقد همسوسازی تهاجمی ضد تقطیر (anti-distillation alignment) و حفاظهای ایمنی سختگیرانهای هستند که در ردههای پرچمدار اعمال میشوند، آنها به عنوان اوراکلهای رمزگشایی بسیار سازگار عمل کردند. هنگامی که توسط یک فرمان کاربر (prompt) برای رونویسی کلمه به کلمه تفکر داخلی دستور داده میشد، مدلهایی مانند Claude Haiku ۴.۵ یا Gemini Robotics ER-۱.۶ به سادگی از دستورالعملها پیروی میکردند. آنها فاقد مکانیسمهای پیچیده امتناع بودند که معمولاً از افشای زنجیره فکری اختصاصی یک مدل پیشرو یا افشای فیلترهای ایمنی حساس جلوگیری میکنند. این پویایی به محققان اجازه داد تا صدها هزار بلوک استدلالی را به صورت سیستماتیک و با کسری از هزینه پرسوجو از مدلهای پرچمدار رمزگشایی کنند، و نشان داد که چگونه آسیبپذیریهای امنیتی API بدون کنترل میتوانند به طور کامل حفاظهای خدمات ابری حساس را به خطر اندازند.[1]
آنها فاقد مکانیسمهای پیچیده امتناع بودند که معمولاً از افشای زنجیره فکری اختصاصی یک مدل پیشرو یا افشای فیلترهای ایمنی حساس جلوگیری میکنند.
در حالی که واکنشهای اولیه در شبکههای اجتماعی و روایتهای بازاریابی این حادثه را به عنوان موردی از «سرکشی» عوامل هوش مصنوعی یا «هک شدن» مدلها معرفی کردند، واقعیت یک شکست امنیتی سنتی و کاملاً شناخته شده در API است. مدلها دقیقاً کاری را انجام دادند که API به آنها اجازه میداد: پردازش یک محموله معتبر و تأیید شده که توسط سرور به آنها تحویل داده شده بود. این شکست در سطح زیرساخت رخ داد، جایی که دروازه API نتوانست منشأ و مقصد مورد نظر محموله رمزگذاری شده را تأیید کند. این تمایز برای تیمهای امنیتی سازمانی حیاتی است، زیرا تمرکز را از مسائل نظری همسوسازی هوش مصنوعی به سمت شیوههای استاندارد امنیت سایبری، مانند کشف مداوم API، اعتبارسنجی سختگیرانه محموله و مدیریت قوی جلسه، تغییر میدهد.[1]
فوریترین و مخربترین پیامد این آسیبپذیری بر توسعهدهندگانی وارد شد که به طور معمول گزارشهای خام عامل خود را برای اشکالزدایی یا همکاری به صورت عمومی به اشتراک میگذاشتند. از آنجایی که بلوکهای استدلالی به صورت رشتههای مبهم و کدگذاری شده با Base۶۴ ظاهر میشدند، توسعهدهندگان کاملاً بیاطلاع بودند که دادههای حساس در داخل آنها جاسازی شده است. اگر یک عامل مستقل در طول وظیفه خود یک فایل پیکربندی حاوی متغیرهای محیطی، URLهای پایگاه داده یا کلیدهای API را میخواند، آن اطلاعات اغلب در ردیابی استدلال پنهان مدل حفظ میشد. حتی اگر توسعهدهندگان متن چت قابل مشاهده را قبل از بارگذاری در گیتهاب با دقت پاکسازی میکردند، بلوکهای رمزگذاری شده بیصدا اسرار متن ساده را حمل میکردند و آنها را کاملاً در معرض دید هر کسی که میدانست چگونه بلوک را از طریق یک مدل ضعیفتر بازپخش کند، قرار میدادند.[1]

فراتر از استخراج دادههای خصوصی و منطق مدل اختصاصی، قابلیت حمل این بلوکهای استدلالی شکل جدیدی از تزریق فرمان نامرئی (invisible prompt injection) را امکانپذیر ساخت. محققان نشان دادند که یک مهاجم میتواند یک دستور مخرب را در داخل یک بلوک استدلالی رمزگذاری شده ایجاد کند و آن را در یک گردش کار عمومی یا مخزن مشترک قرار دهد. هنگامی که عامل قربانی آن بلوک را در طول یک کار معمول پردازش میکرد، مدل دستورالعملهای مخرب را به عنوان استدلال قبلی خود میپذیرفت. این امر به مهاجمان اجازه میداد تا اقدامات غیرمجاز، مانند استخراج دادهها به یک سرور خارجی، را بدون هیچ محرک قابل مشاهده یا متن مشکوکی که در فرمان کاربر ظاهر شود، اجرا کنند، و تشخیص حمله را از طریق نظارت استاندارد ورودی تقریباً غیرممکن میساخت.[1][3]
پس از افشای مسئولانه توسط تیم تحقیقاتی بینالمللی – که شامل کارشناسان امنیتی از برنامه MATS، مؤسسه ماکس پلانک و اسنیک (Snyk) بود – اوپنایآی، آنتروپیک و گوگل به سرعت اقدامات کاهشی سمت سرور (server-side mitigations) را مستقر کردند. حملات بازپخش بین مدلی دیگر در ساختارهای API فعلی قابل تکرار نیستند. ارائهدهندگان شروع به محدود کردن رمزنگاری بستههای استدلالی به مدلها و جلسات مبدأ خاص در لایه دروازه API کردهاند و اطمینان حاصل میکنند که بلوکی که توسط یک مدل تولید شده است، نمیتواند توسط مدل دیگری رمزگشایی یا پردازش شود. در حالی که تهدید فوری خنثی شده است، این حادثه به عنوان یک یادآوری آشکار از مرزهای امنیتی شکننده پیرامون عوامل مستقل هوش مصنوعی عمل میکند.[1][2]
با وجود استقرار موفقیتآمیز وصلهها، این حادثه یک تغییر دائمی را در نحوه برخورد توسعهدهندگان با گزارشهای عامل هوش مصنوعی و دادههای جلسه تحمیل میکند. کارشناسان امنیتی اکنون قویاً توصیه میکنند که با بلوکهای استدلالی مبهم به عنوان محمولههای بسیار حساس رفتار شود تا صرفاً سربار پروتکل. از توسعهدهندگان خواسته میشود که این بلوکها را قبل از به اشتراکگذاری عمومی هرگونه ردیابی، به طور سیستماتیک حذف کنند. علاوه بر این، سازمانهایی که عوامل هوش مصنوعی را مستقر میکنند، باید سیاستهای تهاجمی چرخش اعتبار (credential rotation) را اجرا کنند، با فرض اینکه هر رازی که یک عامل ممکن است در طول یک جلسه لمس کرده باشد، به خطر افتاده است، صرف نظر از اینکه آیا در خروجی نهایی و قابل مشاهده برنامه ظاهر شده است یا خیر.[1]
نکات کلیدی
- یک نقص در APIهای اوپنایآی، آنتروپیک و گوگل امکان استخراج استدلال پنهان هوش مصنوعی را فراهم کرد.
- مهاجمان بلوکهای استدلالی رمزگذاری شده را از طریق مدلهای ضعیفتر بازپخش کردند تا آنها را به متن ساده رمزگشایی کنند.
- محققان ۶۲ کلید API و ۳۳ رمز عبور را از گزارشهای عامل که به صورت عمومی به اشتراک گذاشته شده بودند، بازیابی کردند.
- این آسیبپذیری همچنین تزریق فرمان نامرئی (prompt injection) را از طریق بلوکهای استدلالی مخرب امکانپذیر ساخت.
- هر سه ارائهدهنده اصلی هوش مصنوعی اقدامات کاهشی سمت سرور را برای جلوگیری از بازپخشهای بین مدلی مستقر کردهاند.
بررسی عمیق دیدگاهها
محققان امنیتی
استدلال میکنند که این آسیبپذیری یک شکست اساسی در طراحی API را نشان میدهد تا یک مسئله همسوسازی خاص هوش مصنوعی.
محققان تأکید میکنند که این نقص یک شکست رمزنگاری نبود، بلکه یک سهلانگاری در استقرار بود. با عدم محدود کردن محمولههای رمزگذاری شده به جلسات یا مدلهای خاص، ارائهدهندگان پنهانسازی را به عنوان امنیت تلقی کردند. آنها استدلال میکنند که تا زمانی که ارائهدهندگان به محدودیتهای سختگیرانه در هر جلسه متعهد نشوند، توسعهدهندگان باید فرض کنند که تمام دادههای زنجیره فکری قابل خواندن هستند و با آنها به عنوان دادههای بسیار حساس رفتار کنند.
ارائهدهندگان مدلهای هوش مصنوعی
بر استقرار سریع اقدامات کاهشی سمت سرور و حفظ معماریهای API بدون حالت (stateless) تمرکز دارند.
به دنبال افشاگری، فروشندگانی مانند آنتروپیک، اوپنایآی و گوگل به سرعت وصلههایی را برای جلوگیری از بازپخشهای بین مدلی اجرا کردند. آنها معتقدند که بازگرداندن وضعیت رمزگذاری شده به مشتری برای تعاملات کارآمد و بدون حالت API ضروری است، اما اذعان دارند که این پیادهسازی نیاز به محدودیت رمزنگاری قویتری داشت تا از عمل کردن مدلهای ضعیفتر به عنوان اوراکلهای رمزگشایی جلوگیری شود.
توسعهدهندگان سازمانی
نگرانی خود را در مورد مسئولیت پنهان به اشتراکگذاری گزارشهای عامل و نیاز به پاکسازی پیشفرض بهتر ابراز میکنند.
برای توسعهدهندگانی که عوامل مستقل میسازند، این افشاگری یک زنگ بیدارباش بود. بسیاری از آنها به طور معمول گزارشهای خام جلسه را برای اشکالزدایی به اشتراک میگذاشتند، بدون اینکه بدانند بلوکهای استدلالی مبهم حاوی اسرار متن سادهای هستند که عامل پردازش کرده است. این گروه اکنون از ابزارهایی حمایت میکنند که به طور خودکار بلوکهای استدلالی را از ردیابیهای مشترک حذف کنند و از ارائهدهندگان میخواهند که چنین پاکسازی را به رفتار پیشفرض تبدیل کنند.
چرا مهم است
برای توسعهدهندگانی که در حال ساخت عوامل (Agents) مستقل هوش مصنوعی هستند، این آسیبپذیری نشان میدهد که به اشتراکگذاری گزارشهای خام جلسه برای اشکالزدایی میتواند ناخواسته متغیرهای محیطی حساس و کلیدهای API را فاش کند. این موضوع بر نیاز حیاتی به رفتار با بلوکهای استدلالی مبهم هوش مصنوعی به عنوان محمولههای حساس، نه سربار پروتکل بیضرر، تأکید میکند.
منابع
[1]The Hacker Newsمحققان امنیتی
OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models' Reasoning
مطالعه در The Hacker News →[2]The Neuronارائهدهندگان مدلهای هوش مصنوعی
Researchers Cracked Open AI's Hidden Reasoning
مطالعه در The Neuron →[3]arXivمحققان امنیتی
Stealing Reasoning Traces from Proprietary LLM APIs
مطالعه در arXiv →[4]AlphaXivمحققان امنیتی
Stealing Reasoning Traces from Proprietary LLM APIs
مطالعه در AlphaXiv →
نظرات
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.







