چگونه ابزار BenchMIRT هوش خام را از ایمنی در ارزیابی مدلهای زبانی بزرگ تفکیک میکند
یک چارچوب ارزیابی جدید از نظریههای آزمون روانسنجی برای بررسی اینکه بنچمارکهای مدلهای زبانی بزرگ واقعاً چه چیزی را میسنجند، استفاده میکند. این ابزار نشان میدهد که بسیاری از آزمونهای ایمنی بهطور ناخواسته به جای رفتار ایمن واقعی، به توانایی استدلال خام پاداش میدهند.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
- پژوهشگران ایمنی هوش مصنوعی
- آنها خواستار ارزیابیهای دقیق و تفکیکشده هستند تا اطمینان حاصل شود مدلها واقعاً ایمناند.
- تیمهای تامین سازمانی
- آنها فرآیندهای آزمون مقرونبهصرفه و کارآمد را برای استقرار در دنیای واقعی در اولویت قرار میدهند.
- ارزیابان متنباز
- آنها حامی شفافیت و ممیزی مستقل ادعاهای شرکتها درباره بنچمارکها هستند.
دیدگاههایی که این گزارش پوشش نداده
- آزمایشگاههای پیشرو هوش مصنوعی
- نهادهای نظارتی
نکات کلیدی
- موسسه هوش مصنوعی آلن و Hugging Face ابزار BenchMIRT را برای ممیزی اینکه بنچمارکهای مدلهای زبانی بزرگ واقعاً چه چیزی را میسنجند، منتشر کردند.
- این چارچوب از نظریه پاسخ به سوال برای تحلیل ارزیابیها در سطح تکتک پرسشها استفاده میکند.
- تحلیلها نشان میدهد که بسیاری از بنچمارکهای ایمنی در واقع همبستگی قویتری با توانایی استدلال عمومی دارند.
- ابزار BenchMIRT میتواند عملکرد مدل را با دقت ۷۹ درصد پیشبینی کند، در حالی که تنها از بخش کوچکی از پرسشهای اصلی استفاده میکند.
پژوهشگران هوش مصنوعی و تیمهای تامین سازمانی تعیین میکنند که کدام مدلهای زبانی به دست عموم برسند و برای این تصمیمگیریها بهشدت به نمرات بنچمارکهای استاندارد وابسته هستند. با انتشار ابزار BenchMIRT در ۱ سپتامبر ۲۰۲۶ توسط موسسه هوش مصنوعی آلن (Ai2) و Hugging Face، این ارزیابان اکنون میتوانند خود آزمونها را ممیزی کنند و با کنار زدن پرسشهای گمراهکننده، دریابند که آیا یک مدل واقعاً ایمن است یا صرفاً توانمندی بالایی دارد.[1][2]
صنعت هوش مصنوعی مدتهاست که بنچمارکهایی مانند MMLU یا HarmBench را بهعنوان احکامی قطعی در نظر میگیرد. اگر سیستمی در یک آزمون ایمنی نمره بالایی کسب کند، فرض بر این است که رفتاری ایمن دارد. اما BenchMIRT نشان میدهد که چگونه یک نمره کلی اغلب شبکهای درهمتنیده از قابلیتهای پنهان را میپوشاند و به مدلها برای ویژگیهایی پاداش میدهد که آزمون هرگز برای سنجش آنها طراحی نشده بود.[1]
این چارچوب، نظریه چندبعدی پاسخ به سوال (IRT) را — که یک تکنیک روانسنجی است و در اصل برای آزمونهای استاندارد انسانی طراحی شده — در هوش مصنوعی به کار میگیرد. به جای اینکه فرض شود هر پرامپت ارزش اطلاعاتی یکسانی دارد، IRT بر این مبنا کار میکند که برخی پرسشها دشوارترند، در حالی که برخی دیگر در تفکیک ویژگیهای خاص میان آزموندهندگان عملکرد بهتری دارند.[2]
موسسه Ai2 این چارچوب را با استفاده از نتایج ۱۰۰ مدل زبانی مختلف که به بیش از ۳۴,۰۰۰ پرسش در ۱۶ بنچمارک محبوب پاسخ داده بودند، آموزش داد. بدون اینکه به BenchMIRT گفته شود هر آزمون قرار است چه چیزی را بسنجد، این ابزار بهطور مستقل دو بعد اصلی را که هدایتکننده پاسخها بودند شناسایی کرد: استدلال عمومی و رفتار ایمن.[1][2]
وقتی پژوهشگران بنچمارکهای موجود را در برابر این دو بعد قرار دادند، نتایج، چندین فرض رایج در صنعت را دگرگون کرد. برای نمونه، بنچمارک WMDP (پروکسی سلاحهای کشتار جمعی) برای این طراحی شده که بسنجد آیا مدل از ارائه دانش خطرناک و دوگانه در حوزههای زیستشناسی و امنیت سایبری خودداری میکند یا خیر. با این حال، BenchMIRT دریافت که نمرات WMDP همبستگی بسیار قویتری با استدلال عمومی دارند تا با ایمنی.
وقتی پژوهشگران بنچمارکهای موجود را در برابر این دو بعد قرار دادند، نتایج، چندین فرض رایج در صنعت را دگرگون کرد.
دلیل این امر خلاف شهود است: مدلهای بسیار توانمند در تشخیص بستر خطرناک یک پرسش بهتر عمل میکنند و همین به آنها اجازه میدهد اطلاعاتی را که مشمول جریمه میشوند، ارائه دهند. به همین ترتیب، بنچمارک سوگیری برای پرسش و پاسخ (BBQ) که بهطور گسترده بهعنوان یک آزمون ایمنی دستهبندی میشود، همراستایی بسیار بیشتری با توانایی استدلال خام دارد. تیم Hugging Face در این باره نوشت: «BenchMIRT راهی برای درک بهتر و اصلاح بنچمارکهایی ارائه میدهد که پژوهشگران برای ارزیابی قابلیتهای مدل استفاده میکنند» و خاطرنشان کرد که این ابزار میتواند «پرسشهایی را که اطلاعات مفید چندانی اضافه نمیکنند، نمایان سازد.»[1]
فراتر از افشای آزمونهای ناقص، این چارچوب به ارزیابان اجازه میدهد تا فرآیندهای آزمون خود را بهشدت کوچک کنند. با شناسایی پرامپتهایی که بیشترین اطلاعات را به همراه دارند، BenchMIRT نشان میدهد که حفظ تنها ۱۰ تا ۵۰ درصد از پرسشهای یک بنچمارک، دقیقاً همان رتبهبندی مدلها را حفظ کرده و هزینههای پردازشی اضافی را حذف میکند.[1]
در مورد پرسشهای کنار گذاشته شده (held-out)، این سیستم در ۷۹ درصد مواقع بهدرستی پیشبینی میکند که آیا یک مدل پاسخ صحیح خواهد داد یا خیر؛ در مقایسه با دقت ۷۰ درصدی روش پایهای که صرفاً میانگین نمره کلی مدل در بنچمارک را در نظر میگیرد. این بدان معناست که آزمایشگاهها میتوانند ارزیابیهای سریعتر و ارزانتری را بدون از دست دادن دقت انجام دهند.[1]
البته نسخه فعلی محدودیتهایی نیز دارد. مدلهایی که برای آموزش این چارچوب استفاده شدهاند، همگی تا مارس ۲۰۲۵ منتشر شده بودند؛ به این معنی که این تحلیل هنوز نشان نمیدهد سیستم در مواجهه با جدیدترین نسل مدلهای متمرکز بر استدلال چگونه رفتار میکند.[1]
انتشار کد و مجموعه دادهها، ابزارهای لازم را برای راستیآزمایی ادعاهای ایمنی شرکتها در اختیار ممیزان مستقل قرار میدهد. وقتی یک آزمایشگاه پیشرو ادعا میکند مدل جدیدش از یک آستانه ایمنی خاص عبور کرده است، اشخاص ثالث اکنون میتوانند بررسی کنند که آیا آن آستانه واقعاً ایمنی را میسنجد یا صرفاً بازتابی از توانایی مدل در درک دستورالعملهای پیچیده است.[5]
اصطلاحات کلیدی
- نظریه پاسخ به سوال (IRT)
- یک تکنیک روانسنجی که برای سنجش تواناییها بر اساس الگوهای پاسخ به آزمون استفاده میشود و دشواری تکتک پرسشها را در نظر میگیرد.
- بنچمارک مدل زبانی بزرگ (LLM)
- یک آزمون استاندارد که برای ارزیابی قابلیتها، دانش یا ایمنی یک مدل زبانی بزرگ طراحی شده است.
- استدلال عمومی
- توانایی گسترده یک مدل در پردازش اطلاعات، حل مسائل پیچیده و پیروی از دستورالعملهای چندمرحلهای.
چرا مهم است
از آنجا که دولتها و شرکتها برای تعیین ایمن بودن استقرار یک مدل هوش مصنوعی به نمرات بنچمارکها تکیه میکنند، آزمونهای ناقص میتوانند رفتارهای خطرناک را پشت نمرات بالای هوش پنهان کنند. با ارائه ابزاری برای ممیزی خود آزمونها، BenchMIRT به سازمانها اجازه میدهد تا بررسی کنند که آیا یک مدل واقعاً ایمن است یا صرفاً آنقدر باهوش است که بتواند ارزیابی را دور بزند.
منابع
[1]Hugging Face Blogارزیابان متنبازBenchMIRT: What are LLM benchmarks actually measuring?
مطالعه در Hugging Face Blog →
[2]Allen Institute for AIپژوهشگران ایمنی هوش مصنوعیbenchMIRT: Disentangling Safety and General Capabilities in LLM Evaluation
مطالعه در Allen Institute for AI →
[3]GitHubارزیابان متنبازallenai/BenchMIRT
مطالعه در GitHub →
[4]Hugging Face Collectionsارزیابان متنبازBenchMIRT - a allenai Collection
مطالعه در Hugging Face Collections →
[5]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

