معمای همسویی: چرا آزمایشگاههای هوش مصنوعی بازخورد انسانی را با داوران هوش مصنوعی جایگزین میکنند؟
با بزرگتر شدن مدلهای زبانی، استاندارد صنعتی «یادگیری تقویتی از بازخورد انسانی» (RLHF) به بنبست هزینه و سرعت برخورد کرده است. «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) داوران هوش مصنوعی را جایگزین ارزیابهای انسانی میکند و ظرافتهای ذهنی انسان را فدای مقیاسپذیری عظیم میسازد.
به قلم کاوان رامین
این خبر را به اشتراک بگذارید
بهطور خلاصه
- «یادگیری تقویتی از بازخورد انسانی» (RLHF) برای همسو کردن مدلها به ارزیابهای گرانقیمت انسانی متکی است.
- «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) یک داور هوش مصنوعی را جایگزین انسانها میکند و هزینهها را بهشدت کاهش میدهد.
- «هوش مصنوعی قانوناساسیمحور» داور هوش مصنوعی را با استفاده از مجموعهای مکتوب از اصول صریح بهجای ترجیحات مبهم هدایت میکند.
در مارس ۲۰۲۲، شرکت OpenAI مقالهای منتشر کرد که نشان میداد یک مدل زبانی با ۱.۳ میلیارد پارامتر میتواند تنها با آموزش دیدن برای پیروی از دستورالعملها، از مدلی که ۱۰۰ برابر بزرگتر از آن است، عملکرد بهتری داشته باشد.[4]
این تکنیک، یعنی «یادگیری تقویتی از بازخورد انسانی» (RLHF)، به استاندارد صنعت تبدیل شد. این روش به حاشیهنویسان انسانی متکی است تا خروجیهای مدل را رتبهبندی کنند و مجموعه دادهای از ترجیحات بسازند که یک «مدل پاداش» را برای امتیازدهی به پاسخهای آینده آموزش میدهد. اگرچه این روش در بازاریابیها بهعنوان یک پیشرفت بزرگ در «درک» نیت انسان معرفی میشود، اما RLHF در اساس تنها یک مکانیسم هدایت آماری است که خروجیهای ناخوشایند برای انسان را جریمه میکند.[4][5]
اما با بزرگتر شدن مدلها، RLHF به یک دیوار ساختاری برخورد کرده است. برچسبگذاری انسانی گران، کند و مستعد تناقض است. آموزش یک مدل پاداش قوی میتواند به دهها هزار مقایسه انسانی نیاز داشته باشد، که گلوگاهی ایجاد میکند که سرعت تکرار را کاهش داده و حجم بازخورد ایمنی قابل تولید توسط یک آزمایشگاه را محدود میکند.[1]
جایگزین نوظهور، «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) است. توسعهدهندگان بهجای پرداخت پول به انسانها برای رتبهبندی خروجیها، از یک مدل زبانی آماده و بسیار توانمند بهعنوان داور استفاده میکنند و فرآیند تولید ترجیحات را خودکار میسازند.[1]
در اواخر سال ۲۰۲۲، شرکت Anthropic پیشگام نوع خاصی از این روش به نام «هوش مصنوعی قانوناساسیمحور» (Constitutional AI) شد. در این روش، بهجای تکیه بر ترجیحات مبهم انسانی، به مدل یک «قانون اساسی» مکتوب — مجموعهای از اصول صریح — داده میشود و آموزش میبیند تا خروجیهای خود را بر اساس آن قوانین نقد و اصلاح کند. این کار، همسویی را از یک بررسی حسی و ضمنی انسانی به یک معیار صریح و قابل حسابرسی تغییر میدهد.[2]
نتایج بهدستآمده، این فرض را که نظارت انسانی برای همسویی کاملاً ضروری است، به چالش میکشد. همانطور که نویسندگان یک مطالعه گوگل در سال ۲۰۲۳ اشاره کردند: «این نتایج نشان میدهد که RLAIF میتواند عملکردی در سطح انسان ارائه دهد و راهحلی بالقوه برای محدودیتهای مقیاسپذیری RLHF باشد.» در آزمایشهای رودررو روی وظایف خلاصهسازی، ارزیابهای انسانی خروجیهای هر دو روش RLAIF و RLHF را در حدود ۷۰ درصد مواقع به یک مدل پایه ترجیح دادند.[1]
همزمان، محققان در حال سادهسازی خود مرحله بهینهسازی هستند. در ماه مه ۲۰۲۳، پژوهشگران استنفورد روش «بهینهسازی مستقیم ترجیحات» (DPO) را معرفی کردند که نیاز به آموزش یک مدل پاداش مجزا را بهطور کامل از بین میبرد و دادههای ترجیحی را از نظر ریاضی مستقیماً روی خطمشی مدل زبانی نگاشت میکند تا بار محاسباتی کاهش یابد.[3]
مرزهای کنونی اکنون کاملاً مصنوعی (تولیدشده توسط ماشین) هستند. مقالهای در اوت ۲۰۲۴ از Meta FAIR درباره «ارزیابهای خودآموز» نشان داد که یک داور هوش مصنوعی میتواند قابلیتهای ارزیابی خود را بهصورت تکرارشونده و تنها با استفاده از دادههای مصنوعی بهبود بخشد؛ این کار امتیاز مدل Llama 3 70B را در معیار RewardBench از ۷۵.۴ به ۸۸.۳ ارتقا داد، آن هم بدون هیچگونه داده ترجیحی برچسبگذاریشده.[6]
تغییر از بازخورد انسانی به هوش مصنوعی، اقتصاد آموزش ایمنی را اساساً دگرگون میکند. با خودکارسازی حلقه ترجیحات، آزمایشگاهها میتوانند همسویی را با همان سرعتی که قابلیتهای خام را تکرار میکنند، پیش ببرند — هرچند این امر فشار عظیمی بر اصول اولیهای وارد میکند که داور هوش مصنوعی را هدایت میکنند، زیرا هرگونه نقطه کور در ارزیاب بهطور دائمی در مدل نهایی حک خواهد شد.[7]
بررسی عمیق دیدگاهها
دلایل دفاع از RLHF (بازخورد انسانی)
همسویی با دقت بالا که ریشه در ظرافتهای ذهنی انسان دارد.
یادگیری تقویتی از بازخورد انسانی همچنان استاندارد طلایی برای درک بافت فرهنگی ظریف و ترجیحات ذهنی است. از آنجا که این روش برای رتبهبندی خروجیها به حاشیهنویسان انسانی متکی است، در شناسایی موارد حاشیهای سمی و نقضهای ایمنی ظریفی که سیستمهای خودکار از دست میدهند، برتری دارد. با این حال، این دقت هزینه گزافی دارد: جمعآوری دهها هزار برچسب ترجیحی نیازمند هماهنگی و سرمایه انسانی عظیمی است که گلوگاه شدیدی برای تکرار سریع مدل ایجاد میکند.
دلایل دفاع از RLAIF (بازخورد هوش مصنوعی)
مقیاسپذیری عظیم و شفافیت صریح و مبتنی بر قانون.
یادگیری تقویتی از بازخورد هوش مصنوعی، شهود انسانی را با سرعت و مقیاس معاوضه میکند. با جایگزینی ارزیابهای انسانی با یک مدل زبانی بزرگ آماده که بهعنوان داور عمل میکند، آزمایشگاهها میتوانند مجموعهدادههای ترجیحی را در عرض چند ساعت و با کسری از هزینه تولید کنند. هنگامی که این روش توسط مجموعهای مکتوب از اصول هدایت شود — رویکردی که به عنوان هوش مصنوعی قانوناساسیمحور شناخته میشود — بازخورد بسیار شفاف و سازگار میشود. در آزمونهای معیار در زمینه خلاصهسازی، RLAIF به نرخ پیروزی ۷۰ درصدی نسبت به مدلهای پایه دست مییابد که با عملکرد RLHF برابری میکند، هرچند اگر حسابرسی نشود، خطر تشدید سوگیریهای ذاتی مدل داور را به همراه دارد.
- محققان همسویی خودکار
- اولویت دادن به حلقههای بازخورد مقیاسپذیر و مبتنی بر هوش مصنوعی برای همگام شدن با رشد سریع مدلها.
- تحلیلگران ایمنی و پایهگذاری
- تأکید بر ضرورت نظارت انسانی برای درک ظرافتهای ذهنی و فرهنگی.
دیدگاههایی که این گزارش پوشش نداده
- حاشیهنویسان دادههای انسانی که معیشت آنها تحت تأثیر گذر به بازخورد هوش مصنوعی قرار گرفته است.
منابع
[1]arXivمحققان همسویی خودکارRLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
مطالعه در arXiv →
[2]arXivمحققان همسویی خودکارConstitutional AI: Harmlessness from AI Feedback
مطالعه در arXiv →
[3]arXivمحققان همسویی خودکارDirect Preference Optimization: Your Language Model is Secretly a Reward Model
مطالعه در arXiv →
[4]arXivمحققان همسویی خودکارTraining language models to follow instructions with human feedback
مطالعه در arXiv →
[5]arXivمحققان همسویی خودکارDeep reinforcement learning from human preferences
مطالعه در arXiv →
[6]arXivمحققان همسویی خودکارSelf-Taught Evaluators
مطالعه در arXiv →
[7]تیم سردبیری کوهستانتحلیلگران ایمنی و پایهگذاریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در فناوری
مشاهده همه →معماری ترنسفورمر
چرا دیکودرهای ترنسفورمر قادر به تفکیک دستورات سیستمی از متن نامطمئن نیستند؟
3 منبع
مقررات هوش مصنوعی
قانون هوش مصنوعی اروپا در برابر چین: شکاف عمیق میان دستهبندی ریسک و سانسور محتوا
6 منبع
ایمنی هوش مصنوعی
ایالات متحده و چین برای رسیدگی به حوادث هوش مصنوعی کانال ارتباطی ایمنی ایجاد میکنند
4 منبع
همراستایی هوش مصنوعی
تز تعامد: چرا قدرت بهینهسازی، همگرایی اخلاقی در هوش مصنوعی را تضمین نمیکند
7 منبع
نظرات
هر زاویه. هر روز.
اخبار فناوری با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





