معمای همسویی: چرا آزمایشگاههای هوش مصنوعی بازخورد انسانی را با داوران هوش مصنوعی جایگزین میکنند؟
با بزرگتر شدن مدلهای زبانی، استاندارد صنعتی «یادگیری تقویتی از بازخورد انسانی» (RLHF) به بنبست هزینه و سرعت برخورد کرده است. «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) داوران هوش مصنوعی را جایگزین ارزیابهای انسانی میکند و ظرافتهای ذهنی انسان را فدای مقیاسپذیری عظیم میسازد.
به قلم کاوان رامین
این خبر را به اشتراک بگذارید
- محققان همسویی خودکار
- اولویت دادن به حلقههای بازخورد مقیاسپذیر و مبتنی بر هوش مصنوعی برای همگام شدن با رشد سریع مدلها.
- تحلیلگران ایمنی و پایهگذاری
- تأکید بر ضرورت نظارت انسانی برای درک ظرافتهای ذهنی و فرهنگی.
دیدگاههایی که این گزارش پوشش نداده
- حاشیهنویسان دادههای انسانی که معیشت آنها تحت تأثیر گذر به بازخورد هوش مصنوعی قرار گرفته است.
چرا مهم است
روشی که برای همسو کردن یک مدل هوش مصنوعی استفاده میشود، نقاط کور، سوگیریها و مرزهای ایمنی آن را تعیین میکند. گذر از بازخورد انسانی به بازخورد تولیدشده توسط هوش مصنوعی، اساساً تغییر میدهد که ارزشهای چه کسانی در سیستمهایی که بهزودی نرمافزارهای سازمانی و مصرفکننده را هدایت میکنند، رمزگذاری میشود.
نکات کلیدی
- «یادگیری تقویتی از بازخورد انسانی» (RLHF) برای همسو کردن مدلها به ارزیابهای گرانقیمت انسانی متکی است.
- «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) یک داور هوش مصنوعی را جایگزین انسانها میکند و هزینهها را بهشدت کاهش میدهد.
- «هوش مصنوعی قانوناساسیمحور» داور هوش مصنوعی را با استفاده از مجموعهای مکتوب از اصول صریح بهجای ترجیحات مبهم هدایت میکند.
- آزمایشهای رودررو نشان میدهد که RLAIF میتواند در وظایف مشخصی مانند خلاصهسازی، با عملکرد RLHF برابری کند.
در مارس ۲۰۲۲، شرکت OpenAI مقالهای منتشر کرد که نشان میداد یک مدل زبانی با ۱.۳ میلیارد پارامتر میتواند تنها با آموزش دیدن برای پیروی از دستورالعملها، از مدلی که ۱۰۰ برابر بزرگتر از آن است، عملکرد بهتری داشته باشد.[4]
این تکنیک، یعنی «یادگیری تقویتی از بازخورد انسانی» (RLHF)، به استاندارد صنعت تبدیل شد. این روش به حاشیهنویسان انسانی متکی است تا خروجیهای مدل را رتبهبندی کنند و مجموعه دادهای از ترجیحات بسازند که یک «مدل پاداش» را برای امتیازدهی به پاسخهای آینده آموزش میدهد. اگرچه این روش در بازاریابیها بهعنوان یک پیشرفت بزرگ در «درک» نیت انسان معرفی میشود، اما RLHF در اساس تنها یک مکانیسم هدایت آماری است که خروجیهای ناخوشایند برای انسان را جریمه میکند.[4][5]
اما با بزرگتر شدن مدلها، RLHF به یک دیوار ساختاری برخورد کرده است. برچسبگذاری انسانی گران، کند و مستعد تناقض است. آموزش یک مدل پاداش قوی میتواند به دهها هزار مقایسه انسانی نیاز داشته باشد، که گلوگاهی ایجاد میکند که سرعت تکرار را کاهش داده و حجم بازخورد ایمنی قابل تولید توسط یک آزمایشگاه را محدود میکند.[1]
جایگزین نوظهور، «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) است. توسعهدهندگان بهجای پرداخت پول به انسانها برای رتبهبندی خروجیها، از یک مدل زبانی آماده و بسیار توانمند بهعنوان داور استفاده میکنند و فرآیند تولید ترجیحات را خودکار میسازند.[1]
جایگزین نوظهور، «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) است.
در اواخر سال ۲۰۲۲، شرکت Anthropic پیشگام نوع خاصی از این روش به نام «هوش مصنوعی قانوناساسیمحور» (Constitutional AI) شد. در این روش، بهجای تکیه بر ترجیحات مبهم انسانی، به مدل یک «قانون اساسی» مکتوب — مجموعهای از اصول صریح — داده میشود و آموزش میبیند تا خروجیهای خود را بر اساس آن قوانین نقد و اصلاح کند. این کار، همسویی را از یک بررسی حسی و ضمنی انسانی به یک معیار صریح و قابل حسابرسی تغییر میدهد.[2]
نتایج بهدستآمده، این فرض را که نظارت انسانی برای همسویی کاملاً ضروری است، به چالش میکشد. همانطور که نویسندگان یک مطالعه گوگل در سال ۲۰۲۳ اشاره کردند: «این نتایج نشان میدهد که RLAIF میتواند عملکردی در سطح انسان ارائه دهد و راهحلی بالقوه برای محدودیتهای مقیاسپذیری RLHF باشد.» در آزمایشهای رودررو روی وظایف خلاصهسازی، ارزیابهای انسانی خروجیهای هر دو روش RLAIF و RLHF را در حدود ۷۰ درصد مواقع به یک مدل پایه ترجیح دادند.[1]
همزمان، محققان در حال سادهسازی خود مرحله بهینهسازی هستند. در ماه مه ۲۰۲۳، پژوهشگران استنفورد روش «بهینهسازی مستقیم ترجیحات» (DPO) را معرفی کردند که نیاز به آموزش یک مدل پاداش مجزا را بهطور کامل از بین میبرد و دادههای ترجیحی را از نظر ریاضی مستقیماً روی خطمشی مدل زبانی نگاشت میکند تا بار محاسباتی کاهش یابد.[3]
مرزهای کنونی اکنون کاملاً مصنوعی (تولیدشده توسط ماشین) هستند. مقالهای در اوت ۲۰۲۴ از Meta FAIR درباره «ارزیابهای خودآموز» نشان داد که یک داور هوش مصنوعی میتواند قابلیتهای ارزیابی خود را بهصورت تکرارشونده و تنها با استفاده از دادههای مصنوعی بهبود بخشد؛ این کار امتیاز مدل Llama 3 70B را در معیار RewardBench از ۷۵.۴ به ۸۸.۳ ارتقا داد، آن هم بدون هیچگونه داده ترجیحی برچسبگذاریشده.[6]
تغییر از بازخورد انسانی به هوش مصنوعی، اقتصاد آموزش ایمنی را اساساً دگرگون میکند. با خودکارسازی حلقه ترجیحات، آزمایشگاهها میتوانند همسویی را با همان سرعتی که قابلیتهای خام را تکرار میکنند، پیش ببرند — هرچند این امر فشار عظیمی بر اصول اولیهای وارد میکند که داور هوش مصنوعی را هدایت میکنند، زیرا هرگونه نقطه کور در ارزیاب بهطور دائمی در مدل نهایی حک خواهد شد.[7]
بررسی عمیق دیدگاهها
دلایل دفاع از RLHF (بازخورد انسانی)
همسویی با دقت بالا که ریشه در ظرافتهای ذهنی انسان دارد.
یادگیری تقویتی از بازخورد انسانی همچنان استاندارد طلایی برای درک بافت فرهنگی ظریف و ترجیحات ذهنی است. از آنجا که این روش برای رتبهبندی خروجیها به حاشیهنویسان انسانی متکی است، در شناسایی موارد حاشیهای سمی و نقضهای ایمنی ظریفی که سیستمهای خودکار از دست میدهند، برتری دارد. با این حال، این دقت هزینه گزافی دارد: جمعآوری دهها هزار برچسب ترجیحی نیازمند هماهنگی و سرمایه انسانی عظیمی است که گلوگاه شدیدی برای تکرار سریع مدل ایجاد میکند.
دلایل دفاع از RLAIF (بازخورد هوش مصنوعی)
مقیاسپذیری عظیم و شفافیت صریح و مبتنی بر قانون.
یادگیری تقویتی از بازخورد هوش مصنوعی، شهود انسانی را با سرعت و مقیاس معاوضه میکند. با جایگزینی ارزیابهای انسانی با یک مدل زبانی بزرگ آماده که بهعنوان داور عمل میکند، آزمایشگاهها میتوانند مجموعهدادههای ترجیحی را در عرض چند ساعت و با کسری از هزینه تولید کنند. هنگامی که این روش توسط مجموعهای مکتوب از اصول هدایت شود — رویکردی که به عنوان هوش مصنوعی قانوناساسیمحور شناخته میشود — بازخورد بسیار شفاف و سازگار میشود. در آزمونهای معیار در زمینه خلاصهسازی، RLAIF به نرخ پیروزی ۷۰ درصدی نسبت به مدلهای پایه دست مییابد که با عملکرد RLHF برابری میکند، هرچند اگر حسابرسی نشود، خطر تشدید سوگیریهای ذاتی مدل داور را به همراه دارد.
منابع
[1]arXivمحققان همسویی خودکارRLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
مطالعه در arXiv →
[2]arXivمحققان همسویی خودکارConstitutional AI: Harmlessness from AI Feedback
مطالعه در arXiv →
[3]arXivمحققان همسویی خودکارDirect Preference Optimization: Your Language Model is Secretly a Reward Model
مطالعه در arXiv →
[4]arXivمحققان همسویی خودکارTraining language models to follow instructions with human feedback
مطالعه در arXiv →
[5]arXivمحققان همسویی خودکارDeep reinforcement learning from human preferences
مطالعه در arXiv →
[6]arXivمحققان همسویی خودکارSelf-Taught Evaluators
مطالعه در arXiv →
[7]تیم سردبیری کوهستانتحلیلگران ایمنی و پایهگذاریتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در فناوری
مشاهده همه →حریم خصوصی مرورگر
سه دسته دادهای که اثر انگشت منحصربهفرد مرورگر شما را میسازند
5 منبع
MEMS Sensors
کالبدشکافی شتابسنج و ژیروسکوپ (MEMS): گوشی شما واقعاً چگونه بالا و پایین را تشخیص میدهد؟
5 منبع
هوش مصنوعی کالبددار
گلوگاه دادههای فیزیکی: چرا چین در حال استانداردسازی هوش مصنوعی کالبددار است؟
5 منبع
فناوری باتری
تویوتا هدف ۲۰۲۷ برای باتری حالت جامد خودروی برقی با برد ۱۰۰۰ کیلومتر را تأیید کرد
4 منبع
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





