رفتن به محتوای اصلی
Koohestun
توضیح کوهستانهم‌سویی هوش مصنوعیمقایسه روش‌ها· 3 دقیقه مطالعه· در فناوری

معمای هم‌سویی: چرا آزمایشگاه‌های هوش مصنوعی بازخورد انسانی را با داوران هوش مصنوعی جایگزین می‌کنند؟

با بزرگ‌تر شدن مدل‌های زبانی، استاندارد صنعتی «یادگیری تقویتی از بازخورد انسانی» (RLHF) به بن‌بست هزینه و سرعت برخورد کرده است. «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) داوران هوش مصنوعی را جایگزین ارزیاب‌های انسانی می‌کند و ظرافت‌های ذهنی انسان را فدای مقیاس‌پذیری عظیم می‌سازد.

به قلم کاوان رامین

محققان هم‌سویی خودکار 70%تحلیل‌گران ایمنی و پایه‌گذاری 30%
محققان هم‌سویی خودکار
اولویت دادن به حلقه‌های بازخورد مقیاس‌پذیر و مبتنی بر هوش مصنوعی برای همگام شدن با رشد سریع مدل‌ها.
تحلیل‌گران ایمنی و پایه‌گذاری
تأکید بر ضرورت نظارت انسانی برای درک ظرافت‌های ذهنی و فرهنگی.

دیدگاه‌هایی که این گزارش پوشش نداده

  • حاشیه‌نویسان داده‌های انسانی که معیشت آن‌ها تحت تأثیر گذر به بازخورد هوش مصنوعی قرار گرفته است.

چرا مهم است

روشی که برای هم‌سو کردن یک مدل هوش مصنوعی استفاده می‌شود، نقاط کور، سوگیری‌ها و مرزهای ایمنی آن را تعیین می‌کند. گذر از بازخورد انسانی به بازخورد تولیدشده توسط هوش مصنوعی، اساساً تغییر می‌دهد که ارزش‌های چه کسانی در سیستم‌هایی که به‌زودی نرم‌افزارهای سازمانی و مصرف‌کننده را هدایت می‌کنند، رمزگذاری می‌شود.

نکات کلیدی

  1. «یادگیری تقویتی از بازخورد انسانی» (RLHF) برای هم‌سو کردن مدل‌ها به ارزیاب‌های گران‌قیمت انسانی متکی است.
  2. «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) یک داور هوش مصنوعی را جایگزین انسان‌ها می‌کند و هزینه‌ها را به‌شدت کاهش می‌دهد.
  3. «هوش مصنوعی قانون‌اساسی‌محور» داور هوش مصنوعی را با استفاده از مجموعه‌ای مکتوب از اصول صریح به‌جای ترجیحات مبهم هدایت می‌کند.
  4. آزمایش‌های رودررو نشان می‌دهد که RLAIF می‌تواند در وظایف مشخصی مانند خلاصه‌سازی، با عملکرد RLHF برابری کند.
1.3 billion
پارامترهای اینستراکت‌جی‌پی‌تی
175 billion
پارامترهای جی‌پی‌تی-۳
70%
نرخ پیروزی آر‌ال‌ای‌آی‌اف در برابر اس‌اف‌تی
88.3
امتیاز ارزیاب خودآموز در ریواردبنچ

در مارس ۲۰۲۲، شرکت OpenAI مقاله‌ای منتشر کرد که نشان می‌داد یک مدل زبانی با ۱.۳ میلیارد پارامتر می‌تواند تنها با آموزش دیدن برای پیروی از دستورالعمل‌ها، از مدلی که ۱۰۰ برابر بزرگ‌تر از آن است، عملکرد بهتری داشته باشد.[4]

این تکنیک، یعنی «یادگیری تقویتی از بازخورد انسانی» (RLHF)، به استاندارد صنعت تبدیل شد. این روش به حاشیه‌نویسان انسانی متکی است تا خروجی‌های مدل را رتبه‌بندی کنند و مجموعه داده‌ای از ترجیحات بسازند که یک «مدل پاداش» را برای امتیازدهی به پاسخ‌های آینده آموزش می‌دهد. اگرچه این روش در بازاریابی‌ها به‌عنوان یک پیشرفت بزرگ در «درک» نیت انسان معرفی می‌شود، اما RLHF در اساس تنها یک مکانیسم هدایت آماری است که خروجی‌های ناخوشایند برای انسان را جریمه می‌کند.[4][5]

اما با بزرگ‌تر شدن مدل‌ها، RLHF به یک دیوار ساختاری برخورد کرده است. برچسب‌گذاری انسانی گران، کند و مستعد تناقض است. آموزش یک مدل پاداش قوی می‌تواند به ده‌ها هزار مقایسه انسانی نیاز داشته باشد، که گلوگاهی ایجاد می‌کند که سرعت تکرار را کاهش داده و حجم بازخورد ایمنی قابل تولید توسط یک آزمایشگاه را محدود می‌کند.[1]

تفاوت ساختاری بین بهینه‌سازی ترجیحات مبتنی بر انسان و مبتنی بر هوش مصنوعی.

جایگزین نوظهور، «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) است. توسعه‌دهندگان به‌جای پرداخت پول به انسان‌ها برای رتبه‌بندی خروجی‌ها، از یک مدل زبانی آماده و بسیار توانمند به‌عنوان داور استفاده می‌کنند و فرآیند تولید ترجیحات را خودکار می‌سازند.[1]

جایگزین نوظهور، «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) است.

در اواخر سال ۲۰۲۲، شرکت Anthropic پیشگام نوع خاصی از این روش به نام «هوش مصنوعی قانون‌اساسی‌محور» (Constitutional AI) شد. در این روش، به‌جای تکیه بر ترجیحات مبهم انسانی، به مدل یک «قانون اساسی» مکتوب — مجموعه‌ای از اصول صریح — داده می‌شود و آموزش می‌بیند تا خروجی‌های خود را بر اساس آن قوانین نقد و اصلاح کند. این کار، هم‌سویی را از یک بررسی حسی و ضمنی انسانی به یک معیار صریح و قابل حسابرسی تغییر می‌دهد.[2]

نتایج به‌دست‌آمده، این فرض را که نظارت انسانی برای هم‌سویی کاملاً ضروری است، به چالش می‌کشد. همان‌طور که نویسندگان یک مطالعه گوگل در سال ۲۰۲۳ اشاره کردند: «این نتایج نشان می‌دهد که RLAIF می‌تواند عملکردی در سطح انسان ارائه دهد و راه‌حلی بالقوه برای محدودیت‌های مقیاس‌پذیری RLHF باشد.» در آزمایش‌های رودررو روی وظایف خلاصه‌سازی، ارزیاب‌های انسانی خروجی‌های هر دو روش RLAIF و RLHF را در حدود ۷۰ درصد مواقع به یک مدل پایه ترجیح دادند.[1]

در آزمایش‌های رودررو در زمینه خلاصه‌سازی، بازخورد تولیدشده توسط هوش مصنوعی با عملکرد بازخورد انسانی برابری می‌کند.

هم‌زمان، محققان در حال ساده‌سازی خود مرحله بهینه‌سازی هستند. در ماه مه ۲۰۲۳، پژوهشگران استنفورد روش «بهینه‌سازی مستقیم ترجیحات» (DPO) را معرفی کردند که نیاز به آموزش یک مدل پاداش مجزا را به‌طور کامل از بین می‌برد و داده‌های ترجیحی را از نظر ریاضی مستقیماً روی خط‌مشی مدل زبانی نگاشت می‌کند تا بار محاسباتی کاهش یابد.[3]

مرزهای کنونی اکنون کاملاً مصنوعی (تولیدشده توسط ماشین) هستند. مقاله‌ای در اوت ۲۰۲۴ از Meta FAIR درباره «ارزیاب‌های خودآموز» نشان داد که یک داور هوش مصنوعی می‌تواند قابلیت‌های ارزیابی خود را به‌صورت تکرارشونده و تنها با استفاده از داده‌های مصنوعی بهبود بخشد؛ این کار امتیاز مدل Llama 3 70B را در معیار RewardBench از ۷۵.۴ به ۸۸.۳ ارتقا داد، آن هم بدون هیچ‌گونه داده ترجیحی برچسب‌گذاری‌شده.[6]

تغییر از بازخورد انسانی به هوش مصنوعی، اقتصاد آموزش ایمنی را اساساً دگرگون می‌کند. با خودکارسازی حلقه ترجیحات، آزمایشگاه‌ها می‌توانند هم‌سویی را با همان سرعتی که قابلیت‌های خام را تکرار می‌کنند، پیش ببرند — هرچند این امر فشار عظیمی بر اصول اولیه‌ای وارد می‌کند که داور هوش مصنوعی را هدایت می‌کنند، زیرا هرگونه نقطه کور در ارزیاب به‌طور دائمی در مدل نهایی حک خواهد شد.[7]

بررسی عمیق دیدگاه‌ها

دلایل دفاع از RLHF (بازخورد انسانی)

هم‌سویی با دقت بالا که ریشه در ظرافت‌های ذهنی انسان دارد.

یادگیری تقویتی از بازخورد انسانی همچنان استاندارد طلایی برای درک بافت فرهنگی ظریف و ترجیحات ذهنی است. از آنجا که این روش برای رتبه‌بندی خروجی‌ها به حاشیه‌نویسان انسانی متکی است، در شناسایی موارد حاشیه‌ای سمی و نقض‌های ایمنی ظریفی که سیستم‌های خودکار از دست می‌دهند، برتری دارد. با این حال، این دقت هزینه گزافی دارد: جمع‌آوری ده‌ها هزار برچسب ترجیحی نیازمند هماهنگی و سرمایه انسانی عظیمی است که گلوگاه شدیدی برای تکرار سریع مدل ایجاد می‌کند.

دلایل دفاع از RLAIF (بازخورد هوش مصنوعی)

مقیاس‌پذیری عظیم و شفافیت صریح و مبتنی بر قانون.

یادگیری تقویتی از بازخورد هوش مصنوعی، شهود انسانی را با سرعت و مقیاس معاوضه می‌کند. با جایگزینی ارزیاب‌های انسانی با یک مدل زبانی بزرگ آماده که به‌عنوان داور عمل می‌کند، آزمایشگاه‌ها می‌توانند مجموعه‌داده‌های ترجیحی را در عرض چند ساعت و با کسری از هزینه تولید کنند. هنگامی که این روش توسط مجموعه‌ای مکتوب از اصول هدایت شود — رویکردی که به عنوان هوش مصنوعی قانون‌اساسی‌محور شناخته می‌شود — بازخورد بسیار شفاف و سازگار می‌شود. در آزمون‌های معیار در زمینه خلاصه‌سازی، RLAIF به نرخ پیروزی ۷۰ درصدی نسبت به مدل‌های پایه دست می‌یابد که با عملکرد RLHF برابری می‌کند، هرچند اگر حسابرسی نشود، خطر تشدید سوگیری‌های ذاتی مدل داور را به همراه دارد.

منابع

پوشش منابع

7 منبع

2 دیدگاه شناسایی‌شده

محققان هم‌سویی خودکار 70%تحلیل‌گران ایمنی و پایه‌گذاری 30%
  1. [1]arXivمحققان هم‌سویی خودکار

    RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

    مطالعه در arXiv
  2. [2]arXivمحققان هم‌سویی خودکار

    Constitutional AI: Harmlessness from AI Feedback

    مطالعه در arXiv
  3. [3]arXivمحققان هم‌سویی خودکار

    Direct Preference Optimization: Your Language Model is Secretly a Reward Model

    مطالعه در arXiv
  4. [4]arXivمحققان هم‌سویی خودکار

    Training language models to follow instructions with human feedback

    مطالعه در arXiv
  5. [5]arXivمحققان هم‌سویی خودکار

    Deep reinforcement learning from human preferences

    مطالعه در arXiv
  6. [6]arXivمحققان هم‌سویی خودکار

    Self-Taught Evaluators

    مطالعه در arXiv
  7. [7]تیم سردبیری کوهستانتحلیل‌گران ایمنی و پایه‌گذاری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.