رفتن به محتوای اصلی
Koohestun
توضیح کوهستانهوش مصنوعی قانون‌اساسی‌محورگزارش تشریحی· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه هوش مصنوعی قانون‌اساسی‌محور، یک کتابچه قوانین مکتوب را جایگزین بازخورد انسانی می‌کند

هوش مصنوعی قانون‌اساسی‌محور با جایگزین کردن ارزیاب‌های انسانی با یک چرخه خودکارِ نقد و اصلاح، به آموزش ایمنی اجازه می‌دهد تا همگام با توان پردازشی به‌طور تصاعدی گسترش یابد.

به قلم اِلا فرجاد

پژوهشگران ایمنی هوش مصنوعی 45%مدافعان اخلاق و سیاست‌گذاری 35%طرفداران حضور انسان در چرخه 20%
پژوهشگران ایمنی هوش مصنوعی
بر مقیاس‌پذیری و کارایی هم‌سویی خودکار تمرکز دارند.
مدافعان اخلاق و سیاست‌گذاری
بر شفافیت و ماهیت صریح قوانین مکتوب تأکید می‌کنند.
طرفداران حضور انسان در چرخه
نسبت به حذف کامل نظارت انسانی در امتیازدهی ایمنی هشدار می‌دهند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کاربران نهایی که اثرات پایین‌دستی فیلترهای ایمنی هوش مصنوعی را تجربه می‌کنند
  • ارزیاب‌های انسانی که شغلشان توسط سیستم‌های خودکار بازخورد هوش مصنوعی جایگزین می‌شود

برای هم‌سو کردن یک مدل زبانی بزرگ و مدرن، تیم‌های ایمنی معمولاً به معیاری متکی هستند که به‌کندی و با زحمت فراوان مقیاس‌پذیر می‌شود: ساعات کار انسانی. آموزش یک مدل پیشرفته اغلب به بیش از ۱۰۰,۰۰۰ برچسب ترجیحی انسانی نیاز دارد؛ جایی که ارزیاب‌ها باید خروجی‌های سمی، سوگیرانه یا خطرناک را به‌صورت دستی بخوانند و امتیاز دهند تا به سیستم بیاموزند از چه چیزهایی اجتناب کند. این فرآیند که با نام «یادگیری تقویتی از بازخورد انسانی» (RLHF) شناخته می‌شود، ستون فقرات ایمنی در بیشتر مدل‌های تجاری را تشکیل می‌دهد. اما با پیچیده‌تر شدن مدل‌ها، ارزیابی انسانی به یک گلوگاه عملیاتی تبدیل می‌شود. هوش مصنوعی قانون‌اساسی‌محور، یک کتابچه قوانین مکتوب را جایگزین این گلوگاه انسانی می‌کند.[1]

هوش مصنوعی قانون‌اساسی‌محور که برای نخستین بار توسط پژوهشگران شرکت آنتروپیک (Anthropic) در مقاله‌ای در ۱۵ دسامبر ۲۰۲۲ معرفی شد، بار هم‌سویی ایمنی را از دوش ارزیاب‌های انسانی برداشته و به خود هوش مصنوعی محول می‌کند. به‌جای استنتاج خواسته‌های انسان‌ها از طریق هزاران کلیکِ ترجیحیِ کورکورانه، به مدل یک «قانون اساسی» به‌معنای واقعی کلمه داده می‌شود؛ یعنی مجموعه‌ای از اصول صریح و مکتوب. پیاده‌سازی اولیه آنتروپیک از اصولی استفاده کرد که از منابعی مانند اعلامیه جهانی حقوق بشر سازمان ملل متحد در سال ۱۹۴۸ استخراج شده بودند. سپس سیستم از این اصول برای نقد و اصلاح رفتار خود استفاده می‌کند و عملاً پرزحمت‌ترین بخش ایمنی هوش مصنوعی را خودکار می‌سازد.[1][4]

این سازوکار در ۲ فاز مجزا آشکار می‌شود و با یک چرخه نظارت‌شده‌ی نقد و اصلاح آغاز می‌گردد. پژوهشگران کار را با یک مدل پایه شروع می‌کنند که برای مفید بودن آموزش دیده، اما هیچ فیلتر ایمنی ندارد. آن‌ها این مدل را با یک پرسش خطرناک یا خصمانه تحریک می‌کنند و مدل یک پیش‌نویس پاسخ بدون فیلتر و بالقوه مضر تولید می‌کند. در این نقطه، سیستم مداخله کرده و از مدل می‌خواهد پیش‌نویس خود را بخواند و آن را بر اساس ۱ اصل مشخص که به‌طور تصادفی از قانون اساسی انتخاب شده است، نقد کند.[1]

برای مثال، اگر مدل دستورالعمل‌هایی برای یک فعالیت مضر بنویسد، فرمان نقد ممکن است بپرسد: «آیا این پاسخ، رفتار غیرقانونی یا خطرناک را تشویق می‌کند؟» مدل با استفاده از درک زبانی موجود خود، تخلف را شناسایی می‌کند. سپس به آن دستور داده می‌شود تا پاسخ را به‌گونه‌ای بازنویسی کند که ضمن حفظ بیشترین میزان مفید بودن، آسیب آن برطرف شود. این جفتِ قبل و بعد — یعنی فرمان اولیه و خروجی ایمن و جدیداً اصلاح‌شده — به داده‌های آموزشی باکیفیت تبدیل می‌شود. مدل یاد می‌گیرد قوانین را درونی‌سازی کند، بدون اینکه هیچ انسانی آن تعامل خاص را امتیازدهی کرده باشد.[1][3]

در فاز یادگیری نظارت‌شده، مدل یک پاسخ اولیه می‌نویسد، آن را بر اساس یک اصل مکتوب نقد می‌کند و برای ایمن شدن، آن را بازنویسی می‌کند.

فاز دوم، این خودنظارتی را با استفاده از تکنیکی به نام «یادگیری تقویتی از بازخورد هوش مصنوعی» (RLAIF) مقیاس‌پذیر می‌کند؛ تکنیکی که در طول سال‌های ۲۰۲۳ و ۲۰۲۴ پذیرش گسترده‌تری در صنعت یافت. در روش سنتی RLHF، به ارزیاب‌های انسانی ۲ پاسخ از مدل نشان داده می‌شود و از آن‌ها خواسته می‌شود روی پاسخی که بهتر است کلیک کنند تا مجموعه داده عظیمی از ترجیحات انسانی ساخته شود. اما در RLAIF، یک مدل ارزیاب هوش مصنوعی وظیفه امتیازدهی را بر عهده می‌گیرد. به این ارزیاب، قانون اساسی داده می‌شود و از آن خواسته می‌شود قضاوت کند کدام‌یک از ۲ پاسخ، پایبندی بهتری به اصول مکتوب دارد.[1][2]

اما در RLAIF، یک مدل ارزیاب هوش مصنوعی وظیفه امتیازدهی را بر عهده می‌گیرد.

این تغییر معماری، اقتصاد ایمنی هوش مصنوعی را به‌طور بنیادین دگرگون می‌کند. با جایگزینی سیگنال‌های ترجیحی انسانی با ارزیابی‌های تولیدشده توسط هوش مصنوعی، آموزش ایمنی از زمانِ انسان مستقل می‌شود. این فرآیند به یک پردازش مبتنی بر توان محاسباتی تبدیل می‌شود؛ به این معنا که با شتاب گرفتن سخت‌افزارها، توانایی هم‌سو کردن و آزمایش مدل نیز همگام با آن شتاب می‌گیرد. یک ارزیاب هوش مصنوعی می‌تواند ۱۰,۰۰۰ جفت ترجیحی را در همان زمانی تولید و امتیازدهی کند که یک تیم ۵۰ نفره از ارزیاب‌های انسانی تنها قادر به پردازش کسری از آن حجم هستند.[2][4]

یادگیری تقویتی از بازخورد هوش مصنوعی (RLAIF) یک ارزیاب خودکار هوش مصنوعی را جایگزین گلوگاه امتیازدهی انسانی می‌کند.

فراتر از مقیاس‌پذیری، رویکرد قانون‌اساسی‌محور یک مشکل همیشگی شفافیت را در توسعه هوش مصنوعی حل می‌کند. وقتی مدلی صرفاً بر اساس بازخورد انسانی آموزش می‌بیند، ارزش‌های حاصل از آن، مجموعه‌ای آماری و مبهم از چیزهایی است که ارزیاب‌ها در آن روز خاص ترجیح داده‌اند. بیان دقیق مرزهای اخلاقی که مدل آموخته است، تقریباً غیرممکن است. در مقابل، قانون اساسی یک سند صریح است. این سند می‌تواند توسط سیاست‌گذاران یا عموم مردم منتشر، به بحث گذاشته، حسابرسی و به‌روزرسانی شود.[3]

این روش همچنین نحوه تعامل مدل‌ها با کاربران را تغییر می‌دهد. مدل‌هایی که به‌شدت بر اساس بازخورد انسانی آموزش دیده‌اند، اغلب طفره‌رو می‌شوند و برای جلوگیری از تولید پاسخی با امتیاز پایین، به پرسش‌های حساس با یک امتناع کلیشه‌ای پاسخ می‌دهند. از آنجا که هوش مصنوعی قانون‌اساسی‌محور به مدل آموزش می‌دهد تا استدلال خود را نقد و توضیح دهد، سیستم‌های حاصل معمولاً طفره‌رو نیستند. همان‌طور که پژوهشگران آنتروپیک در مقاله بنیادین خود اشاره کردند، هدف، آموزش دستیاری است که «با توضیح دادنِ دلایل مخالفت خود، با پرسش‌های مضر درگیر شود.»[1]

اگرچه مزایای عملیاتی این روش واضح است، اما این رویکرد پرسش‌های ساختاری جدیدی را مطرح می‌کند. اگر یک ارزیاب هوش مصنوعی دارای نقص‌های سیستماتیک یا سوءتفاهم نسبت به یک اصل باشد، این سوگیری‌ها می‌توانند در طول فاز یادگیری تقویتی به‌طور تصاعدی تشدید شوند. علاوه بر این، سیستم همچنان برای نوشتن قانون اساسی به انسان‌ها نیاز دارد؛ به این معنا که مرجعیت اخلاقی نهایی همچنان در دست توسعه‌دهندگانی متمرکز می‌ماند که ۱۰ تا ۲۰ اصل کلیدی را انتخاب می‌کنند.[2]

با نزدیک شدن مدل‌های پیشرفته به قابلیت‌هایی که از توانایی ارزیاب‌های انسانیِ متوسط برای ارزیابی آن‌ها فراتر می‌رود، سازوکارهای هم‌سویی خودکار در حال تبدیل شدن به یک ضرورت ساختاری هستند. هوش مصنوعی قانون‌اساسی‌محور نشان می‌دهد که قوانین حاکم بر هوش مصنوعی مجبور نیستند در وزن‌های یک مدل پاداش پنهان بمانند. با صریح کردن قوانین، توسعه‌دهندگان راهی یافته‌اند تا آموزش ایمنی را هم در اجرا سریع‌تر کنند و هم درک آن را آسان‌تر سازند.[4]

نکات کلیدی

  • هوش مصنوعی قانون‌اساسی‌محور مجموعه‌ای از اصول مکتوب را برای هدایت رفتار مدل، جایگزین ارزیاب‌های ترجیحات انسانی می‌کند.
  • فرآیند آموزش از یک چرخه نقد و اصلاح استفاده می‌کند که در آن، مدل خروجی‌های ناامن خود را تصحیح می‌کند.
  • یادگیری تقویتی از بازخورد هوش مصنوعی (RLAIF) اجازه می‌دهد آموزش ایمنی به‌جای نیروی کار انسانی، با توان پردازشی مقیاس‌پذیر شود.
  • این رویکرد صریح باعث می‌شود ارزش‌های حاکم بر رفتار هوش مصنوعی به‌جای پنهان ماندن در انبوه بازخوردهای انسانی، شفاف و قابل‌بحث باشند.

اصطلاحات کلیدی

هوش مصنوعی قانون‌اساسی‌محور (CAI)
روش آموزشی که در آن یک مدل هوش مصنوعی رفتار خود را به‌جای اتکای صرف به بازخورد انسانی، با مجموعه‌ای از اصول مکتوب هم‌سو می‌کند.
یادگیری تقویتی از بازخورد انسانی (RLHF)
روش سنتی آموزش مدل‌های هوش مصنوعی با استفاده از ارزیاب‌های انسانی برای رتبه‌بندی و امتیازدهی دستی به خروجی‌ها.
یادگیری تقویتی از بازخورد هوش مصنوعی (RLAIF)
روش آموزشی که در آن یک ارزیاب هوش مصنوعی با هدایت یک قانون اساسی، جایگزین ارزیاب‌های انسانی برای رتبه‌بندی خروجی‌ها می‌شود.
چرخه نقد و اصلاح
فاز یادگیری نظارت‌شده که در آن یک مدل، پیش‌نویس پاسخ خود را بر اساس یک اصل ارزیابی کرده و برای ایمن‌تر شدن، آن را بازنویسی می‌کند.

منابع

پوشش منابع

4 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران ایمنی هوش مصنوعی 45%مدافعان اخلاق و سیاست‌گذاری 35%طرفداران حضور انسان در چرخه 20%
  1. [1]Anthropicپژوهشگران ایمنی هوش مصنوعی

    Constitutional AI: Harmlessness from AI Feedback

    مطالعه در Anthropic
  2. [2]IBMپژوهشگران ایمنی هوش مصنوعی

    What is RLAIF?

    مطالعه در IBM
  3. [3]Tolokaمدافعان اخلاق و سیاست‌گذاری

    What is Constitutional AI?

    مطالعه در Toloka
  4. [4]تیم سردبیری کوهستانپژوهشگران ایمنی هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.