چگونه «بهینهسازی مستقیم ترجیحات» (DPO) در واقعیت مدلهای زبانی بزرگ را همسو میکند
بهینهسازی مستقیم ترجیحات (DPO)، خط لوله پیچیده یادگیری تقویتی برای آموزش هوش مصنوعی را با یک مرحله ساده دستهبندی جایگزین میکند. این روش با اثبات ریاضی این موضوع که یک مدل زبانی بهطور ضمنی تابع پاداش خود را در درونش دارد، همسو کردن هوش مصنوعی با ترجیحات انسانی را سریعتر، ارزانتر و پایدارتر کرده است.
به قلم کیان راد
این خبر را به اشتراک بگذارید
- حامیان متنباز
- برای DPO ارزش قائلاند زیرا با کاهش موانع پردازشی برای تنظیم ظریف، همسویی هوش مصنوعی را دموکراتیزه کرده است.
- مستقرکنندگان سازمانی هوش مصنوعی
- بر پایداری و مقرونبهصرفه بودن DPO برای همسو کردن مدلها با دستورالعملهای شرکتی تمرکز دارند.
- پژوهشگران پیشرو هوش مصنوعی
- کارایی DPO را تأیید میکنند، اما خاطرنشان میسازند که RLHF ممکن است همچنان برای وظایف استدلالی پیچیده و باز ضروری باشد.
دیدگاههایی که این گزارش پوشش نداده
- حاشیهنویسان دادههای انسانی
- تولیدکنندگان سختافزار
چرا مهم است
هزینه پردازشی آموزش رفتار به هوش مصنوعی بهشدت کاهش یافته است. با حذف نیاز به یک مدل پاداش مجزا، DPO به توسعهدهندگان متنباز و تیمهای سازمانی اجازه میدهد تا مدلهای زبانی قدرتمند را روی سختافزارهای معمولی همسو کنند و انحصار شرکتهای بزرگ فناوری در استقرار ایمن هوش مصنوعی را بشکنند.
هزینه پردازشی برای آموزش رفتار به هوش مصنوعی بهشدت افت کرده است. یک پیشرفت ریاضیاتی که با نام «بهینهسازی مستقیم ترجیحات» (DPO) شناخته میشود، توانسته است خط لوله شکننده و چندمرحلهای مورد نیاز برای همسو کردن مدلهای زبانی بزرگ را با یک مرحله پایدار دستهبندی جایگزین کند. حالا توسعهدهندگان بهجای آموزش یک مدل «منتقد» مجزا برای امتیازدهی به خروجیهای هوش مصنوعی و سپس استفاده از یادگیری تقویتی برای به حداکثر رساندن آن امتیازها، میتوانند ترجیحات انسانی را مستقیماً وارد تابع زیان (loss function) مدل کنند. نتیجه کار، سیستمی است که بدون نیاز به آن بار پردازشی سنگینی که پیشتر همسویی هوش مصنوعی را به دیتاسنترهای عظیم محدود میکرد، یاد میگیرد انسانها واقعاً چه میخواهند.[1][4]
برای درک سازوکار واقعی DPO، باید معماریای را که این روش جایگزین آن شده است بررسی کنیم: «یادگیری تقویتی از بازخورد انسانی» (RLHF). زمانی که OpenAI نسخه اولیه ChatGPT را آموزش داد، برای تبدیل یک پیشبینیکننده خام متن به یک دستیار مفید، به RLHF تکیه کرد. آن فرآیند به ۳ فاز مجزا نیاز داشت. اول، مدل تحت تنظیم ظریف نظارتشده قرار گرفت تا قالب یک مکالمه را بیاموزد. دوم، انسانها به پاسخهای مدل نمره دادند و از آن نمرات برای آموزش یک «مدل پاداش» جداگانه استفاده شد. در نهایت، الگوریتمی به نام «بهینهسازی سیاست مجاور» (PPO) مدل زبانی اصلی را از طریق آزمون و خطا بهروزرسانی کرد و هر زمان که مدل منتقدِ مجزا خروجیهایش را تأیید میکرد، به آن پاداش میداد.[2][3]
آن خط لوله ۳ مرحلهای RLHF بهشدت ناپایدار است. الگوریتم PPO به ابرپارامترهای (hyperparameters) خود حساسیت بالایی دارد و خود مدل پاداش نیز میتواند مورد سوءاستفاده قرار گیرد. اگر مدل پاداش بهاشتباه نمره بالایی به یک عبارت خاص بدهد، مدل زبانی اصلی بهسرعت یاد میگیرد که آن عبارت را بیش از حد تکرار کند تا نمره خود را بهطور مصنوعی بالا ببرد؛ پدیدهای که به آن «هک پاداش» (reward hacking) میگویند. علاوه بر این، اجرای RLHF نیازمند نگهداری همزمان ۴ شبکه عصبی مجزا در حافظه است: سیاست فعال، سیاست مرجع، مدل پاداش و مدل ارزش. برای مدلی با ۷۰ میلیارد پارامتر، این ردپای حافظه از ۱۴۰۰ گیگابایت VRAM فراتر میرود و نیازهای سختافزاری را به سطحی فراتر از ظرفیت بیشتر سرورهای سازمانی میرساند.[3][4]
در ماه مه ۲۰۲۳، تیمی متشکل از ۶ پژوهشگر از دانشگاه استنفورد (Stanford University) مقالهای ۲۴ صفحهای منتشر کردند که کل این خط لوله را در هم شکست. آنها از نظر ریاضی ثابت کردند که سیاست بهینه تحت هدف استاندارد RLHF، یک رابطه فرمبسته (closed-form) با تابع پاداش دارد. در عمل، این یعنی خود مدل زبانی در خفا یک مدل پاداش است. پژوهشگران با اعمال یک تغییر متغیر نشان دادند که میتوان مرحله پیچیده یادگیری تقویتی را بهطور کامل دور زد.[1]
الگوریتم حاصل، یعنی DPO، مستقیماً روی جفتهای ترجیحی عمل میکند. دادههای آموزشی شامل یک پرامپت (prompt)، یک پاسخ انتخابی که انسان آن را ترجیح داده، و یک پاسخ ردشده است که انسان آن را نپسندیده است. روش DPO هر دو پاسخ را به مدل زبانی میدهد و احتمالی را که مدل به هر کدام اختصاص میدهد محاسبه میکند. سپس وزنهای داخلی مدل را با استفاده از یک هدف ساده آنتروپی متقاطع باینری (binary cross-entropy) بهروزرسانی میکند: افزایش احتمال پاسخ انتخابی و کاهش احتمال پاسخ ردشده.[1][2]
الگوریتم حاصل، یعنی DPO، مستقیماً روی جفتهای ترجیحی عمل میکند.
این رویکرد مستقیم، نیاز به نمونهبرداری از پاسخهای جدید مدل در طول آموزش را از بین میبرد. در RLHF سنتی، مدل باید دائماً متن جدید تولید کند، آن را برای امتیازدهی به مدل پاداش بفرستد و سپس سیاست خود را بهروز کند. گرگ شونینگر (Greg Schoeninger)، پژوهشگر هوش مصنوعی در Oxen.ai مینویسد: «روش DPO این فرآیند را با حذف کامل مدل پاداش ساده میکند. آنها در عوض با اصلاح تابع زیان در مرحله نهایی، یک مجموعهداده مقایسهای را مستقیماً به مدل نهایی میدهند. این یک نمونه عالی از حذف وابستگیهاست و نشان میدهد که چگونه ساده نگهداشتن کارها میتواند به نتایج بهتری منجر شود.» از آنجا که DPO نیازی به تولید زنده متن ندارد، بهطور قابلتوجهی سریعتر و از نظر پردازشی سبکتر است.[2]
پایداری DPO بازتابی از پایداری تنظیم ظریف نظارتشده استاندارد است. از آنجا که این روش بهجای یادگیری تقویتی بر زیان دستهبندی (classification loss) تکیه دارد، از فراموشی فاجعهبار و هک پاداش که گریبانگیر PPO است، جلوگیری میکند. آزمایشهای اولیه تیم استنفورد نشان داد که DPO میتواند احساسات متن تولیدشده را بهتر از RLHF مبتنی بر PPO کنترل کند، در حالی که در وظایف خلاصهسازی و دیالوگ، کیفیتی برابر یا حتی بهتر از آن ارائه میدهد.[1]
پذیرش DPO چشمانداز هوش مصنوعی متنباز را بهطور بنیادین تغییر داده است. پیش از معرفی آن، همسو کردن یک مدل عظیم نیازمند تیمهای مهندسی متخصص و بودجههای پردازشی کلان بود. امروزه، این تکنیک بهطور گسترده در کتابخانههای آموزشی ادغام شده است و به پژوهشگران مستقل و توسعهدهندگان سازمانی اجازه میدهد تا مدلهایی مانند Llama 3.1 متا با ۸ و ۷۰ میلیارد پارامتر یا مدلهای ۷ میلیارد پارامتری Mistral را بدون اتکا به APIهای شخص ثالث، با دستورالعملهای شرکتی یا استانداردهای ایمنی خاص خود تنظیم ظریف کنند.[3][4]
با وجود تمام مزایا، DPO بدون محدودیت هم نیست. از آنجا که این روش روی یک مجموعهداده آفلاین و ثابت آموزش میبیند، اگر خروجیهای مدل بیش از حد از دادههایی که در ابتدا روی آنها تنظیم شده بود فاصله بگیرد، ممکن است دچار تغییر توزیع شود. در مقابل، RLHF بهطور پیوسته پاسخهای جدیدی از سیاست فعال نمونهبرداری میکند و به مدل پاداش اجازه میدهد دقیقاً همان متنی را که مدل در حال حاضر تولید میکند، نمرهدهی کند. برای وظایف استدلالی بسیار پیچیده و باز، برخی از آزمایشگاههای پیشرو هوش مصنوعی همچنان برای حفظ حلقههای بازخورد فعال، به نسخههای مختلف RLHF تکیه میکنند.[3]
کیفیت همسویی نیز همچنان کاملاً به کیفیت دادههای ترجیحی انسانی وابسته است. نه DPO و نه RLHF هیچکدام بهتنهایی سیگنال انسانی تولید نمیکنند. همانطور که تیم مهندسی در Mercor اشاره میکند: «چالشبرانگیزترین بخش همسویی، ثبات و تخصص دامنهای است که پشت دادههای ترجیحی قرار دارد، نه انتخاب بهینهساز.» اگر مجموعهداده حاوی ترجیحات متناقض باشد (مثلاً یک حاشیهنویس پاسخهای مختصر را ترجیح دهد و دیگری پاسخهای طولانی را)، مدل برای بهینهسازی سیاست خود با مشکل مواجه خواهد شد.[3]
پژوهشگران از همین حالا در حال توسعه نسخههای جدیدی بر پایه DPO هستند. نسخههای جدیدتر تلاش میکنند تا شدت یک ترجیح را نیز در نظر بگیرند؛ به این شکل که احتمال پاسخ ترجیحدادهشده باید با حاشیه مشخصی (که اغلب در تابع زیان بین ۰.۱ تا ۰.۵ تنظیم میشود) از پاسخ ردشده بیشتر باشد. رویکردهای دیگر سعی میکنند با توقف دورهای آموزش، تولید پاسخهای جدید، نمرهدهی به آنها توسط یک قاضی هوش مصنوعی و سپس ازسرگیری DPO روی دادههای تازه، فاصله موجود با RLHF را پر کنند.[1][4]
گذار از RLHF به DPO نشاندهنده بلوغ در حوزه همسویی هوش مصنوعی است. با تقلیل یک مسئله پیچیده و چندمدلی یادگیری تقویتی به یک وظیفه سرراست دستهبندی، صنعت هوش مصنوعی نحوه آموزش پیروی از دستورالعملها به مدلها را استانداردسازی کرده است. در حالی که مدلهای زبانی همچنان در حال بزرگتر شدن هستند، دستاوردهای بهرهوری ارائهشده توسط DPO تضمین میکند که فرآیند ایمن و مفید ساختن آنها نیز همگام با خودشان مقیاسپذیر بماند.[2][4]
نکات کلیدی
- بهینهسازی مستقیم ترجیحات (DPO) یادگیری تقویتی پیچیده را با یک مرحله دستهبندی جایگزین میکند.
- این الگوریتم از نظر ریاضی ثابت میکند که یک مدل زبانی بهطور ضمنی تابع پاداش خود را در بر دارد.
- روش DPO نیاز به آموزش یک مدل پاداش جداگانه را از بین میبرد و نیازهای حافظه و پردازش را بهشدت کاهش میدهد.
- این تکنیک همسویی هوش مصنوعی را دموکراتیزه کرده و به توسعهدهندگان متنباز اجازه میدهد مدلها را روی سختافزارهای مصرفی تنظیم ظریف (fine-tune) کنند.
- با وجود پایداری بالا، DPO ممکن است دچار تغییر توزیع (distribution shift) شود، زیرا بهجای تولید زنده، بر مجموعهدادههای آفلاین و ثابت تکیه دارد.
منابع
[1]arXivپژوهشگران پیشرو هوش مصنوعیDirect Preference Optimization: Your Language Model is Secretly a Reward Model
مطالعه در arXiv →
[2]Oxen.aiحامیان متنبازArxiv Dives - Direct Preference Optimization (DPO)
مطالعه در Oxen.ai →
[3]Mercorمستقرکنندگان سازمانی هوش مصنوعیDPO vs. RLHF: Comparison and when to use each
مطالعه در Mercor →
[4]تیم سردبیری کوهستانپژوهشگران پیشرو هوش مصنوعیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در متا
مشاهده همه →اصالت هوش مصنوعی
واترمارکهای رمزنگاریشده هوش مصنوعی واقعاً چگونه سیگنالها را در متن و تصویر جاسازی میکنند؟
7 منبع
روشهای آماری
مقیاسپذیری توان آماری: راهکار بنجامینی-هاچبرگ برای مشکل مقایسههای چندگانه
5 منبع
استانداردهای سختافزار
استاندارد IEC 60529: دو رقم گواهی IP واقعاً چگونه مقاومت در برابر آب و گردوغبار را تعریف میکنند؟
6 منبع
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.




