رفتن به محتوای اصلی
توضیح کوهستانمعماری LLMتوضیح و تشریح۸ شهریور ۱۴۰۵، ۵:۳۸· 6 دقیقه مطالعه· در هوش مصنوعی

سازوکارهای اصلی آموزش مدل‌های زبان بزرگ (LLM): مقایسه پیش‌آموزش، تنظیم دقیق، و RLHF

تشریح فرآیند سه‌مرحله‌ای که متن خام اینترنت را به یک هوش مصنوعی مکالمه‌محور تبدیل می‌کند، و نشان می‌دهد که مدل‌ها چگونه دستور زبان را می‌آموزند، دانش کسب می‌کنند و یک شخصیت ایمن پیدا می‌کنند.

به قلم ندا وزیری

حداکثرگرایان مقیاس 40%محققان همسوسازی 35%حامیان وزن باز 25%
حداکثرگرایان مقیاس
استدلال می‌کنند که حجم داده‌های پیش‌آموزش و مقیاس محاسباتی، محرک‌های اصلی هوش مدل هستند و تنظیم دقیق را صرفاً یک پوشش ظاهری می‌دانند.
محققان همسوسازی
بر RLHF و هوش مصنوعی قانون‌اساسی به عنوان اجزای حیاتی تمرکز می‌کنند که مدل‌های خام را ایمن، قابل استفاده و از نظر تجاری مقرون به صرفه می‌سازند.
حامیان وزن باز
بر قدرت تنظیم دقیق تحت نظارت تأکید می‌کنند و استدلال می‌کنند که مجموعه‌های داده با کیفیت بالا و باز به مدل‌های کوچک‌تر اجازه می‌دهد تا فراتر از حد انتظار عمل کنند.

چرا مهم است

درک نحوه ساخت مدل‌های هوش مصنوعی، ابهامات پیرامون قابلیت‌ها و نقص‌های آن‌ها را برطرف می‌کند. وقتی یک چت‌بات دچار توهم (Hallucination) می‌شود یا از پاسخ دادن به یک فرمان سر باز می‌زند، دانستن اینکه آیا این شکست ناشی از مرحله پیش‌آموزش بنیادی است یا تنظیم دقیق (Fine-Tuning) با هدایت انسانی، به توسعه‌دهندگان کمک می‌کند تا راهکار مناسب برای رفع آن را پیدا کنند.

هنگامی که شرکت متا (Meta) مدل لاما ۳ (Llama 3) خود را آموزش داد، این سیستم بیش از ۱۵ تریلیون توکن داده را بلعید—حجمی از متن که خواندن آن برای یک انسان میلیون‌ها سال طول می‌کشد. با این حال، اگر بلافاصله پس از اتمام پردازش این تریلیون‌ها کلمه با آن مدل تعامل می‌کردید، به عنوان یک چت‌بات کاملاً بی‌فایده بود. به سؤالات شما پاسخ نمی‌داد؛ احتمالاً فقط سؤالات بیشتری تولید می‌کرد، یا یک جمله را تا زمانی که حافظه‌اش تمام شود، به طور بی‌پایان تکمیل می‌کرد.[1]

این واقعیت غیرمنتظره، توهم اصلی هوش مصنوعی مدرن را برجسته می‌کند: یک هوش مصنوعی مکالمه‌محور، یک مغز واحد و یکپارچه نیست. بلکه محصول یک فرآیند تولید سه‌مرحله‌ای دقیق است. برای ساخت سیستمی مانند چت‌جی‌پی‌تی (ChatGPT) یا کلود (Claude)، توسعه‌دهندگان ابتدا باید هوش خام را شکل دهند، سپس رفتار آن را قالب‌بندی کنند و در نهایت قضاوت آن را صیقل دهند. این مراحل به عنوان پیش‌آموزش (Pre-training)، تنظیم دقیق تحت نظارت (SFT) و یادگیری تقویتی از بازخورد انسانی (RLHF) شناخته می‌شوند.[5]

مرحله اول، پیش‌آموزش، جایی است که مدل دانش خود را از جهان کسب می‌کند. هدف در این مرحله به طرز فریبنده‌ای ساده است: پیش‌بینی کلمه بعدی در یک دنباله. محققان بخش‌های عظیمی از اینترنت—ویکی‌پدیا، کتاب‌ها، مقالات علمی و مخازن کد—را به مدل می‌دهند و کلمه نهایی هر جمله را می‌پوشانند. مدل کلمه را حدس می‌زند، پاسخ واقعی را بررسی می‌کند و وزن‌های ریاضی داخلی خود را به طور جزئی تنظیم می‌کند تا دفعه بعد حدس بهتری بزند.[1][5]

در حالی که «پیش‌بینی کلمه بعدی» شبیه یک تکمیل خودکار پر زرق و برق به نظر می‌رسد، انجام دقیق آن در میان تریلیون‌ها مثال، مدل را مجبور می‌کند تا نمایش‌های داخلی عمیقی از منطق، دستور زبان و حقایق بسازد. برای پیش‌بینی صحیح کلمه بعدی در یک مقاله پیچیده فیزیک، مدل نمی‌تواند صرفاً به تکرار طوطی‌وار آماری تکیه کند؛ بلکه باید به طور ضمنی قوانین فیزیک را بیاموزد. این مرحله تقریباً ۹۹ درصد از کل بودجه محاسباتی را مصرف می‌کند و به ده‌ها هزار واحد پردازش گرافیکی (GPU) تخصصی نیاز دارد که ماه‌ها به طور مداوم کار کنند.[1]

فرآیند سه‌مرحله‌ای، یک موتور تکمیل خودکار خام را به یک دستیار مکالمه‌محور تبدیل می‌کند.

خروجی این تلاش محاسباتی عظیم، «مدل پایه» نامیده می‌شود. مدل‌های پایه قدرتمند اما بیگانه هستند. از آنجا که آن‌ها صرفاً برای پیش‌بینی آنچه در اینترنت می‌آید آموزش دیده‌اند، اگر به یک مدل پایه فرمان دهید «شعری درباره اقیانوس بنویس»، ممکن است در پاسخ «شعری درباره آسمان بنویس» تولید کند، زیرا فهرست‌های فرمان‌های نوشتاری در وب رایج هستند.[5]

برای تبدیل این موتور تکمیل خودکار بیگانه به یک دستیار مفید، توسعه‌دهندگان به مرحله دوم می‌روند: تنظیم دقیق تحت نظارت (SFT). در اینجا، هدف از پیش‌بینی به پیروی از دستورالعمل تغییر می‌کند. به جای تریلیون‌ها سند تصادفی اینترنت، مجموعه‌ای از داده‌های بسیار منتخب شامل جفت‌های فرمان و پاسخ عالی که توسط کارشناسان انسانی نوشته شده‌اند، به مدل داده می‌شود.[2][5]

در طول SFT، محققان اصلی را کشف کردند که به عنوان «کمتر، بیشتر است برای همسوسازی» (LIMA) شناخته می‌شود. پژوهش LIMA نشان داد که برای آموزش رفتار به یک مدل، نیازی به حجم عظیمی از داده نیست. اغلب تنها ۱۰۰۰ تا ۱۰۰۰۰ مثال با کیفیت استثنایی و ساخته دست انسان کافی است تا وضعیت کلی مدل را از یک پیش‌بینی‌کننده متن منفعل به یک دستیار فعال و مفید تغییر دهد.[4]

در طول SFT، محققان اصلی را کشف کردند که به عنوان «کمتر، بیشتر است برای همسوسازی» (LIMA) شناخته می‌شود.

با این حال، SFT یک مشکل مقیاس‌پذیری دارد. نوشتن هزاران مقاله کامل چند پاراگرافی، قطعه کد و اثبات ریاضی به طرز باورنکردنی گران و کُند است. علاوه بر این، کارشناسان انسانی اغلب در مورد اینکه چه چیزی یک پاسخ «کامل» به یک پرسش پیچیده یا ذهنی است، اختلاف نظر دارند. این گلوگاه منجر به توسعه مرحله سوم و حیاتی‌ترین مرحله برای چت‌بات‌های مدرن شد.[2][3]

تنظیم دقیق تحت نظارت، هدف مدل را از پیش‌بینی متن اینترنت به پیروی از دستورالعمل‌های صریح تغییر می‌دهد.

یادگیری تقویتی از بازخورد انسانی (RLHF) پیشرفتی بود که سیستم‌هایی مانند چت‌جی‌پی‌تی را عملی ساخت. به جای درخواست از انسان‌ها برای نوشتن پاسخ‌های کامل از ابتدا، RLHF از انسان‌ها می‌خواهد که به عنوان منتقد عمل کنند. یک فرمان به مدل داده می‌شود و مدل چندین پاسخ ممکن و متفاوت تولید می‌کند. یک رتبه‌بندی‌کننده انسانی آن‌ها را می‌خواند و از بهترین به بدترین رتبه‌بندی می‌کند.[2][3]

این رتبه‌بندی‌های انسانی مستقیماً به مدل زبان اصلی بازگردانده نمی‌شوند. در عوض، از آن‌ها برای آموزش یک هوش مصنوعی ثانویه و کوچک‌تر به نام «مدل پاداش» (Reward Model) استفاده می‌شود. تنها وظیفه مدل پاداش این است که به یک قطعه متن نگاه کند و پیش‌بینی کند که یک انسان چه امتیازی به آن خواهد داد. هنگامی که مدل پاداش آموزش دید، به عنوان یک قاضی خودکار و پرسرعت عمل می‌کند.[3]

در حلقه تقویتی نهایی، مدل زبان بزرگ اصلی (LLM) پاسخ دادن به میلیون‌ها فرمان را تمرین می‌کند. مدل پاداش فوراً به هر پاسخ امتیاز می‌دهد و مدل زبان بزرگ اصلی رفتار خود را برای به حداکثر رساندن آن امتیاز با استفاده از الگوریتمی به نام بهینه‌سازی سیاست مجاورتی (PPO) به‌روزرسانی می‌کند. این حلقه خودکار به مدل اجازه می‌دهد تا لحن مکالمه خود را اصلاح کند، یاد بگیرد درخواست‌های خطرناک را رد کند و شخصیتی مفید را در مقیاسی اتخاذ کند که رتبه‌بندی‌کنندگان انسانی هرگز نمی‌توانستند به آن دست یابند.[3][5]

برخی از آزمایشگاه‌های پیشرو این مفهوم را حتی فراتر برده‌اند. شرکت آنتروپیک (Anthropic) نوعی از آن را به نام هوش مصنوعی قانون‌اساسی (Constitutional AI) پیشگام کرد که به طور کامل جایگزین رتبه‌بندی‌کنندگان انسانی می‌شود. به جای اینکه انسان‌ها پاسخ‌ها را برای آموزش مدل پاداش رتبه‌بندی کنند، یک هوش مصنوعی جداگانه پاسخ‌ها را بر اساس یک «قانون اساسی» مکتوب از اصول (مانند: «پاسخی را انتخاب کنید که کمترین آسیب را داشته باشد») ارزیابی می‌کند. این امر به فرآیند همسوسازی اجازه می‌دهد تا بدون اتکا به ناوگان عظیم نیروی کار انسانی، با سرعت بیشتری مقیاس‌پذیر شود.

یادگیری تقویتی از بازخورد انسانی از یک هوش مصنوعی ثانویه برای خودکارسازی امتیازدهی به رفتار مدل اصلی استفاده می‌کند.

درک این فرآیند سه‌مرحله‌ای توضیح می‌دهد که چرا مدل‌های هوش مصنوعی به روش‌های خاصی که مشاهده می‌کنیم، شکست می‌خورند. اگر مدلی یک تاریخ تاریخی ساختگی را توهم کند، شکست احتمالاً ناشی از مرحله پیش‌آموزش است—آن واقعیت به سادگی در وزن‌های داخلی مدل جذب نشده است. RLHF نمی‌تواند به طور معجزه‌آسایی حقایق جدیدی را به مدل بیاموزد؛ بلکه فقط می‌تواند به مدل بیاموزد که چگونه حقایقی را که از قبل می‌داند ارائه دهد، یا چگونه با ادب به ندانستن اعتراف کند.[5]

در مقابل، اگر مدلی از پاسخ دادن به یک سؤال بی‌ضرر خودداری کند، زیرا با احتیاط بیش از حد آن را خطرناک علامت‌گذاری کرده است، این یک شکست در مرحله RLHF است. مدل پاداش برای جریمه کردن هر چیزی که شبیه بحث و جدل باشد، بیش از حد تهاجمی آموزش دیده است و در نتیجه یک مدل پایه «لوبوتومی‌شده» (کم‌توان) ایجاد شده است.[3][5]

در حالی که صنعت به سمت سیستم‌های توانمندتر در حرکت است، مکانیک آموزش در حال تکامل است. آزمایشگاه‌ها به طور فزاینده‌ای از داده‌های مصنوعی تولید شده توسط مدل‌های قدیمی‌تر برای آموزش مدل‌های جدیدتر استفاده می‌کنند و تلاش می‌کنند تا محدودیت‌های متن تولید شده توسط انسان را دور بزنند. با این حال، معماری بنیادی—شکل دادن پایگاه دانش، تعریف قالب و تقویت رفتار—همچنان سنگ بنای هوش مصنوعی مدرن باقی مانده است.[1][5]

نکات کلیدی

  • هوش مصنوعی مکالمه‌محور مدرن در سه مرحله مجزا ساخته می‌شود: پیش‌آموزش (Pre-training)، تنظیم دقیق تحت نظارت (SFT)، و یادگیری تقویتی از بازخورد انسانی (RLHF).
  • پیش‌آموزش تقریباً ۹۹٪ از بودجه محاسباتی را مصرف می‌کند و با پیش‌بینی متن در میان تریلیون‌ها سند، دانش اصلی مدل را می‌سازد.
  • تنظیم دقیق تحت نظارت از چند هزار مثال با کیفیت بالا و انسانی استفاده می‌کند تا به مدل خام بیاموزد چگونه خروجی خود را در قالب یک دستیار مفید ارائه دهد.
  • RLHF از رتبه‌بندی‌های انسانی برای آموزش یک «مدل پاداش» خودکار استفاده می‌کند، که سپس پاسخ‌های هوش مصنوعی اصلی را امتیازدهی می‌کند تا ایمنی و لحن مکالمه آن را در مقیاس وسیع اصلاح کند.

اصطلاحات کلیدی

Base Model
شبکه عصبی خامی که پس از پیش‌آموزش تولید می‌شود و قادر به پیش‌بینی متن است اما هنوز برای عمل به عنوان یک دستیار مکالمه‌محور آموزش ندیده است.
Token
واحد بنیادی داده که توسط مدل زبان بزرگ (LLM) پردازش می‌شود و تقریباً معادل یک کلمه یا بخشی از یک کلمه است.
Supervised Fine-Tuning (SFT)
فرآیند آموزش یک مدل پایه بر روی مجموعه‌ای از داده‌های منتخب شامل جفت‌های فرمان و پاسخ کامل برای آموزش نحوه پیروی از دستورالعمل‌ها.
Reward Model
یک هوش مصنوعی ثانویه و کوچک‌تر که بر اساس ترجیحات انسانی آموزش داده شده تا به طور خودکار رفتار مدل زبان اصلی را امتیازدهی و هدایت کند.
Proximal Policy Optimization (PPO)
الگوریتم یادگیری تقویتی خاصی که برای به‌روزرسانی وزن‌های مدل اصلی بر اساس امتیازات ارائه شده توسط مدل پاداش استفاده می‌شود.

آنچه نمی‌دانیم

  • اینکه آیا بازخورد انسانی با افزایش توانایی مدل‌ها در استدلال فراتر از درک انسان، همچنان کارآمد باقی خواهد ماند یا خیر.
  • نسبت دقیق داده‌های مصنوعی به داده‌های تولید شده توسط انسان که در حال حاضر در فرآیندهای تنظیم دقیق مدل‌های مرزی منتشر نشده استفاده می‌شود.
  • اینکه آیا معماری‌های جایگزین در نهایت نیاز به این فرآیند سه‌مرحله‌ای مجزا را به طور کامل از بین خواهند برد یا خیر.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

حداکثرگرایان مقیاس 40%محققان همسوسازی 35%حامیان وزن باز 25%
  1. [1]Meta AIحداکثرگرایان مقیاس

    Introducing Meta Llama 3: The most capable openly available LLM to date

    مطالعه در Meta AI
  2. [2]OpenAI Researchمحققان همسوسازی

    Aligning language models to follow instructions

    مطالعه در OpenAI Research
  3. [3]Hugging Faceحامیان وزن باز

    Illustrating Reinforcement Learning from Human Feedback (RLHF)

    مطالعه در Hugging Face
  4. [4]arXivحامیان وزن باز

    LIMA: Less Is More for Alignment

    مطالعه در arXiv
  5. [5]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.