رفتن به محتوای اصلی
Koohestun
توضیح کوهستانآموزش مدلگزارش تشریحی· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه الگوریتم GRPO گلوگاه حافظه را در آموزش استدلال هوش مصنوعی از بین می‌برد

الگوریتم GRPO با کنار گذاشتن مدل ارزش (value model) که حافظه زیادی مصرف می‌کند و امتیازدهی به پاسخ‌ها در مقایسه با یکدیگر، به توسعه‌دهندگان اجازه می‌دهد تا مدل‌های استدلالی پیشرفته را روی سخت‌افزارهای معمولی آموزش دهند.

به قلم ساناز امامی

توسعه‌دهندگان هوش مصنوعی متن‌باز 40%آزمایشگاه‌های سازمانی هوش مصنوعی 35%پژوهشگران همسویی هوش مصنوعی 25%
توسعه‌دهندگان هوش مصنوعی متن‌باز
پژوهشگران مستقل، GRPO را به عنوان یک نیروی دموکراتیزه‌کننده برای آموزش هوش مصنوعی می‌بینند.
آزمایشگاه‌های سازمانی هوش مصنوعی
شرکت‌های بزرگ فناوری، GRPO را به عنوان یک بهینه‌سازی حیاتی در کارایی در نظر می‌گیرند.
پژوهشگران همسویی هوش مصنوعی
پژوهشگران ایمنی هشدار می‌دهند که GRPO ممکن است برای همسویی‌های ظریف انسانی اثربخشی کمتری داشته باشد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار

چرا مهم است

الگوریتم GRPO با حذف نیاز به یک مدل منتقد ثانویه و عظیم، حافظه مورد نیاز برای یادگیری تقویتی را تا نصف کاهش می‌دهد. این کارایی ساختاری در حال دموکراتیزه کردن توسعه هوش مصنوعی است و به آزمایشگاه‌های کوچک‌تر و توسعه‌دهندگان متن‌باز اجازه می‌دهد تا مدل‌های استدلالی پیشرفته‌ای را آموزش دهند که پیش از این به هزاران پردازنده گرافیکی (GPU) نیاز داشتند.

گام حیاتی در آموزش استدلال به یک مدل زبانی بزرگ، «تخمین مزیت» (advantage estimation) است؛ یعنی لحظه‌ای که سیستم به یک پاسخ تولیدشده نگاه می‌کند و دقیقاً محاسبه می‌کند که چقدر بهتر یا بدتر از حد انتظار است. سال‌هاست که این مرحله به یک شبکه عصبی ثانویه و عظیم به نام «مدل ارزش» (value model) نیاز داشت تا به عنوان یک منتقد عمل کند و هر توکنی را که مدل اصلی تولید می‌کند، قضاوت کند. از آنجا که این مدل منتقد اغلب هم‌اندازه مدل اصلی است، عملاً حافظه مورد نیاز برای آموزش سیستم را دو برابر می‌کند و یادگیری تقویتی پیشرفته را پشت درهای بسته آزمایشگاه‌هایی با هزاران پردازنده گرافیکی (GPU) محبوس نگه می‌دارد.[3][4]

الگوریتم «بهینه‌سازی خط‌مشی نسبی گروهی» یا به اختصار GRPO، با تغییر نحوه سنجش موفقیت توسط مدل، این گلوگاه را به طور کامل دور می‌زند. به جای تکیه بر یک منتقد مجزا برای پیش‌بینی یک امتیاز مطلق برای یک پاسخ واحد، GRPO مدل را وادار می‌کند تا گروهی از پاسخ‌های مختلف - معمولاً ۴ تا ۱۶ پاسخ - را برای یک پرامپت یکسان تولید کند. سپس همه آن‌ها را با استفاده از یک تابع پاداش سبک یا یک قانون قطعی امتیازدهی می‌کند؛ مانند بررسی اینکه آیا یک اثبات ریاضی به عدد نهایی درستی می‌رسد یا خیر. همان‌طور که پژوهشگران DataCamp اشاره می‌کنند، این تکنیک «نیازی به داده‌های برچسب‌گذاری‌شده ندارد، بلکه تنها به ابزاری برای تأیید صحت و مرتب‌سازی پاسخ‌ها بر اساس آن نیازمند است» [2].[2]

پس از امتیازدهی به گروه پاسخ‌ها، GRPO آن امتیازات را نسبت به یکدیگر نرمال‌سازی می‌کند. این الگوریتم میانگین امتیاز گروه را محاسبه کرده و به پاسخ‌هایی که بالاتر از میانگین هستند، یک مزیت مثبت اختصاص می‌دهد، در حالی که پاسخ‌های پایین‌تر از آن را جریمه می‌کند. با مقایسه خروجی‌های مدل با تلاش‌های همزمان خودش به جای یک خط پایه خارجی، این الگوریتم نیاز به مدل ارزشِ پرمصرف را به طور کامل از بین می‌برد. یک مقاله پیش‌چاپ اخیر در arXiv این تغییر را خلاصه کرده و خاطرنشان می‌کند که GRPO می‌تواند «با تخمین مستقیم مزایا از گروه‌های پاسخ، نیاز به یک منتقد را از بین ببرد» [5].[5]

الگوریتم GRPO به گروهی از پاسخ‌ها در مقایسه با یکدیگر امتیاز می‌دهد و نیاز به یک مدل منتقد خارجی را دور می‌زند.

این تغییر معماری برای اولین بار در اوایل سال ۲۰۲۴ توسط پژوهشگران توسعه‌دهنده DeepSeekMath معرفی شد؛ آن‌ها به راهی نیاز داشتند تا مرزهای استدلال ریاضی را بدون افزایش ردپای سخت‌افزاری خود جابه‌جا کنند. این روش در سال ۲۰۲۵، زمانی که برای آموزش DeepSeek-R1 استفاده شد، توجه گسترده صنعت را به خود جلب کرد و ثابت کرد که یک مدل می‌تواند زنجیره‌های استدلالی پیشرفته و خوداصلاح‌گر را با استفاده از مقایسه‌های گروهی نسبی توسعه دهد. بر اساس تحلیل Deep (Learning) Focus، در حالی که مدل‌های قدیمی‌تر بر «بهینه‌سازی خط‌مشی مجاورتی» (PPO) متکی بودند، «پژوهش‌های اخیر در زمینه استدلال، برای ساخت مدل‌های استدلالی بزرگ بر GRPO تکیه دارند» [3].[3]

دستاوردهای مربوط به کارایی در اینجا بیشتر ساختاری هستند تا حاشیه‌ای. در یک پیکربندی سنتی PPO، آموزش یک مدل ۷۰ میلیارد پارامتری مستلزم نگهداری همزمان وزن‌های مدل، وضعیت‌های بهینه‌ساز، مدل مرجع و مدل ارزش در حافظه است. با کنار گذاشتن مدل ارزش، GRPO بسته به پیکربندی خاص بهینه‌ساز، اوج مصرف حافظه را تقریباً ۳۰ تا ۵۰ درصد کاهش می‌دهد. بررسی وبلاگ یادگیری ماشین AWS تأکید می‌کند که این کارایی باعث می‌شود GRPO «برای مدل‌های مقیاس‌بزرگ مانند DeepSeek-V2 و V3، جایی که کارایی منابع حیاتی است، مناسب‌تر باشد» [4].[4]

کنار گذاشتن مدل ارزش، اوج مصرف حافظه را در طول یادگیری تقویتی تا ۵۰ درصد کاهش می‌دهد.
دستاوردهای مربوط به کارایی در اینجا بیشتر ساختاری هستند تا حاشیه‌ای.

این کاهش در بار پردازشی، چرخه پذیرش سریعی را در سراسر اکوسیستم متن‌باز به راه انداخته است. در سپتامبر ۲۰۲۶، پلتفرم‌هایی مانند Hugging Face، الگوریتم GRPO ناهمگام را با «انطباق رتبه پایین» (LoRA) در کارهای آموزشی خود ادغام کردند [1]. این ادغام به توسعه‌دهندگان اجازه می‌دهد تا خطوط لوله یادگیری تقویتی را روی سخت‌افزارهای توزیع‌شده و معمولی اجرا کنند، بدون اینکه به اتصالات با پهنای باند بالا مانند NCCL شرکت انویدیا وابسته باشند؛ اتفاقی که عملاً دسترسی به آموزش مدل‌های استدلالی را دموکراتیزه می‌کند.[1]

این تغییر همچنین نشان‌دهنده گذار از «یادگیری تقویتی با بازخورد انسانی» (RLHF) به «یادگیری تقویتی با پاداش‌های قابل تأیید» (RLVR) است. از آنجا که GRPO دسته‌ای از خروجی‌ها را به طور همزمان ارزیابی می‌کند، به خوبی با حوزه‌هایی جفت می‌شود که صحت آن‌ها می‌تواند توسط یک کامپایلر یا حل‌کننده ریاضی (به جای یک ارزیاب انسانی) تأیید شود. مدل یاد می‌گیرد که با کاوش در مسیرهای متعدد، مشاهده اینکه کدام مسیر از تأییدکننده عبور می‌کند و به‌روزرسانی وزن‌های داخلی خود برای ترجیح دادن منطق موفق، استدلال کند.[3][6]

در حالی که GRPO در حوزه‌های عینی مانند توسعه نرم‌افزار و ریاضیات عالی عمل می‌کند، پژوهشگران هنوز در حال بررسی محدودیت‌های آن در وظایف ذهنی مانند نوشتن خلاقانه یا همسویی مکالمه‌ای هستند. بدون یک مدل ارزش متراکم که راهنمایی توکن به توکن ارائه دهد، این الگوریتم کاملاً به نتیجه نهایی زنجیره استدلال متکی است. با این حال، GRPO با دموکراتیزه کردن توان محاسباتی مورد نیاز برای آموزش مدل‌های استدلالی، مسیر توسعه هوش مصنوعی با وزن‌های باز (open-weight) را اساساً تغییر داده و گلوگاه را از دسترسی به سخت‌افزار، به طراحی تأییدکننده منتقل کرده است.[6]

آنچه نمی‌دانیم

  • آیا GRPO می‌تواند به طور کامل جایگزین PPO برای وظایف ذهنی همسویی انسانی شود، جایی که تعریف پاداش‌های قابل تأیید غیرممکن است.
  • اندازه گروه در GRPO چگونه با مدل‌های بزرگتر از ۱۰۰ میلیارد پارامتر مقیاس‌پذیر می‌شود، بدون اینکه گلوگاه‌های حافظه دوباره ایجاد شوند.

نکات کلیدی

  • الگوریتم بهینه‌سازی خط‌مشی نسبی گروهی (GRPO) مدل ارزش پرمصرف را از یادگیری تقویتی حذف می‌کند.
  • این الگوریتم به جای استفاده از یک خط پایه مطلق، به گروهی متشکل از ۴ تا ۱۶ پاسخ در مقایسه با یکدیگر امتیاز می‌دهد.
  • کنار گذاشتن مدل ارزش، اوج مصرف حافظه را در طول آموزش تقریباً ۳۰ تا ۵۰ درصد کاهش می‌دهد.
  • این افزایش کارایی به توسعه‌دهندگان متن‌باز اجازه می‌دهد تا مدل‌های استدلالی بزرگ را روی سخت‌افزارهای معمولی آموزش دهند.
  • الگوریتم GRPO به ویژه برای وظایف قابل تأیید مانند ریاضیات و توسعه نرم‌افزار مؤثر است.

اصطلاحات کلیدی

یادگیری تقویتی (Reinforcement Learning)
یک چارچوب یادگیری ماشین که در آن یک مدل با تعامل با یک محیط و دریافت پاداش یا جریمه برای اقدامات خود، یاد می‌گیرد.
بهینه‌سازی خط‌مشی مجاورتی (PPO)
الگوریتم سنتی یادگیری تقویتی که برای هوش مصنوعی استفاده می‌شود و برای تخمین پاداش مورد انتظار یک پاسخ تولیدشده، به یک مدل ارزش مجزا متکی است.
مدل ارزش (Value Model)
یک شبکه عصبی ثانویه که در یادگیری تقویتی سنتی برای عمل کردن به عنوان یک منتقد استفاده می‌شود و پیش‌بینی می‌کند که یک وضعیت یا توکن خاص چقدر خوب است.
تخمین مزیت (Advantage Estimation)
فرآیند ریاضی تعیین اینکه یک اقدام خاص در مقایسه با خط پایه مورد انتظار چقدر بهتر بوده است.
یادگیری تقویتی با پاداش‌های قابل تأیید (RLVR)
یک رویکرد آموزشی که در آن مدل بر اساس بررسی‌های قطعی و مبتنی بر قانون، به جای رتبه‌بندی ترجیحات انسانی، پاداش می‌گیرد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان هوش مصنوعی متن‌باز 40%آزمایشگاه‌های سازمانی هوش مصنوعی 35%پژوهشگران همسویی هوش مصنوعی 25%
  1. [1]Hugging Face Blogتوسعه‌دهندگان هوش مصنوعی متن‌باز

    Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL

    مطالعه در Hugging Face Blog
  2. [2]DataCampآزمایشگاه‌های سازمانی هوش مصنوعی

    Group Relative Policy Optimization (GRPO)

    مطالعه در DataCamp
  3. [3]Deep (Learning) Focusپژوهشگران همسویی هوش مصنوعی

    Reinforcement Learning for LLMs

    مطالعه در Deep (Learning) Focus
  4. [4]AWS Machine Learning Blogآزمایشگاه‌های سازمانی هوش مصنوعی

    Summary of why GRPO is Better

    مطالعه در AWS Machine Learning Blog
  5. [5]arXivپژوهشگران همسویی هوش مصنوعی

    Reinforcement Learning

    مطالعه در arXiv
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.