رفتن به محتوای اصلی
کوهستان
توضیح کوهستانآموزش مدلگزارش تشریحی· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه الگوریتم GRPO گلوگاه حافظه را در آموزش استدلال هوش مصنوعی از بین می‌برد

الگوریتم GRPO با کنار گذاشتن مدل ارزش (value model) که حافظه زیادی مصرف می‌کند و امتیازدهی به پاسخ‌ها در مقایسه با یکدیگر، به توسعه‌دهندگان اجازه می‌دهد تا مدل‌های استدلالی پیشرفته را روی سخت‌افزارهای معمولی آموزش دهند.

به قلم ساناز امامی

به‌طور خلاصه

  • الگوریتم بهینه‌سازی خط‌مشی نسبی گروهی (GRPO) مدل ارزش پرمصرف را از یادگیری تقویتی حذف می‌کند.
  • این الگوریتم به جای استفاده از یک خط پایه مطلق، به گروهی متشکل از ۴ تا ۱۶ پاسخ در مقایسه با یکدیگر امتیاز می‌دهد.
  • کنار گذاشتن مدل ارزش، اوج مصرف حافظه را در طول آموزش تقریباً ۳۰ تا ۵۰ درصد کاهش می‌دهد.

گام حیاتی در آموزش استدلال به یک مدل زبانی بزرگ، «تخمین مزیت» (advantage estimation) است؛ یعنی لحظه‌ای که سیستم به یک پاسخ تولیدشده نگاه می‌کند و دقیقاً محاسبه می‌کند که چقدر بهتر یا بدتر از حد انتظار است. سال‌هاست که این مرحله به یک شبکه عصبی ثانویه و عظیم به نام «مدل ارزش» (value model) نیاز داشت تا به عنوان یک منتقد عمل کند و هر توکنی را که مدل اصلی تولید می‌کند، قضاوت کند.

از آنجا که این مدل منتقد اغلب هم‌اندازه مدل اصلی است، عملاً حافظه مورد نیاز برای آموزش سیستم را دو برابر می‌کند و یادگیری تقویتی پیشرفته را پشت درهای بسته آزمایشگاه‌هایی با هزاران پردازنده گرافیکی (GPU) محبوس نگه می‌دارد.[3][4]

الگوریتم «بهینه‌سازی خط‌مشی نسبی گروهی» یا به اختصار GRPO، با تغییر نحوه سنجش موفقیت توسط مدل، این گلوگاه را به طور کامل دور می‌زند. به جای تکیه بر یک منتقد مجزا برای پیش‌بینی یک امتیاز مطلق برای یک پاسخ واحد، GRPO مدل را وادار می‌کند تا گروهی از پاسخ‌های مختلف - معمولاً ۴ تا ۱۶ پاسخ - را برای یک پرامپت یکسان تولید کند.

سپس همه آن‌ها را با استفاده از یک تابع پاداش سبک یا یک قانون قطعی امتیازدهی می‌کند؛ مانند بررسی اینکه آیا یک اثبات ریاضی به عدد نهایی درستی می‌رسد یا خیر. همان‌طور که پژوهشگران DataCamp اشاره می‌کنند، این تکنیک «نیازی به داده‌های برچسب‌گذاری‌شده ندارد، بلکه تنها به ابزاری برای تأیید صحت و مرتب‌سازی پاسخ‌ها بر اساس آن نیازمند است» [2].[2]

پس از امتیازدهی به گروه پاسخ‌ها، GRPO آن امتیازات را نسبت به یکدیگر نرمال‌سازی می‌کند. این الگوریتم میانگین امتیاز گروه را محاسبه کرده و به پاسخ‌هایی که بالاتر از میانگین هستند، یک مزیت مثبت اختصاص می‌دهد، در حالی که پاسخ‌های پایین‌تر از آن را جریمه می‌کند.

با مقایسه خروجی‌های مدل با تلاش‌های همزمان خودش به جای یک خط پایه خارجی، این الگوریتم نیاز به مدل ارزشِ پرمصرف را به طور کامل از بین می‌برد. یک مقاله پیش‌چاپ اخیر در arXiv این تغییر را خلاصه کرده و خاطرنشان می‌کند که GRPO می‌تواند «با تخمین مستقیم مزایا از گروه‌های پاسخ، نیاز به یک منتقد را از بین ببرد» [5].[5]

الگوریتم GRPO به گروهی از پاسخ‌ها در مقایسه با یکدیگر امتیاز می‌دهد و نیاز به یک مدل منتقد خارجی را دور می‌زند.

این تغییر معماری برای اولین بار در اوایل سال ۲۰۲۴ توسط پژوهشگران توسعه‌دهنده DeepSeekMath معرفی شد؛ آن‌ها به راهی نیاز داشتند تا مرزهای استدلال ریاضی را بدون افزایش ردپای سخت‌افزاری خود جابه‌جا کنند.

این روش در سال ۲۰۲۵، زمانی که برای آموزش DeepSeek-R1 استفاده شد، توجه گسترده صنعت را به خود جلب کرد و ثابت کرد که یک مدل می‌تواند زنجیره‌های استدلالی پیشرفته و خوداصلاح‌گر را با استفاده از مقایسه‌های گروهی نسبی توسعه دهد. بر اساس تحلیل Deep (Learning) Focus، در حالی که مدل‌های قدیمی‌تر بر «بهینه‌سازی خط‌مشی مجاورتی» (PPO) متکی بودند، «پژوهش‌های اخیر در زمینه استدلال، برای ساخت مدل‌های استدلالی بزرگ بر GRPO تکیه دارند» [3].[3]

دستاوردهای مربوط به کارایی در اینجا بیشتر ساختاری هستند تا حاشیه‌ای. در یک پیکربندی سنتی PPO، آموزش یک مدل ۷۰ میلیارد پارامتری مستلزم نگهداری همزمان وزن‌های مدل، وضعیت‌های بهینه‌ساز، مدل مرجع و مدل ارزش در حافظه است. با کنار گذاشتن مدل ارزش، GRPO بسته به پیکربندی خاص بهینه‌ساز، اوج مصرف حافظه را تقریباً ۳۰ تا ۵۰ درصد کاهش می‌دهد. بررسی وبلاگ یادگیری ماشین AWS تأکید می‌کند که این کارایی باعث می‌شود GRPO «برای مدل‌های مقیاس‌بزرگ مانند DeepSeek-V2 و V3، جایی که کارایی منابع حیاتی است، مناسب‌تر باشد» [4].[4]

کنار گذاشتن مدل ارزش، اوج مصرف حافظه را در طول یادگیری تقویتی تا ۵۰ درصد کاهش می‌دهد.

این کاهش در بار پردازشی، چرخه پذیرش سریعی را در سراسر اکوسیستم متن‌باز به راه انداخته است. در سپتامبر ۲۰۲۶، پلتفرم‌هایی مانند Hugging Face، الگوریتم GRPO ناهمگام را با «انطباق رتبه پایین» (LoRA) در کارهای آموزشی خود ادغام کردند [1]. این ادغام به توسعه‌دهندگان اجازه می‌دهد تا خطوط لوله یادگیری تقویتی را روی سخت‌افزارهای توزیع‌شده و معمولی اجرا کنند، بدون اینکه به اتصالات با پهنای باند بالا مانند NCCL شرکت انویدیا وابسته باشند؛ اتفاقی که عملاً دسترسی به آموزش مدل‌های استدلالی را دموکراتیزه می‌کند.[1]

این تغییر همچنین نشان‌دهنده گذار از «یادگیری تقویتی با بازخورد انسانی» (RLHF) به «یادگیری تقویتی با پاداش‌های قابل تأیید» (RLVR) است. از آنجا که GRPO دسته‌ای از خروجی‌ها را به طور همزمان ارزیابی می‌کند، به خوبی با حوزه‌هایی جفت می‌شود که صحت آن‌ها می‌تواند توسط یک کامپایلر یا حل‌کننده ریاضی (به جای یک ارزیاب انسانی) تأیید شود. مدل یاد می‌گیرد که با کاوش در مسیرهای متعدد، مشاهده اینکه کدام مسیر از تأییدکننده عبور می‌کند و به‌روزرسانی وزن‌های داخلی خود برای ترجیح دادن منطق موفق، استدلال کند.[3][6]

این تغییر همچنین نشان‌دهنده گذار از «یادگیری تقویتی با بازخورد انسانی» (RLHF) به «یادگیری تقویتی با پاداش‌های قابل تأیید» (RLVR) است.

در حالی که GRPO در حوزه‌های عینی مانند توسعه نرم‌افزار و ریاضیات عالی عمل می‌کند، پژوهشگران هنوز در حال بررسی محدودیت‌های آن در وظایف ذهنی مانند نوشتن خلاقانه یا همسویی مکالمه‌ای هستند. بدون یک مدل ارزش متراکم که راهنمایی توکن به توکن ارائه دهد، این الگوریتم کاملاً به نتیجه نهایی زنجیره استدلال متکی است.

با این حال، GRPO با دموکراتیزه کردن توان محاسباتی مورد نیاز برای آموزش مدل‌های استدلالی، مسیر توسعه هوش مصنوعی با وزن‌های باز (open-weight) را اساساً تغییر داده و گلوگاه را از دسترسی به سخت‌افزار، به طراحی تأییدکننده منتقل کرده است.[6]

اصطلاحات کلیدی

یادگیری تقویتی (Reinforcement Learning)
یک چارچوب یادگیری ماشین که در آن یک مدل با تعامل با یک محیط و دریافت پاداش یا جریمه برای اقدامات خود، یاد می‌گیرد.
بهینه‌سازی خط‌مشی مجاورتی (PPO)
الگوریتم سنتی یادگیری تقویتی که برای هوش مصنوعی استفاده می‌شود و برای تخمین پاداش مورد انتظار یک پاسخ تولیدشده، به یک مدل ارزش مجزا متکی است.
مدل ارزش (Value Model)
یک شبکه عصبی ثانویه که در یادگیری تقویتی سنتی برای عمل کردن به عنوان یک منتقد استفاده می‌شود و پیش‌بینی می‌کند که یک وضعیت یا توکن خاص چقدر خوب است.
تخمین مزیت (Advantage Estimation)
فرآیند ریاضی تعیین اینکه یک اقدام خاص در مقایسه با خط پایه مورد انتظار چقدر بهتر بوده است.
یادگیری تقویتی با پاداش‌های قابل تأیید (RLVR)
یک رویکرد آموزشی که در آن مدل بر اساس بررسی‌های قطعی و مبتنی بر قانون، به جای رتبه‌بندی ترجیحات انسانی، پاداش می‌گیرد.

پرسش‌های متداول

چرا GRPO در مقایسه با روش‌های قدیمی‌تر تا این حد در مصرف حافظه صرفه‌جویی می‌کند؟

این الگوریتم نیاز به مدل ارزش را به طور کامل از بین می‌برد؛ مدل ارزش یک شبکه عصبی ثانویه است که در الگوریتم‌های قدیمی‌تر مانند PPO برای قضاوت درباره خروجی‌های مدل اصلی استفاده می‌شد.

آیا می‌توان از GRPO برای هر نوع آموزش هوش مصنوعی استفاده کرد؟

در حال حاضر این روش برای وظایفی با پاسخ‌های واضح و قابل تأیید، مانند ریاضیات و برنامه‌نویسی کامپیوتر، بیشترین اثربخشی را دارد؛ جایی که یک سیستم مبتنی بر قانون می‌تواند به راحتی به گروهی از پاسخ‌ها امتیاز دهد.

مدل چگونه بدون مدل ارزش می‌فهمد که یک پاسخ خوب است؟

مدل چندین پاسخ برای یک پرامپت یکسان تولید می‌کند، به همه آن‌ها امتیاز می‌دهد و آن‌ها را با یکدیگر مقایسه می‌کند. پاسخ‌هایی که امتیازی بالاتر از میانگین گروه کسب کنند، تقویت می‌شوند.

بررسی عمیق دیدگاه‌ها

توسعه‌دهندگان هوش مصنوعی متن‌باز

پژوهشگران مستقل، GRPO را به عنوان یک نیروی دموکراتیزه‌کننده برای آموزش هوش مصنوعی می‌بینند.

برای جامعه متن‌باز، مانع اصلی در آموزش مدل‌های استدلالی پیشرفته همیشه دسترسی به سخت‌افزار بوده است. از آنجا که PPO سنتی مستلزم نگهداری یک مدل ارزش عظیم در حافظه در کنار مدل اصلی است، یادگیری تقویتی تا حد زیادی به آزمایشگاه‌های سازمانی با بودجه کلان محدود می‌شد. توسعه‌دهندگان متن‌باز استدلال می‌کنند که GRPO اساساً این پویایی را تغییر می‌دهد. با کنار گذاشتن مدل ارزش و تکیه بر امتیازدهی نسبی گروهی، پژوهشگران مستقل اکنون می‌توانند خطوط لوله یادگیری تقویتی را روی پردازنده‌های گرافیکی توزیع‌شده و معمولی اجرا کنند و پیشرفت‌های هوش مصنوعی جامعه‌محور را تسریع بخشند.

آزمایشگاه‌های سازمانی هوش مصنوعی

شرکت‌های بزرگ فناوری، GRPO را به عنوان یک بهینه‌سازی حیاتی در کارایی در نظر می‌گیرند.

برای آزمایشگاه‌های سازمانی که مراکز داده عظیمی را اداره می‌کنند، GRPO بیش از آنکه صرفاً یک قابلیت جدید باشد، نشان‌دهنده صرفه‌جویی عظیم در هزینه‌هاست. آموزش مدل‌های پیشگام به هزاران پردازنده گرافیکی نیاز دارد که ماه‌ها کار کنند. با کاهش ۳۰ تا ۵۰ درصدی مصرف حافظه در مرحله یادگیری تقویتی، این آزمایشگاه‌ها می‌توانند مدل‌های پایه بزرگ‌تری را روی همان سخت‌افزار آموزش دهند یا دسته‌های بسیار بزرگ‌تری از داده‌های آموزشی را پردازش کنند. پژوهشگران سازمانی تأکید می‌کنند که این کارایی به آن‌ها اجازه می‌دهد تا «یادگیری تقویتی با پاداش‌های قابل تأیید» (RLVR) را تا سطوح بی‌سابقه‌ای مقیاس‌پذیر کنند.

پژوهشگران همسویی هوش مصنوعی

پژوهشگران ایمنی هشدار می‌دهند که GRPO ممکن است برای همسویی‌های ظریف انسانی اثربخشی کمتری داشته باشد.

در حالی که GRPO در وظایف قابل تأیید مانند ریاضیات و کدنویسی عالی عمل می‌کند، پژوهشگران همسویی هوش مصنوعی خاطرنشان می‌کنند که این روش فاقد راهنمایی متراکم و توکن به توکنی است که توسط یک مدل ارزش سنتی ارائه می‌شود. در حوزه‌های ذهنی مانند ایمنی مکالمه یا نوشتن خلاقانه، یک مدل ارزش به هدایت هوش مصنوعی برای دوری از انحرافات رفتاری ظریف، پیش از اتمام پاسخ، کمک می‌کند. کارشناسان همسویی استدلال می‌کنند که اگرچه GRPO بسیار کارآمد است، اما PPO سنتی ممکن است همچنان برای مراحل نهایی تنظیم دقیق ترجیحات انسانی ضروری باشد تا اطمینان حاصل شود که مدل بی‌ضرر و مفید باقی می‌ماند.

توسعه‌دهندگان هوش مصنوعی متن‌باز 40%آزمایشگاه‌های سازمانی هوش مصنوعی 35%پژوهشگران همسویی هوش مصنوعی 25%
توسعه‌دهندگان هوش مصنوعی متن‌باز
پژوهشگران مستقل، GRPO را به عنوان یک نیروی دموکراتیزه‌کننده برای آموزش هوش مصنوعی می‌بینند.
آزمایشگاه‌های سازمانی هوش مصنوعی
شرکت‌های بزرگ فناوری، GRPO را به عنوان یک بهینه‌سازی حیاتی در کارایی در نظر می‌گیرند.
پژوهشگران همسویی هوش مصنوعی
پژوهشگران ایمنی هشدار می‌دهند که GRPO ممکن است برای همسویی‌های ظریف انسانی اثربخشی کمتری داشته باشد.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان هوش مصنوعی متن‌باز 40%آزمایشگاه‌های سازمانی هوش مصنوعی 35%پژوهشگران همسویی هوش مصنوعی 25%
  1. [1]Hugging Face Blogتوسعه‌دهندگان هوش مصنوعی متن‌باز

    Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL

    مطالعه در Hugging Face Blog →
  2. [2]DataCampآزمایشگاه‌های سازمانی هوش مصنوعی

    Group Relative Policy Optimization (GRPO)

    مطالعه در DataCamp →
  3. [3]Deep (Learning) Focusپژوهشگران همسویی هوش مصنوعی

    Reinforcement Learning for LLMs

    مطالعه در Deep (Learning) Focus →
  4. [4]AWS Machine Learning Blogآزمایشگاه‌های سازمانی هوش مصنوعی

    Summary of why GRPO is Better

    مطالعه در AWS Machine Learning Blog →
  5. [5]arXivپژوهشگران همسویی هوش مصنوعی

    Reinforcement Learning

    مطالعه در arXiv →
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.