چگونه الگوریتم GRPO گلوگاه حافظه را در آموزش استدلال هوش مصنوعی از بین میبرد
الگوریتم GRPO با کنار گذاشتن مدل ارزش (value model) که حافظه زیادی مصرف میکند و امتیازدهی به پاسخها در مقایسه با یکدیگر، به توسعهدهندگان اجازه میدهد تا مدلهای استدلالی پیشرفته را روی سختافزارهای معمولی آموزش دهند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- الگوریتم بهینهسازی خطمشی نسبی گروهی (GRPO) مدل ارزش پرمصرف را از یادگیری تقویتی حذف میکند.
- این الگوریتم به جای استفاده از یک خط پایه مطلق، به گروهی متشکل از ۴ تا ۱۶ پاسخ در مقایسه با یکدیگر امتیاز میدهد.
- کنار گذاشتن مدل ارزش، اوج مصرف حافظه را در طول آموزش تقریباً ۳۰ تا ۵۰ درصد کاهش میدهد.
گام حیاتی در آموزش استدلال به یک مدل زبانی بزرگ، «تخمین مزیت» (advantage estimation) است؛ یعنی لحظهای که سیستم به یک پاسخ تولیدشده نگاه میکند و دقیقاً محاسبه میکند که چقدر بهتر یا بدتر از حد انتظار است. سالهاست که این مرحله به یک شبکه عصبی ثانویه و عظیم به نام «مدل ارزش» (value model) نیاز داشت تا به عنوان یک منتقد عمل کند و هر توکنی را که مدل اصلی تولید میکند، قضاوت کند.
از آنجا که این مدل منتقد اغلب هماندازه مدل اصلی است، عملاً حافظه مورد نیاز برای آموزش سیستم را دو برابر میکند و یادگیری تقویتی پیشرفته را پشت درهای بسته آزمایشگاههایی با هزاران پردازنده گرافیکی (GPU) محبوس نگه میدارد.[3][4]
الگوریتم «بهینهسازی خطمشی نسبی گروهی» یا به اختصار GRPO، با تغییر نحوه سنجش موفقیت توسط مدل، این گلوگاه را به طور کامل دور میزند. به جای تکیه بر یک منتقد مجزا برای پیشبینی یک امتیاز مطلق برای یک پاسخ واحد، GRPO مدل را وادار میکند تا گروهی از پاسخهای مختلف - معمولاً ۴ تا ۱۶ پاسخ - را برای یک پرامپت یکسان تولید کند.
سپس همه آنها را با استفاده از یک تابع پاداش سبک یا یک قانون قطعی امتیازدهی میکند؛ مانند بررسی اینکه آیا یک اثبات ریاضی به عدد نهایی درستی میرسد یا خیر. همانطور که پژوهشگران DataCamp اشاره میکنند، این تکنیک «نیازی به دادههای برچسبگذاریشده ندارد، بلکه تنها به ابزاری برای تأیید صحت و مرتبسازی پاسخها بر اساس آن نیازمند است» [2].[2]
پس از امتیازدهی به گروه پاسخها، GRPO آن امتیازات را نسبت به یکدیگر نرمالسازی میکند. این الگوریتم میانگین امتیاز گروه را محاسبه کرده و به پاسخهایی که بالاتر از میانگین هستند، یک مزیت مثبت اختصاص میدهد، در حالی که پاسخهای پایینتر از آن را جریمه میکند.
با مقایسه خروجیهای مدل با تلاشهای همزمان خودش به جای یک خط پایه خارجی، این الگوریتم نیاز به مدل ارزشِ پرمصرف را به طور کامل از بین میبرد. یک مقاله پیشچاپ اخیر در arXiv این تغییر را خلاصه کرده و خاطرنشان میکند که GRPO میتواند «با تخمین مستقیم مزایا از گروههای پاسخ، نیاز به یک منتقد را از بین ببرد» [5].[5]
این تغییر معماری برای اولین بار در اوایل سال ۲۰۲۴ توسط پژوهشگران توسعهدهنده DeepSeekMath معرفی شد؛ آنها به راهی نیاز داشتند تا مرزهای استدلال ریاضی را بدون افزایش ردپای سختافزاری خود جابهجا کنند.
این روش در سال ۲۰۲۵، زمانی که برای آموزش DeepSeek-R1 استفاده شد، توجه گسترده صنعت را به خود جلب کرد و ثابت کرد که یک مدل میتواند زنجیرههای استدلالی پیشرفته و خوداصلاحگر را با استفاده از مقایسههای گروهی نسبی توسعه دهد. بر اساس تحلیل Deep (Learning) Focus، در حالی که مدلهای قدیمیتر بر «بهینهسازی خطمشی مجاورتی» (PPO) متکی بودند، «پژوهشهای اخیر در زمینه استدلال، برای ساخت مدلهای استدلالی بزرگ بر GRPO تکیه دارند» [3].[3]
دستاوردهای مربوط به کارایی در اینجا بیشتر ساختاری هستند تا حاشیهای. در یک پیکربندی سنتی PPO، آموزش یک مدل ۷۰ میلیارد پارامتری مستلزم نگهداری همزمان وزنهای مدل، وضعیتهای بهینهساز، مدل مرجع و مدل ارزش در حافظه است. با کنار گذاشتن مدل ارزش، GRPO بسته به پیکربندی خاص بهینهساز، اوج مصرف حافظه را تقریباً ۳۰ تا ۵۰ درصد کاهش میدهد. بررسی وبلاگ یادگیری ماشین AWS تأکید میکند که این کارایی باعث میشود GRPO «برای مدلهای مقیاسبزرگ مانند DeepSeek-V2 و V3، جایی که کارایی منابع حیاتی است، مناسبتر باشد» [4].[4]
این کاهش در بار پردازشی، چرخه پذیرش سریعی را در سراسر اکوسیستم متنباز به راه انداخته است. در سپتامبر ۲۰۲۶، پلتفرمهایی مانند Hugging Face، الگوریتم GRPO ناهمگام را با «انطباق رتبه پایین» (LoRA) در کارهای آموزشی خود ادغام کردند [1]. این ادغام به توسعهدهندگان اجازه میدهد تا خطوط لوله یادگیری تقویتی را روی سختافزارهای توزیعشده و معمولی اجرا کنند، بدون اینکه به اتصالات با پهنای باند بالا مانند NCCL شرکت انویدیا وابسته باشند؛ اتفاقی که عملاً دسترسی به آموزش مدلهای استدلالی را دموکراتیزه میکند.[1]
این تغییر همچنین نشاندهنده گذار از «یادگیری تقویتی با بازخورد انسانی» (RLHF) به «یادگیری تقویتی با پاداشهای قابل تأیید» (RLVR) است. از آنجا که GRPO دستهای از خروجیها را به طور همزمان ارزیابی میکند، به خوبی با حوزههایی جفت میشود که صحت آنها میتواند توسط یک کامپایلر یا حلکننده ریاضی (به جای یک ارزیاب انسانی) تأیید شود. مدل یاد میگیرد که با کاوش در مسیرهای متعدد، مشاهده اینکه کدام مسیر از تأییدکننده عبور میکند و بهروزرسانی وزنهای داخلی خود برای ترجیح دادن منطق موفق، استدلال کند.[3][6]
این تغییر همچنین نشاندهنده گذار از «یادگیری تقویتی با بازخورد انسانی» (RLHF) به «یادگیری تقویتی با پاداشهای قابل تأیید» (RLVR) است.
در حالی که GRPO در حوزههای عینی مانند توسعه نرمافزار و ریاضیات عالی عمل میکند، پژوهشگران هنوز در حال بررسی محدودیتهای آن در وظایف ذهنی مانند نوشتن خلاقانه یا همسویی مکالمهای هستند. بدون یک مدل ارزش متراکم که راهنمایی توکن به توکن ارائه دهد، این الگوریتم کاملاً به نتیجه نهایی زنجیره استدلال متکی است.
با این حال، GRPO با دموکراتیزه کردن توان محاسباتی مورد نیاز برای آموزش مدلهای استدلالی، مسیر توسعه هوش مصنوعی با وزنهای باز (open-weight) را اساساً تغییر داده و گلوگاه را از دسترسی به سختافزار، به طراحی تأییدکننده منتقل کرده است.[6]
اصطلاحات کلیدی
- یادگیری تقویتی (Reinforcement Learning)
- یک چارچوب یادگیری ماشین که در آن یک مدل با تعامل با یک محیط و دریافت پاداش یا جریمه برای اقدامات خود، یاد میگیرد.
- بهینهسازی خطمشی مجاورتی (PPO)
- الگوریتم سنتی یادگیری تقویتی که برای هوش مصنوعی استفاده میشود و برای تخمین پاداش مورد انتظار یک پاسخ تولیدشده، به یک مدل ارزش مجزا متکی است.
- مدل ارزش (Value Model)
- یک شبکه عصبی ثانویه که در یادگیری تقویتی سنتی برای عمل کردن به عنوان یک منتقد استفاده میشود و پیشبینی میکند که یک وضعیت یا توکن خاص چقدر خوب است.
- تخمین مزیت (Advantage Estimation)
- فرآیند ریاضی تعیین اینکه یک اقدام خاص در مقایسه با خط پایه مورد انتظار چقدر بهتر بوده است.
- یادگیری تقویتی با پاداشهای قابل تأیید (RLVR)
- یک رویکرد آموزشی که در آن مدل بر اساس بررسیهای قطعی و مبتنی بر قانون، به جای رتبهبندی ترجیحات انسانی، پاداش میگیرد.
پرسشهای متداول
چرا GRPO در مقایسه با روشهای قدیمیتر تا این حد در مصرف حافظه صرفهجویی میکند؟
این الگوریتم نیاز به مدل ارزش را به طور کامل از بین میبرد؛ مدل ارزش یک شبکه عصبی ثانویه است که در الگوریتمهای قدیمیتر مانند PPO برای قضاوت درباره خروجیهای مدل اصلی استفاده میشد.
آیا میتوان از GRPO برای هر نوع آموزش هوش مصنوعی استفاده کرد؟
در حال حاضر این روش برای وظایفی با پاسخهای واضح و قابل تأیید، مانند ریاضیات و برنامهنویسی کامپیوتر، بیشترین اثربخشی را دارد؛ جایی که یک سیستم مبتنی بر قانون میتواند به راحتی به گروهی از پاسخها امتیاز دهد.
مدل چگونه بدون مدل ارزش میفهمد که یک پاسخ خوب است؟
مدل چندین پاسخ برای یک پرامپت یکسان تولید میکند، به همه آنها امتیاز میدهد و آنها را با یکدیگر مقایسه میکند. پاسخهایی که امتیازی بالاتر از میانگین گروه کسب کنند، تقویت میشوند.
بررسی عمیق دیدگاهها
توسعهدهندگان هوش مصنوعی متنباز
پژوهشگران مستقل، GRPO را به عنوان یک نیروی دموکراتیزهکننده برای آموزش هوش مصنوعی میبینند.
برای جامعه متنباز، مانع اصلی در آموزش مدلهای استدلالی پیشرفته همیشه دسترسی به سختافزار بوده است. از آنجا که PPO سنتی مستلزم نگهداری یک مدل ارزش عظیم در حافظه در کنار مدل اصلی است، یادگیری تقویتی تا حد زیادی به آزمایشگاههای سازمانی با بودجه کلان محدود میشد. توسعهدهندگان متنباز استدلال میکنند که GRPO اساساً این پویایی را تغییر میدهد. با کنار گذاشتن مدل ارزش و تکیه بر امتیازدهی نسبی گروهی، پژوهشگران مستقل اکنون میتوانند خطوط لوله یادگیری تقویتی را روی پردازندههای گرافیکی توزیعشده و معمولی اجرا کنند و پیشرفتهای هوش مصنوعی جامعهمحور را تسریع بخشند.
آزمایشگاههای سازمانی هوش مصنوعی
شرکتهای بزرگ فناوری، GRPO را به عنوان یک بهینهسازی حیاتی در کارایی در نظر میگیرند.
برای آزمایشگاههای سازمانی که مراکز داده عظیمی را اداره میکنند، GRPO بیش از آنکه صرفاً یک قابلیت جدید باشد، نشاندهنده صرفهجویی عظیم در هزینههاست. آموزش مدلهای پیشگام به هزاران پردازنده گرافیکی نیاز دارد که ماهها کار کنند. با کاهش ۳۰ تا ۵۰ درصدی مصرف حافظه در مرحله یادگیری تقویتی، این آزمایشگاهها میتوانند مدلهای پایه بزرگتری را روی همان سختافزار آموزش دهند یا دستههای بسیار بزرگتری از دادههای آموزشی را پردازش کنند. پژوهشگران سازمانی تأکید میکنند که این کارایی به آنها اجازه میدهد تا «یادگیری تقویتی با پاداشهای قابل تأیید» (RLVR) را تا سطوح بیسابقهای مقیاسپذیر کنند.
پژوهشگران همسویی هوش مصنوعی
پژوهشگران ایمنی هشدار میدهند که GRPO ممکن است برای همسوییهای ظریف انسانی اثربخشی کمتری داشته باشد.
در حالی که GRPO در وظایف قابل تأیید مانند ریاضیات و کدنویسی عالی عمل میکند، پژوهشگران همسویی هوش مصنوعی خاطرنشان میکنند که این روش فاقد راهنمایی متراکم و توکن به توکنی است که توسط یک مدل ارزش سنتی ارائه میشود. در حوزههای ذهنی مانند ایمنی مکالمه یا نوشتن خلاقانه، یک مدل ارزش به هدایت هوش مصنوعی برای دوری از انحرافات رفتاری ظریف، پیش از اتمام پاسخ، کمک میکند. کارشناسان همسویی استدلال میکنند که اگرچه GRPO بسیار کارآمد است، اما PPO سنتی ممکن است همچنان برای مراحل نهایی تنظیم دقیق ترجیحات انسانی ضروری باشد تا اطمینان حاصل شود که مدل بیضرر و مفید باقی میماند.
- توسعهدهندگان هوش مصنوعی متنباز
- پژوهشگران مستقل، GRPO را به عنوان یک نیروی دموکراتیزهکننده برای آموزش هوش مصنوعی میبینند.
- آزمایشگاههای سازمانی هوش مصنوعی
- شرکتهای بزرگ فناوری، GRPO را به عنوان یک بهینهسازی حیاتی در کارایی در نظر میگیرند.
- پژوهشگران همسویی هوش مصنوعی
- پژوهشگران ایمنی هشدار میدهند که GRPO ممکن است برای همسوییهای ظریف انسانی اثربخشی کمتری داشته باشد.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار
منابع
[1]Hugging Face Blogتوسعهدهندگان هوش مصنوعی متنبازAsync GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
مطالعه در Hugging Face Blog →
[2]DataCampآزمایشگاههای سازمانی هوش مصنوعیGroup Relative Policy Optimization (GRPO)
مطالعه در DataCamp →
[3]Deep (Learning) Focusپژوهشگران همسویی هوش مصنوعیReinforcement Learning for LLMs
مطالعه در Deep (Learning) Focus →
[4]AWS Machine Learning Blogآزمایشگاههای سازمانی هوش مصنوعیSummary of why GRPO is Better
مطالعه در AWS Machine Learning Blog →
[5]arXivپژوهشگران همسویی هوش مصنوعیReinforcement Learning
مطالعه در arXiv →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →امنیت زیستی
گوگل دیپمایند از SynthID Bio برای واترمارکگذاری پروتئینهای طراحیشده با هوش مصنوعی رونمایی کرد
5 منبع
معماری شبکه عصبی
تبدیل امتیازهای خام به کلمات: لایه سافتمکس چگونه مدلهای زبانی بزرگ را هدایت میکند
6 منبع
زیرساخت هوش مصنوعی
فلشاتنشن چگونه سد حافظه پردازندههای گرافیکی را میشکند تا هوش مصنوعی با حافظه طولانی خلق شود
5 منبع
یادگیری درونبافتی
موتور بهینهسازی میانی: ترانسفورمرها چگونه برای یادگیری درونبافتی، گرادیان کاهشی را شبیهسازی میکنند؟
7 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





