چگونه الگوریتم GRPO گلوگاه حافظه را در آموزش استدلال هوش مصنوعی از بین میبرد
الگوریتم GRPO با کنار گذاشتن مدل ارزش (value model) که حافظه زیادی مصرف میکند و امتیازدهی به پاسخها در مقایسه با یکدیگر، به توسعهدهندگان اجازه میدهد تا مدلهای استدلالی پیشرفته را روی سختافزارهای معمولی آموزش دهند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- توسعهدهندگان هوش مصنوعی متنباز
- پژوهشگران مستقل، GRPO را به عنوان یک نیروی دموکراتیزهکننده برای آموزش هوش مصنوعی میبینند.
- آزمایشگاههای سازمانی هوش مصنوعی
- شرکتهای بزرگ فناوری، GRPO را به عنوان یک بهینهسازی حیاتی در کارایی در نظر میگیرند.
- پژوهشگران همسویی هوش مصنوعی
- پژوهشگران ایمنی هشدار میدهند که GRPO ممکن است برای همسوییهای ظریف انسانی اثربخشی کمتری داشته باشد.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار
چرا مهم است
الگوریتم GRPO با حذف نیاز به یک مدل منتقد ثانویه و عظیم، حافظه مورد نیاز برای یادگیری تقویتی را تا نصف کاهش میدهد. این کارایی ساختاری در حال دموکراتیزه کردن توسعه هوش مصنوعی است و به آزمایشگاههای کوچکتر و توسعهدهندگان متنباز اجازه میدهد تا مدلهای استدلالی پیشرفتهای را آموزش دهند که پیش از این به هزاران پردازنده گرافیکی (GPU) نیاز داشتند.
گام حیاتی در آموزش استدلال به یک مدل زبانی بزرگ، «تخمین مزیت» (advantage estimation) است؛ یعنی لحظهای که سیستم به یک پاسخ تولیدشده نگاه میکند و دقیقاً محاسبه میکند که چقدر بهتر یا بدتر از حد انتظار است. سالهاست که این مرحله به یک شبکه عصبی ثانویه و عظیم به نام «مدل ارزش» (value model) نیاز داشت تا به عنوان یک منتقد عمل کند و هر توکنی را که مدل اصلی تولید میکند، قضاوت کند. از آنجا که این مدل منتقد اغلب هماندازه مدل اصلی است، عملاً حافظه مورد نیاز برای آموزش سیستم را دو برابر میکند و یادگیری تقویتی پیشرفته را پشت درهای بسته آزمایشگاههایی با هزاران پردازنده گرافیکی (GPU) محبوس نگه میدارد.[3][4]
الگوریتم «بهینهسازی خطمشی نسبی گروهی» یا به اختصار GRPO، با تغییر نحوه سنجش موفقیت توسط مدل، این گلوگاه را به طور کامل دور میزند. به جای تکیه بر یک منتقد مجزا برای پیشبینی یک امتیاز مطلق برای یک پاسخ واحد، GRPO مدل را وادار میکند تا گروهی از پاسخهای مختلف - معمولاً ۴ تا ۱۶ پاسخ - را برای یک پرامپت یکسان تولید کند. سپس همه آنها را با استفاده از یک تابع پاداش سبک یا یک قانون قطعی امتیازدهی میکند؛ مانند بررسی اینکه آیا یک اثبات ریاضی به عدد نهایی درستی میرسد یا خیر. همانطور که پژوهشگران DataCamp اشاره میکنند، این تکنیک «نیازی به دادههای برچسبگذاریشده ندارد، بلکه تنها به ابزاری برای تأیید صحت و مرتبسازی پاسخها بر اساس آن نیازمند است» [2].[2]
پس از امتیازدهی به گروه پاسخها، GRPO آن امتیازات را نسبت به یکدیگر نرمالسازی میکند. این الگوریتم میانگین امتیاز گروه را محاسبه کرده و به پاسخهایی که بالاتر از میانگین هستند، یک مزیت مثبت اختصاص میدهد، در حالی که پاسخهای پایینتر از آن را جریمه میکند. با مقایسه خروجیهای مدل با تلاشهای همزمان خودش به جای یک خط پایه خارجی، این الگوریتم نیاز به مدل ارزشِ پرمصرف را به طور کامل از بین میبرد. یک مقاله پیشچاپ اخیر در arXiv این تغییر را خلاصه کرده و خاطرنشان میکند که GRPO میتواند «با تخمین مستقیم مزایا از گروههای پاسخ، نیاز به یک منتقد را از بین ببرد» [5].[5]
این تغییر معماری برای اولین بار در اوایل سال ۲۰۲۴ توسط پژوهشگران توسعهدهنده DeepSeekMath معرفی شد؛ آنها به راهی نیاز داشتند تا مرزهای استدلال ریاضی را بدون افزایش ردپای سختافزاری خود جابهجا کنند. این روش در سال ۲۰۲۵، زمانی که برای آموزش DeepSeek-R1 استفاده شد، توجه گسترده صنعت را به خود جلب کرد و ثابت کرد که یک مدل میتواند زنجیرههای استدلالی پیشرفته و خوداصلاحگر را با استفاده از مقایسههای گروهی نسبی توسعه دهد. بر اساس تحلیل Deep (Learning) Focus، در حالی که مدلهای قدیمیتر بر «بهینهسازی خطمشی مجاورتی» (PPO) متکی بودند، «پژوهشهای اخیر در زمینه استدلال، برای ساخت مدلهای استدلالی بزرگ بر GRPO تکیه دارند» [3].[3]
دستاوردهای مربوط به کارایی در اینجا بیشتر ساختاری هستند تا حاشیهای. در یک پیکربندی سنتی PPO، آموزش یک مدل ۷۰ میلیارد پارامتری مستلزم نگهداری همزمان وزنهای مدل، وضعیتهای بهینهساز، مدل مرجع و مدل ارزش در حافظه است. با کنار گذاشتن مدل ارزش، GRPO بسته به پیکربندی خاص بهینهساز، اوج مصرف حافظه را تقریباً ۳۰ تا ۵۰ درصد کاهش میدهد. بررسی وبلاگ یادگیری ماشین AWS تأکید میکند که این کارایی باعث میشود GRPO «برای مدلهای مقیاسبزرگ مانند DeepSeek-V2 و V3، جایی که کارایی منابع حیاتی است، مناسبتر باشد» [4].[4]
دستاوردهای مربوط به کارایی در اینجا بیشتر ساختاری هستند تا حاشیهای.
این کاهش در بار پردازشی، چرخه پذیرش سریعی را در سراسر اکوسیستم متنباز به راه انداخته است. در سپتامبر ۲۰۲۶، پلتفرمهایی مانند Hugging Face، الگوریتم GRPO ناهمگام را با «انطباق رتبه پایین» (LoRA) در کارهای آموزشی خود ادغام کردند [1]. این ادغام به توسعهدهندگان اجازه میدهد تا خطوط لوله یادگیری تقویتی را روی سختافزارهای توزیعشده و معمولی اجرا کنند، بدون اینکه به اتصالات با پهنای باند بالا مانند NCCL شرکت انویدیا وابسته باشند؛ اتفاقی که عملاً دسترسی به آموزش مدلهای استدلالی را دموکراتیزه میکند.[1]
این تغییر همچنین نشاندهنده گذار از «یادگیری تقویتی با بازخورد انسانی» (RLHF) به «یادگیری تقویتی با پاداشهای قابل تأیید» (RLVR) است. از آنجا که GRPO دستهای از خروجیها را به طور همزمان ارزیابی میکند، به خوبی با حوزههایی جفت میشود که صحت آنها میتواند توسط یک کامپایلر یا حلکننده ریاضی (به جای یک ارزیاب انسانی) تأیید شود. مدل یاد میگیرد که با کاوش در مسیرهای متعدد، مشاهده اینکه کدام مسیر از تأییدکننده عبور میکند و بهروزرسانی وزنهای داخلی خود برای ترجیح دادن منطق موفق، استدلال کند.[3][6]
در حالی که GRPO در حوزههای عینی مانند توسعه نرمافزار و ریاضیات عالی عمل میکند، پژوهشگران هنوز در حال بررسی محدودیتهای آن در وظایف ذهنی مانند نوشتن خلاقانه یا همسویی مکالمهای هستند. بدون یک مدل ارزش متراکم که راهنمایی توکن به توکن ارائه دهد، این الگوریتم کاملاً به نتیجه نهایی زنجیره استدلال متکی است. با این حال، GRPO با دموکراتیزه کردن توان محاسباتی مورد نیاز برای آموزش مدلهای استدلالی، مسیر توسعه هوش مصنوعی با وزنهای باز (open-weight) را اساساً تغییر داده و گلوگاه را از دسترسی به سختافزار، به طراحی تأییدکننده منتقل کرده است.[6]
آنچه نمیدانیم
- آیا GRPO میتواند به طور کامل جایگزین PPO برای وظایف ذهنی همسویی انسانی شود، جایی که تعریف پاداشهای قابل تأیید غیرممکن است.
- اندازه گروه در GRPO چگونه با مدلهای بزرگتر از ۱۰۰ میلیارد پارامتر مقیاسپذیر میشود، بدون اینکه گلوگاههای حافظه دوباره ایجاد شوند.
نکات کلیدی
- الگوریتم بهینهسازی خطمشی نسبی گروهی (GRPO) مدل ارزش پرمصرف را از یادگیری تقویتی حذف میکند.
- این الگوریتم به جای استفاده از یک خط پایه مطلق، به گروهی متشکل از ۴ تا ۱۶ پاسخ در مقایسه با یکدیگر امتیاز میدهد.
- کنار گذاشتن مدل ارزش، اوج مصرف حافظه را در طول آموزش تقریباً ۳۰ تا ۵۰ درصد کاهش میدهد.
- این افزایش کارایی به توسعهدهندگان متنباز اجازه میدهد تا مدلهای استدلالی بزرگ را روی سختافزارهای معمولی آموزش دهند.
- الگوریتم GRPO به ویژه برای وظایف قابل تأیید مانند ریاضیات و توسعه نرمافزار مؤثر است.
اصطلاحات کلیدی
- یادگیری تقویتی (Reinforcement Learning)
- یک چارچوب یادگیری ماشین که در آن یک مدل با تعامل با یک محیط و دریافت پاداش یا جریمه برای اقدامات خود، یاد میگیرد.
- بهینهسازی خطمشی مجاورتی (PPO)
- الگوریتم سنتی یادگیری تقویتی که برای هوش مصنوعی استفاده میشود و برای تخمین پاداش مورد انتظار یک پاسخ تولیدشده، به یک مدل ارزش مجزا متکی است.
- مدل ارزش (Value Model)
- یک شبکه عصبی ثانویه که در یادگیری تقویتی سنتی برای عمل کردن به عنوان یک منتقد استفاده میشود و پیشبینی میکند که یک وضعیت یا توکن خاص چقدر خوب است.
- تخمین مزیت (Advantage Estimation)
- فرآیند ریاضی تعیین اینکه یک اقدام خاص در مقایسه با خط پایه مورد انتظار چقدر بهتر بوده است.
- یادگیری تقویتی با پاداشهای قابل تأیید (RLVR)
- یک رویکرد آموزشی که در آن مدل بر اساس بررسیهای قطعی و مبتنی بر قانون، به جای رتبهبندی ترجیحات انسانی، پاداش میگیرد.
منابع
[1]Hugging Face Blogتوسعهدهندگان هوش مصنوعی متنبازAsync GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
مطالعه در Hugging Face Blog →
[2]DataCampآزمایشگاههای سازمانی هوش مصنوعیGroup Relative Policy Optimization (GRPO)
مطالعه در DataCamp →
[3]Deep (Learning) Focusپژوهشگران همسویی هوش مصنوعیReinforcement Learning for LLMs
مطالعه در Deep (Learning) Focus →
[4]AWS Machine Learning Blogآزمایشگاههای سازمانی هوش مصنوعیSummary of why GRPO is Better
مطالعه در AWS Machine Learning Blog →
[5]arXivپژوهشگران همسویی هوش مصنوعیReinforcement Learning
مطالعه در arXiv →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →معماری هوش مصنوعی
چگونه قاعده زنجیرهای سیگنالهای خطا را برای بهروزرسانی وزنهای شبکه عصبی به عقب میراند
6 منبع
اجرای محلی
چگونه فرمت GGML اجرای مدلهای زبانی بزرگ را تنها با پردازنده مرکزی (CPU) ممکن میکند
10 منبع
یادگیریزدایی ماشینی
چگونه «یادگیریزدایی ماشینی» هوش مصنوعی را وادار به فراموشی میکند
5 منبع
مقررات هوش مصنوعی
کالیفرنیا «قانون شفافیت در هوش مصنوعی مرزی» را تصویب کرد؛ تعیین استانداردهای ایمنی برای مدلهای عظیم
7 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





