چگونه شبکههای مسیریابی «ترکیب خبرگان» تعداد پارامترهای مدل زبانی را از هزینه پردازشی جدا میکنند
معماریهای «ترکیب خبرگان» (MoE) با فعال کردن تنها بخش تخصصی کوچکی از شبکه عصبی خود برای هر کلمه، به مدلهای زبانی اجازه میدهند تا بدون نیاز به افزایش متناسب در توان پردازشی، تا صدها میلیارد پارامتر گسترش یابند.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
- مدافعان بهرهوری سختافزاری
- استدلال میکنند که تُنُک بودن شدید تنها مسیر پایدار برای گسترش هوش مصنوعی است، زیرا مدلهای متراکم به توان پردازشی خام و برق بسیار زیادی نیاز دارند.
- منتقدان محدودیت حافظه
- اشاره میکنند که اگرچه MoE در توان پردازشی صرفهجویی میکند، اما همچنان برای ذخیره پارامترهای غیرفعال به مقادیر عظیمی از VRAM نیاز دارد که این امر مدلهای بزرگ را از دسترس سختافزارهای مصرفکننده دور نگه میدارد.
- پژوهشگران الگوریتم
- بر بهبود خود مکانیزمهای مسیریابی تمرکز دارند و استدلال میکنند که مسیریابی فعلی Top-K بهینه نیست و در حال بررسی جایگزینهای مسیریابی پیوسته یا نرم هستند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار
- اپراتورهای شبکه برق
چرا مهم است
با بزرگتر شدن مدلهای هوش مصنوعی برای پردازش استدلالهای پیچیده، انرژی و سختافزار مورد نیاز برای اجرای آنها در خطر ناپایداری قرار میگیرد. «ترکیب خبرگان» یک راهحل ساختاری ارائه میدهد که به توسعهدهندگان اجازه میدهد مدلهای بسیار هوشمندتری بسازند که همچنان بتوانند روی سختافزارهای در دسترس با بهرهوری بالا اجرا شوند.
در ۷ مه ۲۰۲۴، تیم تحقیقاتی DeepSeek یک گزارش فنی منتشر کرد که جزئیات یک مدل زبانی ۲۳۶ میلیارد پارامتری را شرح میداد؛ مدلی که برای اجرا تنها به کسری از توان پردازشی مورد انتظار نیاز داشت. این مدل که DeepSeek-V2 نام دارد، با فعال کردن تنها ۲۱ میلیارد پارامتر برای هر توکن، بیش از ۹۰ درصد از شبکه عصبی خود را در طول هر محاسبه غیرفعال نگه میدارد.[1]
این انتشار، یک تغییر ساختاری در نحوه ساخت هوش مصنوعی پیشرفته را تثبیت کرد. توسعهدهندگان به جای عبور دادن اجباری هر قطعه داده از تمام نورونهای مصنوعی (روشی که به عنوان مدلسازی متراکم شناخته میشود)، به طور فزایندهای به یک مکانیزم مسیریابی به نام «ترکیب خبرگان» (MoE) متکی هستند.[5]
محدودیت اساسی مدلهای متراکم در انعطافناپذیری ریاضی آنها نهفته است. در یک معماری متراکم، تولید یک کلمه واحد نیازمند یک عملیات ضرب ماتریسی است که تکتک پارامترهای مدل را درگیر میکند.[5]
با بزرگتر شدن مدلها برای بهبود قابلیتهای استدلالی، این نیاز پردازشی متراکم به صورت خطی افزایش مییابد. یک مدل متراکم ۴۰۰ میلیارد پارامتری تقریباً به ده برابر پهنای باند حافظه و توان پردازشی به ازای هر توکن نسبت به یک مدل ۴۰ میلیارد پارامتری نیاز دارد؛ این موضوع سقف سختی را برای میزان رشد مدلها پیش از آنکه اجرای آنها بیش از حد گران تمام شود، ایجاد میکند.[5]
«ترکیب خبرگان» با جدا کردن ظرفیت دانش کل مدل از هزینه پردازشی فعال آن، این گلوگاه را دور میزند. این کار با جایگزین کردن لایههای یکپارچه و استاندارد شبکه عصبی با زیرشبکههای تخصصی انجام میشود.[5]
این مکانیزم بر دو جزء متمایز تکیه دارد: «خبرگان» و «مسیریاب». در داخل یک لایه MoE، شبکه عصبی پیشخور (feed-forward) استاندارد به چندین بخش مستقل تقسیم میشود.[5]
پژوهشگران شرکت Mistral AI در مقاله ژانویه ۲۰۲۴ خود که به تشریح مدل Mixtral 8x7B میپردازد، اشاره کردند: «میکسترال یک شبکه ترکیب خبرگان تُنُک (sparse) است. این یک مدل صرفاً رمزگشا (decoder-only) است که در آن بلوک پیشخور از مجموعهای متشکل از ۸ گروه متمایز از پارامترها انتخاب میکند.»[2]
مسیریاب به عنوان یک کنترلکننده ترافیک پرسرعت عمل میکند. هنگامی که یک توکن (نمایش ریاضی یک کلمه یا مفهوم) به یک لایه MoE میرسد، مسیریاب آن را ارزیابی کرده و یک توزیع احتمال را در بین تمام خبرگان موجود محاسبه میکند.[5]
سپس تنها یک یا دو خبره برتر را که برای پردازش آن توکن خاص مناسبتر هستند انتخاب کرده و بقیه را نادیده میگیرد. توکن توسط آن خبرگان خاص پردازش میشود و خروجیهای آنها ترکیب شده و به لایه بعدی منتقل میگردد.[5]
سپس تنها یک یا دو خبره برتر را که برای پردازش آن توکن خاص مناسبتر هستند انتخاب کرده و بقیه را نادیده میگیرد.
به عنوان مثال، اگر توکن ورودی مربوط به کد پایتون باشد، مسیریاب ممکن است آن را به خبره ۳ و خبره ۷ ارسال کند. اگر توکن بعدی مربوط به گرامر زبان فرانسوی باشد، ممکن است به خبره ۱ و خبره ۵ هدایت شود.[5]
از آنجا که تنها زیرمجموعهای از خبرگان فعال میشوند، هزینه پردازشی پایین میماند. مدل Mixtral 8x7B در مجموع دارای ۴۷ میلیارد پارامتر است، اما از آنجا که در هر لحظه توکنها را تنها به دو مورد از هشت خبره خود هدایت میکند، با سرعت و هزینه فعال یک مدل ۱۳ میلیارد پارامتری اجرا میشود.[2]
این تُنُک بودن (Sparsity) همان چیزی است که به مدلها اجازه میدهد تا با بهرهوری بالا گسترش یابند. تعداد کل پارامترها (که تعیین میکند مدل چقدر دانش میتواند ذخیره کند) میتواند به طور گستردهای افزایش یابد، در حالی که تعداد پارامترهای فعال (که سرعت استنتاج را تعیین میکند) محدود باقی میماند.[5]
تحقیقات بنیادین برای مسیریابی دادهها به زیرشبکههای تخصصی به سال ۱۹۹۱ بازمیگردد، اما کاربرد آن در مدلهای زبانی بزرگ مدرن توسط مقاله Switch Transformer گوگل که در ۱۱ ژانویه ۲۰۲۱ منتشر شد، رواج یافت.[3]
پژوهشگران گوگل نوشتند: «در این کار ما Switch Transformer را پیشنهاد میکنیم؛ معماریای که پردازش را از پارامترها جدا میکند.» آنها نشان دادند که یک مدل تریلیون پارامتری میتواند با هدایت توکنها به تنها یکی از ۲۰۴۸ خبره، به طور کارآمدی آموزش داده شود.[3]
با این حال، پیادهسازی MoE چالشهای مهندسی قابلتوجهی را به همراه دارد که عمدتاً حول مدیریت حافظه میچرخد. اگرچه پردازش فعال پایین است، اما کل مدل همچنان باید در حافظه دسترسی تصادفی کارت گرافیک (VRAM) قرار داشته باشد.[5]
یک مدل ۲۳۶ میلیارد پارامتری مانند DeepSeek-V2 همچنان به صدها گیگابایت VRAM تنها برای نگهداری خبرگان غیرفعال نیاز دارد؛ به این معنی که با وجود نیازهای پردازشی فعال پایین، نمیتواند روی یک کارت گرافیک معمولی و مصرفکننده اجرا شود.[1]
علاوه بر این، مسیریابها ممکن است در طول آموزش دچار «فروپاشی بازنمایی» (Representation Collapse) شوند. این اتفاق زمانی رخ میدهد که مسیریاب یاد میگیرد تمام توکنها را به همان چند خبره تکراری ارسال کند و بقیه شبکه را آموزشندیده و بیفایده رها کند.[5]
برای جلوگیری از این گلوگاه، مهندسان یک تابع زیان کمکی برای توزیع بار در مرحله آموزش معرفی میکنند. این جریمه ریاضی، مسیریاب را مجبور میکند تا توکنها را به طور نسبتاً یکنواختی در بین تمام خبرگان موجود توزیع کند و اطمینان حاصل کند که کل شبکه آموزش میبیند.[2]
تخصص دقیق این خبرگان به ندرت برای انسان قابل خواندن است. یک خبره به طور صریح به «خبره ریاضی» یا «خبره تاریخ» به شکلی که یک برنامهنویس انسانی طراحی میکند، تبدیل نمیشود.[5]
در عوض، آنها در الگوهای برداری انتزاعی و با ابعاد بالا تخصص پیدا میکنند. یک خبره ممکن است برای علائم نگارشی و حروف ربط فعال شود، در حالی که دیگری برای ساختارهای نحوی خاص در چندین زبان فعال میگردد.[5]
روند حرکت به سمت تُنُک بودن شدید در حال شتاب گرفتن است. در ۲۷ مارس ۲۰۲۴، شرکت Databricks مدل DBRX را منتشر کرد؛ یک مدل ۱۳۲ میلیارد پارامتری که ۳۶ میلیارد پارامتر را به ازای هر توکن فعال میکند و از یک معماری بسیار دانهبندی شده با ۱۶ خبره بهره میبرد که در آن چهار خبره برای هر توکن انتخاب میشوند.[4]
با مقایسه معماریهای Mixtral، DBRX و DeepSeek-V2، یک مسیر روشن پدیدار میشود: با افزایش اندازه کل مدل، درصد پارامترهای فعال به شدت کاهش مییابد. مدلهای پیشرفته آینده احتمالاً دارای تریلیونها پارامتر خواهند بود که به هزاران خبره بسیار دانهبندی شده تقسیم میشوند و برای حفظ سرعت استنتاج، کمتر از یک درصد از شبکه خود را به ازای هر توکن فعال میکنند.[5]
نکات کلیدی
- معماریهای ترکیب خبرگان (MoE) لایههای شبکه عصبی را به زیرشبکههای تخصصی تقسیم میکنند.
- یک مسیریاب (Router) هر توکن را ارزیابی کرده و آن را تنها به مرتبطترین خبرگان ارسال میکند.
- این کار به مدلها اجازه میدهد تا حجم عظیمی از دانش را ذخیره کنند، در حالی که هزینههای پردازشی فعال را پایین نگه میدارند.
- با وجود نیاز پردازشی پایین، مدلهای MoE همچنان برای ذخیره پارامترهای غیرفعال به حافظه عظیمی نیاز دارند.
آنچه نمیدانیم
- تعداد دقیق پارامترها و معماری مسیریابی مدلهای پیشرفته و اختصاصی مانند GPT-4.
- محدودیتهای فیزیکی اینکه یک مسیریاب واحد تا چه تعداد خبره را میتواند پیش از شکست در توزیع بار، به طور موثر مدیریت کند.
- اینکه آیا سختافزارهای حافظه در آینده با سرعت کافی رشد خواهند کرد تا بتوانند مجموعههای عظیم پارامترهای غیرفعال در مدلهای MoE نسل بعدی را در خود جای دهند یا خیر.
اصطلاحات کلیدی
- ترکیب خبرگان (MoE)
- یک معماری شبکه عصبی که لایههای خود را به چندین زیرشبکه تخصصی تقسیم میکند و تنها تعداد کمی از آنها را برای هر قطعه داده فعال میسازد.
- مدل متراکم
- یک معماری سنتی شبکه عصبی که در آن تکتک پارامترها فعال شده و برای پردازش هر قطعه داده مورد استفاده قرار میگیرند.
- مسیریاب (Router)
- مکانیزمی در داخل یک لایه MoE که دادههای ورودی را ارزیابی کرده و تصمیم میگیرد کدام خبرگان خاص باید آن را پردازش کنند.
- پارامترهای فعال
- زیرمجموعهای از کل پارامترهای یک مدل که در واقع برای انجام محاسبات ریاضی یک توکن خاص استفاده میشوند.
منابع
[1]arXivپژوهشگران الگوریتمDeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
مطالعه در arXiv →
[2]arXivپژوهشگران الگوریتمMixtral of Experts
مطالعه در arXiv →
[3]arXivپژوهشگران الگوریتمSwitch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
مطالعه در arXiv →
[4]Databricks Researchمدافعان بهرهوری سختافزاریIntroducing DBRX: A New State-of-the-Art Open LLM
مطالعه در Databricks Research →
[5]تیم سردبیری کوهستانمنتقدان محدودیت حافظهتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →خودتوجهی
چگونه مکانیزم «خودتوجهی» موازی بر گلوگاه پردازش ترتیبی در شبکههای عصبی بازگشتی غلبه کرد
7 منبع
اقتصاد استنتاج
هزینه درجه دوم در برابر سود خطی: چگونه اندازه مدل باعث افزایش تاخیر و هزینه استنتاج میشود
9 منبع
توکنایز کردن
چگونه رمزگذاری جفتبایت (BPE) متن خام را به توکنهای ورودی مدل تبدیل میکند
6 منبع
هوش مصنوعی عاملی
سازوکار فرار هوش مصنوعی عاملی از محیطهای کنترلشده: چرا سیستمها کنترل خود را از دست میدهند؟
8 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





