چگونه شبکههای مسیریابی «ترکیب خبرگان» تعداد پارامترهای مدل زبانی را از هزینه پردازشی جدا میکنند
معماریهای «ترکیب خبرگان» (MoE) با فعال کردن تنها بخش تخصصی کوچکی از شبکه عصبی خود برای هر کلمه، به مدلهای زبانی اجازه میدهند تا بدون نیاز به افزایش متناسب در توان پردازشی، تا صدها میلیارد پارامتر گسترش یابند.
به قلم الوین شادمهر
این خبر را به اشتراک بگذارید
بهطور خلاصه
- معماریهای ترکیب خبرگان (MoE) لایههای شبکه عصبی را به زیرشبکههای تخصصی تقسیم میکنند.
- یک مسیریاب (Router) هر توکن را ارزیابی کرده و آن را تنها به مرتبطترین خبرگان ارسال میکند.
- این کار به مدلها اجازه میدهد تا حجم عظیمی از دانش را ذخیره کنند، در حالی که هزینههای پردازشی فعال را پایین نگه میدارند.
در ۷ مه ۲۰۲۴، تیم تحقیقاتی DeepSeek یک گزارش فنی منتشر کرد که جزئیات یک مدل زبانی ۲۳۶ میلیارد پارامتری را شرح میداد؛ مدلی که برای اجرا تنها به کسری از توان پردازشی مورد انتظار نیاز داشت. این مدل که DeepSeek-V2 نام دارد، با فعال کردن تنها ۲۱ میلیارد پارامتر برای هر توکن، بیش از ۹۰ درصد از شبکه عصبی خود را در طول هر محاسبه غیرفعال نگه میدارد.[1]
این انتشار، یک تغییر ساختاری در نحوه ساخت هوش مصنوعی پیشرفته را تثبیت کرد. توسعهدهندگان به جای عبور دادن اجباری هر قطعه داده از تمام نورونهای مصنوعی (روشی که به عنوان مدلسازی متراکم شناخته میشود)، به طور فزایندهای به یک مکانیزم مسیریابی به نام «ترکیب خبرگان» (MoE) متکی هستند.[5]
محدودیت اساسی مدلهای متراکم در انعطافناپذیری ریاضی آنها نهفته است. در یک معماری متراکم، تولید یک کلمه واحد نیازمند یک عملیات ضرب ماتریسی است که تکتک پارامترهای مدل را درگیر میکند.[5]
با بزرگتر شدن مدلها برای بهبود قابلیتهای استدلالی، این نیاز پردازشی متراکم به صورت خطی افزایش مییابد. یک مدل متراکم ۴۰۰ میلیارد پارامتری تقریباً به ده برابر پهنای باند حافظه و توان پردازشی به ازای هر توکن نسبت به یک مدل ۴۰ میلیارد پارامتری نیاز دارد؛ این موضوع سقف سختی را برای میزان رشد مدلها پیش از آنکه اجرای آنها بیش از حد گران تمام شود، ایجاد میکند.[5]
«ترکیب خبرگان» با جدا کردن ظرفیت دانش کل مدل از هزینه پردازشی فعال آن، این گلوگاه را دور میزند. این کار با جایگزین کردن لایههای یکپارچه و استاندارد شبکه عصبی با زیرشبکههای تخصصی انجام میشود.[5]
این مکانیزم بر دو جزء متمایز تکیه دارد: «خبرگان» و «مسیریاب». در داخل یک لایه MoE، شبکه عصبی پیشخور (feed-forward) استاندارد به چندین بخش مستقل تقسیم میشود.[5]
پژوهشگران شرکت Mistral AI در مقاله ژانویه ۲۰۲۴ خود که به تشریح مدل Mixtral 8x7B میپردازد، اشاره کردند: «میکسترال یک شبکه ترکیب خبرگان تُنُک (sparse) است. این یک مدل صرفاً رمزگشا (decoder-only) است که در آن بلوک پیشخور از مجموعهای متشکل از ۸ گروه متمایز از پارامترها انتخاب میکند.»[2]
مسیریاب به عنوان یک کنترلکننده ترافیک پرسرعت عمل میکند. هنگامی که یک توکن (نمایش ریاضی یک کلمه یا مفهوم) به یک لایه MoE میرسد، مسیریاب آن را ارزیابی کرده و یک توزیع احتمال را در بین تمام خبرگان موجود محاسبه میکند.[5]
سپس تنها یک یا دو خبره برتر را که برای پردازش آن توکن خاص مناسبتر هستند انتخاب کرده و بقیه را نادیده میگیرد. توکن توسط آن خبرگان خاص پردازش میشود و خروجیهای آنها ترکیب شده و به لایه بعدی منتقل میگردد.[5]
به عنوان مثال، اگر توکن ورودی مربوط به کد پایتون باشد، مسیریاب ممکن است آن را به خبره ۳ و خبره ۷ ارسال کند. اگر توکن بعدی مربوط به گرامر زبان فرانسوی باشد، ممکن است به خبره ۱ و خبره ۵ هدایت شود.[5]
از آنجا که تنها زیرمجموعهای از خبرگان فعال میشوند، هزینه پردازشی پایین میماند. مدل Mixtral 8x7B در مجموع دارای ۴۷ میلیارد پارامتر است، اما از آنجا که در هر لحظه توکنها را تنها به دو مورد از هشت خبره خود هدایت میکند، با سرعت و هزینه فعال یک مدل ۱۳ میلیارد پارامتری اجرا میشود.[2]
این تُنُک بودن (Sparsity) همان چیزی است که به مدلها اجازه میدهد تا با بهرهوری بالا گسترش یابند. تعداد کل پارامترها (که تعیین میکند مدل چقدر دانش میتواند ذخیره کند) میتواند به طور گستردهای افزایش یابد، در حالی که تعداد پارامترهای فعال (که سرعت استنتاج را تعیین میکند) محدود باقی میماند.[5]
تحقیقات بنیادین برای مسیریابی دادهها به زیرشبکههای تخصصی به سال ۱۹۹۱ بازمیگردد، اما کاربرد آن در مدلهای زبانی بزرگ مدرن توسط مقاله Switch Transformer گوگل که در ۱۱ ژانویه ۲۰۲۱ منتشر شد، رواج یافت.[3]
پژوهشگران گوگل نوشتند: «در این کار ما Switch Transformer را پیشنهاد میکنیم؛ معماریای که پردازش را از پارامترها جدا میکند.» آنها نشان دادند که یک مدل تریلیون پارامتری میتواند با هدایت توکنها به تنها یکی از ۲۰۴۸ خبره، به طور کارآمدی آموزش داده شود.[3]
با این حال، پیادهسازی MoE چالشهای مهندسی قابلتوجهی را به همراه دارد که عمدتاً حول مدیریت حافظه میچرخد. اگرچه پردازش فعال پایین است، اما کل مدل همچنان باید در حافظه دسترسی تصادفی کارت گرافیک (VRAM) قرار داشته باشد.[5]
یک مدل ۲۳۶ میلیارد پارامتری مانند DeepSeek-V2 همچنان به صدها گیگابایت VRAM تنها برای نگهداری خبرگان غیرفعال نیاز دارد؛ به این معنی که با وجود نیازهای پردازشی فعال پایین، نمیتواند روی یک کارت گرافیک معمولی و مصرفکننده اجرا شود.[1]
علاوه بر این، مسیریابها ممکن است در طول آموزش دچار «فروپاشی بازنمایی» (Representation Collapse) شوند. این اتفاق زمانی رخ میدهد که مسیریاب یاد میگیرد تمام توکنها را به همان چند خبره تکراری ارسال کند و بقیه شبکه را آموزشندیده و بیفایده رها کند.[5]
برای جلوگیری از این گلوگاه، مهندسان یک تابع زیان کمکی برای توزیع بار در مرحله آموزش معرفی میکنند. این جریمه ریاضی، مسیریاب را مجبور میکند تا توکنها را به طور نسبتاً یکنواختی در بین تمام خبرگان موجود توزیع کند و اطمینان حاصل کند که کل شبکه آموزش میبیند.[2]
تخصص دقیق این خبرگان به ندرت برای انسان قابل خواندن است. یک خبره به طور صریح به «خبره ریاضی» یا «خبره تاریخ» به شکلی که یک برنامهنویس انسانی طراحی میکند، تبدیل نمیشود.[5]
در عوض، آنها در الگوهای برداری انتزاعی و با ابعاد بالا تخصص پیدا میکنند. یک خبره ممکن است برای علائم نگارشی و حروف ربط فعال شود، در حالی که دیگری برای ساختارهای نحوی خاص در چندین زبان فعال میگردد.[5]
روند حرکت به سمت تُنُک بودن شدید در حال شتاب گرفتن است. در ۲۷ مارس ۲۰۲۴، شرکت Databricks مدل DBRX را منتشر کرد؛ یک مدل ۱۳۲ میلیارد پارامتری که ۳۶ میلیارد پارامتر را به ازای هر توکن فعال میکند و از یک معماری بسیار دانهبندی شده با ۱۶ خبره بهره میبرد که در آن چهار خبره برای هر توکن انتخاب میشوند.[4]
با مقایسه معماریهای Mixtral، DBRX و DeepSeek-V2، یک مسیر روشن پدیدار میشود: با افزایش اندازه کل مدل، درصد پارامترهای فعال به شدت کاهش مییابد. مدلهای پیشرفته آینده احتمالاً دارای تریلیونها پارامتر خواهند بود که به هزاران خبره بسیار دانهبندی شده تقسیم میشوند و برای حفظ سرعت استنتاج، کمتر از یک درصد از شبکه خود را به ازای هر توکن فعال میکنند.[5]
اصطلاحات کلیدی
- ترکیب خبرگان (MoE)
- یک معماری شبکه عصبی که لایههای خود را به چندین زیرشبکه تخصصی تقسیم میکند و تنها تعداد کمی از آنها را برای هر قطعه داده فعال میسازد.
- مدل متراکم
- یک معماری سنتی شبکه عصبی که در آن تکتک پارامترها فعال شده و برای پردازش هر قطعه داده مورد استفاده قرار میگیرند.
- مسیریاب (Router)
- مکانیزمی در داخل یک لایه MoE که دادههای ورودی را ارزیابی کرده و تصمیم میگیرد کدام خبرگان خاص باید آن را پردازش کنند.
- پارامترهای فعال
- زیرمجموعهای از کل پارامترهای یک مدل که در واقع برای انجام محاسبات ریاضی یک توکن خاص استفاده میشوند.
پرسشهای متداول
آیا یک مدل MoE سریعتر از یک مدل متراکم اجرا میشود؟
بله، یک مدل MoE بسیار سریعتر از یک مدل متراکم با همان اندازه کل اجرا میشود، زیرا برای هر کلمه تنها روی کسر کوچکی از پارامترهای خود عملیات ریاضی انجام میدهد.
آیا میتوانم یک مدل MoE با ۲۰۰ میلیارد پارامتر را روی لپتاپ خود اجرا کنم؟
خیر. با وجود اینکه پردازش فعال پایین است، کل مدل همچنان باید در حافظه (VRAM) بارگذاری شود. یک مدل ۲۰۰ میلیارد پارامتری به صدها گیگابایت VRAM نیاز دارد که بسیار فراتر از محدودیتهای سختافزار مصرفکننده است.
مسیریاب چگونه میداند کدام خبره را انتخاب کند؟
مسیریاب یک شبکه عصبی کوچک است که در کنار بقیه مدل آموزش میبیند. این بخش یاد میگیرد که نمایش ریاضی هر توکن را به خبرگانی که دقیقترین خروجی نهایی را تولید میکنند، نگاشت کند.
آیا خبرگان بر اساس موضوعات انسانی مانند ریاضی یا علوم تقسیم میشوند؟
خیر. خبرگان به جای موضوعات قابل خواندن برای انسان، در الگوهای برداری انتزاعی و با ابعاد بالا تخصص دارند. یک خبره ممکن است به جای یک موضوع گسترده مانند «تاریخ»، ساختارهای گرامری خاصی را مدیریت کند.
بررسی عمیق دیدگاهها
مدافعان بهرهوری سختافزاری
استدلال میکنند که تُنُک بودن شدید تنها مسیر پایدار برای گسترش هوش مصنوعی است.
طرفداران تُنُک بودن شدید استدلال میکنند که دوران گسترش مدلهای متراکم عملاً به پایان رسیده است. با عبور مدلها از مرز تریلیون پارامتر، برق و سرمایش مورد نیاز برای فعال کردن هر نورون به ازای هر توکن، از نظر فیزیکی و اقتصادی غیرممکن میشود. MoE با جدا کردن ظرفیت مدل از هزینه پردازشی آن، به آزمایشگاههای تحقیقاتی اجازه میدهد تا مدلهای بسیار هوشمندتری را بدون نیاز به جهشهای نمایی در شبکههای برق دیتاسنترها آموزش دهند.
منتقدان محدودیت حافظه
اشاره میکنند که مدلهای MoE همچنان برای ذخیره پارامترهای غیرفعال به مقادیر عظیمی از VRAM نیاز دارند.
در حالی که MoE گلوگاه پردازشی را حل میکند، منتقدان خاطرنشان میکنند که این روش گلوگاه حافظه را تشدید میکند. یک مدل ۲۳۶ میلیارد پارامتری ممکن است تنها از ۲۱ میلیارد پارامتر برای پردازش استفاده کند، اما کل مجموعه وزنهای ۲۳۶ میلیارد پارامتری همچنان باید در حافظه پرسرعت GPU قرار داشته باشد. این امر مدلهای پیشرفته با وزن باز (open-weight) را از دسترس توسعهدهندگان مستقل و سختافزارهای مصرفکننده دور نگه میدارد و آنها را مجبور میکند تنها برای نگهداری خبرگان غیرفعال در حافظه، به ارائهدهندگان ابری عظیم و متمرکز وابسته شوند.
پژوهشگران الگوریتم
بر بهبود خود مکانیزمهای مسیریابی برای جلوگیری از گلوگاهها تمرکز دارند.
پژوهشگرانی که بر طراحی معماری تمرکز دارند، استدلال میکنند که روش فعلی مسیریابی «Top-K» (که در آن یک توکن با یک برش سختگیرانه به یک یا دو خبره ارسال میشود) ابزاری زمخت است. آنها به مشکلاتی مانند فروپاشی بازنمایی اشاره میکنند که در آن مسیریاب بیشتر شبکه را نادیده میگیرد و برای رفع آن به جریمههای مصنوعی توزیع بار نیاز است. این گروه به طور فعال در حال تحقیق روی روشهای مسیریابی پیوسته یا «نرم» هستند که خروجیهای خبرگان را به شکل پویاتری ترکیب میکنند، با این هدف که استدلال را بدون برشهای سختگیرانه در طراحیهای فعلی MoE بهبود بخشند.
- مدافعان بهرهوری سختافزاری
- استدلال میکنند که تُنُک بودن شدید تنها مسیر پایدار برای گسترش هوش مصنوعی است، زیرا مدلهای متراکم به توان پردازشی خام و برق بسیار زیادی نیاز دارند.
- منتقدان محدودیت حافظه
- اشاره میکنند که اگرچه MoE در توان پردازشی صرفهجویی میکند، اما همچنان برای ذخیره پارامترهای غیرفعال به مقادیر عظیمی از VRAM نیاز دارد که این امر مدلهای بزرگ را از دسترس سختافزارهای مصرفکننده دور نگه میدارد.
- پژوهشگران الگوریتم
- بر بهبود خود مکانیزمهای مسیریابی تمرکز دارند و استدلال میکنند که مسیریابی فعلی Top-K بهینه نیست و در حال بررسی جایگزینهای مسیریابی پیوسته یا نرم هستند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار
- اپراتورهای شبکه برق
منابع
[1]arXivپژوهشگران الگوریتمDeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
مطالعه در arXiv →
[2]arXivپژوهشگران الگوریتمMixtral of Experts
مطالعه در arXiv →
[3]arXivپژوهشگران الگوریتمSwitch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
مطالعه در arXiv →
[4]Databricks Researchمدافعان بهرهوری سختافزاریIntroducing DBRX: A New State-of-the-Art Open LLM
مطالعه در Databricks Research →
[5]تیم سردبیری کوهستانمنتقدان محدودیت حافظهتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →معماری مدل
مکانیک ترکیب متخصصان (MoE): چگونه مدلهای زبان بزرگ (LLM) پرسشها را به زیرشبکههای تخصصی هدایت میکنند
5 منبع
معماری مدل
استارتاپ اینسپشن از مدل زبان بزرگ مبتنی بر انتشار رونمایی کرد؛ ادعای چند برابر شدن سرعت و نصف شدن هزینه نسبت به مدلهای رایج
5 منبع
امنیت زیستی
گوگل دیپمایند از SynthID Bio برای واترمارکگذاری پروتئینهای طراحیشده با هوش مصنوعی رونمایی کرد
5 منبع
معماری شبکه عصبی
تبدیل امتیازهای خام به کلمات: لایه سافتمکس چگونه مدلهای زبانی بزرگ را هدایت میکند
6 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





