مکانیک ترکیب متخصصان (MoE): چگونه مدلهای زبان بزرگ (LLM) پرسشها را به زیرشبکههای تخصصی هدایت میکنند
معماریهای ترکیب متخصصان (MoE) با هدایت پویا و دینامیک هر کلمه به زیرمجموعهای تخصصی از شبکههای عصبی، به مدلهای هوش مصنوعی اجازه میدهند تا بدون افزایش تصاعدی در هزینههای محاسباتی، به تریلیونها پارامتر مقیاسپذیر شوند.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- بهینهسازان کارایی
- محققان و ارائهدهندگان خدمات ابری که MoE را تنها مسیر پایدار برای مقیاسبندی هوش مصنوعی میدانند و کاهش عظیم در محاسبات (FLOPs) را در اولویت قرار میدهند.
- کاربران با محدودیت سختافزاری
- توسعهدهندگان و طرفداران میزبانی محلی که بر «دیوار حافظه» تأکید میکنند و خاطرنشان میسازند که ردپای عظیم VRAM در MoE، علیرغم کارایی محاسباتی آن، استقرار محلی را محدود میکند.
- محققان قابلیت تفسیر
- دانشمندانی که بر ماهیت جعبه سیاه مسیریابی متخصصان و چالش درک اینکه چرا توکنهای خاصی به متخصصان خاصی هدایت میشوند، تمرکز دارند.
وقتی مردم میشنوند که یک مدل هوش مصنوعی پیشرو دارای یک تریلیون پارامتر است، معمولاً تصور میکنند که سیستم از تمام آن یک تریلیون اتصال برای تولید هر کلمه استفاده میکند. این یک فرض طبیعی است—دقیقاً همانطور که شبکههای عصبی قدیمیتر و کوچکتر کار میکردند. اما در واقعیت، اجرای یک مدل متراکم با تریلیونها پارامتر برای هر توکن، از نظر محاسباتی ویرانگر خواهد بود و برای پاسخ دادن به تنها چند درخواست، به مراکز دادهای به اندازه شهرهای کوچک نیاز دارد. در عوض، مدلهای پیشرو مدرن از تکنیکی به نام ترکیب متخصصان (Mixture of Experts یا MoE) استفاده میکنند تا در هر لحظه تنها بخش کوچکی از «مغز» خود را به صورت انتخابی فعال کنند.[4][5]
برای درک نحوه عملکرد MoE، بهتر است به معماریای که جایگزین میکند نگاه کنیم. در یک مدل ترانسفورمر «متراکم» استاندارد، هر توکن ورودی—یک کلمه یا بخشی از کلمه—از طریق تمام وزنهای موجود در لایههای شبکه عصبی پیشخور عبور میکند. اگر مدل ۷۰ میلیارد پارامتر داشته باشد، تمام ۷۰ میلیارد پارامتر برای هر مرحله از دنباله با هم ضرب میشوند. این رویکرد مبتنی بر نیروی خام، به طور قابل پیشبینی مقیاسپذیر است، اما به یک محدودیت فیزیکی سخت برخورد میکند: در نهایت، برق و سیلیکون مورد نیاز برای انجام محاسبات، از ارزش خروجی بیشتر میشود.[1][4]
ترکیب متخصصان این مشکل را با معرفی چیزی که مهندسان «فعالسازی پراکنده» مینامند، حل میکند. به جای یک لایه پیشخور عظیم، یک مدل MoE آن لایه را با مجموعهای از زیرشبکههای موازی و متمایز جایگزین میکند که محققان آنها را «متخصص» مینامند. هنگامی که یک توکن در مدل حرکت میکند، به همه آنها نمیرود. بلکه توسط یک سازوکار دروازهای یا روتر رهگیری میشود که توکن را به صورت ریاضی ارزیابی کرده و تصمیم میگیرد کدام متخصصان خاص برای پردازش آن مجهزتر هستند.[1][4]
مدل بسیار موفق Mixtral ۸x۷B شرکت میسترال (Mistral) یک نمونه مکانیکی عالی از این مسیریابی در عمل ارائه میدهد. این مدل شامل هشت شبکه متخصص متمایز است. برای هر توکنی که پردازش میکند، روتر دقیقاً دو متخصص از آن هشت متخصص را انتخاب میکند. توکن به آن دو زیرشبکه ارسال میشود، خروجیهای آنها ترکیب میشوند، و بقیه متخصصان برای آن مرحله محاسباتی خاص غیرفعال باقی میمانند.[2]
این سازوکار مسیریابی یک واگرایی عظیم بین ظرفیت کلی دانش مدل و هزینه محاسباتی واقعی آن ایجاد میکند. Mixtral ۸x۷B در مجموع ۴۷ میلیارد پارامتر در تمام متخصصان خود دارد. با این حال، از آنجا که تنها دو متخصص در هر لحظه فعال هستند، مدل فقط از ۱۳ میلیارد پارامتر فعال در هر توکن استفاده میکند. این مدل ظرفیت استدلال یک غول ۴۷ میلیارد پارامتری را داراست، اما با سرعت و هزینه محاسباتی یک سیستم سبک ۱۳ میلیارد پارامتری اجرا میشود.[2][5]
این سازوکار مسیریابی یک واگرایی عظیم بین ظرفیت کلی دانش مدل و هزینه محاسباتی واقعی آن ایجاد میکند.
تحقیقات «سوئیچ ترانسفورمر» (Switch Transformer) گوگل این مفهوم را به نهایت منطقی خود رساند. با پیکربندی روتر برای ارسال هر توکن تنها به یک متخصص (مسیریابی «برترین-۱») به جای دو متخصص، محققان توانستند مدل را تا ۱.۶ تریلیون پارامتر مقیاس دهند. با وجود اندازه سرسامآور آن، فعالسازی پراکنده به این معنی بود که مدل ردپای محاسباتی یک سیستم بسیار کوچکتر را حفظ کرد و در مقایسه با مدلهای متراکم با همان بودجه محاسباتی، به افزایش هفت برابری در سرعت پیشآموزش دست یافت.[3]
با این حال، در حالی که MoE به زیبایی تنگنای محاسباتی را حل میکند، تنگنای حافظه را حل نمیکند. این رایجترین نقطه سردرگمی برای توسعهدهندگانی است که سعی در اجرای محلی این مدلها دارند. حتی اگر فقط ۱۳ میلیارد پارامتر در طول مرحله استنتاج Mixtral فعال باشند، روتر ممکن است در هر لحظه نیاز به فراخوانی هر یک از هشت متخصص داشته باشد. بنابراین، تمام ۴۷ میلیارد پارامتر باید به طور همزمان در حافظه GPU (VRAM) بارگذاری شوند.[1][5]
این پویایی چیزی را ایجاد میکند که مهندسان سختافزار آن را «دیوار حافظه» مینامند. مدلهای MoE از نظر قدرت پردازش خام (FLOPs) فوقالعاده سریع و ارزان هستند، اما برای اینکه فقط بیکار بمانند و منتظر دستورات روتر باشند، به مقادیر زیادی حافظه VRAM گرانقیمت نیاز دارند. برای کاهش این مشکل، استقرار در مقیاس بزرگ از «موازیسازی متخصصان» استفاده میکند، که شبکههای متخصص مختلف را در چندین GPU فیزیکی تقسیم میکند تا هیچ تراشه واحدی مجبور نباشد کل مدل را در خود نگه دارد.[1]
آموزش یک مدل MoE چالشهای مکانیکی منحصر به فرد خود را به همراه دارد که بدنامترین آنها «فروپاشی مسیریابی» است. اگر شبکه روتر در طول آموزش اولیه به حال خود رها شود، اغلب کشف میکند که یک یا دو متخصص در پیشبینی کلمه بعدی کمی بهتر از بقیه هستند. سپس شروع به ارسال هر توکن به آن متخصصان «مورد علاقه» میکند و بقیه شبکه را از دادههای آموزشی محروم میسازد. برای جلوگیری از این امر، مهندسان باید توابع زیان کمکی—جریمههای ریاضی—را معرفی کنند که روتر را مجبور میکند توکنها را به طور مساوی در بین همه متخصصان موجود توزیع کند.[3][5]
این متخصصان دقیقاً چه چیزی را یاد میگیرند؟ با وجود نام انسانگونه، متخصصان به طور منظم به دستهبندیهای قابل درک برای انسان تقسیم نمیشوند. شما یک متخصص اختصاص داده شده به «زبان فرانسه»، دیگری به «کد پایتون» و سومی به «تاریخ» پیدا نخواهید کرد. در عوض، آنها در ساختارهای نحوی پیچیده و چندبعدی و الگوهای توکن تخصص مییابند که اغلب برای تفسیر انسانی کاملاً مبهم هستند. یک خط کد ممکن است بسته به نقطهگذاری و زمینه، از طریق چهار متخصص مختلف مسیریابی شود.[1][4]
در نهایت، ترکیب متخصصان موتور نامرئی است که عصر کنونی هوش مصنوعی مولد را تقویت میکند. با جدا کردن تعداد کل پارامترهای مدل از الزامات محاسباتی فعال آن، MoE به صنعت اجازه میدهد تا هوش را بدون نیاز به مقیاسبندی غیرممکن برق و سیلیکون، همچنان افزایش دهد. این ترفند معماری است که هوش مصنوعی پیشرو را از نظر اقتصادی قابل دوام میسازد.[4][5]
نکات کلیدی
- ترکیب متخصصان (MoE) لایههای شبکه عصبی متراکم را با چندین زیرشبکه تخصصی جایگزین میکند.
- یک روتر به صورت پویا تنها چند متخصص را برای پردازش هر کلمه یا توکن انتخاب میکند.
- این معماری ظرفیت کلی دانش مدل را از هزینه محاسباتی استنتاج آن جدا میکند.
- در حالی که مدلهای MoE مقدار زیادی از توان محاسباتی را ذخیره میکنند، اما همچنان به حافظه کافی برای ذخیره همه متخصصان نیاز دارند.
- مهندسان باید در طول آموزش از توابع زیان کمکی استفاده کنند تا از استفاده بیش از حد روتر از متخصصان خاص جلوگیری شود.
چرا مهم است
هنگامی که مدلهای هوش مصنوعی از مرز یک تریلیون پارامتر عبور میکنند، اجرای آنها به عنوان شبکههای متراکم از نظر اقتصادی و فیزیکی غیرممکن میشود. ترکیب متخصصان یک پیشرفت معماری است که عملیاتی کردن مدلهای پیشرو را از نظر مالی مقرون به صرفه میسازد و مستقیماً نسل کنونی هوش مصنوعی سریع و در دسترس را ممکن میسازد.
اصطلاحات کلیدی
- مدل متراکم (Dense Model)
- یک معماری شبکه عصبی استاندارد که در آن از هر پارامتر برای پردازش هر توکن ورودی استفاده میشود.
- فعالسازی پراکنده (Sparse Activation)
- تکنیکی که در آن تنها از زیرمجموعهای کوچک و تخصصی از پارامترهای مدل برای هر محاسبه استفاده میشود و مقادیر زیادی از توان محاسباتی ذخیره میگردد.
- شبکه روتر (Router Network)
- سازوکار دروازهای در یک مدل MoE که توکن ورودی را ارزیابی کرده و تصمیم میگیرد کدام متخصصان باید آن را پردازش کنند.
- پارامترهای فعال (Active Parameters)
- تعداد پارامترهایی که واقعاً در طول یک گذر رو به جلو (استنتاج) مدل استفاده میشوند و سرعت پردازش را تعیین میکنند.
- فروپاشی مسیریابی (Routing Collapse)
- شکستی در آموزش که در آن شبکه روتر بیش از حد به چند متخصص متکی میشود و بقیه را نادیده میگیرد، که برای رفع آن نیاز به جریمههای ریاضی است.
منابع
[1]Hugging Faceکاربران با محدودیت سختافزاریA Visual Guide to Mixture of Experts (MoE)
مطالعه در Hugging Face →
[2]arXivبهینهسازان کاراییMixtral of Experts
مطالعه در arXiv →
[3]arXivبهینهسازان کاراییSwitch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
مطالعه در arXiv →
[4]IBMبهینهسازان کاراییWhat is a mixture of experts (MoE)?
مطالعه در IBM →
[5]تیم سردبیری کوهستانمحققان قابلیت تفسیرتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

