معماری مدل Llama 3.1 405B متا در واقعیت چگونه کار میکند؟
نگاهی به درون ۱۲۶ بلوک ترانسفورمر و ۴۰۵ میلیارد پارامتر مدل زبانی پرچمدار و وزنباز متا؛ مدلی که پیچیدگی معماری ترکیبی از خبرگان (MoE) را فدای پایداری در آموزش کرده است.
به قلم آیدا امینی
این خبر را به اشتراک بگذارید
- پذیرندگان سازمانی هوش مصنوعی
- این مدل را بیشتر به عنوان یک موتور تقطیر دانش میبینند تا هدفی برای استقرار نهایی.
- حامیان متنباز
- استدلال میکنند که انتشار وزنها بدون دادههای آموزشی، متنباز واقعی نیست.
- پژوهشگران ایمنی هوش مصنوعی
- بر خطرات گسترش قابلیتهای سطح پیشرو بدون کنترلهای دسترسی تمرکز دارند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزاری که از نیازهای پردازشی عظیم مدلهای متراکم سود میبرند.
- پژوهشگران مستقلی که بودجه کافی برای اجرای استنتاج روی مدل ۴۰۵ میلیارد پارامتری را ندارند.
نکات کلیدی
- مدل Llama 3.1 405B یک ترانسفورمر متراکم و خودهمبسته با ۱۲۶ لایه و ۴۰۵ میلیارد پارامتر است.
- متا برای تضمین پایداری آموزش در مقیاس بالا، عمداً از معماری «ترکیبی از خبرگان» (MoE) دوری کرده است.
- این مدل برای کاهش مصرف حافظه در زمان استنتاج، از مکانیزم توجه پرسوجوی گروهبندیشده (GQA) استفاده میکند.
- با استفاده از تعبیههای موقعیتی چرخشی (RoPE)، این مدل از یک پنجره زمینه ۱۲۸,۰۰۰ توکنی پشتیبانی میکند.
- کاربرد اصلی این مدل برای سازمانها، تقطیر دانش آن به مدلهای کوچکتر ۸ و ۷۰ میلیارد پارامتری است.
در دل معماری مدل Llama 3.1 405B متا، دقیقاً ۱۲۶ بلوک ترانسفورمر بین تعبیههای توکن ورودی و هد نهایی تصویرسازی خروجی روی هم چیده شدهاند. این عمق مشخص در کنار ۴۰۵ میلیارد پارامتر، هندسه محاسباتی چنان عظیمی خلق میکند که در حافظه هیچ سرور تجاری واحدی جا نمیگیرد. آموزش شبکهای در این مقیاس، نیازمند توزیع بار کاری بین هزاران پردازنده گرافیکی است؛ فرآیندی که مهندسان را مجبور به پذیرش مصالحههایی در نحوه مدیریت حافظه و توان پردازشی میکند.[1]
زمانی که متا این مدل را در ژوئیه ۲۰۲۴ منتشر کرد، صنعت هوش مصنوعی منتظر یک معماری «ترکیبی از خبرگان» (MoE) بود؛ طراحی خاصی که برای صرفهجویی در محاسبات، دادهها را از طریق زیرشبکههای تخصصی هدایت میکند. اما در عوض، تیم مهندسی یک ترانسفورمر استاندارد متراکم، خودهمبسته و صرفاً-رمزگشا ساخت. این تصمیم کاملاً آگاهانه بود. پژوهشگران دیتاکمپ در تحلیل فنی خود خاطرنشان کردند: «معماری ترکیبی از خبرگان (MoE) عمداً کنار گذاشته شده است تا پایداری و مقیاسپذیری در فرآیند آموزش در اولویت قرار گیرد.»[1][2]
یک مدل متراکم ۴۰۵ میلیارد پارامتری به این معناست که برای تولید هر توکن، تکتک پارامترها فعال میشوند. این رویکرد مبتنی بر نیروی خالص به توان محاسباتی عظیمی نیاز دارد، اما در عوض پیچیدگیهای مسیریابی و خرابیهای تعادل بار را که اغلب در طول آموزش گریبانگیر مدلهای MoE میشود، از بین میبرد. متا برای اینکه این معماری متراکم را در مقیاس بالا عملی کند، چندین بهینهسازی ریاضی خاص را در سطح لایهها پیادهسازی کرده است.[1][2]
مهمترینِ این بهینهسازیها، مکانیزم توجه پرسوجوی گروهبندیشده (GQA) است. در یک مکانیزم توجه چندسره استاندارد، هر هد پرسوجو، هد کلید و مقدار اختصاصی خود را دارد که در زمان استنتاج، حجم عظیمی از حافظه را میبلعد. مکانیزم GQA چندین هد پرسوجو را گروهبندی میکند تا از یک جفت کلید-مقدار مشترک استفاده کنند. این کار اندازه حافظه پنهان کلید-مقدار را در طول رمزگشایی کاهش میدهد و به مدل اجازه میدهد تا اطلاعات را بسیار سریعتر و بدون افت فاجعهبار در کیفیت استدلال پردازش کند.[1]
این معماری برای مدیریت اسناد طولانی، از تعبیههای موقعیتی چرخشی (RoPE) بهره میبرد. ترانسفورمرهای سنتی وقتی متن بیش از حد طولانی میشود، در به خاطر سپردن موقعیت دقیق کلمات به مشکل برمیخورند. مکانیزم RoPE اطلاعات موقعیتی را به صورت پویا رمزگذاری میکند و به Llama 3.1 405B اجازه میدهد تا پنجره زمینهای برابر با ۱۲۸,۰۰۰ توکن (تقریباً معادل یک کتاب ۳۰۰ صفحهای) را حفظ کند. این زمینه گسترده برای کاربردهای سازمانی مانند تحلیل کد و خلاصهسازی اسناد حیاتی است.[1][2][3]
در داخل لایههای پیشخور، این مدل تابع فعالسازی استاندارد ReLU را با SwiGLU جایگزین کرده است. تابع SwiGLU یک مکانیزم دروازهای اضافه میکند که قدرت بیان مدل را بهبود میبخشد و به آن اجازه میدهد الگوهای زبانی پیچیدهتری را درک کند. در همین حال، نرمالسازی لایه میانگین مربعات (RMSNorm) در سراسر شبکه اعمال میشود تا ضمن کاهش سربار محاسباتی، گرادیانهای آموزشی را تثبیت کند.[1]
آموزش این معماری نیازمند مجموعه دادهای متشکل از ۱۵ تریلیون توکن بود که تاریخ قطع دانش آن به دسامبر ۲۰۲۳ برمیگردد. فاز پیشآموزش، مدل را در معرض یک پیکره متنی عظیم و چندزبانه قرار داد و به آن گرامر، حقایق و الگوهای استدلالی را آموخت. از آنجا که این مدل بسیار بزرگ است، زیرساخت آموزشی برای تقسیم ۱۲۶ لایه در میان خوشههایی از پردازندههای گرافیکی H100، بر ترکیبی از موازیسازی تنسور، موازیسازی خط لوله و موازیسازی دادهها تکیه داشت.[1][4]
آموزش این معماری نیازمند مجموعه دادهای متشکل از ۱۵ تریلیون توکن بود که تاریخ قطع دانش آن به دسامبر ۲۰۲۳ برمیگردد.
پس از پیشآموزش اولیه، مدل تحت «تنظیم دقیق نظارتشده» (SFT) و «بهینهسازی مستقیم ترجیحات» (DPO) قرار گرفت. در SFT، مدل روی مجموعه دادههای دستوری خاص و باکیفیت آموزش میبیند، در حالی که DPO خروجیهای مدل را بدون درگیری با پیچیدگیهای آموزش یک مدل پاداش جداگانه، با ترجیحات انسانی همسو میکند. این فاز همسوسازی دقیقاً همان جایی است که مدل یاد گرفت دستورالعملها را دنبال کند، از ابزارها استفاده کند و درخواستهای مضر را رد کند.[1][2][4]
عملکرد نهایی این مدل با مدلهای اختصاصی رقابت میکند. در بنچمارک MMLU (درک زبان چندوظیفهای عظیم)، Llama 3.1 405B به دقت میانگین کلان ۸۵.۲ درصد دست یافت و در بنچمارک ARC-Challenge امتیاز ۹۶.۱ درصد را ثبت کرد. این معیارها نشاندهنده قابلیتهای استدلالی قوی، بهویژه در وظایف ریاضی و کدنویسی هستند.[1]
با این حال، کاربرد واقعی مدل ۴۰۵ میلیارد پارامتری به عنوان یک چتبات مصرفکننده نیست، بلکه به عنوان یک موتور تقطیر دانش است. تحلیلگران IBM در این باره توضیح دادند: «دانش و تواناییهای نوظهور مدل ۴۰۵ میلیارد پارامتری را میتوان در یک مدل کوچکتر تقطیر کرد و قابلیتهای یک مدل بزرگ معلم را با استنتاج سریع و مقرونبهصرفه یک مدل دانشآموز ترکیب کرد.» متا فعالانه توسعهدهندگان را تشویق میکند تا از این مدل برای تولید دادههای مصنوعی جهت آموزش مدلهای کوچکتر و کارآمدتر مانند نسخههای ۸ و ۷۰ میلیارد پارامتری استفاده کنند.[3][4]
این فرآیند تقطیر بسیار حیاتی است، زیرا اجرای استنتاج روی یک مدل متراکم ۴۰۵ میلیارد پارامتری برای اکثر سازمانها به شدت گران تمام میشود. تنها برای بارگذاری وزنهای این مدل در حافظه، به چندین پردازنده گرافیکی ردهبالا نیاز است. با انتقال الگوهای استدلالی مدل ۴۰۵ میلیارد پارامتری به یک مدل ۸ میلیارد پارامتری، توسعهدهندگان میتوانند قابلیتهای پیشرفته هوش مصنوعی را روی دستگاههای لبه مانند گوشیهای هوشمند و لپتاپها مستقر کنند.[1][2]
انتشار Llama 3.1 405B همچنین بحثهایی را درباره تعریف «متنباز» در هوش مصنوعی برانگیخت. در حالی که متا وزنهای مدل و کد استنتاج را تحت یک لایسنس سفارشی به صورت رایگان توزیع میکند، مجموعه داده آموزشی ۱۵ تریلیون توکنی و کد دقیق زیرساخت آموزشی همچنان اختصاصی باقی ماندهاند. بنیاد نرمافزار متنباز استدلال کرده است که مدلهای فاقد دادههای آموزشی باز، با تعریف دقیق متنباز همخوانی ندارند؛ هرچند صنعت هوش مصنوعی به طور گسترده پارادایم «وزنباز» را به عنوان یک مصالحه عملی پذیرفته است.[4][5]
برای رفع نگرانیهای ایمنی در این مقیاس، متا Llama Guard 3 را ادغام کرده است؛ یک مدل ایمنی چندزبانه که برای فیلتر کردن محتوای مضر طراحی شده است. نسخههای تنظیمشده با دستورالعملِ مدل ۴۰۵ میلیارد پارامتری به شدت بهینهسازی شدهاند تا با استفاده از تکنیکهایی مانند «یادگیری تقویتی از بازخورد انسانی» (RLHF) برای حفظ همسویی، درخواستهای ناقض دستورالعملهای ایمنی را رد کنند.[1][2][4]
پشتیبانی بومی این معماری از استفاده از ابزارها، یکی دیگر از قابلیتهای مهم آن است. این مدل برای تولید فراخوانی ابزار برای موتورهای جستجو، مفسرهای کد و موتورهای استدلال ریاضی تنظیم دقیق شده است. این ویژگی به مدل اجازه میدهد تا پیش از تولید پاسخ، کدهای پایتون را اجرا کند یا برای تأیید حقایق از پایگاههای داده خارجی پرسوجو کند و به این ترتیب، شکاف بین مدلهای زبانی ایستا و عاملهای خودمختار فعال را پر کند.[1][3]
انتخابهای مهندسی در پس Llama 3.1 405B، روند گستردهتری را در توسعه مدلهای پایه برجسته میکند. متا با رد پیچیدگیهای معماری ترکیبی از خبرگان به نفع یک ترانسفورمر عظیم و متراکم، قوانین مقیاسپذیری قابل پیشبینی و پایداری آموزش را بر کارایی تئوریک استنتاج ترجیح داد. این ۱۲۶ بلوک ترانسفورمر، گواهی بر مقیاس عظیمی است که برای جابهجا کردن مرزهای مدلسازی زبانی خودهمبسته به آن نیاز است.[1][5]
چرا مهم است
درک معماری یک مدل ۴۰۵ میلیارد پارامتری، محدودیتهای فیزیکی و محاسباتی هوش مصنوعی مدرن را آشکار میکند و نشان میدهد که غولهای فناوری چگونه هنگام استقرار مدلها در مقیاس دیتاسنتر، کارایی تئوریک را با پایداری در آموزش معامله میکنند.
بررسی عمیق دیدگاهها
حامیان متنباز
توسعهدهندگانی که استدلال میکنند «وزنباز» به معنای متنباز واقعی نیست.
بنیاد نرمافزار متنباز و حامیان سرسخت این حوزه استدلال میکنند که انتشار وزنهای مدل بدون دادههای آموزشی یا کدهای زیرساختی، ناقض اصول بنیادین متنباز است. آنها بر این باورند که بدون دسترسی به ۱۵ تریلیون توکن استفاده شده برای پیشآموزش، پژوهشگران مستقل نمیتوانند مدل را به طور کامل از نظر سوگیریها حسابرسی کنند، فرآیند آموزش را بازتولید کنند یا بفهمند رفتارهای خاص چگونه آموخته شدهاند. از نگاه این گروه، Llama 3.1 صرفاً یک «متنباز شویی» است؛ یعنی استفاده از اصطلاحات متنباز برای بازاریابی، در حالی که کنترل انحصاری بر ارزشمندترین دارایی، یعنی دادهها، حفظ شده است.
پذیرندگان سازمانی هوش مصنوعی
سازمانهایی که بر استقرار امن و مقرونبهصرفه هوش مصنوعی تمرکز دارند.
برای کاربران سازمانی، مدل ۴۰۵ میلیارد پارامتری کمتر به عنوان یک هدف استقرار و بیشتر به عنوان یک ابزار توسعه کاربرد دارد. از آنجا که اجرای یک مدل متراکم ۴۰۵ میلیارد پارامتری نیازمند میلیونها دلار سختافزار اختصاصی است، سازمانها این مدل پرچمدار را عمدتاً به عنوان یک تولیدکننده دادههای مصنوعی میبینند. آنها از مدل ۴۰۵ میلیارد پارامتری در محیطهای ابری امن برای تولید دادههای آموزشی بسیار دقیق و خاصِ دامنه استفاده میکنند که سپس برای تنظیم دقیق مدل بسیار کوچکتر ۸ میلیارد پارامتری جهت استقرار ارزان، سریع و درونسازمانی به کار میرود.
پژوهشگران ایمنی هوش مصنوعی
متخصصانی که نگران گسترش قابلیتهای سطح پیشرو هستند.
پژوهشگران ایمنی بر ماهیت دوگانه مدلهای پیشرو با وزنباز تأکید میکنند. اگرچه متا Llama Guard 3 و تکنیکهای گسترده RLHF را برای جلوگیری از تولید محتوای مضر توسط مدل پیادهسازی کرده است، اما این واقعیت که وزنها به صورت رایگان قابل دانلود هستند به این معناست که بازیگران مخرب میتوانند از نظر تئوری این نردههای محافظ ایمنی را از طریق تنظیم دقیق حذف کنند. این گروه استدلال میکنند که انتشار یک مدل ۴۰۵ میلیارد پارامتری، دسترسی به قابلیتهایی را دموکراتیزه میکند که میتوانند برای حملات فیشینگ نیزهای خودکار یا کشف آسیبپذیریها استفاده شوند و بار دفاعی را به دوش جامعه گستردهتر امنیت سایبری میاندازند.
منابع
[1]Meta AIپژوهشگران ایمنی هوش مصنوعیThe Llama 3 Herd of Models
مطالعه در Meta AI →
[2]DataCampپذیرندگان سازمانی هوش مصنوعیWhat Is Llama 3.1 405B?
مطالعه در DataCamp →
[3]IBMپذیرندگان سازمانی هوش مصنوعیMeta announces Llama 3.1
مطالعه در IBM →
[4]Hugging Faceپژوهشگران ایمنی هوش مصنوعیMeta Llama 3.1 405B
مطالعه در Hugging Face →
[5]تیم سردبیری کوهستانحامیان متنبازتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در متا
مشاهده همه →سیستمهای تصویر نقشه
چرا غیرممکن بودن حفظ همزمان مساحت و زاویه، انتخاب نقشه را به ما دیکته میکند؟
6 منبع
معماری پایگاه داده
چگونه Write-Ahead Logging و Two-Phase Locking اتمیسیته و ایزولاسیون را در پایگاههای داده رابطهای تضمین میکنند
6 منبع
شناخت اجتماعی
چگونه برجستگی ادراکی و اصلاح آگاهانه، اسناد شخصیتی را از موقعیتی در ادراک اجتماعی جدا میکنند
7 منبع
معماری شناختی
چگونه اثر تقدم و تاخر، حافظه بلندمدت را از حافظه کاری جدا میکنند
5 منبع
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





