رفتن به محتوای اصلی
Koohestun
توضیح کوهستانللاما ۳.۱گزارش تحلیلی· 6 دقیقه مطالعه· در متا

معماری مدل Llama 3.1 405B متا در واقعیت چگونه کار می‌کند؟

نگاهی به درون ۱۲۶ بلوک ترانسفورمر و ۴۰۵ میلیارد پارامتر مدل زبانی پرچمدار و وزن‌باز متا؛ مدلی که پیچیدگی معماری ترکیبی از خبرگان (MoE) را فدای پایداری در آموزش کرده است.

به قلم آیدا امینی

پذیرندگان سازمانی هوش مصنوعی 40%حامیان متن‌باز 30%پژوهشگران ایمنی هوش مصنوعی 30%
پذیرندگان سازمانی هوش مصنوعی
این مدل را بیشتر به عنوان یک موتور تقطیر دانش می‌بینند تا هدفی برای استقرار نهایی.
حامیان متن‌باز
استدلال می‌کنند که انتشار وزن‌ها بدون داده‌های آموزشی، متن‌باز واقعی نیست.
پژوهشگران ایمنی هوش مصنوعی
بر خطرات گسترش قابلیت‌های سطح پیشرو بدون کنترل‌های دسترسی تمرکز دارند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزاری که از نیازهای پردازشی عظیم مدل‌های متراکم سود می‌برند.
  • پژوهشگران مستقلی که بودجه کافی برای اجرای استنتاج روی مدل ۴۰۵ میلیارد پارامتری را ندارند.

نکات کلیدی

  • مدل Llama 3.1 405B یک ترانسفورمر متراکم و خودهمبسته با ۱۲۶ لایه و ۴۰۵ میلیارد پارامتر است.
  • متا برای تضمین پایداری آموزش در مقیاس بالا، عمداً از معماری «ترکیبی از خبرگان» (MoE) دوری کرده است.
  • این مدل برای کاهش مصرف حافظه در زمان استنتاج، از مکانیزم توجه پرس‌وجوی گروه‌بندی‌شده (GQA) استفاده می‌کند.
  • با استفاده از تعبیه‌های موقعیتی چرخشی (RoPE)، این مدل از یک پنجره زمینه ۱۲۸,۰۰۰ توکنی پشتیبانی می‌کند.
  • کاربرد اصلی این مدل برای سازمان‌ها، تقطیر دانش آن به مدل‌های کوچک‌تر ۸ و ۷۰ میلیارد پارامتری است.

در دل معماری مدل Llama 3.1 405B متا، دقیقاً ۱۲۶ بلوک ترانسفورمر بین تعبیه‌های توکن ورودی و هد نهایی تصویرسازی خروجی روی هم چیده شده‌اند. این عمق مشخص در کنار ۴۰۵ میلیارد پارامتر، هندسه محاسباتی چنان عظیمی خلق می‌کند که در حافظه هیچ سرور تجاری واحدی جا نمی‌گیرد. آموزش شبکه‌ای در این مقیاس، نیازمند توزیع بار کاری بین هزاران پردازنده گرافیکی است؛ فرآیندی که مهندسان را مجبور به پذیرش مصالحه‌هایی در نحوه مدیریت حافظه و توان پردازشی می‌کند.[1]

زمانی که متا این مدل را در ژوئیه ۲۰۲۴ منتشر کرد، صنعت هوش مصنوعی منتظر یک معماری «ترکیبی از خبرگان» (MoE) بود؛ طراحی خاصی که برای صرفه‌جویی در محاسبات، داده‌ها را از طریق زیرشبکه‌های تخصصی هدایت می‌کند. اما در عوض، تیم مهندسی یک ترانسفورمر استاندارد متراکم، خودهمبسته و صرفاً-رمزگشا ساخت. این تصمیم کاملاً آگاهانه بود. پژوهشگران دیتاکمپ در تحلیل فنی خود خاطرنشان کردند: «معماری ترکیبی از خبرگان (MoE) عمداً کنار گذاشته شده است تا پایداری و مقیاس‌پذیری در فرآیند آموزش در اولویت قرار گیرد.»[1][2]

یک مدل متراکم ۴۰۵ میلیارد پارامتری به این معناست که برای تولید هر توکن، تک‌تک پارامترها فعال می‌شوند. این رویکرد مبتنی بر نیروی خالص به توان محاسباتی عظیمی نیاز دارد، اما در عوض پیچیدگی‌های مسیریابی و خرابی‌های تعادل بار را که اغلب در طول آموزش گریبان‌گیر مدل‌های MoE می‌شود، از بین می‌برد. متا برای اینکه این معماری متراکم را در مقیاس بالا عملی کند، چندین بهینه‌سازی ریاضی خاص را در سطح لایه‌ها پیاده‌سازی کرده است.[1][2]

برخلاف بسیاری از مدل‌های امروزی، Llama 3.1 405B از یک معماری متراکم استفاده می‌کند که در آن تمام پارامترها هنگام استنتاج فعال هستند.

مهم‌ترینِ این بهینه‌سازی‌ها، مکانیزم توجه پرس‌وجوی گروه‌بندی‌شده (GQA) است. در یک مکانیزم توجه چندسره استاندارد، هر هد پرس‌وجو، هد کلید و مقدار اختصاصی خود را دارد که در زمان استنتاج، حجم عظیمی از حافظه را می‌بلعد. مکانیزم GQA چندین هد پرس‌وجو را گروه‌بندی می‌کند تا از یک جفت کلید-مقدار مشترک استفاده کنند. این کار اندازه حافظه پنهان کلید-مقدار را در طول رمزگشایی کاهش می‌دهد و به مدل اجازه می‌دهد تا اطلاعات را بسیار سریع‌تر و بدون افت فاجعه‌بار در کیفیت استدلال پردازش کند.[1]

این معماری برای مدیریت اسناد طولانی، از تعبیه‌های موقعیتی چرخشی (RoPE) بهره می‌برد. ترانسفورمرهای سنتی وقتی متن بیش از حد طولانی می‌شود، در به خاطر سپردن موقعیت دقیق کلمات به مشکل برمی‌خورند. مکانیزم RoPE اطلاعات موقعیتی را به صورت پویا رمزگذاری می‌کند و به Llama 3.1 405B اجازه می‌دهد تا پنجره زمینه‌ای برابر با ۱۲۸,۰۰۰ توکن (تقریباً معادل یک کتاب ۳۰۰ صفحه‌ای) را حفظ کند. این زمینه گسترده برای کاربردهای سازمانی مانند تحلیل کد و خلاصه‌سازی اسناد حیاتی است.[1][2][3]

در داخل لایه‌های پیش‌خور، این مدل تابع فعال‌سازی استاندارد ReLU را با SwiGLU جایگزین کرده است. تابع SwiGLU یک مکانیزم دروازه‌ای اضافه می‌کند که قدرت بیان مدل را بهبود می‌بخشد و به آن اجازه می‌دهد الگوهای زبانی پیچیده‌تری را درک کند. در همین حال، نرمال‌سازی لایه میانگین مربعات (RMSNorm) در سراسر شبکه اعمال می‌شود تا ضمن کاهش سربار محاسباتی، گرادیان‌های آموزشی را تثبیت کند.[1]

مکانیزم GQA با به اشتراک‌گذاری هدهای کلید و مقدار بین چندین پرس‌وجو، سربار حافظه را کاهش می‌دهد.

آموزش این معماری نیازمند مجموعه داده‌ای متشکل از ۱۵ تریلیون توکن بود که تاریخ قطع دانش آن به دسامبر ۲۰۲۳ برمی‌گردد. فاز پیش‌آموزش، مدل را در معرض یک پیکره متنی عظیم و چندزبانه قرار داد و به آن گرامر، حقایق و الگوهای استدلالی را آموخت. از آنجا که این مدل بسیار بزرگ است، زیرساخت آموزشی برای تقسیم ۱۲۶ لایه در میان خوشه‌هایی از پردازنده‌های گرافیکی H100، بر ترکیبی از موازی‌سازی تنسور، موازی‌سازی خط لوله و موازی‌سازی داده‌ها تکیه داشت.[1][4]

آموزش این معماری نیازمند مجموعه داده‌ای متشکل از ۱۵ تریلیون توکن بود که تاریخ قطع دانش آن به دسامبر ۲۰۲۳ برمی‌گردد.

پس از پیش‌آموزش اولیه، مدل تحت «تنظیم دقیق نظارت‌شده» (SFT) و «بهینه‌سازی مستقیم ترجیحات» (DPO) قرار گرفت. در SFT، مدل روی مجموعه داده‌های دستوری خاص و باکیفیت آموزش می‌بیند، در حالی که DPO خروجی‌های مدل را بدون درگیری با پیچیدگی‌های آموزش یک مدل پاداش جداگانه، با ترجیحات انسانی همسو می‌کند. این فاز همسوسازی دقیقاً همان جایی است که مدل یاد گرفت دستورالعمل‌ها را دنبال کند، از ابزارها استفاده کند و درخواست‌های مضر را رد کند.[1][2][4]

عملکرد نهایی این مدل با مدل‌های اختصاصی رقابت می‌کند. در بنچمارک MMLU (درک زبان چندوظیفه‌ای عظیم)، Llama 3.1 405B به دقت میانگین کلان ۸۵.۲ درصد دست یافت و در بنچمارک ARC-Challenge امتیاز ۹۶.۱ درصد را ثبت کرد. این معیارها نشان‌دهنده قابلیت‌های استدلالی قوی، به‌ویژه در وظایف ریاضی و کدنویسی هستند.[1]

مدل ۴۰۵ میلیارد پارامتری در بنچمارک‌ها امتیازاتی رقابتی در سطح مدل‌های اختصاصی پیشرو کسب می‌کند.

با این حال، کاربرد واقعی مدل ۴۰۵ میلیارد پارامتری به عنوان یک چت‌بات مصرف‌کننده نیست، بلکه به عنوان یک موتور تقطیر دانش است. تحلیلگران IBM در این باره توضیح دادند: «دانش و توانایی‌های نوظهور مدل ۴۰۵ میلیارد پارامتری را می‌توان در یک مدل کوچک‌تر تقطیر کرد و قابلیت‌های یک مدل بزرگ معلم را با استنتاج سریع و مقرون‌به‌صرفه یک مدل دانش‌آموز ترکیب کرد.» متا فعالانه توسعه‌دهندگان را تشویق می‌کند تا از این مدل برای تولید داده‌های مصنوعی جهت آموزش مدل‌های کوچک‌تر و کارآمدتر مانند نسخه‌های ۸ و ۷۰ میلیارد پارامتری استفاده کنند.[3][4]

این فرآیند تقطیر بسیار حیاتی است، زیرا اجرای استنتاج روی یک مدل متراکم ۴۰۵ میلیارد پارامتری برای اکثر سازمان‌ها به شدت گران تمام می‌شود. تنها برای بارگذاری وزن‌های این مدل در حافظه، به چندین پردازنده گرافیکی رده‌بالا نیاز است. با انتقال الگوهای استدلالی مدل ۴۰۵ میلیارد پارامتری به یک مدل ۸ میلیارد پارامتری، توسعه‌دهندگان می‌توانند قابلیت‌های پیشرفته هوش مصنوعی را روی دستگاه‌های لبه مانند گوشی‌های هوشمند و لپ‌تاپ‌ها مستقر کنند.[1][2]

انتشار Llama 3.1 405B همچنین بحث‌هایی را درباره تعریف «متن‌باز» در هوش مصنوعی برانگیخت. در حالی که متا وزن‌های مدل و کد استنتاج را تحت یک لایسنس سفارشی به صورت رایگان توزیع می‌کند، مجموعه داده آموزشی ۱۵ تریلیون توکنی و کد دقیق زیرساخت آموزشی همچنان اختصاصی باقی مانده‌اند. بنیاد نرم‌افزار متن‌باز استدلال کرده است که مدل‌های فاقد داده‌های آموزشی باز، با تعریف دقیق متن‌باز همخوانی ندارند؛ هرچند صنعت هوش مصنوعی به طور گسترده پارادایم «وزن‌باز» را به عنوان یک مصالحه عملی پذیرفته است.[4][5]

اندازه عظیم مدل ۴۰۵ میلیارد پارامتری، اجرای محلی آن را روی سخت‌افزارهای استاندارد مصرف‌کنندگان غیرممکن می‌کند.

برای رفع نگرانی‌های ایمنی در این مقیاس، متا Llama Guard 3 را ادغام کرده است؛ یک مدل ایمنی چندزبانه که برای فیلتر کردن محتوای مضر طراحی شده است. نسخه‌های تنظیم‌شده با دستورالعملِ مدل ۴۰۵ میلیارد پارامتری به شدت بهینه‌سازی شده‌اند تا با استفاده از تکنیک‌هایی مانند «یادگیری تقویتی از بازخورد انسانی» (RLHF) برای حفظ همسویی، درخواست‌های ناقض دستورالعمل‌های ایمنی را رد کنند.[1][2][4]

پشتیبانی بومی این معماری از استفاده از ابزارها، یکی دیگر از قابلیت‌های مهم آن است. این مدل برای تولید فراخوانی ابزار برای موتورهای جستجو، مفسرهای کد و موتورهای استدلال ریاضی تنظیم دقیق شده است. این ویژگی به مدل اجازه می‌دهد تا پیش از تولید پاسخ، کدهای پایتون را اجرا کند یا برای تأیید حقایق از پایگاه‌های داده خارجی پرس‌وجو کند و به این ترتیب، شکاف بین مدل‌های زبانی ایستا و عامل‌های خودمختار فعال را پر کند.[1][3]

انتخاب‌های مهندسی در پس Llama 3.1 405B، روند گسترده‌تری را در توسعه مدل‌های پایه برجسته می‌کند. متا با رد پیچیدگی‌های معماری ترکیبی از خبرگان به نفع یک ترانسفورمر عظیم و متراکم، قوانین مقیاس‌پذیری قابل پیش‌بینی و پایداری آموزش را بر کارایی تئوریک استنتاج ترجیح داد. این ۱۲۶ بلوک ترانسفورمر، گواهی بر مقیاس عظیمی است که برای جابه‌جا کردن مرزهای مدل‌سازی زبانی خودهمبسته به آن نیاز است.[1][5]

چرا مهم است

درک معماری یک مدل ۴۰۵ میلیارد پارامتری، محدودیت‌های فیزیکی و محاسباتی هوش مصنوعی مدرن را آشکار می‌کند و نشان می‌دهد که غول‌های فناوری چگونه هنگام استقرار مدل‌ها در مقیاس دیتاسنتر، کارایی تئوریک را با پایداری در آموزش معامله می‌کنند.

بررسی عمیق دیدگاه‌ها

حامیان متن‌باز

توسعه‌دهندگانی که استدلال می‌کنند «وزن‌باز» به معنای متن‌باز واقعی نیست.

بنیاد نرم‌افزار متن‌باز و حامیان سرسخت این حوزه استدلال می‌کنند که انتشار وزن‌های مدل بدون داده‌های آموزشی یا کدهای زیرساختی، ناقض اصول بنیادین متن‌باز است. آن‌ها بر این باورند که بدون دسترسی به ۱۵ تریلیون توکن استفاده شده برای پیش‌آموزش، پژوهشگران مستقل نمی‌توانند مدل را به طور کامل از نظر سوگیری‌ها حسابرسی کنند، فرآیند آموزش را بازتولید کنند یا بفهمند رفتارهای خاص چگونه آموخته شده‌اند. از نگاه این گروه، Llama 3.1 صرفاً یک «متن‌باز شویی» است؛ یعنی استفاده از اصطلاحات متن‌باز برای بازاریابی، در حالی که کنترل انحصاری بر ارزشمندترین دارایی، یعنی داده‌ها، حفظ شده است.

پذیرندگان سازمانی هوش مصنوعی

سازمان‌هایی که بر استقرار امن و مقرون‌به‌صرفه هوش مصنوعی تمرکز دارند.

برای کاربران سازمانی، مدل ۴۰۵ میلیارد پارامتری کمتر به عنوان یک هدف استقرار و بیشتر به عنوان یک ابزار توسعه کاربرد دارد. از آنجا که اجرای یک مدل متراکم ۴۰۵ میلیارد پارامتری نیازمند میلیون‌ها دلار سخت‌افزار اختصاصی است، سازمان‌ها این مدل پرچمدار را عمدتاً به عنوان یک تولیدکننده داده‌های مصنوعی می‌بینند. آن‌ها از مدل ۴۰۵ میلیارد پارامتری در محیط‌های ابری امن برای تولید داده‌های آموزشی بسیار دقیق و خاصِ دامنه استفاده می‌کنند که سپس برای تنظیم دقیق مدل بسیار کوچک‌تر ۸ میلیارد پارامتری جهت استقرار ارزان، سریع و درون‌سازمانی به کار می‌رود.

پژوهشگران ایمنی هوش مصنوعی

متخصصانی که نگران گسترش قابلیت‌های سطح پیشرو هستند.

پژوهشگران ایمنی بر ماهیت دوگانه مدل‌های پیشرو با وزن‌باز تأکید می‌کنند. اگرچه متا Llama Guard 3 و تکنیک‌های گسترده RLHF را برای جلوگیری از تولید محتوای مضر توسط مدل پیاده‌سازی کرده است، اما این واقعیت که وزن‌ها به صورت رایگان قابل دانلود هستند به این معناست که بازیگران مخرب می‌توانند از نظر تئوری این نرده‌های محافظ ایمنی را از طریق تنظیم دقیق حذف کنند. این گروه استدلال می‌کنند که انتشار یک مدل ۴۰۵ میلیارد پارامتری، دسترسی به قابلیت‌هایی را دموکراتیزه می‌کند که می‌توانند برای حملات فیشینگ نیزه‌ای خودکار یا کشف آسیب‌پذیری‌ها استفاده شوند و بار دفاعی را به دوش جامعه گسترده‌تر امنیت سایبری می‌اندازند.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

پذیرندگان سازمانی هوش مصنوعی 40%حامیان متن‌باز 30%پژوهشگران ایمنی هوش مصنوعی 30%
  1. [1]Meta AIپژوهشگران ایمنی هوش مصنوعی

    The Llama 3 Herd of Models

    مطالعه در Meta AI
  2. [2]DataCampپذیرندگان سازمانی هوش مصنوعی

    What Is Llama 3.1 405B?

    مطالعه در DataCamp
  3. [3]IBMپذیرندگان سازمانی هوش مصنوعی

    Meta announces Llama 3.1

    مطالعه در IBM
  4. [4]Hugging Faceپژوهشگران ایمنی هوش مصنوعی

    Meta Llama 3.1 405B

    مطالعه در Hugging Face
  5. [5]تیم سردبیری کوهستانحامیان متن‌باز

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.