رفتن به محتوای اصلی
توضیح کوهستانمعماری هوش مصنوعیتحلیل مکانیسم۱۱ شهریور ۱۴۰۵، ۱۴:۲۴· 6 دقیقه مطالعه· در هوش مصنوعی

مکانیک قوانین مقیاس‌پذیری مدل‌های زبان بزرگ (LLM): چگونه محاسبات، داده و پارامترها عملکرد مدل را پیش‌بینی می‌کنند

پیشرفت سریع مدل‌های زبان بزرگ ناشی از کشف‌های تصادفی نیست، بلکه توسط فرمول‌های ریاضی قابل پیش‌بینی به نام «قوانین مقیاس‌پذیری» هدایت می‌شود. محققان با ایجاد تعادل بین قدرت محاسباتی، اندازه مجموعه داده و تعداد پارامترها، می‌توانند قابلیت‌های یک مدل را پیش از آغاز آموزش آن، با دقت پیش‌بینی کنند.

به قلم آرش رضایی

حداکثرگرایان مقیاس 40%بهینه‌سازان کارایی 35%شکاکان معماری 25%
حداکثرگرایان مقیاس
استدلال می‌کنند که صرفاً افزایش محاسبات و داده‌ها مطابق با قوانین توانی تثبیت شده، برای دستیابی به هوش عمومی مصنوعی کافی است.
بهینه‌سازان کارایی
بر مقیاس‌بندی تنظیم‌شده برای استنتاج تمرکز دارند و استدلال می‌کنند که آینده متعلق به مدل‌های کوچک‌تر و بسیار آموزش‌دیده است که استقرار آن‌ها ارزان است.
شکاکان معماری
معتقدند که قوانین مقیاس‌پذیری فعلی به ناچار به دیوار داده برخورد خواهند کرد و برای پیشرفت به معماری‌های شبکه عصبی اساساً جدید نیاز است.

اصطلاحات کلیدی

محاسبات (FLOPs)
مقدار کل توان پردازش ریاضی مورد استفاده برای آموزش یک مدل هوش مصنوعی، که معمولاً با عملیات ممیز شناور اندازه‌گیری می‌شود.
پارامترها
متغیرهای داخلی یا «وزن‌ها» در یک شبکه عصبی که در طول آموزش برای ذخیره الگوها و دانش تنظیم می‌شوند.
توکن‌ها
واحدهای اساسی متن (اغلب بخش‌هایی از کلمات) که مجموعه داده آموزشی مورد مطالعه مدل هوش مصنوعی را تشکیل می‌دهند.
استنتاج (Inference)
مرحله‌ای که در آن یک مدل هوش مصنوعی آموزش‌دیده واقعاً برای تولید پاسخ‌ها یا پیش‌بینی‌ها برای کاربران استفاده می‌شود.
قانون توانی
یک رابطه ریاضی که در آن تغییر نسبی در یک کمیت منجر به تغییر نسبی متناسب در کمیت دیگری می‌شود و به صورت یک خط مستقیم در نمودار لگاریتمی ظاهر می‌گردد.

نکات کلیدی

  1. پیشرفت هوش مصنوعی توسط فرمول‌های ریاضی قابل پیش‌بینی هدایت می‌شود، نه کشف‌های تصادفی.
  2. قوانین مقیاس‌پذیری نشان می‌دهند که عملکرد مدل به طور قابل پیش‌بینی با افزایش محاسبات، داده و پارامترها بهبود می‌یابد.
  3. قوانین مقیاس‌پذیری اولیه، تعداد پارامترهای عظیم را در اولویت قرار می‌دادند که منجر به مدل‌های غول‌پیکر کمتر از حد آموزش‌دیده شد.
  4. قوانین چینچیلا ثابت کردند که داده و پارامترها باید به طور مساوی مقیاس‌بندی شوند تا آموزش بهینه صورت گیرد.
  5. مدل‌های مدرن به شدت بر روی داده «بیش از حد آموزش داده می‌شوند» تا کوچک‌تر و ارزان‌تر برای اجرای کاربران باشند.
  6. صنعت با یک «دیوار داده» قریب‌الوقوع روبرو است، زیرا فرمول‌ها به متن بیشتری نسبت به آنچه در اینترنت موجود است، نیاز دارند.

رایج‌ترین تصور غلط در مورد هوش مصنوعی این است که پیشرفت آن متکی بر لحظات ناگهانی و غیرقابل پیش‌بینی «کشف» در علوم کامپیوتر است. روایت عمومی اغلب هر مدل زبان جدید و هوشمندتر را به عنوان یک جهش مرموز به جلو، که توسط الگوریتم‌های مخفی یا جرقه‌های خودجوش شناخت دیجیتالی هدایت می‌شود، قاب‌بندی می‌کند.

واقعیت بسیار صنعتی‌تر و از نظر ریاضی سخت‌گیرانه‌تر است. مسیر هوش مصنوعی مدرن توسط «قوانین مقیاس‌پذیری» اداره می‌شود—فرمول‌های تجربی دقیقی که نشان می‌دهند عملکرد مدل به طور قابل پیش‌بینی با افزایش مقیاس متغیرهای خاص بهبود می‌یابد. محققان نیازی به حدس زدن میزان هوشمندی یک مدل ندارند؛ آن‌ها می‌توانند این را پیش از روشن شدن اولین سرور محاسبه کنند.[1]

در هسته خود، قانون مقیاس‌پذیری یک رابطه قانون توانی است. این قانون حکم می‌کند که به ازای هر افزایش یک مرتبه بزرگی در منابع، نرخ خطای مدل به میزان کسری قابل پیش‌بینی کاهش می‌یابد. این بدان معناست که محققان می‌توانند یک مدل کوچک و ارزان را آموزش دهند، عملکرد آن را اندازه‌گیری کنند و با رسم یک خط مستقیم روی نمودار لگاریتمی، دقیقاً پیش‌بینی کنند که یک مدل عظیم و گران‌قیمت ماه‌ها بعد چگونه رفتار خواهد کرد.[1][4]

سه متغیر در این معادله به شدت در هم تنیده‌اند: محاسبات، داده، و پارامترها. «محاسبات» نشان‌دهنده مجموع عملیات ریاضی انجام شده در طول آموزش است که معمولاً با عملیات ممیز شناور (FLOPs) اندازه‌گیری می‌شود. «داده» حجم توکن‌های متنی است که مدل می‌خواند. «پارامترها» اتصالات عصبی داخلی هستند که مدل برای ذخیره الگوها و روابط از آن‌ها استفاده می‌کند.[2]

سه متغیری که عملکرد مدل را دیکته می‌کنند، باید با نسبت‌های ریاضی دقیق مقیاس‌بندی شوند.

رسمیت یافتن این قوانین به طور جدی در حدود سال ۲۰۲۰ آغاز شد، که توسط محققانی که رفتار مدل‌های ترنسفورمر اولیه را ترسیم می‌کردند، رهبری شد. یافته‌های اولیه آن‌ها، که اغلب به عنوان قوانین مقیاس‌پذیری کاپلان (Kaplan) شناخته می‌شوند، یک دستورالعمل خاص برای موفقیت پیشنهاد می‌کرد: اگر بودجه محاسباتی بزرگ‌تری در اختیار دارید، باید بخش عمده آن را صرف افزایش تعداد پارامترهای مدل کنید و تنها بخش کوچکی را به افزودن داده‌های آموزشی بیشتر اختصاص دهید.[2]

تحت این چارچوب اولیه، مدل‌ها به سرعت بسیار بزرگ شدند. صنعت برای ساختن غول‌هایی با صدها میلیارد پارامتر مسابقه داد، با این فرض که اندازه محض، محرک اصلی هوش است. داده‌ها تقریباً به عنوان یک موضوع ثانویه در نظر گرفته می‌شدند، به شرطی که فقط متن کافی برای تغذیه شبکه عظیم پارامترها در طول فرآیند آموزش وجود داشته باشد.[2][7]

این اجماع در سال ۲۰۲۲ توسط محققانی که آنچه را که اکنون به عنوان قوانین مقیاس‌پذیری چینچیلا (Chinchilla) شناخته می‌شود منتشر کردند، بر هم خورد. آن‌ها با آموزش صدها مدل در اندازه‌های مختلف و ردیابی دقیق منحنی‌های افت (Loss Curves)، کشف کردند که قوانین قبلی اهمیت داده‌های آموزشی را به شدت دست کم گرفته بودند.[5]

این اجماع در سال ۲۰۲۲ توسط محققانی که آنچه را که اکنون به عنوان قوانین مقیاس‌پذیری چینچیلا (Chinchilla) شناخته می‌شود منتشر کردند، بر هم خورد.

قوانین چینچیلا نشان داد که آموزش بهینه از نظر محاسباتی مستلزم مقیاس‌بندی پارامترها و داده‌ها به نسبت‌های مساوی است. به ازای هر دو برابر شدن اندازه مدل، مجموعه داده آموزشی نیز باید دو برابر شود. این امر ثابت کرد که مدل‌های عظیم دوران قبل به طور قابل توجهی «کمتر از حد آموزش دیده» بودند—آن‌ها پارامترهای بسیار زیادی داشتند و متن کافی برای رسیدن به پتانسیل کامل خود نخوانده بودند.[5][8]

قوانین مقیاس‌پذیری چینچیلا ثابت کردند که مدل‌های اولیه به شدت کمتر از حد آموزش دیده بودند و صنعت را به سمت مدل‌های کوچک‌تر آموزش دیده بر روی داده‌های بیشتر سوق دادند.

این کشف اساساً مسیر صنعت هوش مصنوعی را تغییر داد. به جای ساخت مدل‌های همیشه بزرگ‌تر، شرکت‌ها شروع به آموزش مدل‌های کوچک‌تر و کارآمدتر بر روی مجموعه‌های داده بسیار بزرگ‌تر کردند. یک مدل ۷۰ میلیارد پارامتری که به طور بهینه آموزش دیده بود، اکنون می‌توانست از یک مدل ۳۰۰ میلیارد پارامتری که تحت پارادایم قدیمی آموزش دیده بود، بهتر عمل کند و میلیون‌ها دلار در هزینه‌های سخت‌افزاری صرفه‌جویی نماید.[5]

با این حال، حتی قوانین چینچیلا نیز تنها فاز آموزش را بهینه می‌کنند. با حرکت مدل‌های هوش مصنوعی از آزمایشگاه‌های تحقیقاتی به محصولات تجاری، هزینه اجرای مدل برای کاربران—که به عنوان استنتاج (Inference) شناخته می‌شود—اغلب از هزینه اولیه آموزش آن پیشی می‌گیرد. یک مدل ممکن است یک بار آموزش داده شود، اما میلیاردها بار مورد پرس و جو قرار می‌گیرد.[6]

تحقیقات اخیر شروع به ترسیم «قوانین مقیاس‌پذیری تنظیم‌شده برای استنتاج» کرده است. این معادلات جدید کل چرخه عمر یک مدل را در نظر می‌گیرند. اگر قرار است یک مدل به شدت در محیط عملیاتی (Production) استفاده شود، از نظر ریاضی بهینه است که یک مدل بسیار کوچک‌تر را بر روی یک مجموعه داده‌ای که به صورت تصاعدی بزرگ‌تر است آموزش دهیم—که بسیار فراتر از نسبت چینچیلا است.[6][9]

این عمل، که به عنوان «آموزش بیش از حد» (Overtraining) شناخته می‌شود، مدل‌هایی را تولید می‌کند که به طرز باورنکردنی متراکم و توانمند هستند، اما اجرای آن‌ها به طرز چشمگیری ارزان است. این توضیح می‌دهد که چرا مدل‌های مدرن با وزن باز (Open-weight) می‌توانند به طور کارآمد روی لپ‌تاپ‌های مصرف‌کننده اجرا شوند، در حالی که عملکرد سیستم‌های عظیم مبتنی بر ابر متعلق به تنها دو سال پیش را مطابقت می‌دهند. بودجه محاسباتی در فاز آموزش پیش‌بینی و سرمایه‌گذاری می‌شود تا هزینه روزانه استنتاج را یارانه‌دهی کند.[9]

قوانین مقیاس‌پذیری تنظیم‌شده برای استنتاج، اولویت را به ارزان‌تر کردن اجرای مدل‌ها می‌دهند، حتی اگر به معنای صرف محاسبات بیشتر در فاز آموزش باشد.

ریاضیات سخت‌گیرانه قوانین مقیاس‌پذیری همچنین به یک چالش قریب‌الوقوع اشاره دارد: دیوار داده (Data Wall). اگر مقیاس‌بندی بهینه برای هر جهش در عملکرد به داده‌های تصاعدی بیشتری نیاز داشته باشد، صنعت در نهایت ذخیره متن با کیفیت بالا و تولید شده توسط انسان در اینترنت را به پایان خواهد رساند. فرمول‌ها دقیقاً میزان داده مورد نیاز را دیکته می‌کنند، و اینترنت به سادگی مقدار محدودی متن دارد.[7][8]

برای ادامه دادن منحنی‌های مقیاس‌پذیری، محققان در حال بررسی داده‌های مصنوعی (Synthetic Data) هستند—استفاده از مدل‌های هوش مصنوعی موجود برای تولید داده‌های آموزشی با کیفیت بالا برای مدل‌های آینده. اینکه آیا قوانین مقیاس‌پذیری زمانی که داده‌ها به صورت مصنوعی تولید می‌شوند، همچنان معتبر خواهند بود یا خیر، و اینکه آیا این کار از تخریب مدل جلوگیری می‌کند، یکی از پرتحقیق‌ترین سوالات در این حوزه باقی مانده است.[3][7]

در حالی که قوانین مقیاس‌پذیری نرخ خطای متوسط یک مدل را کاملاً پیش‌بینی می‌کنند، نمی‌توانند زمان ظهور قابلیت‌های خاص را پیش‌بینی کنند. ممکن است یک مدل به آرامی معیار افت کلی خود را بهبود بخشد، اما ناگهان در یک مقیاس خاص و غیرقابل پیش‌بینی، توانایی انجام محاسبات چند رقمی یا ترجمه یک زبان جدید را به دست آورد. روند کلان یک خط مستقیم است، اما قابلیت‌های خرد در گام‌های ناگهانی ظاهر می‌شوند.[4]

در نهایت، قوانین مقیاس‌پذیری ثابت می‌کنند که هوش در شبکه‌های عصبی یک خاصیت عرفانی نیست، بلکه تابعی از مقیاس و تعادل است. تا زمانی که محاسبات و داده‌ها با نسبت‌های ریاضی صحیح جریان داشته باشند، شواهد تجربی نشان می‌دهد که مدل‌ها به پیشروی قابل پیش‌بینی خود ادامه خواهند داد.[1][10]

منابع

پوشش منابع

10 منبع

3 دیدگاه شناسایی‌شده

حداکثرگرایان مقیاس 40%بهینه‌سازان کارایی 35%شکاکان معماری 25%
  1. [1]arXivبهینه‌سازان کارایی

    Deep Learning Scaling is Predictable, Empirically

    مطالعه در arXiv
  2. [2]arXivبهینه‌سازان کارایی

    Scaling Laws for Neural Language Models

    مطالعه در arXiv
  3. [3]arXivبهینه‌سازان کارایی

    Scaling Laws for Autoregressive Generative Modeling

    مطالعه در arXiv
  4. [4]arXivبهینه‌سازان کارایی

    Explaining Neural Scaling Laws

    مطالعه در arXiv
  5. [5]arXivبهینه‌سازان کارایی

    Training Compute-Optimal Large Language Models

    مطالعه در arXiv
  6. [6]arXivبهینه‌سازان کارایی

    Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws

    مطالعه در arXiv
  7. [7]AIMultipleشکاکان معماری

    LLM Scaling Laws: Analysis from AI Researchers

    مطالعه در AIMultiple
  8. [8]Towards Data Scienceحداکثرگرایان مقیاس

    Scaling Law Of Language Models

    مطالعه در Towards Data Science
  9. [9]Jonas Vetterle Personal Page & Blogبهینه‌سازان کارایی

    Scaling Laws for LLM Pretraining

    مطالعه در Jonas Vetterle Personal Page & Blog
  10. [10]تیم سردبیری کوهستانشکاکان معماری

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.