رفتن به محتوای اصلی
توضیح کوهستانادغام مدلتوضیح مکانیسم۸ شهریور ۱۴۰۵، ۹:۲۷· 5 دقیقه مطالعه· در هوش مصنوعی

مکانیسم ادغام مدل‌ها: چگونه هوش مصنوعی متن‌باز بدون آموزش مجدد، مدل‌های موجود را ترکیب می‌کند

توسعه‌دهندگان در حال ترکیب قابلیت‌های مدل‌های تخصصی هوش مصنوعی در قالب سیستم‌های واحد و بسیار توانمند هستند، آن هم بدون نیاز به هیچ توان محاسباتی اضافی برای آموزش. این تکنیک که با عنوان «ادغام مدل» شناخته می‌شود، با جایگزین کردن خوشه‌های گران‌قیمت GPU با ریاضیات هوشمندانه، در حال دموکراتیزه کردن توسعه هوش مصنوعی است.

به قلم اِلا فرجاد

توسعه‌دهندگان متن‌باز 45%محققان هوش مصنوعی 35%پذیرندگان سازمانی هوش مصنوعی 20%
توسعه‌دهندگان متن‌باز
ادغام مدل را به عنوان دموکراتیزه‌کننده نهایی می‌بینند که به همکاری جامعه اجازه می‌دهد بدون بودجه‌های محاسباتی عظیم با آزمایشگاه‌های شرکتی رقابت کند.
محققان هوش مصنوعی
بر ظرافت ریاضی و محدودیت‌های نظری درون‌یابی وزن، حساب وظیفه و افزونگی پارامتر تمرکز می‌کنند.
پذیرندگان سازمانی هوش مصنوعی
ادغام را به عنوان یک روش بسیار مقرون‌به‌صرفه برای ایجاد مدل‌های تخصصی و چند دامنه‌ای برای استفاده داخلی شرکت می‌بینند.

تصور رایج این است که ساختن یک هوش مصنوعی باهوش‌تر شبیه ساختن یک موتور بزرگ‌تر است: به سوخت بیشتر، فلز بیشتر و پول بسیار بیشتری نیاز دارد. وقتی یک مدل متن‌باز جدید منتشر می‌شود که هم در کدنویسی پایتون و هم در استدلال‌های حقوقی پیچیده عالی عمل می‌کند، فرض فوری این است که یک آزمایشگاه با بودجه کلان، میلیون‌ها دلار و هزاران ساعت GPU صرف کرده تا آن را از ابتدا آموزش مجدد دهد و این قابلیت‌های دوگانه را جذب کند.[6]

اما شواهد به واقعیتی کاملاً متفاوت و تقریباً جادویی اشاره دارند. برخی از توانمندترین مدل‌های موجود در جدول‌های امتیازدهی متن‌باز امروزی، هرگز به معنای سنتی «آموزش» ندیده‌اند. در عوض، آن‌ها با استفاده از تکنیکی که به سرعت در حال بلوغ است و «ادغام مدل» نامیده می‌شود، روی لپ‌تاپ‌های مصرف‌کننده به هم دوخته شده‌اند؛ این تکنیک «مغز» چندین مدل تخصصی را در یک موجودیت واحد و برتر ادغام می‌کند.[1][4]

برای درک چگونگی عملکرد این روش، باید به معماری داخلی یک شبکه عصبی نگاه کنید. یک مدل هوش مصنوعی اساساً یک صفحه گسترده عظیم و چند بُعدی از اعداد است که «وزن‌ها» نامیده می‌شوند و نحوه تبدیل ورودی‌ها به خروجی‌ها را دیکته می‌کنند. به طور سنتی، تغییر این وزن‌ها مستلزم آموزش است—تغذیه مدل با ترابایت‌ها داده و تنظیم آهسته اعداد با استفاده از حساب دیفرانسیل و انتگرال و قدرت محاسباتی عظیم.[3][5]

ادغام مدل‌ها تنها به محاسبات پایه روی یک CPU نیاز دارد و خوشه‌های عظیم GPU مورد نیاز برای آموزش سنتی را دور می‌زند.

ادغام مدل یک سؤال اساساً متفاوت می‌پرسد: چه می‌شود اگر ما وزن‌های یک مدل که منحصراً روی ریاضیات آموزش دیده است و وزن‌های یک مدل که منحصراً روی زبان فرانسه آموزش دیده است را برداریم و به سادگی میانگین بگیریم؟ تلاش‌های اولیه در این زمینه خام بودند و اغلب منجر به مدلی می‌شدند که هم ریاضیات و هم فرانسه را فراموش می‌کرد، پدیده‌ای که محققان از آن به عنوان «فراموشی فاجعه‌بار» یاد می‌کنند.[2][5]

پیشرفت با هندسه بهتر حاصل شد. به جای میانگین‌گیری ساده حسابی، توسعه‌دهندگان شروع به استفاده از «درون‌یابی خطی کروی» یا SLERP کردند. وزن‌های یک مدل را به عنوان یک نقطه خاص روی یک کره عظیم و چند بُعدی تصور کنید. SLERP یک منحنی دقیق را در امتداد سطح آن کره بین دو مدل ترسیم می‌کند و یک نقطه بهینه هندسی پیدا می‌کند که روابط و قابلیت‌های اساسی هر دو مدل والد را حفظ می‌کند.[2][4]

به جای میانگین‌گیری ساده حسابی، توسعه‌دهندگان شروع به استفاده از «درون‌یابی خطی کروی» یا SLERP کردند.

با این حال، SLERP تنها برای ترکیب دقیقاً دو مدل به طور قابل اعتماد کار می‌کند. برای ترکیب سه، چهار یا ده مدل، محققان مفهومی به نام «حساب وظیفه» (Task Arithmetic) را توسعه دادند. این تکنیک وزن‌های خاصی را که هنگام تنظیم دقیق یک مدل پایه برای یک وظیفه خاص، مانند کدنویسی، تغییر کرده‌اند، جدا می‌کند. این تغییرات جدا شده به عنوان یک «بردار وظیفه» استخراج می‌شوند—یک تقطیر ریاضی از توانایی کدنویسی خالص.[1][2]

روی هم قرار دادن چندین بردار وظیفه، یک مشکل مکانیکی جدید ایجاد می‌کند: تداخل. اگر بردار ریاضی به یک وزن عصبی خاص بگوید افزایش یابد، و بردار کدنویسی به همان وزن دقیق بگوید کاهش یابد، آن‌ها یکدیگر را خنثی می‌کنند و عملکرد مدل را کاهش می‌دهند. سیستم توسط دستورالعمل‌های متناقض خود گیج می‌شود.[2][5]

تکنیک‌های پیشرفته مانند ادغام TIES با حذف به‌روزرسانی‌های پارامتری مخالف و تحمیل یک اجماع ریاضی، تضادهای داخلی را حل می‌کنند.

تکنیکی به نام TIES-Merging این مشکل را با تحمیل یک اجماع حل می‌کند. این روش به جهتی نگاه می‌کند که اکثریت بردارها می‌خواهند یک پارامتر خاص را حرکت دهند، اقلیت مخالف را به صفر می‌رساند و از بقیه میانگین می‌گیرد. این به عنوان یک فیلتر ریاضی عمل می‌کند و تضمین می‌کند که تنها قوی‌ترین و همسوترین به‌روزرسانی‌های قابلیت به مدل ادغام‌شده نهایی راه یابند.[2]

افراطی‌ترین تکامل این حل تداخل، DARE است که مخفف Drop And Rescale (حذف و مقیاس‌بندی مجدد) می‌باشد. DARE بر اساس کشف غیرمنتظره‌ای عمل می‌کند که شبکه‌های عصبی به شدت «بیش از حد پارامتری‌شده» هستند. این روش به طور تصادفی تا ۹۰ درصد از تغییرات در یک بردار وظیفه را حذف می‌کند، ۱۰ درصد باقیمانده را برای جبران سیگنال از دست رفته مقیاس‌بندی مجدد می‌کند و سپس آن‌ها را ادغام می‌نماید. نتیجه، مدلی است که مهارت‌های جدید را تقریباً بدون هیچ اصطکاک داخلی جذب می‌کند.[2][6]

پیامدهای اقتصادی این ریاضیات حیرت‌آور است. تنظیم دقیق یک مدل ۷۰ میلیارد پارامتری به خوشه‌هایی از GPUهای تخصصی و برق فراوان نیاز دارد. ادغام همان مدل دقیق، به صفر ساعت GPU نیاز دارد و تنها به اندازه کافی رم استاندارد سیستم برای نگه داشتن وزن‌ها در حافظه، در حالی که CPU محاسبات را انجام می‌دهد. این امر هزینه گسترش قابلیت را از صدها هزار دلار به معنای واقعی کلمه به صفر کاهش می‌دهد.[3][4]

تکنیک DARE تا ۹۰٪ از تغییرات تنظیم دقیق یک مدل را حذف می‌کند و ثابت می‌کند که شبکه‌های عصبی به شدت بیش از حد پارامتری‌شده‌اند.

با این حال، محدودیت‌های بیولوژیکی سخت‌گیرانه‌ای برای این پیوند دیجیتال وجود دارد. شما فقط می‌توانید مدل‌هایی را ادغام کنید که معماری زیربنایی دقیقاً یکسانی داشته باشند—تعداد لایه‌ها، تعداد پارامترها و «اسکلت» بنیادی یکسان. شما نمی‌توانید یک مدل متا لاما (Meta Llama) را با یک مدل میسترال (Mistral) با استفاده از این تکنیک‌های مستقیم وزن ادغام کنید، زیرا صفحات گسترده داخلی آن‌ها با هم همخوانی ندارند.[4][5]

علیرغم این محدودیت‌های ساختاری، مکانیک ادغام مدل‌ها اساساً در حال تغییر اقتصاد هوش مصنوعی است. با جدا کردن رشد قابلیت از هزینه‌های محاسباتی، ادغام تضمین می‌کند که مرز توسعه هوش مصنوعی در دسترس باقی بماند. این امر به انبوهی غیرمتمرکز از توسعه‌دهندگان متن‌باز اجازه می‌دهد تا مهارت‌های تخصصی را به طور نامحدود روی هم انباشته کنند و به عنوان یک هوش جمعی عمل کنند که با پرهزینه‌ترین آزمایشگاه‌های شرکتی جهان رقابت می‌کند.[1][3][6]

چرا مهم است

ادغام مدل، انحصار شرکت‌های بزرگ فناوری را در هم می‌شکند و به توسعه‌دهندگان متن‌باز اجازه می‌دهد تا هوش مصنوعی پیشرفته را روی سخت‌افزار مصرف‌کننده ایجاد کنند. با حذف نیاز به میلیون‌ها دلار توان محاسباتی، گلوگاه پیشرفت هوش مصنوعی را از سرمایه خام به نبوغ ریاضی تغییر می‌دهد.

آنچه نمی‌دانیم

  • چند مدل متمایز را می‌توان در یک معماری واحد ادغام کرد قبل از اینکه اجماع ریاضی شکست بخورد و قابلیت‌ها از بین بروند.
  • آیا تکنیک‌های آینده اجازه ادغام بین معماری‌ها را خواهند داد (به عنوان مثال، ادغام یک مدل ۷ میلیارد پارامتری با یک مدل ۱۳ میلیارد پارامتری).

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان متن‌باز 45%محققان هوش مصنوعی 35%پذیرندگان سازمانی هوش مصنوعی 20%
  1. [1]Emergent Mindتوسعه‌دهندگان متن‌باز

    LLM Merging Techniques Overview

    مطالعه در Emergent Mind
  2. [2]Towards AIمحققان هوش مصنوعی

    The 4 Model Merging Techniques: How to Combine AI Models Without Training

    مطالعه در Towards AI
  3. [3]NVIDIA Technical Blogپذیرندگان سازمانی هوش مصنوعی

    An Introduction to Model Merging for LLMs

    مطالعه در NVIDIA Technical Blog
  4. [4]Ionioتوسعه‌دهندگان متن‌باز

    A Comprehensive Guide on Merging Language Models

    مطالعه در Ionio
  5. [5]Deepchecksپذیرندگان سازمانی هوش مصنوعی

    What is Model Merging? Techniques & Challenges

    مطالعه در Deepchecks
  6. [6]تیم سردبیری کوهستانمحققان هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.