مکانیسم ادغام مدلها: چگونه هوش مصنوعی متنباز بدون آموزش مجدد، مدلهای موجود را ترکیب میکند
توسعهدهندگان در حال ترکیب قابلیتهای مدلهای تخصصی هوش مصنوعی در قالب سیستمهای واحد و بسیار توانمند هستند، آن هم بدون نیاز به هیچ توان محاسباتی اضافی برای آموزش. این تکنیک که با عنوان «ادغام مدل» شناخته میشود، با جایگزین کردن خوشههای گرانقیمت GPU با ریاضیات هوشمندانه، در حال دموکراتیزه کردن توسعه هوش مصنوعی است.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- توسعهدهندگان متنباز
- ادغام مدل را به عنوان دموکراتیزهکننده نهایی میبینند که به همکاری جامعه اجازه میدهد بدون بودجههای محاسباتی عظیم با آزمایشگاههای شرکتی رقابت کند.
- محققان هوش مصنوعی
- بر ظرافت ریاضی و محدودیتهای نظری درونیابی وزن، حساب وظیفه و افزونگی پارامتر تمرکز میکنند.
- پذیرندگان سازمانی هوش مصنوعی
- ادغام را به عنوان یک روش بسیار مقرونبهصرفه برای ایجاد مدلهای تخصصی و چند دامنهای برای استفاده داخلی شرکت میبینند.
تصور رایج این است که ساختن یک هوش مصنوعی باهوشتر شبیه ساختن یک موتور بزرگتر است: به سوخت بیشتر، فلز بیشتر و پول بسیار بیشتری نیاز دارد. وقتی یک مدل متنباز جدید منتشر میشود که هم در کدنویسی پایتون و هم در استدلالهای حقوقی پیچیده عالی عمل میکند، فرض فوری این است که یک آزمایشگاه با بودجه کلان، میلیونها دلار و هزاران ساعت GPU صرف کرده تا آن را از ابتدا آموزش مجدد دهد و این قابلیتهای دوگانه را جذب کند.[6]
اما شواهد به واقعیتی کاملاً متفاوت و تقریباً جادویی اشاره دارند. برخی از توانمندترین مدلهای موجود در جدولهای امتیازدهی متنباز امروزی، هرگز به معنای سنتی «آموزش» ندیدهاند. در عوض، آنها با استفاده از تکنیکی که به سرعت در حال بلوغ است و «ادغام مدل» نامیده میشود، روی لپتاپهای مصرفکننده به هم دوخته شدهاند؛ این تکنیک «مغز» چندین مدل تخصصی را در یک موجودیت واحد و برتر ادغام میکند.[1][4]
برای درک چگونگی عملکرد این روش، باید به معماری داخلی یک شبکه عصبی نگاه کنید. یک مدل هوش مصنوعی اساساً یک صفحه گسترده عظیم و چند بُعدی از اعداد است که «وزنها» نامیده میشوند و نحوه تبدیل ورودیها به خروجیها را دیکته میکنند. به طور سنتی، تغییر این وزنها مستلزم آموزش است—تغذیه مدل با ترابایتها داده و تنظیم آهسته اعداد با استفاده از حساب دیفرانسیل و انتگرال و قدرت محاسباتی عظیم.[3][5]
ادغام مدل یک سؤال اساساً متفاوت میپرسد: چه میشود اگر ما وزنهای یک مدل که منحصراً روی ریاضیات آموزش دیده است و وزنهای یک مدل که منحصراً روی زبان فرانسه آموزش دیده است را برداریم و به سادگی میانگین بگیریم؟ تلاشهای اولیه در این زمینه خام بودند و اغلب منجر به مدلی میشدند که هم ریاضیات و هم فرانسه را فراموش میکرد، پدیدهای که محققان از آن به عنوان «فراموشی فاجعهبار» یاد میکنند.[2][5]
پیشرفت با هندسه بهتر حاصل شد. به جای میانگینگیری ساده حسابی، توسعهدهندگان شروع به استفاده از «درونیابی خطی کروی» یا SLERP کردند. وزنهای یک مدل را به عنوان یک نقطه خاص روی یک کره عظیم و چند بُعدی تصور کنید. SLERP یک منحنی دقیق را در امتداد سطح آن کره بین دو مدل ترسیم میکند و یک نقطه بهینه هندسی پیدا میکند که روابط و قابلیتهای اساسی هر دو مدل والد را حفظ میکند.[2][4]
به جای میانگینگیری ساده حسابی، توسعهدهندگان شروع به استفاده از «درونیابی خطی کروی» یا SLERP کردند.
با این حال، SLERP تنها برای ترکیب دقیقاً دو مدل به طور قابل اعتماد کار میکند. برای ترکیب سه، چهار یا ده مدل، محققان مفهومی به نام «حساب وظیفه» (Task Arithmetic) را توسعه دادند. این تکنیک وزنهای خاصی را که هنگام تنظیم دقیق یک مدل پایه برای یک وظیفه خاص، مانند کدنویسی، تغییر کردهاند، جدا میکند. این تغییرات جدا شده به عنوان یک «بردار وظیفه» استخراج میشوند—یک تقطیر ریاضی از توانایی کدنویسی خالص.[1][2]
روی هم قرار دادن چندین بردار وظیفه، یک مشکل مکانیکی جدید ایجاد میکند: تداخل. اگر بردار ریاضی به یک وزن عصبی خاص بگوید افزایش یابد، و بردار کدنویسی به همان وزن دقیق بگوید کاهش یابد، آنها یکدیگر را خنثی میکنند و عملکرد مدل را کاهش میدهند. سیستم توسط دستورالعملهای متناقض خود گیج میشود.[2][5]
تکنیکی به نام TIES-Merging این مشکل را با تحمیل یک اجماع حل میکند. این روش به جهتی نگاه میکند که اکثریت بردارها میخواهند یک پارامتر خاص را حرکت دهند، اقلیت مخالف را به صفر میرساند و از بقیه میانگین میگیرد. این به عنوان یک فیلتر ریاضی عمل میکند و تضمین میکند که تنها قویترین و همسوترین بهروزرسانیهای قابلیت به مدل ادغامشده نهایی راه یابند.[2]
افراطیترین تکامل این حل تداخل، DARE است که مخفف Drop And Rescale (حذف و مقیاسبندی مجدد) میباشد. DARE بر اساس کشف غیرمنتظرهای عمل میکند که شبکههای عصبی به شدت «بیش از حد پارامتریشده» هستند. این روش به طور تصادفی تا ۹۰ درصد از تغییرات در یک بردار وظیفه را حذف میکند، ۱۰ درصد باقیمانده را برای جبران سیگنال از دست رفته مقیاسبندی مجدد میکند و سپس آنها را ادغام مینماید. نتیجه، مدلی است که مهارتهای جدید را تقریباً بدون هیچ اصطکاک داخلی جذب میکند.[2][6]
پیامدهای اقتصادی این ریاضیات حیرتآور است. تنظیم دقیق یک مدل ۷۰ میلیارد پارامتری به خوشههایی از GPUهای تخصصی و برق فراوان نیاز دارد. ادغام همان مدل دقیق، به صفر ساعت GPU نیاز دارد و تنها به اندازه کافی رم استاندارد سیستم برای نگه داشتن وزنها در حافظه، در حالی که CPU محاسبات را انجام میدهد. این امر هزینه گسترش قابلیت را از صدها هزار دلار به معنای واقعی کلمه به صفر کاهش میدهد.[3][4]
با این حال، محدودیتهای بیولوژیکی سختگیرانهای برای این پیوند دیجیتال وجود دارد. شما فقط میتوانید مدلهایی را ادغام کنید که معماری زیربنایی دقیقاً یکسانی داشته باشند—تعداد لایهها، تعداد پارامترها و «اسکلت» بنیادی یکسان. شما نمیتوانید یک مدل متا لاما (Meta Llama) را با یک مدل میسترال (Mistral) با استفاده از این تکنیکهای مستقیم وزن ادغام کنید، زیرا صفحات گسترده داخلی آنها با هم همخوانی ندارند.[4][5]
علیرغم این محدودیتهای ساختاری، مکانیک ادغام مدلها اساساً در حال تغییر اقتصاد هوش مصنوعی است. با جدا کردن رشد قابلیت از هزینههای محاسباتی، ادغام تضمین میکند که مرز توسعه هوش مصنوعی در دسترس باقی بماند. این امر به انبوهی غیرمتمرکز از توسعهدهندگان متنباز اجازه میدهد تا مهارتهای تخصصی را به طور نامحدود روی هم انباشته کنند و به عنوان یک هوش جمعی عمل کنند که با پرهزینهترین آزمایشگاههای شرکتی جهان رقابت میکند.[1][3][6]
چرا مهم است
ادغام مدل، انحصار شرکتهای بزرگ فناوری را در هم میشکند و به توسعهدهندگان متنباز اجازه میدهد تا هوش مصنوعی پیشرفته را روی سختافزار مصرفکننده ایجاد کنند. با حذف نیاز به میلیونها دلار توان محاسباتی، گلوگاه پیشرفت هوش مصنوعی را از سرمایه خام به نبوغ ریاضی تغییر میدهد.
آنچه نمیدانیم
- چند مدل متمایز را میتوان در یک معماری واحد ادغام کرد قبل از اینکه اجماع ریاضی شکست بخورد و قابلیتها از بین بروند.
- آیا تکنیکهای آینده اجازه ادغام بین معماریها را خواهند داد (به عنوان مثال، ادغام یک مدل ۷ میلیارد پارامتری با یک مدل ۱۳ میلیارد پارامتری).
منابع
[1]Emergent Mindتوسعهدهندگان متنبازLLM Merging Techniques Overview
مطالعه در Emergent Mind →
[2]Towards AIمحققان هوش مصنوعیThe 4 Model Merging Techniques: How to Combine AI Models Without Training
مطالعه در Towards AI →
[3]NVIDIA Technical Blogپذیرندگان سازمانی هوش مصنوعیAn Introduction to Model Merging for LLMs
مطالعه در NVIDIA Technical Blog →
[4]Ionioتوسعهدهندگان متنبازA Comprehensive Guide on Merging Language Models
مطالعه در Ionio →
[5]Deepchecksپذیرندگان سازمانی هوش مصنوعیWhat is Model Merging? Techniques & Challenges
مطالعه در Deepchecks →
[6]تیم سردبیری کوهستانمحققان هوش مصنوعیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.


