چگونه تطبیق رتبه پایین (LoRA) تنظیم دقیق هوش مصنوعی را به ۰.۰۱٪ پارامترهای مدل فشرده میکند
با ثابت نگه داشتن وزنهای اصلی یک شبکه عصبی و آموزش تنها بخش کوچکی از پارامترهای جدید، تطبیق رتبه پایین (لورا) به توسعهدهندگان این امکان را میدهد که مدلهای عظیم هوش مصنوعی را روی سختافزارهای مصرفکننده شخصیسازی کنند. این تکنیک پارامترهای قابل آموزش را تا ۱۰,۰۰۰ برابر کاهش میدهد، در حالی که عملکرد تنظیم دقیق کامل را حفظ میکند.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- محققان کارایی
- بر کاهش هزینه محاسباتی و دموکراتیزه کردن دسترسی به آموزش هوش مصنوعی تمرکز دارند.
- استقراردهندگان سازمانی
- برای آنها ماژولار بودن و توانایی ارائه خدمات به چندین مدل تنظیمشده از یک مدل پایه واحد ارزشمند است.
- ارائهدهندگان پلتفرم
- بر سهولت ادغام و اکوسیستم وزنهای مدل سبک و مشترک تأکید میکنند.
هنگامی که یک شبکه عصبی وظیفه جدیدی را میآموزد، نتیجه دقیقاً در لحظهای تعیین میشود که ماتریسهای وزن آن با مقادیر جدید بهروزرسانی میشوند. در یک مدل استاندارد با ۷ میلیارد پارامتر، این بدان معناست که باید ۷ میلیارد گرادیان جدید به طور همزمان محاسبه و ذخیره شوند—فرآیندی که نیازمند خوشههای عظیمی از پردازندههای گرافیکی تخصصی است.
در سال ۲۰۲۱، محققان اساس این محاسبات را تغییر دادند. آنها تطبیق رتبه پایین یا لورا (LoRA) را معرفی کردند، روشی که مدل اصلی را ثابت نگه میدارد و مجموعهای بسیار کوچکتر از پارامترهای قابل آموزش را به معماری تزریق میکند.[1]
این تکنیک بر یک ویژگی ریاضی به نام «رتبه ذاتی پایین» متکی است. به جای بهروزرسانی یک شبکه عظیم ۱۰,۰۰۰ در ۱۰,۰۰۰ از اعداد، لورا آن بهروزرسانی را به دو ماتریس بسیار کوچکتر تجزیه میکند—برای مثال، یک ماتریس ۱۰,۰۰۰ در ۸ و یک ماتریس ۸ در ۱۰,۰۰۰.[3]
مقاله اصلی آرکایو در سال ۲۰۲۱ بیان میکند: «ما تطبیق رتبه پایین یا لورا را پیشنهاد میکنیم که وزنهای مدل از پیش آموزشدیده را ثابت نگه میدارد و ماتریسهای تجزیه رتبه قابل آموزش را به هر لایه از معماری ترنسفورمر تزریق میکند.»[1]
این تجزیه تعداد پارامترهای قابل آموزش را تا ۱۰,۰۰۰ برابر کاهش میدهد. مدلی که قبلاً نیازمند بهروزرسانی ۷ میلیارد پارامتر بود، اکنون میتواند تنها با تنظیم ۷۰۰,۰۰۰ پارامتر، تنظیم دقیق شود.[1]
پیامدهای سختافزاری این روش فوری هستند. طبق گفته Unsloth، پلتفرمی که در بهینهسازی مدل تخصص دارد، تنظیم دقیق یک مدل ۷ میلیارد پارامتری با استفاده از لورا تقریباً به ۱۴ گیگابایت ویرَم (VRAM) نیاز دارد.[6]
این امر نیاز سختافزاری را از یک پردازنده گرافیکی مرکز داده ۳۰,۰۰۰ دلاری به یک کارت گرافیک مصرفکننده رده بالا کاهش میدهد و دسترسی به شخصیسازی هوش مصنوعی را دموکراتیزه میکند.[6]
با این حال، کاهش حافظه کاملاً متناسب با کاهش پارامترها نیست. در حالی که تعداد پارامترهای قابل آموزش ۹۹.۹۹٪ کاهش مییابد، نیاز واقعی به حافظه پردازنده گرافیکی تنها حدود سه برابر کاهش مییابد.[1]
با این حال، کاهش حافظه کاملاً متناسب با کاهش پارامترها نیست.
این اختلاف به این دلیل رخ میدهد که وزنهای اصلی و ثابت مدل همچنان باید در حافظه بارگذاری شوند تا دادههای آموزشی پردازش شوند. شرکت IBM اشاره میکند که اگرچه وضعیتهای بهینهساز (optimizer states) برای پارامترهای جدید بسیار کوچک هستند، اما خود مدل پایه یک شیء عظیم و غیرقابل جابجایی در رم سیستم باقی میماند.[2]
برای استقرار یک مدل تنظیمشده با لورا، توسعهدهندگان نیازی به میزبانی یک نسخه کاملاً جداگانه از هوش مصنوعی ندارند. آنها به سادگی مدل اصلی را بارگذاری کرده و ماتریسهای کوچک لورا را برای وظایف خاص جایگزین میکنند.[3]
هاگینگ فیس (Hugging Face)، یک مخزن پیشرو در حوزه هوش مصنوعی، بر این ماژولار بودن به عنوان یک مزیت اصلی تأکید میکند. یک مدل پایه واحد میتواند به طور همزمان به دهها کاربرد مختلف خدمات دهد، تنها با اعمال وزنهای مختلف لورا بر اساس درخواستهای مختلف کاربران.[3]
انتخاب لایههایی که باید تطبیق داده شوند حیاتی است. مهندسان Databricks اشاره میکنند که اعمال لورا به طور انحصاری بر روی ماتریسهای پروجکشن کوئری و ولیو مکانیسم توجه (attention mechanism) اغلب بهترین تعادل بین کارایی و دقت را به همراه دارد.[5]
Snorkel AI، که در توسعه هوش مصنوعی دادهمحور تخصص دارد، تأکید میکند که عملکرد لورا با تنظیم دقیق کامل در اکثر وظایف پاییندستی مطابقت دارد، مشروط بر اینکه پارامتر رتبه—مقدار «r»—به درستی تنظیم شده باشد.[4]
مقدار «r» اندازه ماتریسهای تزریق شده را تعیین میکند. رتبه ۸ استاندارد است، اما وظایف پیچیده مانند کدنویسی یا ریاضیات ممکن است به رتبه ۳۲ یا ۶۴ نیاز داشته باشند، که تعداد پارامترها را افزایش میدهد اما الگوهای ظریفتری را ثبت میکند.[6]
محدودیت نهایی لورا، کارایی پارامتری آن نیست، بلکه کیفیت مدل پایه زیرین است. اگر وزنهای ثابت فاقد قابلیتهای استدلال اساسی مورد نیاز برای یک وظیفه باشند، هیچ مقدار تطبیق رتبه پایینی نمیتواند این شکاف را پر کند و فاز پیشآموزش اولیه به عنوان گلوگاه واقعی در توسعه هوش مصنوعی باقی میماند.[7]
بررسی عمیق دیدگاهها
محققان کارایی
بر کاهش هزینه محاسباتی و دموکراتیزه کردن دسترسی به آموزش هوش مصنوعی تمرکز دارند.
این گروه لورا را به عنوان یک پیشرفت اساسی در دسترسی محاسباتی میبیند. این محققان با اثبات اینکه شبکههای عصبی در طول تنظیم دقیق دارای رتبه ذاتی پایینی هستند، استدلال میکنند که نیازهای سختافزاری عظیم گذشته تا حد زیادی صرف بهروزرسانیهای پارامتری اضافی میشده است. کار در حال انجام آنها بر کاهش بیشتر رتبه و ترکیب لورا با تکنیکهای کوانتیزاسیون شدید برای اجرای آموزش بر روی دستگاههای لبه (edge devices) متمرکز است.
استقراردهندگان سازمانی
برای آنها ماژولار بودن و توانایی ارائه خدمات به چندین مدل تنظیمشده از یک مدل پایه واحد ارزشمند است.
برای تیمهای مهندسی شرکتها، جذابیت اصلی لورا فقط هزینه آموزش نیست، بلکه لجستیک استقرار است. میزبانی پنجاه مدل کاملاً تنظیمشده، نیازمند پنجاه برابر ظرفیت سرور است. با استفاده از لورا، شرکتها میتوانند یک مدل پایه عظیم را میزبانی کرده و فایلهای آداپتور با حجم مگابایت را بر اساس هر کاربر اعمال کنند، که اساساً اقتصاد واحد خدمات هوش مصنوعی شخصیسازیشده را تغییر میدهد.
ارائهدهندگان پلتفرم
بر سهولت ادغام و اکوسیستم وزنهای مدل سبک و مشترک تأکید میکنند.
سازمانهایی که مخازن متنباز را نگهداری میکنند، لورا را موتور همکاری جامعه میدانند. از آنجا که وزنهای لورا به اندازه کافی کوچک هستند که بتوان آنها را ایمیل کرد یا در پلتفرمهای استاندارد میزبانی کد به اشتراک گذاشت، یک اکوسیستم سریع و غیرمتمرکز را فعال میکنند که در آن هزاران توسعهدهنده میتوانند بر روی یک مدل بنیادی واحد تکرار کنند، بدون اینکه نیازی به توزیع گیگابایت داده برای هر تنظیم جزئی داشته باشند.
چرا مهم است
با کاهش چشمگیر نیازهای سختافزاری برای شخصیسازی هوش مصنوعی، لورا به توسعهدهندگان مستقل و کسبوکارهای کوچک اجازه میدهد تا مدلهای تخصصی بسازند؛ کاری که پیش از این نیازمند میلیونها دلار زیرساخت در مراکز داده بود.
آنچه نمیدانیم
- آیا پیکربندیهای لورای با رتبه بسیار بالا میتوانند به طور کامل با ظرافتهای تنظیم دقیق کامل در وظایف استدلالی بسیار پیچیده مطابقت داشته باشند یا خیر.
- این تکنیک چگونه مقیاسپذیر خواهد بود، زمانی که مدلهای پایه از آستانه ۱ تریلیون پارامتر عبور کنند.
منابع
[1]arXivمحققان کاراییLoRA: Low-Rank Adaptation of Large Language Models
مطالعه در arXiv →
[2]IBMاستقراردهندگان سازمانیWhat is LoRA (Low-Rank Adaption)?
مطالعه در IBM →
[3]Hugging Faceارائهدهندگان پلتفرمLoRA (Low-Rank Adaptation)
مطالعه در Hugging Face →
[4]Snorkel AIارائهدهندگان پلتفرمLoRA: Low-Rank Adaptation for LLMs
مطالعه در Snorkel AI →
[5]Databricksاستقراردهندگان سازمانیEfficient Fine-Tuning with LoRA: A Guide to Optimal Parameter Selection for Large Language Models
مطالعه در Databricks →
[6]Unslothمحققان کاراییLoRA fine-tuning Hyperparameters Guide
مطالعه در Unsloth →
[7]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



