چگونه تجزیه ماتریسی کمرتبه مستقیماً در وزنهای پایه ادغام میشود تا تاخیر استنتاج هوش مصنوعی را به صفر برساند
مهندسان هوش مصنوعی با بهرهگیری از یک شگرد جبر خطی و ادغام مستقیم ماتریسهای موقت یادگیری در معماری اصلی مدل پایه، راهی یافتهاند تا مدلهای کاملاً تخصصی را بدون کوچکترین افت سرعت یا تاخیر محاسباتی معمول در سیستمهای ماژولار مستقر کنند؛ رویکردی که هزینههای سختافزاری را به شدت کاهش میدهد.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
بهطور خلاصه
- روش LoRA وزنهای اصلی مدل هوش مصنوعی را منجمد کرده و تنها ماتریسهای کمکی کمرتبه را آموزش میدهد که هزینه سختافزاری را به شدت میکاهد.
- از آنجا که شبکههای عصبی مبتنی بر جبر خطی هستند، میتوان این ماتریسهای موقت را پس از پایان آموزش مستقیماً با وزنهای اصلی ادغام کرد.
- این ادغام مستقیم ریاضیاتی به تولید مدلی تخصصی منجر میشود که دقیقاً با همان سرعت مدل اولیه و بدون کمترین تاخیر استنتاج اجرا میشود.
در این مطلب
در یک سو از مناقشه استقرار مدلهای زبانی، مهندسان سیستم باور دارند که تکیه بر یک مدل پایه فراگیر و بزرگ، تنها راهکار مقرونبهصرفه برای سرویسدهی به میلیونها کاربر است. در سوی دیگر، متخصصان حوزههای گوناگون اصرار میورزند که مدلها بدون تنظیم دقیق (Fine-tuning) ویژه هر وظیفه، بیش از حد عمومی باقی میمانند و نمیتوانند گردشکارهای تخصصی در پزشکی، حقوق یا برنامهنویسی را با دقت کافی هدایت کنند.
سازش سنتی گذشته هیچیک از دو طرف را خشنود نمیکرد: تنظیم دقیق یک مدل غولپیکر مستلزم ایجاد مجموعهای سراسر جدید از همان میلیاردها وزن بود که برای میزبانی به سختافزارهای سروری مجزا و گرانقیمت نیاز داشت؛ و در سوی دیگر، متصل کردن ماژولهای آداپتور جانبی کوچکتر نیز تاخیر محاسباتی محسوسی هنگام تولید پاسخ تحمیل میکرد.[4][5]
این بنبست فنی با یک ترفند ریاضی ظریف موسوم به «انطباق کمرتبه» یا LoRA (لورا) شکسته شد. توسعهدهندگان با ثابت نگهداشتن شبکه عصبی اولیه و تزریق ماتریسهای کوچک و موقت حین آموزش، مدل را تنها با کسر کوچکی از هزینههای رایج شخصیسازی میکنند.[1][2]
نکته اساسیتر این است که با پایان فرایند آموزش، این ماتریسهای موقت را میتوان از طریق محاسبات ریاضی مستقیماً درون شبکه اصلی فروپاشید و ادغام کرد. مدل بهدستآمده تمام دانش تخصصی تازه را درون خود نگه میدارد، بیآنکه در مرحله استنتاج حتی میلیثانیهای تاخیر اضافی تولید کند.[4]
دیوار محاسباتی در تنظیم دقیق کامل
برای درک مهندسی این ادغام ماتریسی، ابتدا باید بزرگی مسئلهای را بسنجیم که این روش در پی حل آن است. مدلهای زبانی بزرگ کنونی دهها یا صدها میلیارد پارامتر دارند که هرکدام به شکل یک عدد با دقت اعشاری بالا در ماتریسهای پهناور نگهداری میشوند.[2][7]
پژوهشگران در روش سنتی تنظیم دقیق کامل، باید تکتک این میلیاردها متغیر را دوباره محاسبه و بهروز کنند. بر اساس مقاله سال ۲۰۲۱ پژوهشگران شرکت مایکروسافت که این روش را معرفی کرد، دستکاری مدلی در مقیاس GPT-3 نیازمند تنظیم ۱۷۵ میلیارد پارامتر است؛ فرآیندی که خوشههای عظیمی از کارتهای گرافیکی پیشرفته و بار حافظه سرسامآوری را میطلبد.[1][2]
سباستین راشکا، پژوهشگر و مدرس هوش مصنوعی، در تحلیل سال ۲۰۲۳ خود درباره روشهای بهینه در مصرف پارامتر اشاره میکند: «میزان حافظه موقت مورد نیاز برای تنظیم دقیق کامل، اغلب سه برابر حجم خود مدل است؛ صرفاً به این دلیل که باید حالتهای محاسباتی بهینهساز (optimizer) را در خود جای دهد.»[5]
این واقعیت، فرآیند پیادهسازی سازمانی را با بحران مواجه میکرد. اگر بیمارستانی ده مدل تخصصی مختلف برای ده بخش درمانی مجزا میخواست، روش پیشین آن را ناگزیر میکرد ده مدل غولپیکر ۱۷۵ میلیارد پارامتری را جداگانه میزبانی کند؛ یعنی هزینه سختافزاری پردازش ناگهان ده برابر میشد.[4][7]
فرضیه ابعاد کمرتبه در هوش مصنوعی
فناوری LoRA این بنبست محاسباتی را با تکیه بر مفهومی بنیادین در شبکههای عصبی موسوم به «بُعد ذاتی» دور میزند. این نظریه مطرح میکند که هرچند یک مدل در ظاهر میلیاردها پارامتر دارد، اما تغییرات ریاضی واقعی که برای آموختن یک مهارت مشخص تازه لازم است، در فضایی بسیار کوچکتر و با ابعاد هندسی پایینتر رخ میدهد.[1][2]
بنابراین پژوهشگران به جای تغییر ماتریس غولپیکر وزنهای اصلی (که آن را W مینامیم)، آن را کاملاً منجمد و دستنخورده نگه میدارند. سپس دو ماتریس به مراتب کوچکتر، موسوم به A و B، میسازند و در طول آموزش در کنار مدل پایه منجمد قرار میدهند.[4][5]
این ماتریسهای کمکی «کمرتبه» (Low-Rank) هستند؛ به این معنا که تعداد سطرها و ستونهای بنیادین آنها نسبت به معماری اصلی ناچیز است. مهندسان با آموزش دادن صرفاً همین ماتریسهای ریز، شمار متغیرهای آموزشپذیر را تا ۱۰ هزار برابر کاهش داده و حافظه مصرفی کارت گرافیک را تا یکسوم پایین میآورند.[1][2]
در راهنمای فنی سال ۲۰۲۵ شرکت IBM آمده است: «لورا به ما اجازه میدهد روی یک کارت گرافیک معمولی چیزی را آموزش دهیم که قبلاً به یک رک کامل سرور نیاز داشت.» این کاهش نیاز پردازشی، مسیر تنظیم دقیق مدلها را برای پژوهشگران مستقل و استارتاپهای نوپا هموار کرد.[7]
ریاضیات ادغام مستقیم ماتریسها
با این حال، دستاورد اصلی LoRA فقط نحوه آموزش ارزان نیست، بلکه شیوه به کارگیری نهایی آن است. اگر قرار بود در زمان اجرای مدل، شبکه پایه و ماتریسهای A و B جداگانه فعال بمانند، محاسبات برای هر کلمه خروجی پیچیدهتر و پرهزینهتر میشد.[4]
اینجاست که زیبایی جبر خطی خود را نشان میدهد. از آنجا که لایههای شبکههای عصبی بر پایه ضرب و جمع ماتریسها کار میکنند، میتوان معادلات را بر اساس اصول جبری بازآرایی کرد. خروجی هر لایه در واقع حاصل ضرب ورودی در وزن پایه، به اضافه حاصل ضرب ورودی در ماتریسهای جدید است.[4][5]
به لطف ویژگی توزیعپذیری در جبر ماتریسی، توسعهدهندگان میتوانند ماتریس A را در ماتریس B ضرب کنند تا ماتریسی جدید دقیقاً هماندازه با ماتریس اصلی مدل پایه ساخته شود. سپس این ماتریس جدید را با یک جمع ساده به ماتریس منجمد پایه پیوند میزنند.[1][4]
نتیجه کار، یک ماتریس وزن واحد و یکدست است که هم دانش بنیادین پیشین و هم تخصص جدید را یکجا در بر دارد. آداپتورهای موقت عملاً از نظر محاسباتی ناپدید میشوند، چرا که وزنهایشان برای همیشه درون تاروپود مدل پایه جای گرفته است.[4][6]
حذف کامل جریمه تاخیر در استنتاج
این ادغام ساختاری دستاورد عملیاتی بسیار مهمی به همراه دارد: تاخیر محاسباتی استنتاج صفر میشود. چون ابعاد مدل حاصل از ادغام هیچ تفاوتی با مدل اولیه ندارد، شمار عملیات اعشاری مورد نیاز برای تولید متن با حالت دستنخورده اولیه برابر میماند.[2][4]
روشهای پیشین مانند لایههای آداپتور قدیمی دادهها را مجبور میکردند از مسیرهای عصبی اضافی عبور کنند. این امر چند میلیثانیه تاخیر به ازای هر توکن متن تحمیل میکرد؛ جریمه زمانی کوچکی که در تولید متنهای طولانی یا سرویسدهی همزمان به هزاران کاربر انباشته و تحملناپذیر میشد.[1][5]
اما در رویکرد وزنهای ادغامشده LoRA، این تاخیر به کلی محو میشود. یک ارائهدهنده سرویس ابری میتواند بر حسب درخواست کاربر، مدلهای ادغامشده مختلف را در چند لحظه درون حافظه جابهجا کند و بدون نیاز به سختافزارهای پیچیده مسیریابی، خدمات تخصصی پرسرعت ارائه دهد.[4][7]
تحلیل سال ۲۰۲۳ آزمایشگاه Lightning AI بر روی صدها آزمایش تنظیم دقیق، این مزیت عملیاتی را تایید کرد. مهندسان این مرکز نشان دادند که با وجود کاهش چشمگیر زمان آموزش و حافظه، سرعت بازدهی مدلها در زمان استقرار دقیقاً همپای مدلهای دستنخورده باقی میماند.[6]
گسترش مرزها با تکنیک کوانتایزاسیون
مهندسی این انطباق کمرتبه در سال ۲۰۲۳ با معرفی روش QLoRA در همایش بینالمللی پردازش اطلاعات عصبی گامی فراتر رفت. این روش ادغام ماتریسی را با فشردهسازی حداکثری اعداد ترکیب کرد.[3]
پژوهشگران با کوانتایز کردن و فشردهسازی مدل پایه تا سطح ۴ بیت برای هر پارامتر (به جای فرمتهای متداول ۱۶ یا ۳۲ بیتی)، حجم رم لازم برای بارگذاری اولیه مدل را به شدت کاهش دادند؛ سپس ماتریسهای دقیقتر LoRA را برای جذب یادگیری جدید به آن افزودند.[3][6]
این ترکیب هوشمندانه شرایطی فراهم کرد تا یک مدل غولآسای ۶۵ میلیارد پارامتری روی یک کارت گرافیک ۴۸ گیگابایتی آموزش داده شود؛ کاری که تا پیش از آن ناممکن دانسته میشد. با پایان آموزش، آداپتورهای دقیق همچنان امکان ادغام با وزنهای فشرده پایه را دارند.[3][6]
بدهبستانهای یادگیری با ماتریسهای کمرتبه
با وجود این ظرافت ریاضی، این تکنیک در تمام سناریوها جایگزینی بینقص برای تنظیم دقیق سراسری نیست. از آنجا که فضای پارامترهای آموزشپذیر عمداً محدود شده است، این ماتریسها گنجایش محدودی در یادگیری حجم عظیمی از دادههای بنیادین تازه یا زبانهای کاملاً ناآشنا دارند.[5][8]
مقالهای که در مه ۲۰۲۴ با عنوان «LoRA کمتر میآموزد و کمتر فراموش میکند» روی مخزن arXiv منتشر شد، این محدودیت را اثبات کرد. پژوهشگران دریافتند که انطباق کمرتبه در تغییر لحن، قالب نگارش یا سبک بینظیر است، اما در مقایسه با تنظیم کامل، در به حافظه سپردن دادههای خام کاملاً جدید توان ضعیفتری دارد.[8]
نویسندگان آن مقاله در تحلیل تطبیقی خود اشاره کردند: «مدلهای آموزشدیده با لورا به دلیل تنظیم ساختاری قویتر، کمتر دچار فراموشی فاجعهبار اطلاعات قبلی خود میشوند، اما زمانی که میخواهند حوزههای دانشی سراسر تازه را فرابگیرند، توانایی یادگیریشان بسیار زودتر به سقف میرسد.»[8]
این مرز فنی برای مهندسان هوش مصنوعی اهمیت راهبردی دارد: اگر هدف شما آموزش سبک نگارش لوایح حقوقی به مدل باشد، LoRA بهترین گزینه است. اما اگر قصد دارید کل مفاهیم یک علم تازه کشفشده را از پایه به مدل بیاموزید، تنظیم دقیق کامل همچنان گزینهای اجتنابناپذیر خواهد بود.[7][8]
آینده سیستمهای ماژولار در هوش مصنوعی
با این حال، امکان آموزش ارزان و ادغام مستقیم ماتریسها، رویکرد صنعت نرمافزار به هوش مصنوعی را به کلی تغییر داده است. صنعت دیگر بر مدلهای یکپارچه و سنگین برای تمام کاربریها تکیه نمیکند، بلکه به سمت مجموعههای وسیعی از آداپتورهای تخصصی خرد گرایش یافته است.[4][7]
از آنجا که ماتریسهای تفکیکشده A و B حجمی بسیار ناچیز (اغلب در حد چند ده مگابایت) دارند، بهراحتی روی بستر اینترنت جابهجا میشوند. کاربر میتواند مدل پایه را یک بار دانلود کند و سپس دهها فایل سبک LoRA متناسب با نیازهای مختلف را روی آن بنشاند.[4][5]
از آنجا که ماتریسهای تفکیکشده A و B حجمی بسیار ناچیز (اغلب در حد چند ده مگابایت) دارند، بهراحتی روی بستر اینترنت جابهجا میشوند.
این تحلیل چگونه انجام شد
- روش
- فرمولبندیهای ریاضی روش انطباق کمرتبه از مقالات مبنایی و راهنماهای پیادهسازی گردآوری و تحلیل شدند تا همارزی محاسباتی دقیق میان مدل پایه و مدل ادغامشده در مرحله استنتاج استخراج شود.
- یافته
- تضمین ریاضی مبنی بر اینکه با وجود اضافه شدن میلیونها پارامتر آموزشپذیر در مرحله تنظیم دقیق، حاصلجمع ماتریسی پس از آموزش مدلی تولید میکند که از نظر ابعاد و محاسبات پردازشی (FLOP) دقیقاً با مدل اصلی یکسان است و تقابل سنتی میان تخصصیسازی و سرعت استنتاج را حذف میکند.
- دادههایی که بر پایهٔ آنها کار کردیم
- نسبت کاهش پارامترهای آموزشپذیر (۱۰,۰۰۰ برابر): 10,000x — Microsoft Research
- میزان تاخیر استنتاج اضافه بعد از ادغام (۰ میلیثانیه): 0 ms — Hugging Face
- محدودیتهای این تحلیل
- این تحلیل هزینههای محاسباتی و تاخیر ماتریسهای ادغامشده را ارزیابی میکند، اما نمیتواند افت احتمالی در یادگیری دانش خام کاملاً جدید را در مقایسه با تنظیم دقیق سراسری در تمام مجموعهدادهها به شکل مطلق اندازهگیری کند.
اصطلاحات کلیدی
- LoRA
- مخفف انطباق کمرتبه؛ شیوهای که در آن وزنهای مدل اصلی دستنخورده میمانند و فقط ماتریسهای کمکی بسیار کوچک آموزش میبینند.
- رتبه (Rank)
- ویژگی ریاضی یک ماتریس که بعد واقعی اطلاعات آن را نشان میدهد؛ رتبه پایینتر یعنی سطرها و ستونهای مستقل کمتری در ماتریس وجود دارند.
- تجزیه ماتریسی
- فرایند شکستن یک ماتریس پیچیده و بزرگ به دو یا چند ماتریس کوچکتر که ضرب آنها مقدار ماتریس اولیه را تخمین میزند.
- کوانتایزاسیون (Quantization)
- روش فشردهسازی محاسباتی که دقت عددی وزنها را در شبکه عصبی کاهش میدهد (مثلاً از ۱۶ بیت به ۴ بیت) تا حافظه کمتری اشغال شود.
پرسشهای متداول
آیا میتوان همزمان چند آداپتور LoRA را ادغام کرد؟
بله، امکان ادغام متوالی چند آداپتور درون یک مدل پایه وجود دارد؛ هرچند اگر آداپتورها روی توزیع دادههای متناقض آموزش دیده باشند، ممکن است کیفیت پاسخدهی افت کند.
آیا مدل LoRA ادغامشده به دقت یکسان با تنظیم کامل دست مییابد؟
همیشه اینطور نیست. در تکالیف ناظر بر لحن، سبک و قالببندی دقت یکسان است، اما پژوهشها نشان میدهد در بهخاطرسپاری حجم زیادی از فکتها و دادههای کاملاً جدید ضعیفتر از تنظیم سراسری عمل میکند.
آیا میتوان وزنهای LoRA را بعد از ادغام دوباره جدا کرد؟
بله؛ از آنجا که فرایند ادغام صرفاً یک جمع جبری ماتریسی است، با تفریق مستقیم همان ماتریس آداپتور از وزنهای مدل، نسخه پایه اولیه دقیقاً بازیابی میشود.
بررسی عمیق دیدگاهها
پژوهشگران بهرهوری پردازش
معتقدند در دسترس قرار گرفتن منابع پردازشی از طریق کاهش پارامترها، لازمه بقا و پیشرفت هوش مصنوعی متنباز است.
پژوهشگران مدافع دسترسی آزاد، تجزیه ماتریسی را مهمترین سد دفاعی در برابر انحصار شرکتهای بزرگ فناوری میدانند. آنها استدلال میکنند که با کاهش ۱۰ هزار برابری پارامترهای قابل آموزش بدون افت چشمگیر توانایی مدل، آزمایشگاههای مستقل دیگر برای توسعه هوش مصنوعی نیازی به دیتاسنترهای عظیم نخواهند داشت. امکان اجرای این فرایندها روی کارتهای گرافیک مصرفی، ماهیت غیرمتمرکز توسعه هوش مصنوعی را حفظ میکند. افزون بر این، طرفداران این رویکرد به ابعاد زیستمحیطی آن نیز اشاره میکنند. فرآیند سنتی تنظیم دقیق سراسری هفتهها زمان میبرد و نیازمند صرف مقادیر هنگفتی انرژی برق در خوشههای پردازشی بود. کاهش چشمگیر بار پردازشی ردپای کربنی شخصیسازی مدلهای زبانی را نیز به حداقل میرساند.
تامینکنندگان سختافزار
بر چگونگی افزایش توان عملیاتی و بهرهوری حافظه کارتهای گرافیک در زیرساختهای سرور فعلی با تکیه بر وزنهای ادغامشده تمرکز دارند.
برای ارائهدهندگان رایانش ابری و تولیدکنندگان زیرساخت، جذابیت اصلی لورا در تراکم بازدهی عملیاتی نهفته است. از آنجا که مدلهای ادغامشده هیچ تاخیری حین استنتاج ندارند، شرکتها میتوانند همزمان به هزاران کاربر پاسخ دهند، بیآنکه مجبور به ارتقای خطوط ارتباطی حافظه یا استفاده از سیستمهای مسیریابی گرانقیمت شوند. به علاوه، حجم بسیار ناچیز فایلهای تفکیکشده این امکان را به سرورها میدهد که افزونههای مهارتی مختلف را ظرف چند میلیثانیه روی یک مدل پایه لود شده جابهجا کنند. بدین ترتیب یک کارت گرافیک میتواند همزمان دهها تخصص کاری را پاسخگو باشد و نرخ بازگشت سرمایه سختافزارها را به اوج برساند.
اصالتگرایان کیفیت مدل
تاکید دارند که ماتریسهای کمرتبه ظرفیت محدودی برای ذخیرهسازی دادههای کاملاً جدید نسبت به بهروزرسانی کامل وزنها دارند.
گروهی از پژوهشگران که بالاترین استانداردهای کیفی را دنبال میکنند، هشدار میدهند که نباید به LoRA به عنوان راهحلی نهایی برای همه چالشها نگاه کرد. بررسیهای عملی نشان میدهد که ماتریسهای کمرتبه اگرچه در آموختن لحن یا سبک نگارشی توانمندند، اما ظرفیت ریاضی لازم برای نگهداری مقادیر عظیمی از اطلاعات کاملاً تازه را ندارند. به باور این کارشناسان، زمانی که قرار است مدل زبانی با یک زبان کاملاً ناآشنا یا پایگاهداده بسیار وسیع و تخصصی شرکتی ادغام شود، بعد ذاتی مسئله آنقدر گسترده است که ماتریسهای کوچک از پس آن برنمیآیند. در چنین شرایط پیچیدهای، بهروزرسانی کل ۱۷۵ میلیارد پارامتر معماری همچنان تنها راه تضمینشده برای جلوگیری از توقف یادگیری یا خطای مدل است.
- پژوهشگران بهرهوری پردازش
- معتقدند در دسترس قرار گرفتن منابع پردازشی از طریق کاهش پارامترها، لازمه بقا و پیشرفت هوش مصنوعی متنباز است.
- تامینکنندگان سختافزار
- بر چگونگی افزایش توان عملیاتی و بهرهوری حافظه کارتهای گرافیک در زیرساختهای سرور فعلی با تکیه بر وزنهای ادغامشده تمرکز دارند.
- اصالتگرایان کیفیت مدل
- تاکید دارند که ماتریسهای کمرتبه ظرفیت محدودی برای ذخیرهسازی دادههای کاملاً جدید نسبت به بهروزرسانی کامل وزنها دارند.
دیدگاههایی که این گزارش پوشش نداده
- مهندسان پیادهسازی و استقرار سازمانی
- ارائهدهندگان میزبانی ابری
منابع
[1]arXivاصالتگرایان کیفیت مدلLoRA: Low-Rank Adaptation of Large Language Models
مطالعه در arXiv →
[2]Microsoft Researchپژوهشگران بهرهوری پردازشLoRA: Low-Rank Adaptation of Large Language Models
مطالعه در Microsoft Research →
[3]NeurIPS ProceedingsQLoRA: Efficient Finetuning of Quantized LLMs
مطالعه در NeurIPS Proceedings →
[4]Hugging Faceپژوهشگران بهرهوری پردازشLoRA
مطالعه در Hugging Face →
[5]Sebastian Raschkaاصالتگرایان کیفیت مدلParameter-Efficient LLM Finetuning With Low-Rank Adaptation (LoRA)
مطالعه در Sebastian Raschka →
[6]Lightning AIپژوهشگران بهرهوری پردازشFinetuning LLMs with LoRA and QLoRA: Insights from Hundreds of Experiments
مطالعه در Lightning AI →
[7]IBMتامینکنندگان سختافزارWhat is LoRA (Low-Rank Adaption)?
مطالعه در IBM →
[8]arXivاصالتگرایان کیفیت مدلLoRA Learns Less and Forgets Less
مطالعه در arXiv →
[9]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →یادگیری ماشین
هوش مصنوعی مولد چگونه توزیع احتمال توام دادهها را نگاشت میکند؟
5 منبع
خوداصلاحی هوش مصنوعی
مکانیسم خوداصلاحی هوش مصنوعی: مدلهای زبانی چگونه استدلال خود را نقد و پالایش میکنند؟
6 منبع
ایمنی هوش مصنوعی
آنتروپیک رتبه ریسک فاجعهبار هوش مصنوعی را افزایش داد و مدل پیشگام داخلی را کنار گذاشت
3 منبع
حکمرانی هوش مصنوعی
درخواست ۱,۳۶۷ محقق هوش مصنوعی پیشرو برای توافقنامههای بینالمللی تنظیم سرعت و صدور مجوز
5 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





