رفتن به محتوای اصلی
کوهستان
توضیح کوهستانبهینه‌سازی مدلفناوری لورا· 8 دقیقه مطالعه· در هوش مصنوعی

چگونه تجزیه ماتریسی کم‌رتبه مستقیماً در وزن‌های پایه ادغام می‌شود تا تاخیر استنتاج هوش مصنوعی را به صفر برساند

مهندسان هوش مصنوعی با بهره‌گیری از یک شگرد جبر خطی و ادغام مستقیم ماتریس‌های موقت یادگیری در معماری اصلی مدل پایه، راهی یافته‌اند تا مدل‌های کاملاً تخصصی را بدون کوچک‌ترین افت سرعت یا تاخیر محاسباتی معمول در سیستم‌های ماژولار مستقر کنند؛ رویکردی که هزینه‌های سخت‌افزاری را به شدت کاهش می‌دهد.

به قلم اِلا فرجاد

به‌طور خلاصه

  1. روش LoRA وزن‌های اصلی مدل هوش مصنوعی را منجمد کرده و تنها ماتریس‌های کمکی کم‌رتبه را آموزش می‌دهد که هزینه سخت‌افزاری را به شدت می‌کاهد.
  2. از آنجا که شبکه‌های عصبی مبتنی بر جبر خطی هستند، می‌توان این ماتریس‌های موقت را پس از پایان آموزش مستقیماً با وزن‌های اصلی ادغام کرد.
  3. این ادغام مستقیم ریاضیاتی به تولید مدلی تخصصی منجر می‌شود که دقیقاً با همان سرعت مدل اولیه و بدون کمترین تاخیر استنتاج اجرا می‌شود.

در یک سو از مناقشه استقرار مدل‌های زبانی، مهندسان سیستم باور دارند که تکیه بر یک مدل پایه فراگیر و بزرگ، تنها راهکار مقرون‌به‌صرفه برای سرویس‌دهی به میلیون‌ها کاربر است. در سوی دیگر، متخصصان حوزه‌های گوناگون اصرار می‌ورزند که مدل‌ها بدون تنظیم دقیق (Fine-tuning) ویژه هر وظیفه، بیش از حد عمومی باقی می‌مانند و نمی‌توانند گردش‌کارهای تخصصی در پزشکی، حقوق یا برنامه‌نویسی را با دقت کافی هدایت کنند.

سازش سنتی گذشته هیچ‌یک از دو طرف را خشنود نمی‌کرد: تنظیم دقیق یک مدل غول‌پیکر مستلزم ایجاد مجموعه‌ای سراسر جدید از همان میلیاردها وزن بود که برای میزبانی به سخت‌افزارهای سروری مجزا و گران‌قیمت نیاز داشت؛ و در سوی دیگر، متصل کردن ماژول‌های آداپتور جانبی کوچک‌تر نیز تاخیر محاسباتی محسوسی هنگام تولید پاسخ تحمیل می‌کرد.[4][5]

این بن‌بست فنی با یک ترفند ریاضی ظریف موسوم به «انطباق کم‌رتبه» یا LoRA (لورا) شکسته شد. توسعه‌دهندگان با ثابت نگه‌داشتن شبکه عصبی اولیه و تزریق ماتریس‌های کوچک و موقت حین آموزش، مدل را تنها با کسر کوچکی از هزینه‌های رایج شخصی‌سازی می‌کنند.[1][2]

نکته اساسی‌تر این است که با پایان فرایند آموزش، این ماتریس‌های موقت را می‌توان از طریق محاسبات ریاضی مستقیماً درون شبکه اصلی فروپاشید و ادغام کرد. مدل به‌دست‌آمده تمام دانش تخصصی تازه را درون خود نگه می‌دارد، بی‌آنکه در مرحله استنتاج حتی میلی‌ثانیه‌ای تاخیر اضافی تولید کند.[4]

دیوار محاسباتی در تنظیم دقیق کامل

برای درک مهندسی این ادغام ماتریسی، ابتدا باید بزرگی مسئله‌ای را بسنجیم که این روش در پی حل آن است. مدل‌های زبانی بزرگ کنونی ده‌ها یا صدها میلیارد پارامتر دارند که هرکدام به شکل یک عدد با دقت اعشاری بالا در ماتریس‌های پهناور نگهداری می‌شوند.[2][7]

پژوهشگران در روش سنتی تنظیم دقیق کامل، باید تک‌تک این میلیاردها متغیر را دوباره محاسبه و به‌روز کنند. بر اساس مقاله سال ۲۰۲۱ پژوهشگران شرکت مایکروسافت که این روش را معرفی کرد، دستکاری مدلی در مقیاس GPT-3 نیازمند تنظیم ۱۷۵ میلیارد پارامتر است؛ فرآیندی که خوشه‌های عظیمی از کارت‌های گرافیکی پیشرفته و بار حافظه سرسام‌آوری را می‌طلبد.[1][2]

فناوری LoRA شمار پارامترهای آموزش‌پذیر را در مقایسه با تنظیم دقیق سراسری تا ۱۰,۰۰۰ برابر کاهش می‌دهد.

سباستین راشکا، پژوهشگر و مدرس هوش مصنوعی، در تحلیل سال ۲۰۲۳ خود درباره روش‌های بهینه در مصرف پارامتر اشاره می‌کند: «میزان حافظه موقت مورد نیاز برای تنظیم دقیق کامل، اغلب سه برابر حجم خود مدل است؛ صرفاً به این دلیل که باید حالت‌های محاسباتی بهینه‌ساز (optimizer) را در خود جای دهد.»[5]

این واقعیت، فرآیند پیاده‌سازی سازمانی را با بحران مواجه می‌کرد. اگر بیمارستانی ده مدل تخصصی مختلف برای ده بخش درمانی مجزا می‌خواست، روش پیشین آن را ناگزیر می‌کرد ده مدل غول‌پیکر ۱۷۵ میلیارد پارامتری را جداگانه میزبانی کند؛ یعنی هزینه سخت‌افزاری پردازش ناگهان ده برابر می‌شد.[4][7]

فرضیه ابعاد کم‌رتبه در هوش مصنوعی

فناوری LoRA این بن‌بست محاسباتی را با تکیه بر مفهومی بنیادین در شبکه‌های عصبی موسوم به «بُعد ذاتی» دور می‌زند. این نظریه مطرح می‌کند که هرچند یک مدل در ظاهر میلیاردها پارامتر دارد، اما تغییرات ریاضی واقعی که برای آموختن یک مهارت مشخص تازه لازم است، در فضایی بسیار کوچک‌تر و با ابعاد هندسی پایین‌تر رخ می‌دهد.[1][2]

بنابراین پژوهشگران به جای تغییر ماتریس غول‌پیکر وزن‌های اصلی (که آن را W می‌نامیم)، آن را کاملاً منجمد و دست‌نخورده نگه می‌دارند. سپس دو ماتریس به مراتب کوچک‌تر، موسوم به A و B، می‌سازند و در طول آموزش در کنار مدل پایه منجمد قرار می‌دهند.[4][5]

این ماتریس‌های کمکی «کم‌رتبه» (Low-Rank) هستند؛ به این معنا که تعداد سطرها و ستون‌های بنیادین آن‌ها نسبت به معماری اصلی ناچیز است. مهندسان با آموزش دادن صرفاً همین ماتریس‌های ریز، شمار متغیرهای آموزش‌پذیر را تا ۱۰ هزار برابر کاهش داده و حافظه مصرفی کارت گرافیک را تا یک‌سوم پایین می‌آورند.[1][2]

در راهنمای فنی سال ۲۰۲۵ شرکت IBM آمده است: «لورا به ما اجازه می‌دهد روی یک کارت گرافیک معمولی چیزی را آموزش دهیم که قبلاً به یک رک کامل سرور نیاز داشت.» این کاهش نیاز پردازشی، مسیر تنظیم دقیق مدل‌ها را برای پژوهشگران مستقل و استارتاپ‌های نوپا هموار کرد.[7]

خاصیت توزیع‌پذیری در جبر خطی این امکان را فراهم می‌کند که ماتریس‌های آموزش موقت برای همیشه با وزن‌های اصلی مدل جمع شوند.

ریاضیات ادغام مستقیم ماتریس‌ها

با این حال، دستاورد اصلی LoRA فقط نحوه آموزش ارزان نیست، بلکه شیوه به کارگیری نهایی آن است. اگر قرار بود در زمان اجرای مدل، شبکه پایه و ماتریس‌های A و B جداگانه فعال بمانند، محاسبات برای هر کلمه خروجی پیچیده‌تر و پرهزینه‌تر می‌شد.[4]

اینجاست که زیبایی جبر خطی خود را نشان می‌دهد. از آنجا که لایه‌های شبکه‌های عصبی بر پایه ضرب و جمع ماتریس‌ها کار می‌کنند، می‌توان معادلات را بر اساس اصول جبری بازآرایی کرد. خروجی هر لایه در واقع حاصل ضرب ورودی در وزن پایه، به اضافه حاصل ضرب ورودی در ماتریس‌های جدید است.[4][5]

به لطف ویژگی توزیع‌پذیری در جبر ماتریسی، توسعه‌دهندگان می‌توانند ماتریس A را در ماتریس B ضرب کنند تا ماتریسی جدید دقیقاً هم‌اندازه با ماتریس اصلی مدل پایه ساخته شود. سپس این ماتریس جدید را با یک جمع ساده به ماتریس منجمد پایه پیوند می‌زنند.[1][4]

نتیجه کار، یک ماتریس وزن واحد و یکدست است که هم دانش بنیادین پیشین و هم تخصص جدید را یکجا در بر دارد. آداپتورهای موقت عملاً از نظر محاسباتی ناپدید می‌شوند، چرا که وزن‌هایشان برای همیشه درون تاروپود مدل پایه جای گرفته است.[4][6]

حذف کامل جریمه تاخیر در استنتاج

این ادغام ساختاری دستاورد عملیاتی بسیار مهمی به همراه دارد: تاخیر محاسباتی استنتاج صفر می‌شود. چون ابعاد مدل حاصل از ادغام هیچ تفاوتی با مدل اولیه ندارد، شمار عملیات اعشاری مورد نیاز برای تولید متن با حالت دست‌نخورده اولیه برابر می‌ماند.[2][4]

روش‌های پیشین مانند لایه‌های آداپتور قدیمی داده‌ها را مجبور می‌کردند از مسیرهای عصبی اضافی عبور کنند. این امر چند میلی‌ثانیه تاخیر به ازای هر توکن متن تحمیل می‌کرد؛ جریمه زمانی کوچکی که در تولید متن‌های طولانی یا سرویس‌دهی همزمان به هزاران کاربر انباشته و تحمل‌ناپذیر می‌شد.[1][5]

برخلاف آداپتورهای سنتی، ادغام وزن‌های LoRA تاخیر استنتاج را در مرحله تولید متن کاملاً به صفر می‌رساند.

اما در رویکرد وزن‌های ادغام‌شده LoRA، این تاخیر به کلی محو می‌شود. یک ارائه‌دهنده سرویس ابری می‌تواند بر حسب درخواست کاربر، مدل‌های ادغام‌شده مختلف را در چند لحظه درون حافظه جابه‌جا کند و بدون نیاز به سخت‌افزارهای پیچیده مسیریابی، خدمات تخصصی پرسرعت ارائه دهد.[4][7]

تحلیل سال ۲۰۲۳ آزمایشگاه Lightning AI بر روی صدها آزمایش تنظیم دقیق، این مزیت عملیاتی را تایید کرد. مهندسان این مرکز نشان دادند که با وجود کاهش چشمگیر زمان آموزش و حافظه، سرعت بازدهی مدل‌ها در زمان استقرار دقیقاً هم‌پای مدل‌های دست‌نخورده باقی می‌ماند.[6]

گسترش مرزها با تکنیک کوانتایزاسیون

مهندسی این انطباق کم‌رتبه در سال ۲۰۲۳ با معرفی روش QLoRA در همایش بین‌المللی پردازش اطلاعات عصبی گامی فراتر رفت. این روش ادغام ماتریسی را با فشرده‌سازی حداکثری اعداد ترکیب کرد.[3]

پژوهشگران با کوانتایز کردن و فشرده‌سازی مدل پایه تا سطح ۴ بیت برای هر پارامتر (به جای فرمت‌های متداول ۱۶ یا ۳۲ بیتی)، حجم رم لازم برای بارگذاری اولیه مدل را به شدت کاهش دادند؛ سپس ماتریس‌های دقیق‌تر LoRA را برای جذب یادگیری جدید به آن افزودند.[3][6]

این ترکیب هوشمندانه شرایطی فراهم کرد تا یک مدل غول‌آسای ۶۵ میلیارد پارامتری روی یک کارت گرافیک ۴۸ گیگابایتی آموزش داده شود؛ کاری که تا پیش از آن ناممکن دانسته می‌شد. با پایان آموزش، آداپتورهای دقیق همچنان امکان ادغام با وزن‌های فشرده پایه را دارند.[3][6]

بده‌بستان‌های یادگیری با ماتریس‌های کم‌رتبه

با وجود این ظرافت ریاضی، این تکنیک در تمام سناریوها جایگزینی بی‌نقص برای تنظیم دقیق سراسری نیست. از آنجا که فضای پارامترهای آموزش‌پذیر عمداً محدود شده است، این ماتریس‌ها گنجایش محدودی در یادگیری حجم عظیمی از داده‌های بنیادین تازه یا زبان‌های کاملاً ناآشنا دارند.[5][8]

روش QLoRA با ترکیب انطباق کم‌رتبه و فشرده‌سازی ۴ بیتی، امکان آموزش مدل‌های بسیار بزرگ را روی یک کارت گرافیک معمولی فراهم می‌کند.

مقاله‌ای که در مه ۲۰۲۴ با عنوان «LoRA کمتر می‌آموزد و کمتر فراموش می‌کند» روی مخزن arXiv منتشر شد، این محدودیت را اثبات کرد. پژوهشگران دریافتند که انطباق کم‌رتبه در تغییر لحن، قالب نگارش یا سبک بی‌نظیر است، اما در مقایسه با تنظیم کامل، در به حافظه سپردن داده‌های خام کاملاً جدید توان ضعیف‌تری دارد.[8]

نویسندگان آن مقاله در تحلیل تطبیقی خود اشاره کردند: «مدل‌های آموزش‌دیده با لورا به دلیل تنظیم ساختاری قوی‌تر، کمتر دچار فراموشی فاجعه‌بار اطلاعات قبلی خود می‌شوند، اما زمانی که می‌خواهند حوزه‌های دانشی سراسر تازه را فرابگیرند، توانایی یادگیری‌شان بسیار زودتر به سقف می‌رسد.»[8]

این مرز فنی برای مهندسان هوش مصنوعی اهمیت راهبردی دارد: اگر هدف شما آموزش سبک نگارش لوایح حقوقی به مدل باشد، LoRA بهترین گزینه است. اما اگر قصد دارید کل مفاهیم یک علم تازه کشف‌شده را از پایه به مدل بیاموزید، تنظیم دقیق کامل همچنان گزینه‌ای اجتناب‌ناپذیر خواهد بود.[7][8]

آینده سیستم‌های ماژولار در هوش مصنوعی

با این حال، امکان آموزش ارزان و ادغام مستقیم ماتریس‌ها، رویکرد صنعت نرم‌افزار به هوش مصنوعی را به کلی تغییر داده است. صنعت دیگر بر مدل‌های یکپارچه و سنگین برای تمام کاربری‌ها تکیه نمی‌کند، بلکه به سمت مجموعه‌های وسیعی از آداپتورهای تخصصی خرد گرایش یافته است.[4][7]

از آنجا که ماتریس‌های تفکیک‌شده A و B حجمی بسیار ناچیز (اغلب در حد چند ده مگابایت) دارند، به‌راحتی روی بستر اینترنت جابه‌جا می‌شوند. کاربر می‌تواند مدل پایه را یک بار دانلود کند و سپس ده‌ها فایل سبک LoRA متناسب با نیازهای مختلف را روی آن بنشاند.[4][5]

از آنجا که ماتریس‌های تفکیک‌شده A و B حجمی بسیار ناچیز (اغلب در حد چند ده مگابایت) دارند، به‌راحتی روی بستر اینترنت جابه‌جا می‌شوند.

هنگامی که وظیفه خاصی مطرح می‌شود، سامانه می‌تواند در کسری از ثانیه آداپتور مربوطه را از طریق جمع ماتریسی با وزن‌های پایه ادغام کند، پردازش را با سرعت اصلی انجام دهد و در صورت نیاز با یک تفریق ساده، ماتریس‌ها را برای پذیرش تخصص بعدی تخلیه کند.[4][6]

این معماری تفکیک‌پذیر نویدبخش کاهش پیوسته هزینه‌های محاسباتی هوش مصنوعی در جهان است. تفکیک ماتریسی با جدا کردن فرایند پرهزینه آموزش دانش عمومی از فرآیند ارزان یادگیری مهارت‌های ویژه، صرفه اقتصادی استقرار هوش مصنوعی تخصصی را برای سال‌های آینده تضمین کرده است.[2][7]

این تحلیل چگونه انجام شد

روش
فرمول‌بندی‌های ریاضی روش انطباق کم‌رتبه از مقالات مبنایی و راهنماهای پیاده‌سازی گردآوری و تحلیل شدند تا هم‌ارزی محاسباتی دقیق میان مدل پایه و مدل ادغام‌شده در مرحله استنتاج استخراج شود.
یافته
تضمین ریاضی مبنی بر اینکه با وجود اضافه شدن میلیون‌ها پارامتر آموزش‌پذیر در مرحله تنظیم دقیق، حاصل‌جمع ماتریسی پس از آموزش مدلی تولید می‌کند که از نظر ابعاد و محاسبات پردازشی (FLOP) دقیقاً با مدل اصلی یکسان است و تقابل سنتی میان تخصصی‌سازی و سرعت استنتاج را حذف می‌کند.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • نسبت کاهش پارامترهای آموزش‌پذیر (۱۰,۰۰۰ برابر): 10,000x — Microsoft Research
  • میزان تاخیر استنتاج اضافه بعد از ادغام (۰ میلی‌ثانیه): 0 ms — Hugging Face
محدودیت‌های این تحلیل
این تحلیل هزینه‌های محاسباتی و تاخیر ماتریس‌های ادغام‌شده را ارزیابی می‌کند، اما نمی‌تواند افت احتمالی در یادگیری دانش خام کاملاً جدید را در مقایسه با تنظیم دقیق سراسری در تمام مجموعه‌داده‌ها به شکل مطلق اندازه‌گیری کند.

اصطلاحات کلیدی

LoRA
مخفف انطباق کم‌رتبه؛ شیوه‌ای که در آن وزن‌های مدل اصلی دست‌نخورده می‌مانند و فقط ماتریس‌های کمکی بسیار کوچک آموزش می‌بینند.
رتبه (Rank)
ویژگی ریاضی یک ماتریس که بعد واقعی اطلاعات آن را نشان می‌دهد؛ رتبه پایین‌تر یعنی سطرها و ستون‌های مستقل کمتری در ماتریس وجود دارند.
تجزیه ماتریسی
فرایند شکستن یک ماتریس پیچیده و بزرگ به دو یا چند ماتریس کوچک‌تر که ضرب آن‌ها مقدار ماتریس اولیه را تخمین می‌زند.
کوانتایزاسیون (Quantization)
روش فشرده‌سازی محاسباتی که دقت عددی وزن‌ها را در شبکه عصبی کاهش می‌دهد (مثلاً از ۱۶ بیت به ۴ بیت) تا حافظه کمتری اشغال شود.

پرسش‌های متداول

آیا می‌توان همزمان چند آداپتور LoRA را ادغام کرد؟

بله، امکان ادغام متوالی چند آداپتور درون یک مدل پایه وجود دارد؛ هرچند اگر آداپتورها روی توزیع داده‌های متناقض آموزش دیده باشند، ممکن است کیفیت پاسخ‌دهی افت کند.

آیا مدل LoRA ادغام‌شده به دقت یکسان با تنظیم کامل دست می‌یابد؟

همیشه این‌طور نیست. در تکالیف ناظر بر لحن، سبک و قالب‌بندی دقت یکسان است، اما پژوهش‌ها نشان می‌دهد در به‌خاطرسپاری حجم زیادی از فکت‌ها و داده‌های کاملاً جدید ضعیف‌تر از تنظیم سراسری عمل می‌کند.

آیا می‌توان وزن‌های LoRA را بعد از ادغام دوباره جدا کرد؟

بله؛ از آنجا که فرایند ادغام صرفاً یک جمع جبری ماتریسی است، با تفریق مستقیم همان ماتریس آداپتور از وزن‌های مدل، نسخه پایه اولیه دقیقاً بازیابی می‌شود.

بررسی عمیق دیدگاه‌ها

پژوهشگران بهره‌وری پردازش

معتقدند در دسترس قرار گرفتن منابع پردازشی از طریق کاهش پارامترها، لازمه بقا و پیشرفت هوش مصنوعی متن‌باز است.

پژوهشگران مدافع دسترسی آزاد، تجزیه ماتریسی را مهم‌ترین سد دفاعی در برابر انحصار شرکت‌های بزرگ فناوری می‌دانند. آن‌ها استدلال می‌کنند که با کاهش ۱۰ هزار برابری پارامترهای قابل آموزش بدون افت چشمگیر توانایی مدل، آزمایشگاه‌های مستقل دیگر برای توسعه هوش مصنوعی نیازی به دیتاسنترهای عظیم نخواهند داشت. امکان اجرای این فرایندها روی کارت‌های گرافیک مصرفی، ماهیت غیرمتمرکز توسعه هوش مصنوعی را حفظ می‌کند. افزون بر این، طرفداران این رویکرد به ابعاد زیست‌محیطی آن نیز اشاره می‌کنند. فرآیند سنتی تنظیم دقیق سراسری هفته‌ها زمان می‌برد و نیازمند صرف مقادیر هنگفتی انرژی برق در خوشه‌های پردازشی بود. کاهش چشمگیر بار پردازشی ردپای کربنی شخصی‌سازی مدل‌های زبانی را نیز به حداقل می‌رساند.

تامین‌کنندگان سخت‌افزار

بر چگونگی افزایش توان عملیاتی و بهره‌وری حافظه کارت‌های گرافیک در زیرساخت‌های سرور فعلی با تکیه بر وزن‌های ادغام‌شده تمرکز دارند.

برای ارائه‌دهندگان رایانش ابری و تولیدکنندگان زیرساخت، جذابیت اصلی لورا در تراکم بازدهی عملیاتی نهفته است. از آنجا که مدل‌های ادغام‌شده هیچ تاخیری حین استنتاج ندارند، شرکت‌ها می‌توانند همزمان به هزاران کاربر پاسخ دهند، بی‌آنکه مجبور به ارتقای خطوط ارتباطی حافظه یا استفاده از سیستم‌های مسیریابی گران‌قیمت شوند. به علاوه، حجم بسیار ناچیز فایل‌های تفکیک‌شده این امکان را به سرورها می‌دهد که افزونه‌های مهارتی مختلف را ظرف چند میلی‌ثانیه روی یک مدل پایه لود شده جابه‌جا کنند. بدین ترتیب یک کارت گرافیک می‌تواند همزمان ده‌ها تخصص کاری را پاسخگو باشد و نرخ بازگشت سرمایه سخت‌افزارها را به اوج برساند.

اصالت‌گرایان کیفیت مدل

تاکید دارند که ماتریس‌های کم‌رتبه ظرفیت محدودی برای ذخیره‌سازی داده‌های کاملاً جدید نسبت به به‌روزرسانی کامل وزن‌ها دارند.

گروهی از پژوهشگران که بالاترین استانداردهای کیفی را دنبال می‌کنند، هشدار می‌دهند که نباید به LoRA به عنوان راه‌حلی نهایی برای همه چالش‌ها نگاه کرد. بررسی‌های عملی نشان می‌دهد که ماتریس‌های کم‌رتبه اگرچه در آموختن لحن یا سبک نگارشی توانمندند، اما ظرفیت ریاضی لازم برای نگهداری مقادیر عظیمی از اطلاعات کاملاً تازه را ندارند. به باور این کارشناسان، زمانی که قرار است مدل زبانی با یک زبان کاملاً ناآشنا یا پایگاه‌داده بسیار وسیع و تخصصی شرکتی ادغام شود، بعد ذاتی مسئله آن‌قدر گسترده است که ماتریس‌های کوچک از پس آن برنمی‌آیند. در چنین شرایط پیچیده‌ای، به‌روزرسانی کل ۱۷۵ میلیارد پارامتر معماری همچنان تنها راه تضمین‌شده برای جلوگیری از توقف یادگیری یا خطای مدل است.

پژوهشگران بهره‌وری پردازش 40%تامین‌کنندگان سخت‌افزار 30%اصالت‌گرایان کیفیت مدل 30%
پژوهشگران بهره‌وری پردازش
معتقدند در دسترس قرار گرفتن منابع پردازشی از طریق کاهش پارامترها، لازمه بقا و پیشرفت هوش مصنوعی متن‌باز است.
تامین‌کنندگان سخت‌افزار
بر چگونگی افزایش توان عملیاتی و بهره‌وری حافظه کارت‌های گرافیک در زیرساخت‌های سرور فعلی با تکیه بر وزن‌های ادغام‌شده تمرکز دارند.
اصالت‌گرایان کیفیت مدل
تاکید دارند که ماتریس‌های کم‌رتبه ظرفیت محدودی برای ذخیره‌سازی داده‌های کاملاً جدید نسبت به به‌روزرسانی کامل وزن‌ها دارند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • مهندسان پیاده‌سازی و استقرار سازمانی
  • ارائه‌دهندگان میزبانی ابری

منابع

پوشش منابع

9 منبع

3 دیدگاه شناسایی‌شده

پژوهشگران بهره‌وری پردازش 40%تامین‌کنندگان سخت‌افزار 30%اصالت‌گرایان کیفیت مدل 30%
  1. [1]arXivاصالت‌گرایان کیفیت مدل

    LoRA: Low-Rank Adaptation of Large Language Models

    مطالعه در arXiv →
  2. [2]Microsoft Researchپژوهشگران بهره‌وری پردازش

    LoRA: Low-Rank Adaptation of Large Language Models

    مطالعه در Microsoft Research →
  3. [3]NeurIPS Proceedings

    QLoRA: Efficient Finetuning of Quantized LLMs

    مطالعه در NeurIPS Proceedings →
  4. [4]Hugging Faceپژوهشگران بهره‌وری پردازش

    LoRA

    مطالعه در Hugging Face →
  5. [5]Sebastian Raschkaاصالت‌گرایان کیفیت مدل

    Parameter-Efficient LLM Finetuning With Low-Rank Adaptation (LoRA)

    مطالعه در Sebastian Raschka →
  6. [6]Lightning AIپژوهشگران بهره‌وری پردازش

    Finetuning LLMs with LoRA and QLoRA: Insights from Hundreds of Experiments

    مطالعه در Lightning AI →
  7. [7]IBMتامین‌کنندگان سخت‌افزار

    What is LoRA (Low-Rank Adaption)?

    مطالعه در IBM →
  8. [8]arXivاصالت‌گرایان کیفیت مدل

    LoRA Learns Less and Forgets Less

    مطالعه در arXiv →
  9. [9]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.