رفتن به محتوای اصلی
توضیح کوهستانهوش مصنوعی سازمانیتوضیح و تشریح۲ شهریور ۱۴۰۵، ۱۷:۲۱· 6 دقیقه مطالعه· در هوش مصنوعی

اقتصاد لورا (LoRA): چگونه تنظیم دقیق با بهره‌وری پارامتر، هوش مصنوعی سازمانی را دموکراتیزه می‌کند

انطباق رتبه پایین (LoRA) به کسب‌وکارها این امکان را می‌دهد که مدل‌های زبان بزرگ را برای وظایف خاص سفارشی‌سازی کنند، تنها با به‌روزرسانی کسری از درصد پارامترها. این رویکرد بهره‌ور از نظر پارامتر، هزینه‌های تنظیم دقیق را به میزان قابل توجهی کاهش می‌دهد و هوش مصنوعی سفارشی را بدون نیاز به زیرساخت‌های محاسباتی عظیم، در دسترس قرار می‌دهد.

به قلم ندا وزیری

پذیرندگان هوش مصنوعی سازمانی 40%محققان یادگیری ماشین 35%حامیان متن‌باز 25%
پذیرندگان هوش مصنوعی سازمانی
تمرکز بر صرفه‌جویی در هزینه، حفظ حریم خصوصی داده‌ها و ماژولار بودن که لورا برای موارد استفاده داخلی کسب‌وکار فراهم می‌کند.
محققان یادگیری ماشین
تأکید بر ظرافت ریاضی تجزیه رتبه پایین و توانایی آن در جلوگیری از فراموشی فاجعه‌بار.
حامیان متن‌باز
تنظیم دقیق با بهره‌وری پارامتر را به عنوان نیرویی دموکراتیزه‌کننده می‌بینند که انحصار شرکت‌های بزرگ فناوری بر هوش مصنوعی سفارشی را می‌شکند.

در سال ۲۰۲۰، آموزش یک مدل زبان بزرگ برای درک اصطلاحات خاص یک مرکز درمانی یا یک شرکت حقوقی، به معنای به‌روزرسانی میلیاردها پارامتر بود. این فرآیند، که به عنوان تنظیم دقیق کامل (Full Fine-Tuning) شناخته می‌شود، نیازمند خوشه‌های عظیمی از واحدهای پردازش گرافیکی (GPU) تخصصی بود که هفته‌ها کار می‌کردند [۱]. هزینه بالای محاسبات – که اغلب به ده‌ها یا صدها هزار دلار برای هر آزمایش می‌رسید – بیشتر کسب‌وکارها را از بازار هوش مصنوعی سفارشی محروم می‌کرد. شرکت‌ها مجبور بودند بین مدل‌های عمومی و آماده‌ای که در مواجهه با اصطلاحات تخصصی دچار توهم می‌شدند، یا سیستم‌های سفارشی بسیار گران‌قیمت، یکی را انتخاب کنند.[1]

امروزه، اقتصاد هوش مصنوعی به دلیل تکنیکی به نام تنظیم دقیق با بهره‌وری پارامتر (PEFT) و به طور خاص روشی که به عنوان انطباق رتبه پایین یا لورا (LoRA) شناخته می‌شود، اساساً تغییر کرده است [۲]. لورا به جای اینکه مدل را با تغییر دادن تک تک وزن‌ها در شبکه عصبی‌اش به زور وادار به یادگیری کند، رویکردی جراحی‌گونه در پیش می‌گیرد. این روش مدل بنیادی عظیم و از پیش آموزش‌دیده را کاملاً دست‌نخورده باقی می‌گذارد و پارامترهای اصلی آن را ثابت می‌کند [۳].[2][3]

برای درک نحوه عملکرد این روش، تصور مدل بنیادی به عنوان یک کتابخانه وسیع و پیچیده از دانش عمومی بشر مفید است. تنظیم دقیق کامل شبیه بازنویسی هر کتاب در کتابخانه برای تغییر لحن متن است. در مقابل، لورا به سادگی یک پوشش نازک و شفاف را روی صفحات می‌لغزاند [۴]. این پوشش‌ها – که به صورت ریاضی به عنوان ماتریس‌های کوچک و قابل آموزش نمایش داده می‌شوند – خروجی‌های مدل را هنگام عبور داده‌ها تنظیم می‌کنند، بدون اینکه متن زیرین را تغییر دهند [۳].[3][4]

ترفند ریاضی که لورا را ممکن می‌سازد، بر مفهوم «رتبه ذاتی پایین» استوار است. محققان کشف کردند که اگرچه مدل‌های بنیادی حاوی میلیاردها پارامتر هستند، اما تنظیمات واقعی مورد نیاز برای تطبیق آن‌ها با یک وظیفه جدید خاص را می‌توان در یک فضای با ابعاد بسیار پایین‌تر نمایش داد [۲]. با تجزیه به‌روزرسانی‌های وزنی لازم به دو ماتریس کوچک‌تر، لورا بار محاسباتی را به شدت کاهش می‌دهد [۵].[2][5]

لورا تعداد پارامترهای قابل آموزش را تا ۱۰,۰۰۰ برابر در مقایسه با تنظیم دقیق کامل کاهش می‌دهد.

دستاوردهای بهره‌وری حاصل از این روش حیرت‌آور است. هنگامی که لورا روی یک مدل عظیم مانند GPT-3 با ۱۷۵ میلیارد پارامتر اعمال می‌شود، تعداد پارامترهای قابل آموزش را از ۱۷۵ میلیارد به تنها ۱۷ میلیون کاهش می‌دهد [۲]. این نشان‌دهنده کاهش ۱۰,۰۰۰ برابری در متغیرهایی است که کامپیوتر باید در طول فرآیند آموزش ردیابی و به‌روزرسانی کند [۲].[2]

برای بخش‌های فناوری اطلاعات سازمانی، این کاهش ریاضی مستقیماً به صرفه‌جویی در سخت‌افزار تبدیل می‌شود. از آنجا که مدل پایه ثابت شده است، سیستم دیگر نیازی به ذخیره به‌روزرسانی‌های گرادیان عظیم و وضعیت‌های بهینه‌ساز در حافظه فعال ندارد [۳]. کاری که زمانی برای تنظیم دقیق به یک قفسه پر از GPUهای سطح سازمانی نیاز داشت، اکنون می‌تواند روی یک کارت گرافیک سطح مصرف‌کننده رده بالا اجرا شود [۲].[2][3]

برای بخش‌های فناوری اطلاعات سازمانی، این کاهش ریاضی مستقیماً به صرفه‌جویی در سخت‌افزار تبدیل می‌شود.

فراتر از صرفه‌جویی فوری در هزینه‌های فاز آموزش، لورا یک معماری ماژولار معرفی می‌کند که یکی از بزرگترین مشکلات در استقرار هوش مصنوعی سازمانی را حل می‌کند: هزینه‌های میزبانی [۴]. در یک تنظیمات سنتی، اگر شرکتی یک مدل هوش مصنوعی برای پشتیبانی مشتری و دیگری برای نوشتن محتوای بازاریابی می‌خواست، باید دو مدل عظیم و مستقل را روی سرورهای خود میزبانی می‌کرد و هزینه زیرساخت خود را دو برابر می‌کرد [۱].[1][4]

با این حال، آداپتورهای لورا فوق‌العاده سبک هستند – اغلب تنها چند مگابایت حجم دارند، در مقایسه با ده‌ها گیگابایتی که برای مدل پایه لازم است [۲]. یک شرکت می‌تواند یک مدل بنیادی ثابت را در حافظه بارگذاری کند و سپس بسته به درخواست کاربر، آداپتورهای مختلف لورا را به صورت پویا تعویض کند [۳]. آداپتور پشتیبانی مشتری یک پرس‌وجو را مدیریت می‌کند و میلی‌ثانیه‌های بعد، آداپتور بازاریابی پرس‌وجوی بعدی را پردازش می‌کند، در حالی که همه از منابع محاسباتی اصلی یکسان استفاده می‌کنند [۴].[2][3][4]

از آنجا که آداپتورهای لورا سبک هستند، می‌توان چندین آداپتور تخصصی را به صورت پویا بر روی یک مدل پایه ثابت تعویض کرد.

این ماژولار بودن، باعث افزایش پذیرش سازمانی شده است، به ویژه در صنایع با مقررات سختگیرانه مانند مالی و مراقبت‌های بهداشتی [۵]. از آنجا که آموزش آداپتورهای لورا بسیار ارزان است، شرکت‌ها می‌توانند مدل‌ها را به طور کامل روی سخت‌افزار خصوصی و داخلی خود تنظیم دقیق کنند [۳]. این تضمین می‌کند که داده‌های اختصاصی حساس – مانند سوابق بیماران یا گزارش‌های مالی منتشر نشده – هرگز فایروال شرکتی را ترک نمی‌کنند تا به یک API ابری شخص ثالث برسند [۵].[3][5]

جامعه متن‌باز نیز این معماری را پذیرفته است و مخازن گسترده‌ای از آداپتورهای لورای از پیش آموزش‌دیده را برای همه چیز، از تولید سبک‌های هنری خاص در مدل‌های تصویری گرفته تا نوشتن کد در زبان‌های برنامه‌نویسی تخصصی، ایجاد کرده است [۲]. توسعه‌دهندگان می‌توانند این آداپتورها را دانلود کرده و روی هم قرار دهند؛ به عنوان مثال، ترکیب یک مدل پایه با یک لورای «کدنویسی» و یک لورای «ممیزی امنیتی» برای ایجاد یک عامل بسیار تخصصی در عرض چند دقیقه [۵].[2][5]

با وجود تأثیر تحول‌آفرین آن بر اقتصاد هوش مصنوعی، لورا یک راه‌حل جهانی برای هر چالش یادگیری ماشین نیست. این تکنیک در آموزش رفتارهای جدید، قوانین قالب‌بندی یا لحن‌های سبکی خاص به یک مدل بسیار مؤثر است [۱]. با این حال، محققان اشاره می‌کنند که در تزریق دانش واقعی کاملاً جدید به مدل، کارایی کمتری دارد [۲]. اگر یک مدل در طول آموزش اولیه خود هرگز یک پایگاه داده اختصاصی خاص را ندیده باشد، یک آداپتور لورا برای آموزش آن حقایق از ابتدا دچار مشکل خواهد شد.[1][2]

در حالی که لورا هزینه‌های آموزش را به شدت کاهش می‌دهد، استقرار مدل‌های تطبیق یافته همچنان به سخت‌افزار استنتاج (Inference) توانمند نیاز دارد.

علاوه بر این، در حالی که لورا هزینه فاز آموزش را به شدت کاهش می‌دهد، هزینه محاسباتی سنگین استنتاج (Inference) – فرآیند اجرای واقعی مدل برای تولید پاسخ‌ها – را حذف نمی‌کند [۳]. مدل پایه همچنان برای کار کردن به حافظه قابل توجهی نیاز دارد، به این معنی که شرکت‌ها همچنان باید در سخت‌افزار توانمند برای استقرار سرمایه‌گذاری کنند، حتی اگر فرآیند سفارشی‌سازی دموکراتیزه شده باشد [۴].[3][4]

از آنجا که صنعت هوش مصنوعی تمرکز خود را از ساخت مدل‌های عظیم و عمومی به استقرار عوامل تخصصی و وظیفه‌محور تغییر می‌دهد، تکنیک‌های بهره‌ور از نظر پارامتر در حال تبدیل شدن به استاندارد هستند [۵]. با جدا کردن هزینه سفارشی‌سازی از اندازه مدل، لورا تضمین کرده است که موج بعدی نوآوری هوش مصنوعی نه تنها توسط غول‌های فناوری با مزارع سرور عظیم، بلکه توسط هر کسب‌وکاری که مشکل خاصی برای حل کردن دارد، هدایت خواهد شد [۳].[3][5]

نکات کلیدی

  • لورا (انطباق رتبه پایین) به کسب‌وکارها اجازه می‌دهد تا مدل‌های هوش مصنوعی را بدون به‌روزرسانی کل شبکه عصبی سفارشی‌سازی کنند.
  • این تکنیک مدل پایه را ثابت می‌کند و ماتریس‌های کوچک و قابل آموزش را برای تنظیم رفتار مدل تزریق می‌کند.
  • لورا می‌تواند تعداد پارامترهای قابل آموزش را تا ۱۰,۰۰۰ برابر کاهش دهد و هزینه‌های محاسباتی را به شدت پایین بیاورد.
  • آداپتورهای سبک لورا را می‌توان به صورت پویا تعویض کرد و به یک مدل پایه اجازه داد تا چندین وظیفه تخصصی را انجام دهد.
  • کارایی لورا شرکت‌ها را قادر می‌سازد تا مدل‌ها را به صورت محلی تنظیم دقیق کنند و از داده‌های اختصاصی حساس محافظت نمایند.

چرا مهم است

تا همین اواخر، تطبیق یک مدل بنیادی برای درک داده‌های اختصاصی شرکت، نیازمند میلیون‌ها دلار هزینه محاسباتی بود. لورا این معادله را تغییر می‌دهد و به تیم‌های کوچک اجازه می‌دهد تا مدل‌های هوش مصنوعی خصوصی و بسیار تخصصی را روی سخت‌افزارهای سطح مصرف‌کننده بسازند، و انحصار شرکت‌های بزرگ فناوری بر هوش مصنوعی سفارشی را می‌شکند.

اصطلاحات کلیدی

تنظیم دقیق
فرآیند گرفتن یک مدل یادگیری ماشین از پیش آموزش‌دیده و آموزش بیشتر آن بر روی یک مجموعه داده کوچک‌تر و خاص برای تطبیق آن با یک وظیفه جدید.
فراموشی فاجعه‌بار
پدیده‌ای که در آن یک شبکه عصبی در هنگام یادگیری اطلاعات جدید در طول تنظیم دقیق کامل، اطلاعاتی را که قبلاً آموخته بود به طور کامل از دست می‌دهد.
مدل بنیادی
یک مدل هوش مصنوعی بزرگ و عمومی که بر روی حجم وسیعی از داده‌ها آموزش دیده و می‌تواند با طیف گسترده‌ای از وظایف بعدی تطبیق یابد.
استنتاج
فازی که در آن یک مدل یادگیری ماشین آموزش‌دیده به طور فعال برای پیش‌بینی یا تولید متن بر اساس ورودی‌های جدید کاربر استفاده می‌شود.
ماتریس رتبه پایین
یک آرایه فشرده شده ریاضی از اعداد که اطلاعات ضروری یک مجموعه داده یا به‌روزرسانی وزنی بسیار بزرگتر را ثبت می‌کند و در فضای محاسباتی صرفه‌جویی می‌کند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

پذیرندگان هوش مصنوعی سازمانی 40%محققان یادگیری ماشین 35%حامیان متن‌باز 25%
  1. [1]Wikipediaحامیان متن‌باز

    Fine-tuning (deep learning)

    مطالعه در Wikipedia
  2. [2]Hugging Faceمحققان یادگیری ماشین

    LoRA (Low-Rank Adaptation)

    مطالعه در Hugging Face
  3. [3]IBMپذیرندگان هوش مصنوعی سازمانی

    What is low-rank adaptation (LoRA)?

    مطالعه در IBM
  4. [4]Cloudflareپذیرندگان هوش مصنوعی سازمانی

    What is low-rank adaptation (LoRA)?

    مطالعه در Cloudflare
  5. [5]arXivمحققان یادگیری ماشین

    PrecAIse: A Domain-Adaptable Conversational Agent

    مطالعه در arXiv
  6. [6]تیم سردبیری کوهستانحامیان متن‌باز

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.