چگونه انتقال لاجیت به یک مدل کوچک دانشآموز اجازه میدهد تا با عملکرد مدل بزرگ معلم برابری کند
تقطیر دانش به مدلهای عظیم هوش مصنوعی اجازه میدهد تا تواناییهای استدلالی خود را به سیستمهای بسیار کوچکتر و سریعتر منتقل کنند. مهندسان با آموزش مدل کوچکتر بر اساس احتمالات ریاضی خام مدل بزرگتر، به جای تکیه بر پاسخهای نهایی، میتوانند اندازه مدل را تا ۹۰ درصد فشرده کنند و در عین حال بیشتر عملکرد آن را حفظ نمایند.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- مهندسان بهرهوری
- تمرکز بر استقرار عملی سیستمهای هوش مصنوعی روی سختافزارهای مصرفی و دستگاههای لبه (Edge devices).
- محققان پیشگام
- تمرکز بر محدودیتهای نظری فشردهسازی مدل و مرزهای هوش مصنوعی.
- حامیان متنباز
- تقطیر را به عنوان راهی برای دموکراتیزه کردن دسترسی به هوش مصنوعی با قابلیت اجرای مدلها روی سختافزار مصرفکننده ارزشمند میدانند.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار که درآمدشان به نیازهای محاسباتی عظیم وابسته است
نکات کلیدی
- تقطیر دانش، مدلهای عظیم هوش مصنوعی را با آموزش سیستمهای کوچکتر برای تقلید از خروجیهای ریاضی آنها فشرده میکند.
- مدل دانشآموز به جای یادگیری از پاسخهای صحیح، از لاجیتهای معلم - امتیازات خام برای هر پاسخ ممکن - یاد میگیرد.
- این تکنیک استدلال پنهان معلم را منتقل میکند، مانند دانستن اینکه کدام پاسخهای نادرست محتملتر هستند.
- یک پارامتر ریاضی به نام دما برای بزرگنمایی این احتمالات ثانویه استفاده میشود تا دانشآموز بتواند آنها را یاد بگیرد.
- تقطیر به مدلهایی که تا ۹۰ درصد کوچکتر هستند اجازه میدهد تا بخش اعظم عملکرد سیستم اصلی را حفظ کنند.
فرض غالب در توسعه هوش مصنوعی این است که توانایی یک مدل کاملاً به تعداد پارامترهای آن بستگی دارد؛ یعنی یک سیستم ۷ میلیارد پارامتری هرگز نمیتواند به عمق استدلال یک غول ۷۰ میلیارد پارامتری برسد. اما ریاضیاتِ تقطیر دانش مستقیماً این فرض را نقض میکند. مهندسان با تغییر دادن آنچه مدل کوچکتر در حال یادگیری از آن است، میتوانند یک شبکه عصبی عظیم را به کسری از اندازه اصلیاش فشرده کنند، در حالی که بخش اعظم عملکرد آن دستنخورده باقی میماند.[1][2]
تکنیکی که این امر را ممکن میسازد، «انتقال لاجیت» (Logit transfer) نام دارد که اولین بار در یک مقاله برجسته در سال ۲۰۱۵ توسط محققان گوگل فرمولبندی شد. به جای آموزش یک مدل کوچک «دانشآموز» با مجموعهای از پاسخهای صحیح، این مدل آموزش میبیند تا دقیقاً خروجیهای ریاضی یک مدل عظیم و کاملاً آموزشدیده «معلم» را تقلید کند.[1]
برای درک نحوه کارکرد این مکانیسم، باید به نحوه تصمیمگیری یک شبکه عصبی نگاه کرد. وقتی یک مدل هوش مصنوعی ورودیای را پردازش میکند - چه تشخیص تصویر یک سگ باشد و چه پیشبینی کلمه بعدی در یک جمله - صرفاً یک پاسخ صحیح واحد ارائه نمیدهد. در عوض، لایه نهایی آن فهرستی از امتیازات خام و نرمالنشده را برای هر پاسخ ممکن در دایره واژگانش تولید میکند. به این امتیازات خام، «لاجیت» (Logits) میگویند.[6]
در یک فرآیند آموزش استاندارد، این لاجیتها از یک تابع ریاضی به نام لایه «سافتمکس» (Softmax) عبور میکنند که آنها را به احتمالاتی تبدیل میکند که مجموعشان به ۱۰۰ درصد میرسد. سپس مدل بر اساس میزان فاصله بالاترین احتمال خود از پاسخ صحیح واقعی جریمه میشود؛ یک «هدف سخت» (Hard target) که برای پاسخ صحیح عدد ۱ و برای هر چیز دیگری عدد ۰ است.[2][4]
مشکل اهداف سخت این است که حجم عظیمی از اطلاعات را دور میریزند. اگر به یک مدل تصویر یک خودروی بیامو (BMW) نشان داده شود، هدف سخت تنها به آن میگوید که این تصویر یک بیامو است. این هدف به مدل نمیگوید که تصویر کمی شبیه به یک آئودی است، شباهت بسیار اندکی به یک کامیون حمل زباله دارد و اصلاً شبیه به یک هویج نیست.[1][5]
با این حال، مدل معلم از قبل این روابط را یاد گرفته است. لاجیتهای آن حاوی توزیع غنی از احتمالات در میان تمام دستهبندیهای ممکن است. این «اهداف نرم» (Soft targets) فرآیند استدلال درونی معلم را آشکار میکنند؛ همان چیزی که محققان در سال ۲۰۱۵ آن را «دانش تاریک» نامیدند که شباهتهای پنهان میان مفاهیم مختلف را نقشهبرداری میکند.[1]
لاجیتهای آن حاوی توزیع غنی از احتمالات در میان تمام دستهبندیهای ممکن است.
انتقال لاجیت، مدل دانشآموز را مجبور میکند تا کل این توزیع را بازتولید کند. در طول آموزش، دانشآموز نه تنها به خاطر اشتباه در پاسخ نهایی جریمه میشود، بلکه به دلیل عدم تطابق با مقادیر دقیق لاجیتهای معلم برای تکتک پاسخهای نادرست نیز جریمه خواهد شد.[3][6]
همانطور که در مستندات فنی شرکت IBM آمده است، تقطیر دانش «فرآیند انتقال دانش از یک مدل بزرگ و سنگین به یک مدل کوچکتر و کارآمدتر» است. با مجبور کردن دانشآموز به تطبیق با لاجیتهای معلم، دانشآموز روابط میان نقاط داده را بسیار سریعتر از زمانی که بخواهد صرفاً دادههای خام را مطالعه کند، یاد میگیرد.[5]
یکی از اجزای حیاتی این فرآیند، یک پارامتر ریاضی به نام «دما» (Temperature) است. وقتی مدل معلم پیشبینی میکند، اغلب بسیار مطمئن است و احتمال ۹۹.۹ درصد را به پاسخ صحیح و کسری میکروسکوپی از یک درصد را به گزینههای جایگزین اختصاص میدهد. این امر باعث میشود اهداف نرم تقریباً شبیه به اهداف سخت به نظر برسند و روابط ثانویه و ارزشمند پنهان بمانند.[1][4]
مهندسان با افزایش مصنوعی دما در تابع سافتمکس در طول آموزش، توزیع احتمال را مجبور میکنند تا مسطح شود. یک اطمینان ۹۹.۹ درصدی ممکن است به ۸۰ درصد کاهش یابد، در حالی که احتمالات پاسخهای محتمل بعدی از ۰.۰۰۱ درصد به ۵ یا ۱۰ درصد افزایش مییابد. این بزرگنمایی باعث میشود استدلال ثانویه معلم برای دانشآموز قابل مشاهده شود.[1][2]
تحقیقات اخیر این مکانیسم را بسط داده است. مقالهای در سال ۲۰۲۴ در مورد استانداردسازی لاجیت نشان داد که پارامتر دما اساساً به عنوان یک تکنیک کاهش واریانس عمل میکند و از اتکای بیش از حد مدل دانشآموز به پیشبینیهای با بالاترین سطح اطمینانِ معلم در دورههای اولیه آموزش جلوگیری میکند.[7][8]
دستاوردهای بهرهوری حاصل از این فرآیند خیرهکننده است. یک مدل دانشآموز اغلب میتواند با استفاده از کمتر از ۱۰ درصد پارامترها، به ۹۵ درصد از دقت معلم دست یابد. این کاهش به طور مستقیم به معنای نیاز به حافظه کمتر، سرعت استنتاج بالاتر و کاهش چشمگیر مصرف انرژی است.[2]
با این حال، انتقال لاجیت یک کپیبرداری بینقص نیست. مدل دانشآموز همچنان توسط معماری کوچکتر خود محدود میشود، به این معنی که نمیتواند به اندازه مدل عظیم معلم، موارد استثنایی نادر یا اطلاعات عمومی و جزئی را به خاطر بسپارد. این مدل الگوهای استدلال کلی معلم را یاد میگیرد، اما فاقد ظرفیت ذخیرهسازی محض برای دانش جامع و همهجانبه است.[3][5]
در شرایطی که صنعت هوش مصنوعی به سمت مدلهایی با تریلیونها پارامتر حرکت میکند، تقطیر دانش به پل ارتباطی اصلی میان تحقیقات پیشگامانه و استقرار عملی تبدیل شده است. مدلهای عظیم الگوهای پیچیده را کشف میکنند و انتقال لاجیت آن اکتشافات را در اندازهای بستهبندی میکند که در عمل قابل استفاده باشد.[8]
اصطلاحات کلیدی
- لاجیتها (Logits)
- امتیازات ریاضی خام و نرمالنشدهای که توسط لایه نهایی یک شبکه عصبی پیش از تبدیل شدن به احتمالات تولید میشوند.
- اهداف نرم (Soft Targets)
- توزیع کامل احتمالات در میان تمام پاسخهای ممکن که حدسهای ثانویه یک مدل را آشکار میکند.
- اهداف سخت (Hard Targets)
- پاسخ مطلقاً صحیح در یک مجموعه داده آموزشی که به صورت احتمال ۱۰۰ درصد برای یک گزینه و ۰ درصد برای سایر گزینهها نشان داده میشود.
- مقیاسبندی دما (Temperature Scaling)
- یک تنظیم ریاضی که توزیع احتمال را مسطح میکند و تفاوت میان پاسخهای بسیار محتمل و بسیار نامحتمل را کاهش میدهد.
چرا مهم است
با رشد مدلهای هوش مصنوعی و رسیدن آنها به تریلیونها پارامتر، اجرای آنها به دیتاسنترهای عظیم و انرژی فوقالعادهای نیاز دارد. انتقال لاجیت این گلوگاه را برطرف میکند و اجازه میدهد هوش یک مدل در ابعاد ابررایانه، در سیستمی چنان کوچک فشرده شود که بتواند به صورت محلی و بدون نیاز به اینترنت روی یک گوشی هوشمند اجرا شود.
منابع
[1]arXivمحققان پیشگام[1503.02531] Distilling the Knowledge in a Neural Network
مطالعه در arXiv →
[2]MachineLearningMastery.comمهندسان بهرهوریA Gentle Introduction to Model Distillation
مطالعه در MachineLearningMastery.com →
[3]ResearchGateمحققان پیشگامLogit Distillation via Student Diversity
مطالعه در ResearchGate →
[4]Data Annotation Companyمهندسان بهرهوریKnowledge Distillation: Teacher-Student Loss Explained
مطالعه در Data Annotation Company →
[5]IBMحامیان متنبازWhat is Knowledge distillation?
مطالعه در IBM →
[6]arXivمحققان پیشگامA Closer Look at Knowledge Distillation with Features, Logits, and Gradients
مطالعه در arXiv →
[7]arXivمحققان پیشگامLogit Standardization in Knowledge Distillation
مطالعه در arXiv →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →سیستمهای چندعاملی
چگونه یالهای شرطی تصمیمگیریها را در جریانهای کاری هوش مصنوعی چندعاملی هدایت میکنند
7 منبع
هوش مصنوعی قانوناساسیمحور
چگونه هوش مصنوعی قانوناساسیمحور، یک کتابچه قوانین مکتوب را جایگزین بازخورد انسانی میکند
4 منبع
اتوماسیون وب
چگونه ایجنتهای هوش مصنوعی مدل شیء دسترسیپذیری را به وبگردی خودکار تبدیل میکنند
6 منبع
قانون هوش مصنوعی اتحادیه اروپا
اتحادیه اروپا مهلت انطباق با مقررات پرخطر قانون هوش مصنوعی را ۱۶ ماه به تعویق انداخت
4 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





