رفتن به محتوای اصلی
Koohestun
توضیح کوهستانتقطیر دانشگزارش تحلیلی· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه انتقال لاجیت به یک مدل کوچک دانش‌آموز اجازه می‌دهد تا با عملکرد مدل بزرگ معلم برابری کند

تقطیر دانش به مدل‌های عظیم هوش مصنوعی اجازه می‌دهد تا توانایی‌های استدلالی خود را به سیستم‌های بسیار کوچک‌تر و سریع‌تر منتقل کنند. مهندسان با آموزش مدل کوچک‌تر بر اساس احتمالات ریاضی خام مدل بزرگ‌تر، به جای تکیه بر پاسخ‌های نهایی، می‌توانند اندازه مدل را تا ۹۰ درصد فشرده کنند و در عین حال بیشتر عملکرد آن را حفظ نمایند.

به قلم اِلا فرجاد

مهندسان بهره‌وری 40%محققان پیشگام 35%حامیان متن‌باز 25%
مهندسان بهره‌وری
تمرکز بر استقرار عملی سیستم‌های هوش مصنوعی روی سخت‌افزارهای مصرفی و دستگاه‌های لبه (Edge devices).
محققان پیشگام
تمرکز بر محدودیت‌های نظری فشرده‌سازی مدل و مرزهای هوش مصنوعی.
حامیان متن‌باز
تقطیر را به عنوان راهی برای دموکراتیزه کردن دسترسی به هوش مصنوعی با قابلیت اجرای مدل‌ها روی سخت‌افزار مصرف‌کننده ارزشمند می‌دانند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار که درآمدشان به نیازهای محاسباتی عظیم وابسته است

نکات کلیدی

  • تقطیر دانش، مدل‌های عظیم هوش مصنوعی را با آموزش سیستم‌های کوچک‌تر برای تقلید از خروجی‌های ریاضی آن‌ها فشرده می‌کند.
  • مدل دانش‌آموز به جای یادگیری از پاسخ‌های صحیح، از لاجیت‌های معلم - امتیازات خام برای هر پاسخ ممکن - یاد می‌گیرد.
  • این تکنیک استدلال پنهان معلم را منتقل می‌کند، مانند دانستن اینکه کدام پاسخ‌های نادرست محتمل‌تر هستند.
  • یک پارامتر ریاضی به نام دما برای بزرگ‌نمایی این احتمالات ثانویه استفاده می‌شود تا دانش‌آموز بتواند آن‌ها را یاد بگیرد.
  • تقطیر به مدل‌هایی که تا ۹۰ درصد کوچک‌تر هستند اجازه می‌دهد تا بخش اعظم عملکرد سیستم اصلی را حفظ کنند.

فرض غالب در توسعه هوش مصنوعی این است که توانایی یک مدل کاملاً به تعداد پارامترهای آن بستگی دارد؛ یعنی یک سیستم ۷ میلیارد پارامتری هرگز نمی‌تواند به عمق استدلال یک غول ۷۰ میلیارد پارامتری برسد. اما ریاضیاتِ تقطیر دانش مستقیماً این فرض را نقض می‌کند. مهندسان با تغییر دادن آنچه مدل کوچک‌تر در حال یادگیری از آن است، می‌توانند یک شبکه عصبی عظیم را به کسری از اندازه اصلی‌اش فشرده کنند، در حالی که بخش اعظم عملکرد آن دست‌نخورده باقی می‌ماند.[1][2]

تکنیکی که این امر را ممکن می‌سازد، «انتقال لاجیت» (Logit transfer) نام دارد که اولین بار در یک مقاله برجسته در سال ۲۰۱۵ توسط محققان گوگل فرمول‌بندی شد. به جای آموزش یک مدل کوچک «دانش‌آموز» با مجموعه‌ای از پاسخ‌های صحیح، این مدل آموزش می‌بیند تا دقیقاً خروجی‌های ریاضی یک مدل عظیم و کاملاً آموزش‌دیده «معلم» را تقلید کند.[1]

برای درک نحوه کارکرد این مکانیسم، باید به نحوه تصمیم‌گیری یک شبکه عصبی نگاه کرد. وقتی یک مدل هوش مصنوعی ورودی‌ای را پردازش می‌کند - چه تشخیص تصویر یک سگ باشد و چه پیش‌بینی کلمه بعدی در یک جمله - صرفاً یک پاسخ صحیح واحد ارائه نمی‌دهد. در عوض، لایه نهایی آن فهرستی از امتیازات خام و نرمال‌نشده را برای هر پاسخ ممکن در دایره واژگانش تولید می‌کند. به این امتیازات خام، «لاجیت» (Logits) می‌گویند.[6]

در یک فرآیند آموزش استاندارد، این لاجیت‌ها از یک تابع ریاضی به نام لایه «سافت‌مکس» (Softmax) عبور می‌کنند که آن‌ها را به احتمالاتی تبدیل می‌کند که مجموعشان به ۱۰۰ درصد می‌رسد. سپس مدل بر اساس میزان فاصله بالاترین احتمال خود از پاسخ صحیح واقعی جریمه می‌شود؛ یک «هدف سخت» (Hard target) که برای پاسخ صحیح عدد ۱ و برای هر چیز دیگری عدد ۰ است.[2][4]

مدل دانش‌آموز با تطبیق توزیع کامل احتمال مدل معلم یاد می‌گیرد، نه صرفاً با تکیه بر پاسخ صحیح نهایی.

مشکل اهداف سخت این است که حجم عظیمی از اطلاعات را دور می‌ریزند. اگر به یک مدل تصویر یک خودروی بی‌ام‌و (BMW) نشان داده شود، هدف سخت تنها به آن می‌گوید که این تصویر یک بی‌ام‌و است. این هدف به مدل نمی‌گوید که تصویر کمی شبیه به یک آئودی است، شباهت بسیار اندکی به یک کامیون حمل زباله دارد و اصلاً شبیه به یک هویج نیست.[1][5]

با این حال، مدل معلم از قبل این روابط را یاد گرفته است. لاجیت‌های آن حاوی توزیع غنی از احتمالات در میان تمام دسته‌بندی‌های ممکن است. این «اهداف نرم» (Soft targets) فرآیند استدلال درونی معلم را آشکار می‌کنند؛ همان چیزی که محققان در سال ۲۰۱۵ آن را «دانش تاریک» نامیدند که شباهت‌های پنهان میان مفاهیم مختلف را نقشه‌برداری می‌کند.[1]

لاجیت‌های آن حاوی توزیع غنی از احتمالات در میان تمام دسته‌بندی‌های ممکن است.

انتقال لاجیت، مدل دانش‌آموز را مجبور می‌کند تا کل این توزیع را بازتولید کند. در طول آموزش، دانش‌آموز نه تنها به خاطر اشتباه در پاسخ نهایی جریمه می‌شود، بلکه به دلیل عدم تطابق با مقادیر دقیق لاجیت‌های معلم برای تک‌تک پاسخ‌های نادرست نیز جریمه خواهد شد.[3][6]

همان‌طور که در مستندات فنی شرکت IBM آمده است، تقطیر دانش «فرآیند انتقال دانش از یک مدل بزرگ و سنگین به یک مدل کوچک‌تر و کارآمدتر» است. با مجبور کردن دانش‌آموز به تطبیق با لاجیت‌های معلم، دانش‌آموز روابط میان نقاط داده را بسیار سریع‌تر از زمانی که بخواهد صرفاً داده‌های خام را مطالعه کند، یاد می‌گیرد.[5]

یکی از اجزای حیاتی این فرآیند، یک پارامتر ریاضی به نام «دما» (Temperature) است. وقتی مدل معلم پیش‌بینی می‌کند، اغلب بسیار مطمئن است و احتمال ۹۹.۹ درصد را به پاسخ صحیح و کسری میکروسکوپی از یک درصد را به گزینه‌های جایگزین اختصاص می‌دهد. این امر باعث می‌شود اهداف نرم تقریباً شبیه به اهداف سخت به نظر برسند و روابط ثانویه و ارزشمند پنهان بمانند.[1][4]

افزایش پارامتر دما منحنی احتمال را مسطح می‌کند و حدس‌های ثانویه معلم را برای دانش‌آموز قابل مشاهده می‌سازد.

مهندسان با افزایش مصنوعی دما در تابع سافت‌مکس در طول آموزش، توزیع احتمال را مجبور می‌کنند تا مسطح شود. یک اطمینان ۹۹.۹ درصدی ممکن است به ۸۰ درصد کاهش یابد، در حالی که احتمالات پاسخ‌های محتمل بعدی از ۰.۰۰۱ درصد به ۵ یا ۱۰ درصد افزایش می‌یابد. این بزرگ‌نمایی باعث می‌شود استدلال ثانویه معلم برای دانش‌آموز قابل مشاهده شود.[1][2]

تحقیقات اخیر این مکانیسم را بسط داده است. مقاله‌ای در سال ۲۰۲۴ در مورد استانداردسازی لاجیت نشان داد که پارامتر دما اساساً به عنوان یک تکنیک کاهش واریانس عمل می‌کند و از اتکای بیش از حد مدل دانش‌آموز به پیش‌بینی‌های با بالاترین سطح اطمینانِ معلم در دوره‌های اولیه آموزش جلوگیری می‌کند.[7][8]

دستاوردهای بهره‌وری حاصل از این فرآیند خیره‌کننده است. یک مدل دانش‌آموز اغلب می‌تواند با استفاده از کمتر از ۱۰ درصد پارامترها، به ۹۵ درصد از دقت معلم دست یابد. این کاهش به طور مستقیم به معنای نیاز به حافظه کمتر، سرعت استنتاج بالاتر و کاهش چشمگیر مصرف انرژی است.[2]

مدل‌های تقطیرشده اغلب می‌توانند بخش اعظم عملکرد معلم را حفظ کنند در حالی که تنها به کسری از توان محاسباتی نیاز دارند.

با این حال، انتقال لاجیت یک کپی‌برداری بی‌نقص نیست. مدل دانش‌آموز همچنان توسط معماری کوچک‌تر خود محدود می‌شود، به این معنی که نمی‌تواند به اندازه مدل عظیم معلم، موارد استثنایی نادر یا اطلاعات عمومی و جزئی را به خاطر بسپارد. این مدل الگوهای استدلال کلی معلم را یاد می‌گیرد، اما فاقد ظرفیت ذخیره‌سازی محض برای دانش جامع و همه‌جانبه است.[3][5]

در شرایطی که صنعت هوش مصنوعی به سمت مدل‌هایی با تریلیون‌ها پارامتر حرکت می‌کند، تقطیر دانش به پل ارتباطی اصلی میان تحقیقات پیشگامانه و استقرار عملی تبدیل شده است. مدل‌های عظیم الگوهای پیچیده را کشف می‌کنند و انتقال لاجیت آن اکتشافات را در اندازه‌ای بسته‌بندی می‌کند که در عمل قابل استفاده باشد.[8]

اصطلاحات کلیدی

لاجیت‌ها (Logits)
امتیازات ریاضی خام و نرمال‌نشده‌ای که توسط لایه نهایی یک شبکه عصبی پیش از تبدیل شدن به احتمالات تولید می‌شوند.
اهداف نرم (Soft Targets)
توزیع کامل احتمالات در میان تمام پاسخ‌های ممکن که حدس‌های ثانویه یک مدل را آشکار می‌کند.
اهداف سخت (Hard Targets)
پاسخ مطلقاً صحیح در یک مجموعه داده آموزشی که به صورت احتمال ۱۰۰ درصد برای یک گزینه و ۰ درصد برای سایر گزینه‌ها نشان داده می‌شود.
مقیاس‌بندی دما (Temperature Scaling)
یک تنظیم ریاضی که توزیع احتمال را مسطح می‌کند و تفاوت میان پاسخ‌های بسیار محتمل و بسیار نامحتمل را کاهش می‌دهد.

چرا مهم است

با رشد مدل‌های هوش مصنوعی و رسیدن آن‌ها به تریلیون‌ها پارامتر، اجرای آن‌ها به دیتاسنترهای عظیم و انرژی فوق‌العاده‌ای نیاز دارد. انتقال لاجیت این گلوگاه را برطرف می‌کند و اجازه می‌دهد هوش یک مدل در ابعاد ابررایانه، در سیستمی چنان کوچک فشرده شود که بتواند به صورت محلی و بدون نیاز به اینترنت روی یک گوشی هوشمند اجرا شود.

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

مهندسان بهره‌وری 40%محققان پیشگام 35%حامیان متن‌باز 25%
  1. [1]arXivمحققان پیشگام

    [1503.02531] Distilling the Knowledge in a Neural Network

    مطالعه در arXiv
  2. [2]MachineLearningMastery.comمهندسان بهره‌وری

    A Gentle Introduction to Model Distillation

    مطالعه در MachineLearningMastery.com
  3. [3]ResearchGateمحققان پیشگام

    Logit Distillation via Student Diversity

    مطالعه در ResearchGate
  4. [4]Data Annotation Companyمهندسان بهره‌وری

    Knowledge Distillation: Teacher-Student Loss Explained

    مطالعه در Data Annotation Company
  5. [5]IBMحامیان متن‌باز

    What is Knowledge distillation?

    مطالعه در IBM
  6. [6]arXivمحققان پیشگام

    A Closer Look at Knowledge Distillation with Features, Logits, and Gradients

    مطالعه در arXiv
  7. [7]arXivمحققان پیشگام

    Logit Standardization in Knowledge Distillation

    مطالعه در arXiv
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.