مکانیزم توجه ضرب داخلی مقیاسیافته در معماری ترانسفورمر چگونه وزن توکنهای ورودی را میسنجد؟
مکانیزم توجه ضرب داخلی مقیاسیافته به مدلهای هوش مصنوعی اجازه میدهد تا ارتباط هر کلمه در یک توالی را بهطور همزمان ارزیابی کنند. این معماری با تصویر کردن توکنها در بردارهای پرسوجو، کلید و ارزش و نرمالسازی واریانس آنها، از اشباع گرادیان در طول آموزش جلوگیری میکند.
به قلم ایمان شریعتی
این خبر را به اشتراک بگذارید
- خلوصگرایان ریاضیاتی
- به این مکانیزم صرفاً به عنوان یک الگوریتم مسیریابی ضرب ماتریسی بسیار بهینهشده نگاه میکنند.
- مهندسان کاربردی هوش مصنوعی
- بر توانایی این مکانیزم در مقیاسپذیری روی پردازندههای گرافیکی و مدیریت پنجرههای زمینه عظیم تمرکز دارند.
- مروجان آموزشی
- بر استعارههای بصری و مفهومی برای توضیح جبر خطی به مخاطبان گستردهتر تأکید میکنند.
دیدگاههایی که این گزارش پوشش نداده
- معماران سختافزاری که در حال طراحی سیلیکونهای سفارشی و بهینهشده برای نیازهای پهنای باند حافظه در مکانیزم توجه هستند.
- عصبشناسانی که مسیریابی ریاضیاتی توجه را با توجه شناختی بیولوژیکی واقعی مقایسه میکنند.
در ۱۲ ژوئن ۲۰۱۷، تیمی متشکل از هشت پژوهشگر در Google Brain و Google Research یک مقاله پیشچاپ ۱۵ صفحهای منتشر کردند که شبکههای عصبی بازگشتی را که در آن زمان بر ترجمه ماشینی تسلط داشتند، کنار گذاشت. نویسندگان نوشتند: «ما یک معماری شبکه ساده و جدید به نام ترانسفورمر پیشنهاد میکنیم که صرفاً بر پایه مکانیزمهای توجه بنا شده و بازگشت و پیچیدگی را کاملاً حذف میکند.» این معماری تماماً حول یک عملیات ریاضی به نام «توجه ضرب داخلی مقیاسیافته» ساخته شده بود؛ عملیاتی که با فراهم کردن امکان سنجش همزمان (و نه ترتیبی) میزان ارتباط هر کلمه در یک توالی، نحوه پردازش زبان توسط ماشینها را اساساً تغییر داد.[4]
قابلیت واقعی این مکانیزم اغلب در پسِ ادبیات بازاریابیِ انسانانگارانه پنهان میماند. وقتی شرکتهای هوش مصنوعی ادعا میکنند که مدلهایشان زمینه را «میفهمند»، اسناد را «میخوانند» یا درباره پرامپتهای پیچیده «استدلال» میکنند، در واقع در حال توصیف خروجیِ یک ضرب ماتریسیِ بهشدت موازیسازیشده هستند. مکانیزم توجه ضرب داخلی مقیاسیافته، صرفاً یک الگوریتم مسیریابی پیشرفته است. این الگوریتم دقیقاً محاسبه میکند که یک توکن خاص چقدر باید روی هر توکن دیگر در توالی ورودی تمرکز یا «توجه» داشته باشد، و در نهایت مجموعهای وزندار از بردارها را خروجی میدهد که روابط متنی میان کلمات را در بر میگیرد.[6]
برای اجرای این مسیریابی، معماری ترانسفورمر هر توکن ورودی را به سه بردار مجزا تصویر میکند: یک پرسوجو، یک کلید و یک ارزش. همانطور که در کالبدشکافیهای بصری این معماری به تفصیل آمده است، «پرسوجو» نشاندهنده چیزی است که توکن فعلی در بافتار پیرامون خود به دنبال آن میگردد، «کلید» نشاندهنده چیزی است که یک توکن در خود دارد یا به توکنهای دیگر ارائه میدهد، و «ارزش» دربردارنده محتوای معنایی واقعی است. این مکانیزم برای ایجاد رابطه میان آنها، ضرب داخلیِ بین پرسوجوی توکن فعلی و کلیدهای تمام توکنهای موجود در توالی را محاسبه میکند.[5]
این ضرب داخلی یک امتیاز خام به دست میدهد که نشاندهنده همراستایی ریاضیاتی بین دو توکن است. یک امتیاز مثبت بالا نشاندهنده ارتباط قوی است، در حالی که یک امتیاز منفی نشان میدهد توکنها نامرتبط هستند. با این حال، هرچه ابعاد جاسازی بزرگتر میشود، این ضربهای داخلی خام میتوانند بهشدت بزرگ شوند. در معماری اولیه سال ۲۰۱۷، پژوهشگران از بُعد کلید ۶۴ استفاده کردند. اگر این ضربهای داخلی مقیاسبندی نشوند، بردارهای ۶۴-بعدی (با فرض اینکه بردارهای اولیه از توزیعهای مستقل با میانگین صفر و واریانس یک استخراج شده باشند) واریانسی برابر با ۶۴ از خود نشان خواهند داد.[1][4]
این ضرب داخلی یک امتیاز خام به دست میدهد که نشاندهنده همراستایی ریاضیاتی بین دو توکن است.
این واریانس یک مشکل مکانیکی جدی در مرحله آموزش ایجاد میکند. امتیازات خام از یک تابع سافتمکس عبور داده میشوند تا به یک توزیع احتمال تبدیل شوند، جایی که مجموع تمام وزنها دقیقاً برابر با یک میشود. اگر مقادیر ورودی به سافتمکس بیش از حد بزرگ باشند، این تابع به سمت نواحی بهشدت مسطح خود رانده میشود. در این نواحی، گرادیانها — همان سیگنالهای ریاضیاتی حیاتی که برای بهروزرسانی وزنهای مدل در طول پسانتشار استفاده میشوند — به صفر نزدیک شده و عملاً فرآیند یادگیری را متوقف کرده و از بهبود شبکه جلوگیری میکنند.[2][3]
راهحلی که نام کامل این مکانیزم نیز از آن گرفته شده، عامل «مقیاسبندی» است. پیش از اعمال تابع سافتمکس، معماری ترانسفورمر ضرب داخلی خام را بر جذرِ بُعد کلید تقسیم میکند. برای بُعد ۶۴، این مقسومعلیه دقیقاً ۸ است. این نرمالسازی ریاضیاتی، واریانس را دوباره به ۱ فشرده میکند و تضمین میکند که تابع سافتمکس در ناحیه میانی و حساس خود عمل کند؛ جایی که گرادیانها آزادانه جریان دارند و مدل میتواند وزنهای توجه بهینه را برای هر توالیِ دادهشده بهطور کارآمدی یاد بگیرد.[4]
پس از آنکه امتیازات نرمالسازی شده و به احتمالات تبدیل شدند، در بردارهای «ارزش» ضرب میشوند. نتیجه کار، یک بازنمایی جدید و زمینهآگاه از توکن اصلی است. اگر کلمه «بانک» در کنار «رودخانه» ظاهر شود، مکانیزم توجه وزنهای بالایی را به توکنهای مرتبط با آب اختصاص میدهد و ارزشهای آنها را به درون بازنمایی «بانک» میکشد. اما اگر همین کلمه در کنار «سپرده» بیاید، توکنهای مالی بر این جمع وزندار غالب میشوند و اجازه میدهند دقیقاً همان کلمه، صرفاً بر اساس بافتار ریاضیاتی پیرامونش، بهگونهای متفاوت پردازش شود.[5]
مقاله سال ۲۰۱۷ این مکانیزم را تنها یک بار در هر لایه اعمال نکرد؛ بلکه مفهوم توجه «چند-سَری» را معرفی کرد. با تقسیم جاسازی ۵۱۲-بعدی به هشت سَرِ ۶۴-بعدی موازی، مدل میتواند بهطور همزمان به زیرفضاهای بازنمایی متفاوتی توجه کند. یک سَر ممکن است توافقهای دستوری فاعل و فعل را ردیابی کند، در حالی که سَر دیگر روابط معنایی یا نزدیکی موقعیتی را زیر نظر دارد؛ و همه اینها بدون افزایش پیچیدگی محاسباتی کلی در مقایسه با یک مکانیزم تک-سَری که روی بُعد کامل عمل میکند، انجام میشود. همین موازیسازی است که به ترانسفورمرهای مدرن اجازه میدهد پیچیدگی عظیم زبان انسان را در یک گذرِ روبهجلوی واحد ثبت کنند.[3][4]
با وجود مقیاس عظیم مدلهای زبانی بزرگ امروزی، دقیقاً همین عملیات ضرب داخلی مقیاسیافته است که همچنان موتور محاسباتیِ زیر کاپوت آنها باقی مانده است. در حالی که شرکتها از قابلیتهای جدید، یکپارچهسازیهای چندوجهی و رفتارهای نوظهور پرده برمیدارند، ریاضیات بنیادینِ وزندهی به توکنها از سال ۲۰۱۷ تاکنون تغییری نکرده است. صنعت هوش مصنوعی صرفاً ابعاد ماتریسها را مقیاس داده، پنجرههای زمینه را بزرگتر کرده و خوشههای سختافزاری عظیمی را مستقر کرده است که برای ضرب کردن آنها در مقیاسی بیسابقه مورد نیازند. نوآوری هستهای که به رونق امروزِ هوش مصنوعی مولد قدرت میبخشد، هنوز هم فقط یک ترفند هوشمندانه برای جلوگیری از محو شدن گرادیانها در طول ضرب ماتریسی است.[6]
چرا مهم است
درک مکانیزم توجه ضرب داخلی مقیاسیافته، هیاهوی تبلیغاتی پیرامون هوش مصنوعی را کنار میزند و مسیریابی دقیق ریاضیاتی را آشکار میکند که به مدلهای زبانی مدرن اجازه میدهد تا زمینه و بافتار را پردازش کنند.
نکات کلیدی
- مکانیزم توجه ضرب داخلی مقیاسیافته در مقاله سال ۲۰۱۷ با عنوان «توجه تمام چیزی است که نیاز دارید» معرفی شد.
- این مکانیزم توکنهای ورودی را به بردارهای پرسوجو، کلید و ارزش تصویر میکند تا ارتباط متنی را تعیین کند.
- ضربهای داخلی خام بر جذر بُعد کلید تقسیم میشوند تا از اشباع گرادیان جلوگیری شود.
- این مقیاسبندی تضمین میکند که تابع سافتمکس در ناحیهای عمل کند که سیگنالهای یادگیری بتوانند جریان یابند.
- توجه چند-سری بُعد جاسازی را تقسیم میکند تا چندین رابطه را بهطور همزمان ردیابی کند.
بررسی عمیق دیدگاهها
پژوهشگران یادگیری ماشین
بر ظرافت ریاضیاتی و قابلیت موازیسازی معماری تمرکز دارند.
برای پژوهشگران، پیشرفت اصلی توجه ضرب داخلی مقیاسیافته، توانایی آن در پردازش همزمان کل توالیها بود. برخلاف شبکههای عصبی بازگشتی که مجبور بودند توکنها را بهصورت ترتیبی بخوانند و از گلوگاهها رنج میبردند، مکانیزم توجه بر ضربهای ماتریسی بسیار بهینهشدهای تکیه دارد که روی پردازندههای گرافیکی مدرن بهطور کارآمد اجرا میشوند. عامل مقیاسبندی بهطور خاص مشکل محو شدن گرادیان را که تلاشهای اولیه در شبکههای توجه عمیق را با مشکل مواجه کرده بود، حل کرد.
فروشندگان تجاری هوش مصنوعی
خروجیهای این مکانیزم را به جای عملیات ریاضی، به عنوان قابلیتهای شناختی چارچوببندی میکنند.
فروشندگان تجاری اغلب جبر خطی مکانیزم توجه را پنهان کرده و آگاهی متنیِ حاصل از آن را با عباراتی انسانانگارانه توصیف میکنند. در محتواهای بازاریابی مکرراً ادعا میشود که مدلها ظرافتها را «میفهمند» یا درباره اسناد «استدلال» میکنند. در واقعیت، این قابلیتها نتیجه مستقیم عملیات ضرب داخلی مقیاسیافته است که وزنهای احتمالی بالاتری را به توکنهای مرتبط معنایی در سراسر یک پنجره زمینه عظیم اختصاص میدهد.
منابع
[1]Dive into Deep Learningخلوصگرایان ریاضیاتی11. Attention Mechanisms and Transformers
مطالعه در Dive into Deep Learning →
[2]MachineLearningMastery.comخلوصگرایان ریاضیاتیThe Transformer Attention Mechanism
مطالعه در MachineLearningMastery.com →
[3]Dive into Deep Learningخلوصگرایان ریاضیاتی11.7. The Transformer Architecture — Dive into Deep Learning 1.0.3 documentation
مطالعه در Dive into Deep Learning →
[4]arXivخلوصگرایان ریاضیاتیAttention Is All You Need
مطالعه در arXiv →
[5]Jay Alammarمروجان آموزشیThe Illustrated Transformer
مطالعه در Jay Alammar →
[6]تیم سردبیری کوهستانمروجان آموزشیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.


