رفتن به محتوای اصلی
Koohestun
توضیح کوهستانمکانیزم توجهگزارش تحلیلی· 5 دقیقه مطالعه· در متا

مکانیزم توجه ضرب داخلی مقیاس‌یافته در معماری ترانسفورمر چگونه وزن توکن‌های ورودی را می‌سنجد؟

مکانیزم توجه ضرب داخلی مقیاس‌یافته به مدل‌های هوش مصنوعی اجازه می‌دهد تا ارتباط هر کلمه در یک توالی را به‌طور همزمان ارزیابی کنند. این معماری با تصویر کردن توکن‌ها در بردارهای پرس‌وجو، کلید و ارزش و نرمال‌سازی واریانس آن‌ها، از اشباع گرادیان در طول آموزش جلوگیری می‌کند.

به قلم ایمان شریعتی

خلوص‌گرایان ریاضیاتی 50%مهندسان کاربردی هوش مصنوعی 30%مروجان آموزشی 20%
خلوص‌گرایان ریاضیاتی
به این مکانیزم صرفاً به عنوان یک الگوریتم مسیریابی ضرب ماتریسی بسیار بهینه‌شده نگاه می‌کنند.
مهندسان کاربردی هوش مصنوعی
بر توانایی این مکانیزم در مقیاس‌پذیری روی پردازنده‌های گرافیکی و مدیریت پنجره‌های زمینه عظیم تمرکز دارند.
مروجان آموزشی
بر استعاره‌های بصری و مفهومی برای توضیح جبر خطی به مخاطبان گسترده‌تر تأکید می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • معماران سخت‌افزاری که در حال طراحی سیلیکون‌های سفارشی و بهینه‌شده برای نیازهای پهنای باند حافظه در مکانیزم توجه هستند.
  • عصب‌شناسانی که مسیریابی ریاضیاتی توجه را با توجه شناختی بیولوژیکی واقعی مقایسه می‌کنند.

در ۱۲ ژوئن ۲۰۱۷، تیمی متشکل از هشت پژوهشگر در Google Brain و Google Research یک مقاله پیش‌چاپ ۱۵ صفحه‌ای منتشر کردند که شبکه‌های عصبی بازگشتی را که در آن زمان بر ترجمه ماشینی تسلط داشتند، کنار گذاشت. نویسندگان نوشتند: «ما یک معماری شبکه ساده و جدید به نام ترانسفورمر پیشنهاد می‌کنیم که صرفاً بر پایه مکانیزم‌های توجه بنا شده و بازگشت و پیچیدگی را کاملاً حذف می‌کند.» این معماری تماماً حول یک عملیات ریاضی به نام «توجه ضرب داخلی مقیاس‌یافته» ساخته شده بود؛ عملیاتی که با فراهم کردن امکان سنجش همزمان (و نه ترتیبی) میزان ارتباط هر کلمه در یک توالی، نحوه پردازش زبان توسط ماشین‌ها را اساساً تغییر داد.[4]

قابلیت واقعی این مکانیزم اغلب در پسِ ادبیات بازاریابیِ انسان‌انگارانه پنهان می‌ماند. وقتی شرکت‌های هوش مصنوعی ادعا می‌کنند که مدل‌هایشان زمینه را «می‌فهمند»، اسناد را «می‌خوانند» یا درباره پرامپت‌های پیچیده «استدلال» می‌کنند، در واقع در حال توصیف خروجیِ یک ضرب ماتریسیِ به‌شدت موازی‌سازی‌شده هستند. مکانیزم توجه ضرب داخلی مقیاس‌یافته، صرفاً یک الگوریتم مسیریابی پیشرفته است. این الگوریتم دقیقاً محاسبه می‌کند که یک توکن خاص چقدر باید روی هر توکن دیگر در توالی ورودی تمرکز یا «توجه» داشته باشد، و در نهایت مجموعه‌ای وزن‌دار از بردارها را خروجی می‌دهد که روابط متنی میان کلمات را در بر می‌گیرد.[6]

برای اجرای این مسیریابی، معماری ترانسفورمر هر توکن ورودی را به سه بردار مجزا تصویر می‌کند: یک پرس‌وجو، یک کلید و یک ارزش. همان‌طور که در کالبدشکافی‌های بصری این معماری به تفصیل آمده است، «پرس‌وجو» نشان‌دهنده چیزی است که توکن فعلی در بافتار پیرامون خود به دنبال آن می‌گردد، «کلید» نشان‌دهنده چیزی است که یک توکن در خود دارد یا به توکن‌های دیگر ارائه می‌دهد، و «ارزش» دربردارنده محتوای معنایی واقعی است. این مکانیزم برای ایجاد رابطه میان آن‌ها، ضرب داخلیِ بین پرس‌وجوی توکن فعلی و کلیدهای تمام توکن‌های موجود در توالی را محاسبه می‌کند.[5]

هر توکن ورودی برای محاسبه امتیازات توجه، به سه بردار مجزا تصویر می‌شود.

این ضرب داخلی یک امتیاز خام به دست می‌دهد که نشان‌دهنده هم‌راستایی ریاضیاتی بین دو توکن است. یک امتیاز مثبت بالا نشان‌دهنده ارتباط قوی است، در حالی که یک امتیاز منفی نشان می‌دهد توکن‌ها نامرتبط هستند. با این حال، هرچه ابعاد جاسازی بزرگ‌تر می‌شود، این ضرب‌های داخلی خام می‌توانند به‌شدت بزرگ شوند. در معماری اولیه سال ۲۰۱۷، پژوهشگران از بُعد کلید ۶۴ استفاده کردند. اگر این ضرب‌های داخلی مقیاس‌بندی نشوند، بردارهای ۶۴-بعدی (با فرض اینکه بردارهای اولیه از توزیع‌های مستقل با میانگین صفر و واریانس یک استخراج شده باشند) واریانسی برابر با ۶۴ از خود نشان خواهند داد.[1][4]

این ضرب داخلی یک امتیاز خام به دست می‌دهد که نشان‌دهنده هم‌راستایی ریاضیاتی بین دو توکن است.

این واریانس یک مشکل مکانیکی جدی در مرحله آموزش ایجاد می‌کند. امتیازات خام از یک تابع سافت‌مکس عبور داده می‌شوند تا به یک توزیع احتمال تبدیل شوند، جایی که مجموع تمام وزن‌ها دقیقاً برابر با یک می‌شود. اگر مقادیر ورودی به سافت‌مکس بیش از حد بزرگ باشند، این تابع به سمت نواحی به‌شدت مسطح خود رانده می‌شود. در این نواحی، گرادیان‌ها — همان سیگنال‌های ریاضیاتی حیاتی که برای به‌روزرسانی وزن‌های مدل در طول پس‌انتشار استفاده می‌شوند — به صفر نزدیک شده و عملاً فرآیند یادگیری را متوقف کرده و از بهبود شبکه جلوگیری می‌کنند.[2][3]

راه‌حلی که نام کامل این مکانیزم نیز از آن گرفته شده، عامل «مقیاس‌بندی» است. پیش از اعمال تابع سافت‌مکس، معماری ترانسفورمر ضرب داخلی خام را بر جذرِ بُعد کلید تقسیم می‌کند. برای بُعد ۶۴، این مقسوم‌علیه دقیقاً ۸ است. این نرمال‌سازی ریاضیاتی، واریانس را دوباره به ۱ فشرده می‌کند و تضمین می‌کند که تابع سافت‌مکس در ناحیه میانی و حساس خود عمل کند؛ جایی که گرادیان‌ها آزادانه جریان دارند و مدل می‌تواند وزن‌های توجه بهینه را برای هر توالیِ داده‌شده به‌طور کارآمدی یاد بگیرد.[4]

تقسیم ضرب داخلی خام بر جذر بُعد کلید، از اشباع شدن تابع سافت‌مکس جلوگیری می‌کند.

پس از آنکه امتیازات نرمال‌سازی شده و به احتمالات تبدیل شدند، در بردارهای «ارزش» ضرب می‌شوند. نتیجه کار، یک بازنمایی جدید و زمینه‌آگاه از توکن اصلی است. اگر کلمه «بانک» در کنار «رودخانه» ظاهر شود، مکانیزم توجه وزن‌های بالایی را به توکن‌های مرتبط با آب اختصاص می‌دهد و ارزش‌های آن‌ها را به درون بازنمایی «بانک» می‌کشد. اما اگر همین کلمه در کنار «سپرده» بیاید، توکن‌های مالی بر این جمع وزن‌دار غالب می‌شوند و اجازه می‌دهند دقیقاً همان کلمه، صرفاً بر اساس بافتار ریاضیاتی پیرامونش، به‌گونه‌ای متفاوت پردازش شود.[5]

مقاله سال ۲۰۱۷ این مکانیزم را تنها یک بار در هر لایه اعمال نکرد؛ بلکه مفهوم توجه «چند-سَری» را معرفی کرد. با تقسیم جاسازی ۵۱۲-بعدی به هشت سَرِ ۶۴-بعدی موازی، مدل می‌تواند به‌طور همزمان به زیرفضاهای بازنمایی متفاوتی توجه کند. یک سَر ممکن است توافق‌های دستوری فاعل و فعل را ردیابی کند، در حالی که سَر دیگر روابط معنایی یا نزدیکی موقعیتی را زیر نظر دارد؛ و همه این‌ها بدون افزایش پیچیدگی محاسباتی کلی در مقایسه با یک مکانیزم تک-سَری که روی بُعد کامل عمل می‌کند، انجام می‌شود. همین موازی‌سازی است که به ترانسفورمرهای مدرن اجازه می‌دهد پیچیدگی عظیم زبان انسان را در یک گذرِ روبه‌جلوی واحد ثبت کنند.[3][4]

با وجود مقیاس عظیم مدل‌های زبانی بزرگ امروزی، دقیقاً همین عملیات ضرب داخلی مقیاس‌یافته است که همچنان موتور محاسباتیِ زیر کاپوت آن‌ها باقی مانده است. در حالی که شرکت‌ها از قابلیت‌های جدید، یکپارچه‌سازی‌های چندوجهی و رفتارهای نوظهور پرده برمی‌دارند، ریاضیات بنیادینِ وزن‌دهی به توکن‌ها از سال ۲۰۱۷ تاکنون تغییری نکرده است. صنعت هوش مصنوعی صرفاً ابعاد ماتریس‌ها را مقیاس داده، پنجره‌های زمینه را بزرگ‌تر کرده و خوشه‌های سخت‌افزاری عظیمی را مستقر کرده است که برای ضرب کردن آن‌ها در مقیاسی بی‌سابقه مورد نیازند. نوآوری هسته‌ای که به رونق امروزِ هوش مصنوعی مولد قدرت می‌بخشد، هنوز هم فقط یک ترفند هوشمندانه برای جلوگیری از محو شدن گرادیان‌ها در طول ضرب ماتریسی است.[6]

چرا مهم است

درک مکانیزم توجه ضرب داخلی مقیاس‌یافته، هیاهوی تبلیغاتی پیرامون هوش مصنوعی را کنار می‌زند و مسیریابی دقیق ریاضیاتی را آشکار می‌کند که به مدل‌های زبانی مدرن اجازه می‌دهد تا زمینه و بافتار را پردازش کنند.

نکات کلیدی

  • مکانیزم توجه ضرب داخلی مقیاس‌یافته در مقاله سال ۲۰۱۷ با عنوان «توجه تمام چیزی است که نیاز دارید» معرفی شد.
  • این مکانیزم توکن‌های ورودی را به بردارهای پرس‌وجو، کلید و ارزش تصویر می‌کند تا ارتباط متنی را تعیین کند.
  • ضرب‌های داخلی خام بر جذر بُعد کلید تقسیم می‌شوند تا از اشباع گرادیان جلوگیری شود.
  • این مقیاس‌بندی تضمین می‌کند که تابع سافت‌مکس در ناحیه‌ای عمل کند که سیگنال‌های یادگیری بتوانند جریان یابند.
  • توجه چند-سری بُعد جاسازی را تقسیم می‌کند تا چندین رابطه را به‌طور همزمان ردیابی کند.

بررسی عمیق دیدگاه‌ها

پژوهشگران یادگیری ماشین

بر ظرافت ریاضیاتی و قابلیت موازی‌سازی معماری تمرکز دارند.

برای پژوهشگران، پیشرفت اصلی توجه ضرب داخلی مقیاس‌یافته، توانایی آن در پردازش همزمان کل توالی‌ها بود. برخلاف شبکه‌های عصبی بازگشتی که مجبور بودند توکن‌ها را به‌صورت ترتیبی بخوانند و از گلوگاه‌ها رنج می‌بردند، مکانیزم توجه بر ضرب‌های ماتریسی بسیار بهینه‌شده‌ای تکیه دارد که روی پردازنده‌های گرافیکی مدرن به‌طور کارآمد اجرا می‌شوند. عامل مقیاس‌بندی به‌طور خاص مشکل محو شدن گرادیان را که تلاش‌های اولیه در شبکه‌های توجه عمیق را با مشکل مواجه کرده بود، حل کرد.

فروشندگان تجاری هوش مصنوعی

خروجی‌های این مکانیزم را به جای عملیات ریاضی، به عنوان قابلیت‌های شناختی چارچوب‌بندی می‌کنند.

فروشندگان تجاری اغلب جبر خطی مکانیزم توجه را پنهان کرده و آگاهی متنیِ حاصل از آن را با عباراتی انسان‌انگارانه توصیف می‌کنند. در محتواهای بازاریابی مکرراً ادعا می‌شود که مدل‌ها ظرافت‌ها را «می‌فهمند» یا درباره اسناد «استدلال» می‌کنند. در واقعیت، این قابلیت‌ها نتیجه مستقیم عملیات ضرب داخلی مقیاس‌یافته است که وزن‌های احتمالی بالاتری را به توکن‌های مرتبط معنایی در سراسر یک پنجره زمینه عظیم اختصاص می‌دهد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

خلوص‌گرایان ریاضیاتی 50%مهندسان کاربردی هوش مصنوعی 30%مروجان آموزشی 20%
  1. [1]Dive into Deep Learningخلوص‌گرایان ریاضیاتی

    11. Attention Mechanisms and Transformers

    مطالعه در Dive into Deep Learning
  2. [2]MachineLearningMastery.comخلوص‌گرایان ریاضیاتی

    The Transformer Attention Mechanism

    مطالعه در MachineLearningMastery.com
  3. [3]Dive into Deep Learningخلوص‌گرایان ریاضیاتی

    11.7. The Transformer Architecture — Dive into Deep Learning 1.0.3 documentation

    مطالعه در Dive into Deep Learning
  4. [4]arXivخلوص‌گرایان ریاضیاتی

    Attention Is All You Need

    مطالعه در arXiv
  5. [5]Jay Alammarمروجان آموزشی

    The Illustrated Transformer

    مطالعه در Jay Alammar
  6. [6]تیم سردبیری کوهستانمروجان آموزشی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.