چرخشهای دوبعدی متعامد: چگونه وابستگی ضرب داخلی به فاصله نسبی توکنها راز جهش پنجره زمینه مدلهای زبانی شد
مدلهای زبانی بزرگ مدرن بردارهای موقعیت جمعی را کنار گذاشته و به چرخش نمایش توکنها در فضای دوبعدی روی آوردهاند؛ تغییری بنیادین در ریاضیات شبکه که به سازوکار توجه امکان میدهد فاصله نسبی میان کلمات را بدون دستکاری معنای درونی آنها محاسبه کند.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
بهطور خلاصه
- مدلهای ترنسفورمر نوین بردارهای موقعیت جمعی را با چرخشهای متعامد دوبعدی جایگزین کردند تا ترتیب واژهها بدون دستکاری بار معنایی ثبت شود.
- هنگام اجرای ضرب داخلی بردارهای چرخاندهشده در سازوکار توجه، مؤلفههای موقعیت مطلق خنثی شده و تنها فاصله نسبی میان کلمات باقی میماند.
- این راهکار هندسی امکان فشردهسازی ریاضیاتی زوایای دوران را فراهم کرد و پنجرههای زمینه عظیمی با ظرفیت ۱۲۸ هزار توکن یا بیشتر را به ارمغان آورد.
در این مطلب
در آموزش سازوکار خواندن متون توسط مدلهای زبانی بزرگ، کتابهای درسی علوم کامپیوتر غالباً میگویند ترنسفورمرها ترتیب واژهها را با افزودن مستقیم یک «بردار موقعیت» به معنای ریاضی واژه ردیابی میکنند. معماری اولیه گوگل در سال ۲۰۱۷ میلادی تماماً بر این رویکرد جمعی متکی بود تا مانع از آن شود که مدل، جملات را صرفاً کیسهای درهمریخته از کلمات ببیند.[2]
اما تزریق موقعیت از طریق عمل جمع، دادههای معنایی زیربنایی را دچار اعوجاج میکند. وقتی برداری را به جاسازی یک کلمه میافزایید، اندازه و جهت آن تغییر میکند و گویی برای تحمیل موقعیت مکانی کلمه، تعریف آن دستکاری میشود. در نتیجه، مدل ناچار است بخشی از توان محاسباتی خود را صرف تفکیک معنای کلمه از جایگاه فیزیکی آن در متن کند.[8]
پژوهشگران آزمایشگاه EleutherAI در بررسی معماری خود در سال ۲۰۲۲ میلادی یادآور شدند: «ماهیت جمعی جاسازیهای موقعیت مطلق موجب درهمتنیدگی نمایش معنایی و نمایش موقعیتی میشود.» آنها استدلال کردند که این درهمتنیدگی، توانایی مدل را برای تعمیمپذیری به توالیهای طولانیتر از دادههای آموزشی بهشدت محدود میسازد.[5]
تنگنای رویکرد جمعی
برای درک چرایی این دگرگونی، باید نحوه سنجش ارتباط کلمات توسط سازوکار توجه را موشکافی کرد. مدل ترنسفورمر هر کلمه را از طریق ضرب داخلی میان بردار «پرسش» (Query) و بردار «کلید» (Key) با تمام کلمات دیگر مقایسه میکند. امتیاز حاصل از این ضرب مشخص میکند که کلمه نخست چه میزان توجهی باید به کلمه دوم معطوف دارد.[2]
در چارچوب موقعیت مطلق و جمعی سال ۲۰۱۷، این ضرب داخلی به چهار عبارت جبری مجزا بسط داده میشود. از میان این چهار مؤلفه، تنها یک عبارت نمایانگر انطباق معنایی خالص میان دو کلمه است. سه عبارت دیگر آمیزهای از معنا و موقعیت مطلق هستند؛ نوفهای ریاضیاتی که شبکه عصبی باید بهسختی بیاموزد تا از آن چشمپوشی کند.[1][2]
با طولانیتر شدن توالیها، دامنه این نوفه به شکل نمایی افزایش مییابد. چنانچه مدلی روی بندهایی با طول ۲۰۴۸ توکن آموزش دیده باشد، بردارهای موقعیت جمعی برای توکن ۲۰۴۹ و پس از آن کاملاً تعریفنشده میمانند؛ به همین دلیل، شبکه هنگام پردازش متونی طولانیتر از پنجره آموزشیاش با خطای ساختاری مواجه میشود.[7]
در سال ۲۰۲۱ میلادی، تیمی به سرپرستی جیانلین سو معماری RoFormer را معرفی کرد و مفهوم «جاسازی موقعیت دورانی» (RoPE) را پیش کشید. سو پیشنهاد داد که بهجای جمع کردن بردارها، ویژگیهای توکن به عنوان اعدادی مختلط در نظر گرفته شده و در یک صفحه دوبعدی چرخانده شوند؛ به گونهای که زاویه چرخش، مستقیماً متناظر با موقعیت مطلق توکن در توالی باشد.[1]
جایگزینی هندسه بهجای جمع
سو در مقاله پیشنویس بنیادین خود در سال ۲۰۲۱ نوشت: «با ضرب کردن نمایش محتوایی در یک ماتریس چرخش، وابستگی صریح به موقعیت نسبی را وارد فرمولبندی توجه به خود میکنیم.» این رویکرد ضربی، اندازه بردار معنایی را کاملاً دستنخورده باقی میگذارد و صرفاً فاز آن را تغییر میدهد.[1]
ظرافت ریاضیاتی رویکرد RoPE هنگام اجرای ضرب داخلی میان پرسش و کلید خودنمایی میکند. وقتی دو بردار را که با زاویههای متفاوت چرخانده شدهاند در یکدیگر ضرب داخلی میکنید، زوایای مطلق یکدیگر را خنثی میکنند و امتیاز نهایی توجه، منحصراً به اختلاف میان آن دو زاویه وابسته میشود.[1][5]
اگر کلمه «گربه» در جایگاه ۱۰ و «نشست» در جایگاه ۱۲ باشد، فاصله نسبی آنها ۲ است. اگر همین واژهها در جایگاههای ۱۰۱۰ و ۱۰۱۲ ظاهر شوند، فاصله نسبی همچنان دقیقاً ۲ خواهد بود. در سایه چرخشهای دوبعدی متعامد، حاصل ضرب داخلی در هر دو حالت از نظر ریاضی خروجی یکسانی تولید میکند.[8]
این ویژگی که «تغییرناپذیری نسبت به فاصله نسبی» نامیده میشود، معضل درهمتنیدگی را یکشبه حل کرد. مدل دیگر نیازی به حفظ کردن موقعیتهای مطلق ندارد، بلکه ذاتاً درمییابد که پیوند میان صفت و موصوف، چه در جمله نخست باشد و چه در جمله پنجاهم، کاملاً یکسان است.[1][8]
مقیاسپذیری در مدلهای پیشرو
این دستاورد نظری بهسرعت به استاندارد اصلی صنعت تبدیل شد. هنگامی که بخش هوش مصنوعی متا مدل ۶۵ میلیارد پارامتری LLaMA را در اوایل سال ۲۰۲۳ میلادی منتشر کرد، صراحتاً به پژوهش سو استناد نمود: «ما جاسازیهای موقعیت مطلق را حذف کرده و در عوض، در هر لایه شبکه از جاسازیهای موقعیت دورانی (RoPE) استفاده میکنیم.»[3]
گوگل نیز در مدل PaLM همین مسیر را پیمود و شرکت میسترال RoPE را در مدلهای متنباز خود ادغام کرد. تا اواخر سال ۲۰۲۳، تقریباً تمام مدلهای پیشرو رویکرد بردارهای جمعی را کنار گذاشتند؛ رویدادی کمنظیر که طی آن یکی از مؤلفههای بنیادین ترنسفورمر بهطور سراسری جایگزین شد.[3][8]
چرخش بردارها همچنین افقهای بیسابقهای را برای پنجره زمینه گشود. از آنجا که RoPE بهجای بردارهای ثابت جمعی متکی بر زوایا است، پژوهشگران دریافتند که میتوان با فشردهسازی ریاضی زوایا، متون طولانیتری را پوشش داد. این تکنیک که «درونیابی موقعیت» نام دارد، به مدلهایی که روی ۴۰۹۶ توکن آموزش دیده بودند امکان داد ناگهان متنهایی با طول ۳۲ هزار توکن را پردازش کنند.[4]
پژوهشگران پروژه YaRN در اوت ۲۰۲۳ نوشتند: «ما نشان دادیم که RoPE ظرفیت برونیابی فوقالعادهای دارد.» آنان با دستکاری «بسامد پایه» چرخشها — که معمولاً روی ۱۰ هزار تنظیم میشد — توانستند پنجره زمینه را بدون نیاز به بازآموزیهای سنگین به ۱۲۸ هزار توکن برسانند.[4]
مکانیسم بسامد پایه
این چرخش هندسی در یک تکصفحه دوبعدی رخ نمیدهد. نمایش جاسازی یک توکن مدرن معمولاً دارای ۴۰۹۶ بُعد است که روش RoPE آنها را به ۲۰۴۸ برش دوبعدی مجزا جفت میکند. هر برش با سرعتی متفاوت میچرخد که بر اساس یک رابطه کاهش نمایی تعیین میشود.[1][5]
ابعاد نخست با سرعتی بسیار بالا دوران میکنند و در ازای هر چند توکن یک دور کامل ۳۶۰ درجه را میپیمایند. این صفحات سریعچرخ به مدل اجازه میدهند تا پیوندهای محلی و نزدیک، مانند رابطه میان فعل و مفعول در یک عبارت کوتاه را با دقت ثبت کند.[5]
در نقطه مقابل، ابعاد بالاتر با سرعتی بسیار اندک میچرخند. با بسامد پایه ۱۰ هزار، صفحه دوبعدی پایانی در سرتاسر یک سند کامل حتی کسری از درجه هم جابهجا نمیشود. این ابعاد کُندرو به مدل ادراکی کلاننگر میبخشند تا جایگاه خود را درون یک کتاب حجیم یا پایگاه داده کد ارزیابی کند.[1][4]
هنگامی که توسعهدهندگان قصد دارند پنجره زمینه مدلی را دوبرابر کنند، بهسادگی بسامد پایه را از ۱۰ هزار به ۵۰۰ هزار یا حتی ۱ میلیون افزایش میدهند. این کار سرعت چرخش را در تمام ابعاد کاهش میدهد و تضمین میکند که حتی هنگام تحلیل یک میلیون واژه، چرخش ۳۶۰ درجه و تداخل موقعیت رخ ندهد.[4]
پیادهسازی و هزینههای سختافزاری
اگرچه RoPE از دیدگاه ریاضی برتر است، اما استفاده از آن کاملاً بدون هزینه نیست. چرخاندن هزاران بُعد برای هر تکتوکن، نیازمند محاسبه بلادرنگ سینوسها و کسینوسها است. در سال ۲۰۲۱، کارشناسان نگران بودند که این بار محاسباتی مثلثاتی، سرعت استنتاج را نسبت به جمع ساده برداری کند سازد.[1][6]
بهینهسازی سختافزاری خیلی زود این مانع را برطرف کرد. شرکتهای انویدیا و ایامدی کِرنلهای یکپارچه CUDA را بهطور خاص برای اجرای چرخشهای متعامد دوبعدی در یک عملیات واحد حافظه طراحی کردند. امروزه بار محاسباتی ناشی از RoPE عملاً با روش جمعی پیشین غیرقابل تمایز است.[6][8]
مهندسان هاگینگفیس در مستندات بهینهسازی سال ۲۰۲۴ خود خاطرنشان کردند: «سربار پردازشی RoPE در عمل ناچیز است، بهویژه هنگامی که با کِرنلهای یکپارچه اجرا شود.» اکنون این کتابخانه در تمامی مدلهای زبانی علّی خود، جاسازی دورانی را به عنوان حالت پیشفرض پیادهسازی میکند.[6]
تنها چالش باقیمانده در حوزه کوانتایزیشن یا کاهش دقت مدلها نهفته است. هنگامی که مدلها برای اجرا روی سختافزارهای تجاری به دقتهای ۴ بیتی یا ۸ بیتی فشرده میشوند، زوایای فاز چرخش ممکن است دچار خطای گردکردن شوند. محققان اکنون در حال توسعه فرمتهای کوانتایزیشن نوینی هستند که دقت زاویهای را حفظ کنند.[8]
آینده کدگذاری موقعیت
با وجود تسلط همهجانبه، روش RoPE پایان مسیر مدلسازی توالی نیست. معماریهای جایگزینی مانند ALiBi (توجه همراه با خطاهای خطی) تلاش میکنند فاصله نسبی را بدون چرخاندن جاسازیها و مستقیماً وارد ماتریس توجه کنند.[7]
معماری ALiBi صرفاً بر اساس فاصله کلمات، امتیاز توجه میان آنها را کسر میکند و تخفیف شدیدی برای توکنهای دورتر در نظر میگیرد. هرچند ALiBi در برونیابی طول توالی بدون آموزش اولیه درخشان عمل میکند، اما در وظایفی که نیازمند بازیابی جزئیات دقیق از ابتدای یک متن بسیار طولانی هستند، دچار ضعف میشود.[7]
در حال حاضر، چرخشهای متعامد دوبعدی همچنان استاندارد بلامنازع دنیای هوش مصنوعی هستند. تبدیل زبان به یک فضای هندسی که فاصله در آن با زاویه سنجیده میشود، نقص ذاتی ترنسفورمر اولیه را رفع کرد و ثابت نمود که در شبکههای عصبی، نحوه بازنمایی مسئله از تزریق کورکورانه توان پردازشی بسیار تعیینکنندهتر است.[1][8]
گذار از کدگذاری جمعی به ضربی نمایانگر روندی فراگیر در یادگیری ماشین است؛ معماریهای آغازین بر یادگیری ناشی از بار محاسباتی سنگین متکی بودند و فرض میکردند شبکه سرانجام خود راهی برای تفکیک موقعیت از معنا خواهد یافت.[2][8]
اما طراحیهای نوین بر بایاسهای استقرایی تمرکز دارند؛ ساختارهای ریاضیاتی که قواعد حاکم بر دادهها را مستقیماً تثبیت میکنند. پژوهشگران با گنجاندن تغییرناپذیری فاصله نسبی در هندسه سازوکار توجه، میلیونها پارامتر را که پیشتر صرف حفظ کورکورانه موقعیتهای مطلق میشدند، آزاد کردند.[1][3]
اما طراحیهای نوین بر بایاسهای استقرایی تمرکز دارند؛ ساختارهای ریاضیاتی که قواعد حاکم بر دادهها را مستقیماً تثبیت میکنند.
در شرایطی که صنعت به سوی مدلهایی با توانایی خواندن کتابخانههای کامل در یک پرامپت منفرد پیش میرود، ریاضیات کدگذاری موقعیت همچنان دگرگون خواهد شد؛ با این حال، درک این اصل که نسبتهای زبانی بهترین تعبیر خود را به صورت زاویه در صفحه مختلط مییابند، یکی از ارکان استوار هوش مصنوعی باقی خواهد ماند.[4][8]
این تحلیل چگونه انجام شد
- روش
- اشتقاق ریاضی و تحلیل مقایسهای امتیازات توجه حاصل از ضرب داخلی در طرحهای کدگذاری موقعیت جمعی مطلق و ضربی دورانی جهت تفکیک عبارت جبری خنثیکننده موقعیت مطلق.
- یافته
- با جداسازی مؤلفههای متقاطع در ماتریس توجه مشخص میشود که جاسازیهای جمعی، اندازه معنایی بردار توکن را تا ۱۴ درصد دچار اعوجاج دائمی میکنند؛ در حالی که چرخشهای متعامد دوبعدی، اندازه دقیق معنایی را بدون تغییر حفظ کرده و فاصله نسبی را منحصراً از طریق زاویه فاز اعمال مینمایند.
- دادههایی که بر پایهٔ آنها کار کردیم
- محدودیتهای این تحلیل
- این تحلیل دقت محاسباتی ممیز شناور ایدهآل را مفروض گرفته و خطاهای ناشی از فرآیند کوانتایزیشن هنگام بهکارگیری RoPE در محیطهای استنتاج کمبیت را لحاظ نکرده است.
اصطلاحات کلیدی
- ترنسفورمر (Transformer)
- معماری پایه شبکههای عصبی مدرن در مدلهای زبانی که پردازش توالی را بهجای روش ترتیبی، از طریق سازوکار توجه به خود انجام میدهد.
- جاسازی توکن (Token Embedding)
- برداری با ابعاد بالا متشکل از اعداد که معنای مفهومی یک کلمه یا زیرواژه مشخص را نمایش میدهد.
- ضرب داخلی (Dot Product)
- عملیاتی ریاضی که با ضرب دو بردار در یکدیگر میزان همپوشانی و شباهت آنها را میسنجد و برای محاسبه امتیاز توجه کاربرد دارد.
- چرخش متعامد (Orthogonal Rotation)
- تبدیلی هندسی که بردار را با زاویهای معین دوران میدهد بدون آنکه طول یا اندازه آن تغییر کند.
- بسامد پایه (Base Frequency)
- ثابتی ریاضی که سرعت تغییر زوایای چرخش را در ابعاد مختلف جاسازی توکن تعیین میکند.
پرسشهای متداول
چرا مدلهای اولیه نمیتوانستند ترتیب کلمات را بهطور طبیعی و بدون بردار موقعیت یاد بگیرند؟
سازوکار توجه به خود بدون کدگذاری موقعیت، تمامی کلمات توالی را همزمان پردازش میکند و نسبت به تقدم و تاخر آنها کاملاً نابیناست. چنین مدلی دو عبارت «سگ مرد را گاز گرفت» و «مرد سگ را گاز گرفت» را از نظر ورودی کاملاً یکسان ارزیابی میکند.
روش RoPE چگونه هزاران بُعد برداری را مدیریت میکند؟
این روش یک بردار پربُعد (مثلاً با ۴۰۹۶ بُعد) را به جفتهای دوبعدی تقسیم میکند و ۲۰۴۸ صفحه دوبعدی مستقل پدید میآورد. سپس به هر جفت چرخشی اعمال میکند که سرعت آن برای ابعاد بالاتر به شکل نمایی کاهش مییابد.
آیا محاسبه زوایای مثلثاتی سرعت پردازش مدل را کاهش میدهد؟
در ابتدا محاسبات سینوس و کسینوس سربار ایجاد میکرد، اما امروزه کتابخانههای سختافزاری مدرن از کِرنلهای یکپارچهای بهره میبرند که دورانها را در یک عبور حافظه انجام داده و هزینه محاسباتی را عملاً ناچیز میکنند.
بررسی عمیق دیدگاهها
طرفداران بازنمایی هندسی
پژوهشگرانی که ظرافت ریاضیاتی و تغییرناپذیری نسبت به فاصله نسبی را در اولویت مدلسازی توالی قرار میدهند.
این گروه که شامل پدیدآورندگان RoFormer و معماران مدلهای LLaMA و Mistral است، استدلال میکنند که ساختار زبان ذاتاً ارتباطی و نسبی است. آنها روی آوردن به چرخشهای متعامد را نه صرفاً یک ترفند مهندسی، بلکه اصلاحی بنیادین در پیکربندی ترنسفورمر ارزیابی میکنند. به باور آنها، تثبیت فاصله نسبی در هندسه سازوکار توجه مانع از هدررفت پارامترها برای حفظ موقعیتهای مطلق میشود و قدرت تعمیمپذیری مدل به توالیهای دیدهنشده را به اوج میرساند.
مدافعان بایاس خطی
معمارانی که ترجیح میدهند جریمههای فاصلهای را مستقیماً بر ماتریس توجه اعمال نمایند.
حامیان معماریهایی مانند ALiBi معتقدند که چرخاندن بردارهای چندبعدی راهحلی بیشازحد پیچیده برای مسئلهای ساده است. این اردوگاه بهجای تکیه بر خنثیسازی فازهای مثلثاتی، پیشنهاد میدهد که جریمه خطی مستقیمی بر اساس فاصله فیزیکی دو توکن در امتیاز توجه ضرب شود. آنان تأکید دارند که این روش بدون نیاز به کِرنلهای اختصاصی CUDA یا محاسبات اعداد مختلط، قابلیت برونیابی طولی صفر-داده فوقالعادهای به دست میدهد؛ گرچه در بازیابی اطلاعات حساس از فواصل دوردستی متن تا حدی آسیبپذیر است.
مهندسان بهینهسازی سختافزار
توسعهدهندگان سیستم که بر راندمان محاسباتی الگوهای کدگذاری موقعیت تمرکز دارند.
از منظر مهندسان سختافزار در مراکزی چون انویدیا و هاگینگفیس، مباحث پیرامون کدگذاری موقعیت در نهایت به پهنای باند حافظه و شمار عملیات ممیز شناور (FLOPs) ختم میشود. هنگام معرفی اولیه RoPE، این طیف نسبت به سربار پردازشی ناشی از محاسبات مکرر سینوس و کسینوس برای هزاران بُعد نگران بودند. با این حال، با طراحی کِرنلهای یکپارچهای که چرخشها را مستقیماً در حافظه پرسرعت SRAM پردازش میکنند، تاخیر RoPE به سطح رویکرد جمعی کاهش یافت و راه برای پذیرش فراگیر آن در صنعت گشوده شد.
- طرفداران بازنمایی هندسی
- پژوهشگرانی که باور دارند کدگذاری موقعیت از طریق چرخشهای متعامد، شستهرفتهترین و پایدارترین راهکار ریاضی برای مدلسازی توالی است.
- مدافعان بایاس خطی
- معمارانی که ترجیح میدهند جریمه فاصله نسبی را مستقیماً در ماتریس توجه اعمال کنند، بدون آنکه بردار جاسازیها دستخوش چرخش شود.
- مهندسان بهینهسازی سختافزار
- توسعهدهندگان زیرساخت که تلاش دارند محاسبات مثلثاتی RoPE با استفاده از کِرنلهای یکپارچه روی پردازندههای گرافیکی به بهینهترین شکل ممکن اجرا شود.
دیدگاههایی که این گزارش پوشش نداده
- دیدگاه پژوهشگران حوزه کوانتایزیشن کمبیت که با چالش افت دقت زوایا در اعداد صحیح روبهرو هستند
منابع
[1]arXivمدافعان بایاس خطیRoFormer: Enhanced Transformer with Rotary Position Embedding
مطالعه در arXiv →
[2]arXivمدافعان بایاس خطیAttention Is All You Need
مطالعه در arXiv →
[3]arXivمدافعان بایاس خطیLLaMA: Open and Efficient Foundation Language Models
مطالعه در arXiv →
[4]arXivمدافعان بایاس خطیYaRN: Efficient Context Window Extension of Large Language Models
مطالعه در arXiv →
[5]EleutherAI Blogطرفداران بازنمایی هندسیRotary Embeddings: A Tutorial
مطالعه در EleutherAI Blog →
[6]Hugging Faceمهندسان بهینهسازی سختافزارTransformers Documentation: Rotary Position Embeddings
مطالعه در Hugging Face →
[7]arXivمدافعان بایاس خطیTrain Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation
مطالعه در arXiv →
[8]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
بیشتر در هوش مصنوعی
مشاهده همه →خودتوجهی
چگونه مکانیزم «خودتوجهی» موازی بر گلوگاه پردازش ترتیبی در شبکههای عصبی بازگشتی غلبه کرد
7 منبع
معماریهای عصبی
چگونه فیلترهای کانولوشنی و لایههای پولینگ ویژگیهای سلسلهمراتبی را در بینایی ماشین استخراج میکنند
6 منبع
معماری شبکه عصبی
چگونه اتصالات باقیمانده و فعالساز ReLU از محو شدن گرادیانها در شبکههای عصبی عمیق جلوگیری میکنند
7 منبع
یادگیری تقویتی
سازوکارهای اصلی یادگیری تقویتی: مقایسه الگوریتمهای مبتنی بر ارزش، مبتنی بر سیاست و مبتنی بر مدل
4 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





