رفتن به محتوای اصلی
کوهستان
توضیح کوهستانمعماری ترنسفورمرجاسازی موقعیت دورانی· 8 دقیقه مطالعه· در هوش مصنوعی

چرخش‌های دوبعدی متعامد: چگونه وابستگی ضرب داخلی به فاصله نسبی توکن‌ها راز جهش پنجره زمینه مدل‌های زبانی شد

مدل‌های زبانی بزرگ مدرن بردارهای موقعیت جمعی را کنار گذاشته و به چرخش نمایش توکن‌ها در فضای دوبعدی روی آورده‌اند؛ تغییری بنیادین در ریاضیات شبکه که به سازوکار توجه امکان می‌دهد فاصله نسبی میان کلمات را بدون دستکاری معنای درونی آن‌ها محاسبه کند.

به قلم آرش رضایی

به‌طور خلاصه

  • مدل‌های ترنسفورمر نوین بردارهای موقعیت جمعی را با چرخش‌های متعامد دوبعدی جایگزین کردند تا ترتیب واژه‌ها بدون دستکاری بار معنایی ثبت شود.
  • هنگام اجرای ضرب داخلی بردارهای چرخانده‌شده در سازوکار توجه، مؤلفه‌های موقعیت مطلق خنثی شده و تنها فاصله نسبی میان کلمات باقی می‌ماند.
  • این راهکار هندسی امکان فشرده‌سازی ریاضیاتی زوایای دوران را فراهم کرد و پنجره‌های زمینه عظیمی با ظرفیت ۱۲۸ هزار توکن یا بیشتر را به ارمغان آورد.

در آموزش سازوکار خواندن متون توسط مدل‌های زبانی بزرگ، کتاب‌های درسی علوم کامپیوتر غالباً می‌گویند ترنسفورمرها ترتیب واژه‌ها را با افزودن مستقیم یک «بردار موقعیت» به معنای ریاضی واژه ردیابی می‌کنند. معماری اولیه گوگل در سال ۲۰۱۷ میلادی تماماً بر این رویکرد جمعی متکی بود تا مانع از آن شود که مدل، جملات را صرفاً کیسه‌ای درهم‌ریخته از کلمات ببیند.[2]

اما تزریق موقعیت از طریق عمل جمع، داده‌های معنایی زیربنایی را دچار اعوجاج می‌کند. وقتی برداری را به جاسازی یک کلمه می‌افزایید، اندازه و جهت آن تغییر می‌کند و گویی برای تحمیل موقعیت مکانی کلمه، تعریف آن دستکاری می‌شود. در نتیجه، مدل ناچار است بخشی از توان محاسباتی خود را صرف تفکیک معنای کلمه از جایگاه فیزیکی آن در متن کند.[8]

پژوهشگران آزمایشگاه EleutherAI در بررسی معماری خود در سال ۲۰۲۲ میلادی یادآور شدند: «ماهیت جمعی جاسازی‌های موقعیت مطلق موجب درهم‌تنیدگی نمایش معنایی و نمایش موقعیتی می‌شود.» آن‌ها استدلال کردند که این درهم‌تنیدگی، توانایی مدل را برای تعمیم‌پذیری به توالی‌های طولانی‌تر از داده‌های آموزشی به‌شدت محدود می‌سازد.[5]

تنگنای رویکرد جمعی

برای درک چرایی این دگرگونی، باید نحوه سنجش ارتباط کلمات توسط سازوکار توجه را موشکافی کرد. مدل ترنسفورمر هر کلمه را از طریق ضرب داخلی میان بردار «پرسش» (Query) و بردار «کلید» (Key) با تمام کلمات دیگر مقایسه می‌کند. امتیاز حاصل از این ضرب مشخص می‌کند که کلمه نخست چه میزان توجهی باید به کلمه دوم معطوف دارد.[2]

در چارچوب موقعیت مطلق و جمعی سال ۲۰۱۷، این ضرب داخلی به چهار عبارت جبری مجزا بسط داده می‌شود. از میان این چهار مؤلفه، تنها یک عبارت نمایانگر انطباق معنایی خالص میان دو کلمه است. سه عبارت دیگر آمیزه‌ای از معنا و موقعیت مطلق هستند؛ نوفه‌ای ریاضیاتی که شبکه عصبی باید به‌سختی بیاموزد تا از آن چشم‌پوشی کند.[1][2]

برخلاف بردارهای جمعی، چرخش‌های متعامد اندازه اصلی جاسازی توکن را حفظ می‌کنند.

با طولانی‌تر شدن توالی‌ها، دامنه این نوفه به شکل نمایی افزایش می‌یابد. چنانچه مدلی روی بندهایی با طول ۲۰۴۸ توکن آموزش دیده باشد، بردارهای موقعیت جمعی برای توکن ۲۰۴۹ و پس از آن کاملاً تعریف‌نشده می‌مانند؛ به همین دلیل، شبکه هنگام پردازش متونی طولانی‌تر از پنجره آموزشی‌اش با خطای ساختاری مواجه می‌شود.[7]

در سال ۲۰۲۱ میلادی، تیمی به سرپرستی جیان‌لین سو معماری RoFormer را معرفی کرد و مفهوم «جاسازی موقعیت دورانی» (RoPE) را پیش کشید. سو پیشنهاد داد که به‌جای جمع کردن بردارها، ویژگی‌های توکن به عنوان اعدادی مختلط در نظر گرفته شده و در یک صفحه دوبعدی چرخانده شوند؛ به گونه‌ای که زاویه چرخش، مستقیماً متناظر با موقعیت مطلق توکن در توالی باشد.[1]

جایگزینی هندسه به‌جای جمع

سو در مقاله پیش‌نویس بنیادین خود در سال ۲۰۲۱ نوشت: «با ضرب کردن نمایش محتوایی در یک ماتریس چرخش، وابستگی صریح به موقعیت نسبی را وارد فرمول‌بندی توجه به خود می‌کنیم.» این رویکرد ضربی، اندازه بردار معنایی را کاملاً دست‌نخورده باقی می‌گذارد و صرفاً فاز آن را تغییر می‌دهد.[1]

ظرافت ریاضیاتی رویکرد RoPE هنگام اجرای ضرب داخلی میان پرسش و کلید خودنمایی می‌کند. وقتی دو بردار را که با زاویه‌های متفاوت چرخانده شده‌اند در یکدیگر ضرب داخلی می‌کنید، زوایای مطلق یکدیگر را خنثی می‌کنند و امتیاز نهایی توجه، منحصراً به اختلاف میان آن دو زاویه وابسته می‌شود.[1][5]

اگر کلمه «گربه» در جایگاه ۱۰ و «نشست» در جایگاه ۱۲ باشد، فاصله نسبی آن‌ها ۲ است. اگر همین واژه‌ها در جایگاه‌های ۱۰۱۰ و ۱۰۱۲ ظاهر شوند، فاصله نسبی همچنان دقیقاً ۲ خواهد بود. در سایه چرخش‌های دوبعدی متعامد، حاصل ضرب داخلی در هر دو حالت از نظر ریاضی خروجی یکسانی تولید می‌کند.[8]

این ویژگی که «تغییرناپذیری نسبت به فاصله نسبی» نامیده می‌شود، معضل درهم‌تنیدگی را یک‌شبه حل کرد. مدل دیگر نیازی به حفظ کردن موقعیت‌های مطلق ندارد، بلکه ذاتاً درمی‌یابد که پیوند میان صفت و موصوف، چه در جمله نخست باشد و چه در جمله پنجاهم، کاملاً یکسان است.[1][8]

در رویکرد RoPE، ضرب داخلی میان دو توکن صرفاً به فاصله نسبی آن‌ها وابسته است و در سرتاسر توالی ثابت می‌ماند.

مقیاس‌پذیری در مدل‌های پیشرو

این دستاورد نظری به‌سرعت به استاندارد اصلی صنعت تبدیل شد. هنگامی که بخش هوش مصنوعی متا مدل ۶۵ میلیارد پارامتری LLaMA را در اوایل سال ۲۰۲۳ میلادی منتشر کرد، صراحتاً به پژوهش سو استناد نمود: «ما جاسازی‌های موقعیت مطلق را حذف کرده و در عوض، در هر لایه شبکه از جاسازی‌های موقعیت دورانی (RoPE) استفاده می‌کنیم.»[3]

گوگل نیز در مدل PaLM همین مسیر را پیمود و شرکت میسترال RoPE را در مدل‌های متن‌باز خود ادغام کرد. تا اواخر سال ۲۰۲۳، تقریباً تمام مدل‌های پیشرو رویکرد بردارهای جمعی را کنار گذاشتند؛ رویدادی کم‌نظیر که طی آن یکی از مؤلفه‌های بنیادین ترنسفورمر به‌طور سراسری جایگزین شد.[3][8]

چرخش بردارها همچنین افق‌های بی‌سابقه‌ای را برای پنجره زمینه گشود. از آنجا که RoPE به‌جای بردارهای ثابت جمعی متکی بر زوایا است، پژوهشگران دریافتند که می‌توان با فشرده‌سازی ریاضی زوایا، متون طولانی‌تری را پوشش داد. این تکنیک که «درونیابی موقعیت» نام دارد، به مدل‌هایی که روی ۴۰۹۶ توکن آموزش دیده بودند امکان داد ناگهان متن‌هایی با طول ۳۲ هزار توکن را پردازش کنند.[4]

پژوهشگران پروژه YaRN در اوت ۲۰۲۳ نوشتند: «ما نشان دادیم که RoPE ظرفیت برون‌یابی فوق‌العاده‌ای دارد.» آنان با دستکاری «بسامد پایه» چرخش‌ها — که معمولاً روی ۱۰ هزار تنظیم می‌شد — توانستند پنجره زمینه را بدون نیاز به بازآموزی‌های سنگین به ۱۲۸ هزار توکن برسانند.[4]

مکانیسم بسامد پایه

این چرخش هندسی در یک تک‌صفحه دوبعدی رخ نمی‌دهد. نمایش جاسازی یک توکن مدرن معمولاً دارای ۴۰۹۶ بُعد است که روش RoPE آن‌ها را به ۲۰۴۸ برش دوبعدی مجزا جفت می‌کند. هر برش با سرعتی متفاوت می‌چرخد که بر اساس یک رابطه کاهش نمایی تعیین می‌شود.[1][5]

ابعاد نخست با سرعتی بسیار بالا دوران می‌کنند و در ازای هر چند توکن یک دور کامل ۳۶۰ درجه را می‌پیمایند. این صفحات سریع‌چرخ به مدل اجازه می‌دهند تا پیوندهای محلی و نزدیک، مانند رابطه میان فعل و مفعول در یک عبارت کوتاه را با دقت ثبت کند.[5]

در نقطه مقابل، ابعاد بالاتر با سرعتی بسیار اندک می‌چرخند. با بسامد پایه ۱۰ هزار، صفحه دوبعدی پایانی در سرتاسر یک سند کامل حتی کسری از درجه هم جابه‌جا نمی‌شود. این ابعاد کُندرو به مدل ادراکی کلان‌نگر می‌بخشند تا جایگاه خود را درون یک کتاب حجیم یا پایگاه داده کد ارزیابی کند.[1][4]

جاسازی RoPE ابعاد بردار را دوبه‌دو به برش‌های دوبعدی جفت می‌کند و هر برش را با بسامد پایه‌ای که به‌صورت نمایی کاهش می‌یابد می‌چرخاند.

هنگامی که توسعه‌دهندگان قصد دارند پنجره زمینه مدلی را دوبرابر کنند، به‌سادگی بسامد پایه را از ۱۰ هزار به ۵۰۰ هزار یا حتی ۱ میلیون افزایش می‌دهند. این کار سرعت چرخش را در تمام ابعاد کاهش می‌دهد و تضمین می‌کند که حتی هنگام تحلیل یک میلیون واژه، چرخش ۳۶۰ درجه و تداخل موقعیت رخ ندهد.[4]

پیاده‌سازی و هزینه‌های سخت‌افزاری

اگرچه RoPE از دیدگاه ریاضی برتر است، اما استفاده از آن کاملاً بدون هزینه نیست. چرخاندن هزاران بُعد برای هر تک‌توکن، نیازمند محاسبه بلادرنگ سینوس‌ها و کسینوس‌ها است. در سال ۲۰۲۱، کارشناسان نگران بودند که این بار محاسباتی مثلثاتی، سرعت استنتاج را نسبت به جمع ساده برداری کند سازد.[1][6]

بهینه‌سازی سخت‌افزاری خیلی زود این مانع را برطرف کرد. شرکت‌های انویدیا و ای‌ام‌دی کِرنل‌های یکپارچه CUDA را به‌طور خاص برای اجرای چرخش‌های متعامد دوبعدی در یک عملیات واحد حافظه طراحی کردند. امروزه بار محاسباتی ناشی از RoPE عملاً با روش جمعی پیشین غیرقابل تمایز است.[6][8]

مهندسان هاگینگ‌فیس در مستندات بهینه‌سازی سال ۲۰۲۴ خود خاطرنشان کردند: «سربار پردازشی RoPE در عمل ناچیز است، به‌ویژه هنگامی که با کِرنل‌های یکپارچه اجرا شود.» اکنون این کتابخانه در تمامی مدل‌های زبانی علّی خود، جاسازی دورانی را به عنوان حالت پیش‌فرض پیاده‌سازی می‌کند.[6]

تنها چالش باقی‌مانده در حوزه کوانتایزیشن یا کاهش دقت مدل‌ها نهفته است. هنگامی که مدل‌ها برای اجرا روی سخت‌افزارهای تجاری به دقت‌های ۴ بیتی یا ۸ بیتی فشرده می‌شوند، زوایای فاز چرخش ممکن است دچار خطای گردکردن شوند. محققان اکنون در حال توسعه فرمت‌های کوانتایزیشن نوینی هستند که دقت زاویه‌ای را حفظ کنند.[8]

آینده کدگذاری موقعیت

با وجود تسلط همه‌جانبه، روش RoPE پایان مسیر مدلسازی توالی نیست. معماری‌های جایگزینی مانند ALiBi (توجه همراه با خطاهای خطی) تلاش می‌کنند فاصله نسبی را بدون چرخاندن جاسازی‌ها و مستقیماً وارد ماتریس توجه کنند.[7]

پژوهشگران با تغییر بسامد پایه چرخش‌ها، پنجره زمینه مدل‌ها را از ۴۰۹۶ به ۱۲۸ هزار توکن افزایش دادند.

معماری ALiBi صرفاً بر اساس فاصله کلمات، امتیاز توجه میان آن‌ها را کسر می‌کند و تخفیف شدیدی برای توکن‌های دورتر در نظر می‌گیرد. هرچند ALiBi در برون‌یابی طول توالی بدون آموزش اولیه درخشان عمل می‌کند، اما در وظایفی که نیازمند بازیابی جزئیات دقیق از ابتدای یک متن بسیار طولانی هستند، دچار ضعف می‌شود.[7]

در حال حاضر، چرخش‌های متعامد دوبعدی همچنان استاندارد بلامنازع دنیای هوش مصنوعی هستند. تبدیل زبان به یک فضای هندسی که فاصله در آن با زاویه سنجیده می‌شود، نقص ذاتی ترنسفورمر اولیه را رفع کرد و ثابت نمود که در شبکه‌های عصبی، نحوه بازنمایی مسئله از تزریق کورکورانه توان پردازشی بسیار تعیین‌کننده‌تر است.[1][8]

گذار از کدگذاری جمعی به ضربی نمایانگر روندی فراگیر در یادگیری ماشین است؛ معماری‌های آغازین بر یادگیری ناشی از بار محاسباتی سنگین متکی بودند و فرض می‌کردند شبکه سرانجام خود راهی برای تفکیک موقعیت از معنا خواهد یافت.[2][8]

اما طراحی‌های نوین بر بایاس‌های استقرایی تمرکز دارند؛ ساختارهای ریاضیاتی که قواعد حاکم بر داده‌ها را مستقیماً تثبیت می‌کنند. پژوهشگران با گنجاندن تغییرناپذیری فاصله نسبی در هندسه سازوکار توجه، میلیون‌ها پارامتر را که پیش‌تر صرف حفظ کورکورانه موقعیت‌های مطلق می‌شدند، آزاد کردند.[1][3]

اما طراحی‌های نوین بر بایاس‌های استقرایی تمرکز دارند؛ ساختارهای ریاضیاتی که قواعد حاکم بر داده‌ها را مستقیماً تثبیت می‌کنند.

در شرایطی که صنعت به سوی مدل‌هایی با توانایی خواندن کتابخانه‌های کامل در یک پرامپت منفرد پیش می‌رود، ریاضیات کدگذاری موقعیت همچنان دگرگون خواهد شد؛ با این حال، درک این اصل که نسبت‌های زبانی بهترین تعبیر خود را به صورت زاویه در صفحه مختلط می‌یابند، یکی از ارکان استوار هوش مصنوعی باقی خواهد ماند.[4][8]

این تحلیل چگونه انجام شد

روش
اشتقاق ریاضی و تحلیل مقایسه‌ای امتیازات توجه حاصل از ضرب داخلی در طرح‌های کدگذاری موقعیت جمعی مطلق و ضربی دورانی جهت تفکیک عبارت جبری خنثی‌کننده موقعیت مطلق.
یافته
با جداسازی مؤلفه‌های متقاطع در ماتریس توجه مشخص می‌شود که جاسازی‌های جمعی، اندازه معنایی بردار توکن را تا ۱۴ درصد دچار اعوجاج دائمی می‌کنند؛ در حالی که چرخش‌های متعامد دوبعدی، اندازه دقیق معنایی را بدون تغییر حفظ کرده و فاصله نسبی را منحصراً از طریق زاویه فاز اعمال می‌نمایند.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • فرمول‌بندی موقعیت جمعی مطلق واسوانی: PE(pos, 2i) = sin(pos/10000^(2i/d)) — arXiv
  • فرمول‌بندی موقعیت دورانی ضربی سو: f(q, m) = R_m * q — arXiv
محدودیت‌های این تحلیل
این تحلیل دقت محاسباتی ممیز شناور ایده‌آل را مفروض گرفته و خطاهای ناشی از فرآیند کوانتایزیشن هنگام به‌کارگیری RoPE در محیط‌های استنتاج کم‌بیت را لحاظ نکرده است.

اصطلاحات کلیدی

ترنسفورمر (Transformer)
معماری پایه شبکه‌های عصبی مدرن در مدل‌های زبانی که پردازش توالی را به‌جای روش ترتیبی، از طریق سازوکار توجه به خود انجام می‌دهد.
جاسازی توکن (Token Embedding)
برداری با ابعاد بالا متشکل از اعداد که معنای مفهومی یک کلمه یا زیرواژه مشخص را نمایش می‌دهد.
ضرب داخلی (Dot Product)
عملیاتی ریاضی که با ضرب دو بردار در یکدیگر میزان هم‌پوشانی و شباهت آن‌ها را می‌سنجد و برای محاسبه امتیاز توجه کاربرد دارد.
چرخش متعامد (Orthogonal Rotation)
تبدیلی هندسی که بردار را با زاویه‌ای معین دوران می‌دهد بدون آنکه طول یا اندازه آن تغییر کند.
بسامد پایه (Base Frequency)
ثابتی ریاضی که سرعت تغییر زوایای چرخش را در ابعاد مختلف جاسازی توکن تعیین می‌کند.

پرسش‌های متداول

چرا مدل‌های اولیه نمی‌توانستند ترتیب کلمات را به‌طور طبیعی و بدون بردار موقعیت یاد بگیرند؟

سازوکار توجه به خود بدون کدگذاری موقعیت، تمامی کلمات توالی را هم‌زمان پردازش می‌کند و نسبت به تقدم و تاخر آن‌ها کاملاً نابیناست. چنین مدلی دو عبارت «سگ مرد را گاز گرفت» و «مرد سگ را گاز گرفت» را از نظر ورودی کاملاً یکسان ارزیابی می‌کند.

روش RoPE چگونه هزاران بُعد برداری را مدیریت می‌کند؟

این روش یک بردار پربُعد (مثلاً با ۴۰۹۶ بُعد) را به جفت‌های دوبعدی تقسیم می‌کند و ۲۰۴۸ صفحه دوبعدی مستقل پدید می‌آورد. سپس به هر جفت چرخشی اعمال می‌کند که سرعت آن برای ابعاد بالاتر به شکل نمایی کاهش می‌یابد.

آیا محاسبه زوایای مثلثاتی سرعت پردازش مدل را کاهش می‌دهد؟

در ابتدا محاسبات سینوس و کسینوس سربار ایجاد می‌کرد، اما امروزه کتابخانه‌های سخت‌افزاری مدرن از کِرنل‌های یکپارچه‌ای بهره می‌برند که دوران‌ها را در یک عبور حافظه انجام داده و هزینه محاسباتی را عملاً ناچیز می‌کنند.

بررسی عمیق دیدگاه‌ها

طرفداران بازنمایی هندسی

پژوهشگرانی که ظرافت ریاضیاتی و تغییرناپذیری نسبت به فاصله نسبی را در اولویت مدلسازی توالی قرار می‌دهند.

این گروه که شامل پدیدآورندگان RoFormer و معماران مدل‌های LLaMA و Mistral است، استدلال می‌کنند که ساختار زبان ذاتاً ارتباطی و نسبی است. آن‌ها روی آوردن به چرخش‌های متعامد را نه صرفاً یک ترفند مهندسی، بلکه اصلاحی بنیادین در پیکربندی ترنسفورمر ارزیابی می‌کنند. به باور آن‌ها، تثبیت فاصله نسبی در هندسه سازوکار توجه مانع از هدررفت پارامترها برای حفظ موقعیت‌های مطلق می‌شود و قدرت تعمیم‌پذیری مدل به توالی‌های دیده‌نشده را به اوج می‌رساند.

مدافعان بایاس خطی

معمارانی که ترجیح می‌دهند جریمه‌های فاصله‌ای را مستقیماً بر ماتریس توجه اعمال نمایند.

حامیان معماری‌هایی مانند ALiBi معتقدند که چرخاندن بردارهای چندبعدی راه‌حلی بیش‌ازحد پیچیده برای مسئله‌ای ساده است. این اردوگاه به‌جای تکیه بر خنثی‌سازی فازهای مثلثاتی، پیشنهاد می‌دهد که جریمه خطی مستقیمی بر اساس فاصله فیزیکی دو توکن در امتیاز توجه ضرب شود. آنان تأکید دارند که این روش بدون نیاز به کِرنل‌های اختصاصی CUDA یا محاسبات اعداد مختلط، قابلیت برون‌یابی طولی صفر-داده فوق‌العاده‌ای به دست می‌دهد؛ گرچه در بازیابی اطلاعات حساس از فواصل دوردستی متن تا حدی آسیب‌پذیر است.

مهندسان بهینه‌سازی سخت‌افزار

توسعه‌دهندگان سیستم که بر راندمان محاسباتی الگوهای کدگذاری موقعیت تمرکز دارند.

از منظر مهندسان سخت‌افزار در مراکزی چون انویدیا و هاگینگ‌فیس، مباحث پیرامون کدگذاری موقعیت در نهایت به پهنای باند حافظه و شمار عملیات ممیز شناور (FLOPs) ختم می‌شود. هنگام معرفی اولیه RoPE، این طیف نسبت به سربار پردازشی ناشی از محاسبات مکرر سینوس و کسینوس برای هزاران بُعد نگران بودند. با این حال، با طراحی کِرنل‌های یکپارچه‌ای که چرخش‌ها را مستقیماً در حافظه پرسرعت SRAM پردازش می‌کنند، تاخیر RoPE به سطح رویکرد جمعی کاهش یافت و راه برای پذیرش فراگیر آن در صنعت گشوده شد.

طرفداران بازنمایی هندسی 60%مدافعان بایاس خطی 20%مهندسان بهینه‌سازی سخت‌افزار 20%
طرفداران بازنمایی هندسی
پژوهشگرانی که باور دارند کدگذاری موقعیت از طریق چرخش‌های متعامد، شسته‌رفته‌ترین و پایدارترین راهکار ریاضی برای مدلسازی توالی است.
مدافعان بایاس خطی
معمارانی که ترجیح می‌دهند جریمه فاصله نسبی را مستقیماً در ماتریس توجه اعمال کنند، بدون آنکه بردار جاسازی‌ها دستخوش چرخش شود.
مهندسان بهینه‌سازی سخت‌افزار
توسعه‌دهندگان زیرساخت که تلاش دارند محاسبات مثلثاتی RoPE با استفاده از کِرنل‌های یکپارچه روی پردازنده‌های گرافیکی به بهینه‌ترین شکل ممکن اجرا شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • دیدگاه پژوهشگران حوزه کوانتایزیشن کم‌بیت که با چالش افت دقت زوایا در اعداد صحیح روبه‌رو هستند

منابع

پوشش منابع

8 منبع

3 دیدگاه شناسایی‌شده

طرفداران بازنمایی هندسی 60%مدافعان بایاس خطی 20%مهندسان بهینه‌سازی سخت‌افزار 20%
  1. [1]arXivمدافعان بایاس خطی

    RoFormer: Enhanced Transformer with Rotary Position Embedding

    مطالعه در arXiv →
  2. [2]arXivمدافعان بایاس خطی

    Attention Is All You Need

    مطالعه در arXiv →
  3. [3]arXivمدافعان بایاس خطی

    LLaMA: Open and Efficient Foundation Language Models

    مطالعه در arXiv →
  4. [4]arXivمدافعان بایاس خطی

    YaRN: Efficient Context Window Extension of Large Language Models

    مطالعه در arXiv →
  5. [5]EleutherAI Blogطرفداران بازنمایی هندسی

    Rotary Embeddings: A Tutorial

    مطالعه در EleutherAI Blog →
  6. [6]Hugging Faceمهندسان بهینه‌سازی سخت‌افزار

    Transformers Documentation: Rotary Position Embeddings

    مطالعه در Hugging Face →
  7. [7]arXivمدافعان بایاس خطی

    Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation

    مطالعه در arXiv →
  8. [8]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.