رفتن به محتوای اصلی
توضیح کوهستانمعماری‌های عصبیتوضیح و تشریح۸ شهریور ۱۴۰۵، ۱۷:۳۴· 7 دقیقه مطالعه· در هوش مصنوعی

مکانیسم معماری ترنسفورمر: چگونه خودتوجهی و کدگذاری موقعیتی به هوش مصنوعی مدرن قدرت می‌بخشند

معماری ترنسفورمر با این قابلیت که به مدل‌ها اجازه می‌دهد به جای پردازش کلمه به کلمه، کل توالی داده‌ها را به صورت همزمان پردازش کنند، انقلابی در هوش مصنوعی ایجاد کرد. این مدل‌ها با ترکیب مکانیسم‌های خودتوجهی و کدگذاری موقعیتی، روابط پیچیده را در حجم وسیعی از متن ترسیم می‌کنند و اساس سیستم‌های هوش مصنوعی مولد امروزی را تشکیل می‌دهند.

به قلم فرشید جمشیدی

مهندسان سخت‌افزار هوش مصنوعی 35%محققان الگوریتمی 35%زبان‌شناسان و متخصصان خالص NLP 30%
مهندسان سخت‌افزار هوش مصنوعی
تمرکز بر محدودیت‌های محاسباتی فیزیکی معماری.
محققان الگوریتمی
تمرکز بر بهینه‌سازی یا جایگزینی مکانیسم توجه اصلی.
زبان‌شناسان و متخصصان خالص NLP
تمرکز بر تمایز بین همبستگی آماری و درک واقعی.

نکات کلیدی

  1. معماری ترنسفورمر پردازش متوالی را با پردازش موازی جایگزین کرد و در هوش مصنوعی انقلاب به پا کرد.
  2. خودتوجهی به مدل اجازه می‌دهد تا به صورت پویا اهمیت زمینه‌ای هر کلمه در یک توالی را بسنجد.
  3. کدگذاری موقعیتی از امواج ریاضی برای اطمینان از به خاطر سپردن ترتیب دقیق کلمات توسط مدل استفاده می‌کند.
  4. اتکای این معماری به ضرب ماتریسی یک گلوگاه محاسباتی درجه دوم ایجاد می‌کند.
  5. بسیاری از مدل‌های مولد مدرن از ساختار فقط رمزگشا (Decoder-only) استفاده می‌کنند و کاملاً به خودتوجهی برای پیش‌بینی متکی هستند.

برای دهه‌ها، تحقیقات هوش مصنوعی با یک گلوگاه اساسی دست و پنجه نرم می‌کرد: خطی بودن بی‌امان زمان. شبکه‌های عصبی بازگشتی (RNNs)، که استاندارد قبلی برای پردازش زبان طبیعی بودند، مجبور بودند متن را به صورت متوالی و کلمه به کلمه بخوانند. تا زمانی که یک RNN به انتهای یک پاراگراف طولانی می‌رسید، ظرافت‌های ابتدای آن را از نظر ریاضی «فراموش» کرده بود، که درک عمیق زمینه‌ای را تقریباً غیرممکن می‌ساخت. تنش واضح و به ظاهر غیرقابل حل بود—چگونه یک ماشین می‌تواند زبان پیچیده را واقعاً درک کند در حالی که معماری آن فقط به آن اجازه می‌دهد در هر لحظه به یک قطعه داده نگاه کند؟

راه‌حل این گلوگاه در سال ۲۰۱۷ با مقاله‌ای به ظاهر ساده با عنوان «توجه تنها چیزی است که نیاز دارید» (Attention Is All You Need) ارائه شد. این مقاله که توسط تیمی از محققان گوگل منتشر شد، پیشنهاد کرد که پردازش متوالی به طور کامل کنار گذاشته شود و به جای آن از یک معماری جدید و رادیکال به نام ترنسفورمر استفاده شود. ترنسفورمر به جای خواندن یک جمله از چپ به راست، همه چیز را به یکباره می‌بیند و کل توالی داده‌ها را به صورت همزمان پردازش می‌کند. این تغییر از خواندن خطی به پردازش موازی، مسیر یادگیری ماشین را به طور اساسی تغییر داد.[1]

برای درک اینکه ترنسفورمر چگونه به این پردازش موازی دست می‌یابد، ابتدا باید موتور اصلی آن را بررسی کنیم: مکانیسم خودتوجهی (Self-Attention). وقتی یک انسان جمله‌ای مانند «ساحل رودخانه» را می‌خواند، فوراً می‌داند که «ساحل» به خشکی اشاره دارد، نه یک مؤسسه مالی، زیرا کلمات زمینه‌ای اطراف آن را مشخص می‌کنند. خودتوجهی معادل ریاضی این غریزه انسانی است و به مدل اجازه می‌دهد تا به صورت پویا اهمیت هر کلمه در یک توالی را در برابر هر کلمه دیگری بسنجد تا معنای واقعی آن را استخراج کند.

در عمل، خودتوجهی یک امتیاز ارتباطی خاص را محاسبه می‌کند که نشان می‌دهد هر کلمه چقدر باید بر درک کلمه دیگر تأثیر بگذارد. همانطور که تحلیل فنی IBM توضیح می‌دهد، این مکانیسم به مدل اجازه می‌دهد تا یک شبکه متراکم و به هم پیوسته از روابط بسازد و وابستگی‌های دوربرد را که مدل‌های متوالی به سادگی در نویز از دست می‌دادند، ثبت کند. با تخصیص وزن‌های عددی دقیق به این روابط، مدل دقیقاً یاد می‌گیرد که کدام بخش‌های یک جمله برای معنای کلی حیاتی هستند و کدام‌ها را می‌توان با خیال راحت نادیده گرفت.[7]

معماری اصلی این فرآیند را از طریق سه بردار متمایز برای هر کلمه رسمی می‌کند: کوئری‌ها (Queries)، کلیدها (Keys) و مقادیر (Values). این را مانند یک سیستم بازیابی کتابخانه بسیار کارآمد در مقیاس بزرگ در نظر بگیرید. کوئری نشان‌دهنده چیزی است که یک کلمه خاص به دنبال آن است، کلید نشان‌دهنده محتوایی است که کلمات دیگر در خود دارند، و مقدار، معنای واقعی معنایی است که وقتی یک کوئری و یک کلید از نظر ریاضی مطابقت دارند، استخراج می‌شود. این سه‌گانه اساس ریاضی محاسبه توجه را تشکیل می‌دهد و به شبکه اجازه می‌دهد اطلاعات را به صورت پویا مسیریابی کند.[1]

خودتوجهی برای مسیریابی ریاضی اطلاعات بین کلمات، به بردارهای کوئری، کلید و مقدار متکی است.

ترنسفورمر این عملیات را فقط یک بار انجام نمی‌دهد. از «توجه چندسر» (Multi-Head Attention) استفاده می‌کند و چندین عملیات کوئری-کلید-مقدار را به صورت موازی اجرا می‌کند. همانطور که در پیاده‌سازی حاشیه‌نویسی شده هاروارد NLP شرح داده شده است، این امر به مدل اجازه می‌دهد تا انواع کاملاً متفاوتی از روابط را به طور همزمان ردیابی کند—یک «سر» ممکن است صرفاً بر ساختار گرامری تمرکز کند، در حالی که دیگری لحن عاطفی یا تطابق فعل و فاعل را دنبال می‌کند. این ردیابی موازی چیزی است که عمق درک بی‌سابقه‌ای به این معماری می‌بخشد.[3]

با این حال، پردازش همزمان همه چیز یک نقص معماری مهلک ایجاد می‌کند. اگر همه کلمات در یک لحظه دریافت و تحلیل شوند، مدل اساساً مفهوم ترتیب کلمات را از دست می‌دهد. برای یک مکانیسم خودتوجهی خالص، جملات «سگ مرد را گاز گرفت» و «مرد سگ را گاز گرفت» از نظر ریاضی یکسان به نظر می‌رسند زیرا حاوی مجموعه دقیقاً یکسانی از توکن‌ها هستند. بدون حس داخلی توالی، مدل نمی‌تواند نحو، گرامر یا جریان روایی اساسی را درک کند و آن را برای تولید زبان پیچیده بی‌فایده می‌سازد.

با این حال، پردازش همزمان همه چیز یک نقص معماری مهلک ایجاد می‌کند.

برای حل این مشکل توالی بدون بازگشت به پردازش خطی و کند، ترنسفورمر به تکنیکی به نام «کدگذاری موقعیتی» (Positional Encoding) متکی است. قبل از اینکه کلمات به موتور خودتوجهی وارد شوند، با یک امضای ریاضی مهر می‌شوند که موقعیت دقیق مطلق و نسبی آن‌ها را در متن نشان می‌دهد. این راه‌حل ظریف به مدل اجازه می‌دهد تا داده‌ها را به طور کامل به صورت موازی پردازش کند در حالی که همچنان یک نقشه ریاضی کامل از اینکه هر کلمه در ساختار جمله اصلی به کجا تعلق دارد، حفظ کند.

این کدگذاری‌های موقعیتی اعداد شاخص ساده نیستند. طبق آموزش‌های DataCamp و Machine Learning Mastery در این زمینه، آن‌ها از امواج سینوسی و کسینوسی در هم تنیده با فرکانس‌های مختلف استفاده می‌کنند. این امر یک الگوی ریاضی پیوسته و منحصر به فرد ایجاد می‌کند که به مدل اجازه می‌دهد فاصله دقیق بین هر دو کلمه را محاسبه کند، صرف نظر از اینکه چقدر در توالی از هم دور هستند. با جاسازی مستقیم این امواج در داده‌ها، مدل ذاتاً روابط فضایی بین توکن‌ها را درک می‌کند.[6][9]

کدگذاری موقعیتی از امواج سینوسی و کسینوسی در هم تنیده استفاده می‌کند تا حس ریاضی ترتیب کلمات را به مدل بدهد.

هنگامی که خودتوجهی و کدگذاری موقعیتی با هم ترکیب می‌شوند، نتیجه یک عملیات ضرب ماتریسی عظیم و بسیار موازی است. تحلیل معماری «Dive into Deep Learning» نشان می‌دهد که سنگین‌ترین کار محاسباتی در اینجا اتفاق می‌افتد. مدل به معنای انسانی «فکر» نمی‌کند؛ بلکه هزاران ماتریس را ضرب می‌کند تا وزن‌های شبکه عصبی خود را بر اساس داده‌های توالی به طور مداوم به‌روزرسانی کند. این واقعیت ریاضی، موتور محرک کل سیستم است.[4]

این ما را به بزرگترین محدودیت معماری می‌رساند: گلوگاه درجه دوم (Quadratic Bottleneck). از آنجایی که هر کلمه باید رابطه خود را با هر کلمه دیگری در توالی محاسبه کند، هزینه محاسباتی به صورت درجه دوم یا O(n²) افزایش می‌یابد. اگر طول متنی را که به مدل می‌دهید دو برابر کنید، توان محاسباتی مورد نیاز چهار برابر می‌شود. این قانون مقیاس‌بندی مرزهای فیزیکی و اقتصادی اینکه یک پنجره متنی (Context Window) چقدر می‌تواند واقع‌بینانه بزرگ شود را تعیین می‌کند.[4]

هزینه محاسباتی خودتوجهی به صورت درجه دوم مقیاس می‌یابد و با افزایش طول متن، به طور تصاعدی به توان بیشتری نیاز دارد.

این مقیاس‌بندی درجه دوم، تقاضاهای زیرساختی عظیم هوش مصنوعی مدرن را توضیح می‌دهد. مکانیسم خودتوجهی در ثبت زمینه (Context) فوق‌العاده مؤثر است، اما اساساً یک عملیات ریاضی با نیروی خام است. این مکانیسم نیازمند سخت‌افزار تخصصی—به ویژه پردازنده‌های گرافیکی (GPU) پیشرفته—است که هدف اصلی آن‌ها اجرای همزمان هزاران ضرب ماتریسی است. بدون این مراکز داده عظیم و پرمصرف، معماری ترنسفورمر از نظر تئوری درخشان اما عملاً برای کاربردهای مولد در مقیاس بزرگ که دوران تکنولوژیک کنونی را تعریف می‌کنند، غیرقابل استفاده باقی می‌ماند.

در ابتدا، ترنسفورمر با دو نیمه متمایز طراحی شد: یک رمزگذار (Encoder) که ورودی را می‌خواند و پردازش می‌کند، و یک رمزگشا (Decoder) که خروجی را تولید می‌کند. تصویرسازی «ترنسفورمر مصور» (Illustrated Transformer) اثر جی آلامار نشان می‌دهد که چگونه رمزگذار درک عمیق زمینه‌ای خود را به رمزگشا منتقل می‌کند، که سپس کلمه منطقی بعدی را در توالی پیش‌بینی می‌کند. این ساختار دوگانه برای وظایف ترجمه ماشینی، که مورد استفاده اصلی معماری بود، بسیار مؤثر بود.[2]

جالب اینجاست که این معماری از زمان معرفی در سال ۲۰۱۷ به طور قابل توجهی تکامل یافته است. بسیاری از مشهورترین مدل‌های مولد امروزی، از جمله خانواده GPT، رمزگذار را به طور کامل کنار گذاشتند. آن‌ها از معماری «فقط رمزگشا» (Decoder-only) استفاده می‌کنند و صرفاً به خودتوجهی پوشش‌دار (Masked Self-Attention) متکی هستند تا توکن بعدی را بر اساس هر آنچه قبلاً آمده است پیش‌بینی کنند، و ثابت می‌کنند که مکانیسم توجه اصلی به اندازه کافی قوی است که بتواند بدون نیاز به فاز رمزگذاری جداگانه برای درک داده‌های ورودی، به تنهایی بایستد.

در نهایت، معماری ترنسفورمر موفق شد زیرا با موفقیت منطق متوالی را با محاسبات موازی مبادله کرد. با استفاده از خودتوجهی برای ترسیم زمینه و کدگذاری موقعیتی برای به خاطر سپردن ترتیب، پردازش زبان طبیعی را از یک کار کند و خطی به یک عملیات ریاضی بسیار موازی تبدیل کرد و زمینه اصلی را برای کل دوران هوش مصنوعی مولد فراهم ساخت. در حالی که با چالش‌های مقیاس‌بندی روبرو است، مکانیسم‌های اصلی آن همچنان استاندارد بی‌چون و چرای هوش مصنوعی مدرن باقی مانده‌اند.

اصطلاحات کلیدی

خودتوجهی
یک مکانیسم ریاضی که به مدل اجازه می‌دهد اهمیت هر کلمه در یک توالی را در برابر هر کلمه دیگری بسنجد تا زمینه را بسازد.
کدگذاری موقعیتی
تکنیکی که داده‌ها را با یک امضای ریاضی (اغلب با استفاده از امواج سینوسی و کسینوسی) مهر می‌کند تا مدل ترتیب کلمات اصلی را به خاطر بسپارد.
توجه چندسر
اجرای چندین عملیات خودتوجهی به صورت موازی، که به مدل اجازه می‌دهد انواع مختلفی از روابط را به طور همزمان ردیابی کند.
توکن
واحد اساسی داده که توسط یک مدل هوش مصنوعی پردازش می‌شود، که می‌تواند یک کلمه، بخشی از یک کلمه یا یک کاراکتر واحد باشد.

منابع

پوشش منابع

10 منبع

3 دیدگاه شناسایی‌شده

مهندسان سخت‌افزار هوش مصنوعی 35%محققان الگوریتمی 35%زبان‌شناسان و متخصصان خالص NLP 30%
  1. [1]arXiv

    Attention Is All You Need

    مطالعه در arXiv
  2. [2]Jay Alammar

    The Illustrated Transformer

    مطالعه در Jay Alammar
  3. [3]Harvard NLP

    The Annotated Transformer

    مطالعه در Harvard NLP
  4. [4]Dive into Deep Learning

    11.7. The Transformer Architecture

    مطالعه در Dive into Deep Learning
  5. [5]DataCamp

    Self-Attention Explained: The Mechanism Powering Modern AI

    مطالعه در DataCamp
  6. [6]DataCamp

    Positional Encoding: How Transformers Understand Order

    مطالعه در DataCamp
  7. [7]IBM

    What is self-attention?

    مطالعه در IBM
  8. [8]Machine Learning Mastery

    A Gentle Introduction to Attention and Transformer Models

    مطالعه در Machine Learning Mastery
  9. [9]Machine Learning Mastery

    A Gentle Introduction to Positional Encoding in Transformer Models, Part 1

    مطالعه در Machine Learning Mastery
  10. [10]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.