رفتن به محتوای اصلی
توضیح کوهستانمعماری هوش مصنوعیتوضیح و تشریح۹ شهریور ۱۴۰۵، ۱۴:۳۲· 5 دقیقه مطالعه· در هوش مصنوعی

سازوکار توکن‌سازی: چگونه متن به عدد تبدیل می‌شود و پنجره متنی مدل‌های زبان بزرگ را تعریف می‌کند

پیش از آنکه یک مدل زبان بزرگ بتواند یک فرمان (prompt) را پردازش کند، متن باید به توکن‌های عددی تجزیه شود. این گام اساسی تعیین می‌کند که مدل چه میزان اطلاعاتی را می‌تواند در پنجره متنی خود نگه دارد و چرا در برخی انواع استدلال‌ها دچار مشکل می‌شود.

به قلم الوین شادمهر

محققان هوش مصنوعی 40%توسعه‌دهندگان سازمانی 35%تحلیلگران سیاست و اقتصاد 25%
محققان هوش مصنوعی
تمرکز بر بهینه‌سازی الگوریتم‌های توکن‌سازی برای فشرده‌سازی بهتر، عدالت بین‌زبانی و بهبود استدلال در سطح کاراکتر.
توسعه‌دهندگان سازمانی
اولویت‌بندی حداکثرسازی پنجره متنی برای وظایف پیچیده مانند تحلیل پایگاه کد، ضمن مدیریت هزینه‌های مالی مرتبط با مصرف توکن.
تحلیلگران سیاست و اقتصاد
بررسی اینکه چگونه کارایی توکن‌سازی و محدودیت‌های پنجره متنی، دوام تجاری و دسترسی به ابزارهای هوش مصنوعی را دیکته می‌کنند.

هنگامی که کاربر فرمانی را در یک مدل زبان بزرگ (LLM) تایپ می‌کند، هوش مصنوعی حروف، کلمات یا جملات را نمی‌بیند. بلکه یک دنباله از اعداد را مشاهده می‌کند. لایه ترجمه بین زبان انسانی و ریاضیات ماشین، توکن‌سازی نامیده می‌شود و این گلوگاه نامرئی است که هم قابلیت‌ها و هم محدودیت‌های سخت هوش مصنوعی مدرن را تعریف می‌کند.[4][5]

توکن، واحد بنیادی داده‌ای است که توسط مدل زبان بزرگ پردازش می‌شود. لزوماً یک کلمه کامل نیست؛ می‌تواند یک کاراکتر، یک هجا، یا یک عبارت رایج باشد. فرآیند تجزیه متن به این واحدها توسط الگوریتم‌هایی کنترل می‌شود که رایج‌ترین آن‌ها رمزگذاری جفت بایت (BPE) است. BPE با ادغام مکرر جفت‌های کاراکتر یا بایت‌هایی که بیشترین تکرار را در مجموعه داده آموزشی دارند، کار می‌کند تا زمانی که به اندازه واژگان از پیش تعریف شده‌ای برسد.[1][5]

این سازوکار فشرده‌سازی برای کلمات رایج انگلیسی بسیار کارآمد است. کلمه «apple» ممکن است یک توکن واحد باشد. با این حال، کلمات کمتر رایج، اسامی خاص، یا کلمات در زبان‌های دیگر ممکن است به چندین توکن تقسیم شوند. به عنوان مثال، یک اصطلاح فنی پیچیده ممکن است به سه یا چهار شناسه عددی مجزا تجزیه شود. این تفاوت توضیح می‌دهد که چرا مدل‌های زبان بزرگ، انگلیسی را کارآمدتر از بسیاری از زبان‌های دیگر پردازش می‌کنند، زیرا نسبت توکن به کلمه در انگلیسی پایین‌تر است و ظرفیت پردازشی کمتری از مدل را مصرف می‌کند.[1][4]

رمزگذاری جفت بایت (BPE) کلمات را به واحدهای زیرکلمه‌ای رایج تجزیه می‌کند که سپس شناسه‌های عددی به آن‌ها اختصاص داده می‌شود.

نحوه توکن‌سازی متن مستقیماً بر توانایی مدل زبان بزرگ در انجام وظایف خاصی تأثیر می‌گذارد. از آنجا که مدل بر اساس توکن‌ها عمل می‌کند نه کاراکترهای مجزا، ذاتاً فاقد درک در سطح کاراکتر از متنی است که تولید می‌کند. به همین دلیل است که مدل‌های زبان بزرگ اغلب در وظایفی مانند شمردن تعداد حرف «r» در کلمه «strawberry»، نوشتن اشعار سرواژه‌ای (acrostic poems)، یا معکوس کردن املای یک کلمه دچار مشکل می‌شوند. مدل «نمی‌داند» یک کلمه چگونه هجی می‌شود؛ بلکه فقط رابطه آماری بین توکنی که نماینده آن کلمه است و توکن‌های دیگر را می‌داند.[1][5]

توکن‌سازی به طور ناگسستنی با مفهوم پنجره متنی گره خورده است. پنجره متنی حداکثر تعداد توکن‌هایی است که یک مدل زبان بزرگ می‌تواند در یک زمان در حافظه فعال خود نگه دارد، که شامل هم فرمان کاربر و هم پاسخ تولید شده توسط مدل می‌شود. اگر مدلی دارای پنجره متنی ۱۲۸٬۰۰۰ توکنی باشد، می‌تواند تقریباً معادل یک کتاب ۳۰۰ صفحه‌ای را در یک تعامل واحد پردازش کند.[2][3]

توکن‌سازی به طور ناگسستنی با مفهوم پنجره متنی گره خورده است.

هنگامی که یک مکالمه یا سند از پنجره متنی فراتر می‌رود، مدل شروع به «فراموش کردن» اطلاعات اولیه می‌کند. این فرآیند بر اساس اصل پنجره کشویی عمل می‌کند و قدیمی‌ترین توکن‌ها را حذف می‌کند تا فضایی برای توکن‌های جدید باز شود. این محدودیت یک قید فیزیکی سخت است که توسط معماری ترنسفورمر دیکته شده است، جایی که هزینه محاسباتی پردازش توکن‌ها به صورت درجه دوم (quadratic) با طول دنباله افزایش می‌یابد.[2][3]

اندازه پنجره متنی یک میدان نبرد اصلی در توسعه هوش مصنوعی است. مدل‌های اولیه به چند هزار توکن محدود بودند و آن‌ها را به مکالمات کوتاه یا خلاصه‌سازی محدود می‌کردند. مدل‌های پیشرفته مدرن دارای پنجره‌های متنی از ۱۲۸٬۰۰۰ تا بیش از یک میلیون توکن هستند که آن‌ها را قادر می‌سازد کل پایگاه‌های کد را تحلیل کنند، چندین سند طولانی را ترکیب نمایند، یا انسجام را در تعاملات طولانی‌مدت حفظ کنند.[2][4]

با این حال، صرفاً گسترش پنجره متنی، بازیابی کامل اطلاعات را تضمین نمی‌کند. تحقیقات نشان می‌دهد که مدل‌ها اغلب از پدیده «گم‌شده در میانه» رنج می‌برند، به این صورت که می‌توانند اطلاعات را از همان ابتدا یا انتهای یک فرمان طولانی به دقت بازیابی کنند، اما برای استخراج حقایق دفن شده در میانه یک پنجره متنی عظیم دچار مشکل می‌شوند. این کاهش عملکرد، تفاوت بین ظرفیت نظری و کاربرد عملی را برجسته می‌کند.[3][5]

مدل‌ها اغلب برای بازیابی اطلاعاتی که در میانه یک پنجره متنی بزرگ دفن شده‌اند، دچار مشکل می‌شوند.

اقتصاد هوش مصنوعی نیز به توکن‌سازی گره خورده است. ارائه‌دهندگان API معمولاً توسعه‌دهندگان را بر اساس تعداد توکن‌های پردازش شده — هم ورودی (فرمان) و هم خروجی (متن تولید شده) — شارژ می‌کنند. بنابراین، توکن‌سازی کارآمد تنها یک ضرورت فنی نیست؛ بلکه یک الزام مالی است. یک توکن‌ساز که متن را مؤثرتر فشرده می‌کند، هزینه اجرای مدل را کاهش داده و اجازه می‌دهد اطلاعات بیشتری در پنجره متنی جای گیرد.[4][5]

با چندوجهی شدن مدل‌های هوش مصنوعی، که تصاویر، صدا و ویدئو را در کنار متن پردازش می‌کنند، مفهوم توکن‌سازی در حال گسترش است. داده‌های بصری به «تکه‌های تصویر» (image patches) یا توکن‌های بصری تجزیه می‌شوند، که به معماری ترنسفورمر اجازه می‌دهد تا با استفاده از همان چارچوب ریاضی زیربنایی، وجوه مختلف را پردازش کند. این رویکرد یکپارچه به توکن‌سازی، زیربنای نسل بعدی سیستم‌های هوش مصنوعی است که قادر به استدلال در میان اشکال مختلف داده هستند.[5]

با وجود این پیشرفت‌ها، سازوکارهای بنیادی توکن‌سازی متن همچنان یک حوزه حیاتی برای مطالعه باقی مانده است. محققان در حال بررسی رویکردهای جایگزین برای BPE هستند و به دنبال روش‌هایی می‌گردند که در زبان‌های مختلف عادلانه‌تر بوده و برای استدلال در سطح کاراکتر قوی‌تر باشند. تا زمانی که یک تغییر پارادایم رخ دهد، درک اینکه چگونه متن به عدد تبدیل می‌شود، برای هر کسی که به دنبال تسلط بر قابلیت‌ها و محدودیت‌های مدل‌های زبان بزرگ است، ضروری است.[1][5]

نکات کلیدی

  • توکن‌سازی متن انسانی را به دنباله‌های عددی تبدیل می‌کند که مدل‌های هوش مصنوعی قادر به پردازش آن‌ها هستند.
  • الگوریتم رمزگذاری جفت بایت (BPE) روش استاندارد برای تجزیه متن به توکن‌های زیرکلمه‌ای است.
  • از آنجا که مدل‌ها توکن‌ها را پردازش می‌کنند نه حروف را، در وظایف سطح کاراکتر مانند املا یا شمارش حروف خاص مشکل دارند.
  • پنجره متنی حداکثر تعداد توکن‌هایی را تعریف می‌کند که یک مدل می‌تواند در حافظه فعال خود نگه دارد.
  • گسترش پنجره‌های متنی به مدل‌ها اجازه می‌دهد کل کتاب‌ها یا پایگاه‌های کد را پردازش کنند، اما همچنان ممکن است از مشکلات بازیابی اطلاعات «گم‌شده در میانه» رنج ببرند.
  • کارایی توکن‌سازی مستقیماً بر هزینه مالی اجرای مدل‌های هوش مصنوعی از طریق استفاده از API تأثیر می‌گذارد.

چرا مهم است

درک توکن‌سازی پرده از این راز برمی‌دارد که چرا مدل‌های هوش مصنوعی گاهی در انجام وظایف ساده‌ای مانند شمردن حروف یا معکوس کردن کلمات شکست می‌خورند، و همچنین محدودیت‌های فیزیکی سختی را که بر میزان اطلاعات ورودی به یک فرمان حاکم است، روشن می‌سازد.

اصطلاحات کلیدی

توکن
واحد بنیادی داده‌ای که توسط یک مدل زبان پردازش می‌شود و می‌تواند نماینده یک کاراکتر، بخشی از یک کلمه، یا یک کلمه کامل باشد.
رمزگذاری جفت بایت (BPE)
یک الگوریتم رایج فشرده‌سازی داده است که برای توکن‌سازی متن با ادغام مکرر جفت‌های کاراکتری که بیشترین تکرار را دارند، استفاده می‌شود.
پنجره متنی
حداکثر تعداد توکن‌هایی که یک مدل هوش مصنوعی می‌تواند در یک زمان در حافظه فعال خود نگه دارد، شامل هم فرمان و هم پاسخ.
معماری ترنسفورمر
طراحی شبکه عصبی زیربنایی که توسط مدل‌های زبان بزرگ مدرن استفاده می‌شود و توکن‌ها را به صورت موازی پردازش می‌کند، اما با طولانی‌تر شدن دنباله‌ها، از نظر محاسباتی پرهزینه می‌شود.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

محققان هوش مصنوعی 40%توسعه‌دهندگان سازمانی 35%تحلیلگران سیاست و اقتصاد 25%
  1. [1]GitHubمحققان هوش مصنوعی

    GitHub - karpathy/minbpe: Minimal, clean code for the Byte Pair Encoding (BPE) algorithm commonly used in LLM tokenization.

    مطالعه در GitHub
  2. [2]IBMتوسعه‌دهندگان سازمانی

    What is a context window?

    مطالعه در IBM
  3. [3]Unstructuredتوسعه‌دهندگان سازمانی

    LLM Context Windows Explained: A Developer's Guide

    مطالعه در Unstructured
  4. [4]The Technology Policy Instituteتحلیلگران سیاست و اقتصاد

    From Tokens to Context Windows: Simplifying AI Jargon

    مطالعه در The Technology Policy Institute
  5. [5]تیم سردبیری کوهستانمحققان هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.