تبدیل امتیازهای خام به کلمات: لایه سافتمکس چگونه مدلهای زبانی بزرگ را هدایت میکند
در آخرین مرحله از تولید متن، مدلهای هوش مصنوعی اعداد خام و مقیاسبندینشدهای به نام لاجیت تولید میکنند. تابع سافتمکس با استفاده از ریاضیات، این امتیازهای بیحدومرز را در یک توزیع احتمالاتی تمیز فشرده میکند و مدل را وادار میسازد تا کلمه بعدی خود را انتخاب کند.
به قلم فرشید جمشیدی
این خبر را به اشتراک بگذارید
- متخصصان یادگیری ماشین
- سافتمکس را به عنوان روشی ظریف و از نظر ریاضیاتی معتبر برای تبدیل خروجیهای بیحدومرز شبکه عصبی به احتمالات قابل استفاده میبینند.
- مهندسان سختافزار
- بر روی گلوگاه محاسباتیِ محاسبه توانها و مجموعها در دایره واژگان عظیم در طول فرآیند استنتاج تمرکز دارند.
- پژوهشگران تفسیرپذیری هوش مصنوعی
- تأکید میکنند که چگونه نرمالسازی اجباری، قطعیت مطلق مدل را پنهان میکند و تشخیص زمان حدس زدن هوش مصنوعی را دشوار میسازد.
دیدگاههایی که این گزارش پوشش نداده
- توسعهدهندگان برنامههای کاربردی نهایی
- دانشمندان علوم شناختی که انتخاب کلمات توسط هوش مصنوعی را با انسان مقایسه میکنند
لایه نهایی یک مدل زبانی بزرگ، قدرت تصمیمگیری نهایی را برای تعیین کلمهای که قرار است روی صفحه ظاهر شود، در دست دارد. پیش از آنکه سیستمی مانند ChatGPT یا Claude حتی یک کاراکتر تولید کند، شبکه عصبی آن مجموعه عظیمی از امتیازهای خام و بیحدومرز را تولید میکند؛ یک امتیاز برای هر کلمه ممکن در دایره واژگانش. این اعداد خام که به عنوان لاجیت شناخته میشوند، از نظر ریاضیاتی آشفتهاند و از مقادیر منفی بسیار پایین تا اعداد صحیح مثبت بسیار بالا متغیرند. مدل نمیتواند مستقیماً از آنها برای تاس ریختن و انتخاب یک کلمه استفاده کند. در عوض، به یک عملیات ریاضی خاص متکی است تا این آشفتگی را به یک منوی تمیز و قابل استفاده از انتخابها تبدیل کند.[7]
این عملیات همان تابع سافتمکس است. سافتمکس به عنوان پلی میان محاسبات داخلی هوش مصنوعی و احتمالات آماری مورد نیاز برای تولید متن خوانا برای انسان عمل میکند. با عبور دادن لاجیتها از این تابع، مدل یک فهرست دلخواه از امتیازها را به یک توزیع احتمالاتی دقیق تبدیل میکند که در آن هر مقدار مثبت است و مجموع کل مجموعه دقیقاً برابر با ۱.۰ یا ۱۰۰ درصد میشود.[1][7]
مستندات فنی Dremio توضیح میدهد: «سافتمکس یک تابع ریاضی است که برداری از اعداد را به برداری از احتمالات تبدیل میکند.» این فرآیند تضمین میکند که احتمالات هر مقدار با مقیاس نسبی هر مقدار در بردار متناسب باشد. این بدان معناست که بالاترین امتیاز خام به محتملترین کلمه بعدی تبدیل میشود، اما درصد دقیق آن به فاصله میان آن امتیاز و سایر امتیازها بستگی دارد.[6]
این مکانیزم در دو مرحله مجزا عمل میکند که با توانرسانی آغاز میشود. این تابع ثابت ریاضی e (تقریباً ۲.۷۱۸) را در نظر گرفته و آن را به توان هر لاجیت میرساند. این مرحله هدفی دوگانه دارد. نخست، هرگونه امتیاز خام منفی را به اعداد مثبت تبدیل میکند که یک الزام قطعی برای محاسبه احتمالات معتبر است. دوم، به عنوان یک تقویتکننده تهاجمی برای انتخابهای برتر مدل عمل میکند.[3][7]
از آنجا که منحنی e به توان x به صورت نمایی رشد میکند، تفاوتهای کوچک در لاجیتهای خام به تفاوتهای عظیمی در مقادیر به توان رسیده تبدیل میشوند. اگر یک کلمه دارای لاجیت ۴ و کلمه دیگر دارای لاجیت ۵ باشد، تفاوت خام آنها تنها ۱ است. اما پس از توانرسانی، اولی تقریباً به ۵۴.۶ و دومی به ۱۴۸.۴ تبدیل میشود. این تابع به شدت به انتخابهای برتر مدل پاداش میدهد و کلمات محتمل را از نویز پسزمینه دایره واژگان جدا میکند.[7]
مرحله دوم، نرمالسازی است. سیستم مجموع تمام مقادیر جدید به توان رسیده را در کل دایره واژگان محاسبه میکند. سپس هر مقدار به توان رسیده را بر آن مجموع کل تقسیم میکند. این تقسیم تضمین میکند که خروجیهای نهایی همیشه دقیقاً به ۱۰۰ درصد برسند و یک توزیع احتمالاتی معتبر ایجاد کنند که یک الگوریتم نمونهبرداری میتواند از آن برای انتخاب توکن بعدی استفاده کند.[1][5]
در مدخل ویکیپدیا درباره این موضوع آمده است: «تابع سافتمکس اغلب به عنوان آخرین تابع فعالسازی یک شبکه عصبی برای نرمالسازی خروجی شبکه به یک توزیع احتمالاتی بر روی کلاسهای خروجی پیشبینیشده استفاده میشود.» در زمینه مدلهای زبانی بزرگ، این کلاسهای خروجی همان توکنهای مجزا (کلمات، بخشهایی از کلمات یا کاراکترها) هستند که مدل میداند چگونه آنها را تولید کند.[1]
برای مدلهای زبانی مدرن، این محاسبه از نظر پردازشی بسیار سنگین است. یک مدل استاندارد ممکن است دایره واژگانی متشکل از ۵۰,۲۵۷ توکن داشته باشد، به این معنی که تابع سافتمکس باید ۵۰,۲۵۷ توان را محاسبه کرده و هر کدام را بر مجموع کل تقسیم کند؛ آن هم هر بار که تنها یک کلمه تولید میکند. با بزرگتر شدن مدلها و رسیدن دایره واژگان به ۱۲۸,۰۰۰ یا بیشتر، بار سختافزاری این لایه نهایی به طور قابل توجهی افزایش مییابد.[7]
برای مدلهای زبانی مدرن، این محاسبه از نظر پردازشی بسیار سنگین است.
پژوهشگران به طور فعال در حال کار برای بهینهسازی این گلوگاه هستند. مقالهای که در ژانویه ۲۰۲۵ در arXiv منتشر شد، رویکردی اصلاحشده به نام Scalable-Softmax را معرفی کرد که برای بهبود عملکرد در مکانیزمهای توجه طراحی شده است. نویسندگان استدلال میکنند که روش آنها «برای مکانیزم توجه برتر است» زیرا سربار حافظه و محاسبات مورد نیاز برای محاسبات نمایی استاندارد را کاهش میدهد و به مدلها اجازه میدهد تا اطلاعات را سریعتر و بدون از دست دادن دقت پردازش کنند.[2]
رفتار تابع سافتمکس همچنین میتواند به صورت دستی توسط کاربران از طریق پارامتری به نام دما تنظیم شود. مقیاسبندی دما درست پیش از انجام محاسبه سافتمکس مداخله میکند. با تقسیم تمام لاجیتهای خام بر یک مقدار دما، کاربران میتوانند شکل توزیع احتمالاتی نهایی را تغییر داده و میزان خلاقیت متن را دگرگون سازند.[4]
بر اساس گزارش Machine Learning Mastery: «دما یک ابرپارامتر است که میزان تصادفی بودن خروجی مدل را کنترل میکند. دمای بالا مدل را خلاقتر میکند، در حالی که دمای پایین آن را متمرکزتر و قطعیتر میسازد.»[4]
وقتی دما زیر ۱.۰ تنظیم شود (مثلاً ۰.۵)، لاجیتها پیش از توانرسانی عملاً دو برابر میشوند. به دلیل منحنی نمایی، این کار فاصله میان امتیازهای برتر و امتیازهای پایینتر را حتی بیشتر میکند. سپس تابع سافتمکس این شکافِ کشیدهشده را به یک توزیع احتمالاتی تبدیل میکند که در آن انتخاب برتر غالب است و اغلب از احتمال ۹۰ درصد فراتر میرود، که نتیجه آن متنی بسیار قابل پیشبینی است.[7]
برعکس، تنظیم دما بالای ۱.۰ لاجیتها را به هم فشردهتر میکند. وقتی این مقادیر فشردهشده از تابع توانرسانی عبور میکنند، احتمالات حاصل به طور یکنواختتری توزیع میشوند. کلمهای که ممکن بود در دمای عادی تنها ۲ درصد شانس داشته باشد، ممکن است به شانس ۱۰ درصدی جهش کند و مدل را ترغیب کند تا کلمات کمتر رایج را انتخاب کرده و پاسخهای متنوعتر و غیرقابل پیشبینیتری تولید کند.[4][7]
جذابیت شهودی سافتمکس در توانایی آن برای مدیریت هرگونه ورودی نهفته است. همانطور که MetricGate در راهنمای مبتدیان خود توضیح میدهد، این تابع «یک بردار نرمالنشده را میگیرد و آن را به یک توزیع احتمالاتی نرمالسازی میکند.» مهم نیست که شبکه عصبی لاجیتهایی در محدوده صدها یا هزاران منفی تولید کند؛ ریاضیات به طور قابل اعتمادی آنها را به یک محدوده تمیز ۰ تا ۱ وادار میکند.[3]
با این حال، این نرمالسازی اجباری یک محدودیت حیاتی نیز در تفسیرپذیری هوش مصنوعی ایجاد میکند. از آنجا که سافتمکس همیشه خروجیها را طوری مقیاسبندی میکند که مجموع آنها به ۱۰۰ درصد برسد، قطعیت مطلق مدل را پنهان میسازد. اگر مدلی درباره کلمه بعدی کاملاً نامطمئن باشد و لاجیتهای بسیار پایینی برای هر توکن تولید کند، سافتمکس همچنان بالاترینِ آن امتیازهای پایین را بالا میکشد تا شبیه به یک پیشبینی مطمئن به نظر برسد.[7]
بررسی فنی JumpCloud بیان میکند: «تابع سافتمکس یک تابع ریاضی است که برداری از اعداد را به برداری از احتمالات تبدیل میکند، جایی که احتمالات هر مقدار با مقیاس نسبی هر مقدار در بردار متناسب است.» کلمه کلیدی در اینجا «نسبی» است. این تابع تنها اندازهگیری میکند که یک کلمه چقدر بهتر از بقیه است، نه اینکه آیا هیچیک از کلمات واقعاً انتخابهای خوبی هستند یا خیر.[5]
با وجود این محدودیتها، سافتمکس همچنان استاندارد بلامنازع برای لایه نهایی مدلهای طبقهبندی و تولید متن باقی مانده است. از معماری اصلی ترانسفورمر که در سال ۲۰۱۷ منتشر شد تا مدلهای پیشرفتهای که امروزه به کار گرفته میشوند، توالی توانرسانی و نرمالسازی همان مترجم جهانی است که ریاضیات یادگیری عمیق را به زبان انسانی تبدیل میکند.[7]
در حالی که صنعت به سمت دایره واژگان بزرگتر و سرعتهای تولید بالاتر پیش میرود، ریاضیات زیربنایی لایه سافتمکس همچنان هدفی برای بهینهسازی سختافزاری خواهد بود. اما مکانیزم اصلی (تقویت موارد محتمل و فشردهسازی کل مجموعه به یک درصد تمیز) به عنوان گام بنیادینی که به هوش مصنوعی اجازه میدهد کلمات خود را انتخاب کند، باقی خواهد ماند.[2][7]
آنچه نمیدانیم
- آیا مدلهای پیشرفته آینده، سافتمکس استاندارد را به طور کامل کنار گذاشته و به تقریبهای بهینهسازیشده سختافزاری روی خواهند آورد یا خیر.
- چگونه میتوان پیش از آنکه نرمالسازی سافتمکس مجموع احتمالات را به ۱۰۰ درصد برساند، معیارهای قطعیت مطلق را به شکلی مؤثر از مدل استخراج کرد.
نکات کلیدی
- تابع سافتمکس امتیازهای خام شبکه عصبی که لاجیت نامیده میشوند را به یک توزیع احتمالاتی دقیق تبدیل میکند.
- این فرآیند از توانرسانی برای تبدیل اعداد منفی به مثبت و برجستهتر کردن تفاوت میان انتخابهای برتر مدل استفاده میکند.
- نرمالسازی تضمین میکند که مجموع احتمالات نهایی در کل دایره واژگان همیشه دقیقاً برابر با ۱۰۰ درصد باشد.
- تنظیم پارامتر دما لاجیتها را پیش از اعمال سافتمکس مقیاسبندی میکند و به کاربران اجازه میدهد تا میزان خلاقیت متن تولیدشده را کنترل کنند.
- از آنجا که سافتمکس مجموع احتمالات را به ۱۰۰ درصد میرساند، به جای قطعیت مطلق مدل در یک پاسخ، احتمال نسبی آن را اندازهگیری میکند.
چرا مهم است
درک نحوه کارکرد سافتمکس، ابهامات پیرامون نحوه «تفکر» و تولید متن توسط مدلهای هوش مصنوعی را برطرف میکند. این موضوع نشان میدهد که مدلهای زبانی درباره پاسخهای خود قطعیت مطلق ندارند، بلکه به یک ترفند ریاضی متکی هستند تا از میان انبوهی از نویزهای آماری، انتخابی با ظاهر مطمئن ارائه دهند.
اصطلاحات کلیدی
- لاجیت
- امتیاز عددی خام و بیحدومرزی که توسط یک شبکه عصبی پیش از تبدیل شدن به احتمال تولید میشود.
- توانرسانی
- یک عملیات ریاضی که یک عدد پایه (معمولاً e) را به توان یک ورودی مشخص میرساند، اعداد منفی را مثبت کرده و تفاوتها را تقویت میکند.
- نرمالسازی
- فرآیند تقسیم مقادیر فردی بر مجموع کل آنها به طوری که مجموع کل مجموعه دقیقاً برابر با ۱.۰ یا ۱۰۰ درصد شود.
- دما
- یک تنظیم قابل کنترل توسط کاربر که لاجیتها را پیش از تابع سافتمکس مقیاسبندی میکند و تعیین میکند خروجی هوش مصنوعی چقدر خلاقانه یا قابل پیشبینی باشد.
- دایره واژگان
- مجموعه کامل توکنها (کلمات، بخشهایی از کلمات یا کاراکترها) که یک مدل زبانی قادر به تولید آنهاست.
منابع
[1]Wikipediaپژوهشگران تفسیرپذیری هوش مصنوعیSoftmax function
مطالعه در Wikipedia →
[2]arXivمهندسان سختافزارScalable-Softmax Is Superior for Attention
مطالعه در arXiv →
[3]MetricGateمتخصصان یادگیری ماشینThe Softmax Function Explained Intuitively for Beginners
مطالعه در MetricGate →
[4]Machine Learning Masteryمتخصصان یادگیری ماشینHow LLMs Choose Their Words: A Practical Walk-Through of Logits, Softmax and Sampling
مطالعه در Machine Learning Mastery →
[5]JumpCloudمتخصصان یادگیری ماشینWhat Is Softmax Function in AI Models?
مطالعه در JumpCloud →
[6]Dremioپژوهشگران تفسیرپذیری هوش مصنوعیWhat is Softmax Function?
مطالعه در Dremio →
[7]تیم سردبیری کوهستانپژوهشگران تفسیرپذیری هوش مصنوعیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →ادغام مدلها
حل تداخل پارامترها: ادغام مدلها چگونه بدون نیاز به آموزش مجدد، قابلیتهای هوش مصنوعی را ترکیب میکند
6 منبع
تفسیرپذیری مکانیسمی
ترجمه جعبه سیاه: «لنز لاجیت» چگونه محاسبات هوش مصنوعی را به متن قابلفهم برای انسان تبدیل میکند
8 منبع
بهینهسازی مدل
جریمه L2: چگونه کاهش وزن و دراپاوت از بیشبرازش شبکههای عصبی جلوگیری میکنند
6 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.




