رفتن به محتوای اصلی
Koohestun
توضیح کوهستانرمزگشایی مدلتوضیح و تشریح· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه نمونه‌برداری دما و هسته‌ای خروجی مدل‌های زبان را شکل می‌دهند

مدل‌های زبان با محاسبه احتمالات کلمه بعدی، متن تولید می‌کنند، اما توسعه‌دهندگان انتخاب نهایی را از طریق فیلترهای ریاضی کنترل می‌کنند. مهندسان با تنظیم دما و نمونه‌برداری هسته‌ای، تعادل دقیقی بین انسجام قابل پیش‌بینی و تنوع خلاقانه را دیکته می‌کنند.

به قلم ندا وزیری

مهندسان قطعی‌گرا 35%طراحان پرامپت خلاق 35%محققان الگوریتم نمونه‌برداری 30%
مهندسان قطعی‌گرا
طرفدار دماهای پایین و رمزگشایی حریصانه برای تضمین حداکثر دقت واقعی و خروجی‌های قابل بازتولید در وظایف برنامه‌نویسی و داده هستند.
طراحان پرامپت خلاق
اولویت‌شان دماهای بالاتر و نمونه‌برداری هسته‌ای گسترده‌تر است تا مدل را مجبور به ترکیب‌های زبانی بدیع و طوفان فکری کنند.
محققان الگوریتم نمونه‌برداری
تمرکز بر توسعه آستانه‌های پویا مانند مین-پی دارند که امکان تنوع بالا را بدون خطر توکن‌های توهم‌زای دنباله طولانی فراهم می‌کند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • کاربران نهایی که به پارامترهای API دسترسی ندارند
  • مهندسان سخت‌افزار که تأخیر نمونه‌برداری را بهینه می‌کنند

پیش از آنکه یک هوش مصنوعی حتی یک هجا تولید کند، مهندس نرم‌افزاری که فراخوانی API را پیکربندی می‌کند، یک انتخاب ریاضی انجام می‌دهد. توسعه‌دهنده با تنظیم دو پارامتر مشخص—دما (temperature) و تاپ-پی (top-p)—درست قبل از اجرای درخواست تولید، دقیقاً میزان هرج و مرج آماری مجاز برای تزریق به پاسخ مدل را تعیین می‌کند.[6]

مدل‌های زبان در واقع متن خروجی نمی‌دهند؛ بلکه یک توزیع احتمال تولید می‌کنند. هنگامی که یک مدل یک پرامپت را پردازش می‌کند، لایه نهایی شبکه عصبی آن، نمرات خام و نرمال‌نشده‌ای به نام لاجیت‌ها (Logits) را برای هر توکن بعدی ممکن در واژگان خود تولید می‌کند، که اغلب از ۵۰,۰۰۰ قطعه کلمه متمایز فراتر می‌رود.[2][5]

این لاجیت‌های خام سپس از طریق تابع سافت‌مکس (Softmax) عبور داده می‌شوند و به یک توزیع احتمال مبتنی بر درصد تمیز تبدیل می‌شوند که مجموع آن ۱۰۰ درصد است. همانطور که ماکسیم لابون در یک تحلیل فنی در سال ۲۰۲۴ برای هاگینگ فیس اشاره کرد: «استراتژی‌های رمزگشایی نحوه انتخاب توکن بعدی از توزیع احتمال را دیکته می‌کنند.»[2]

ساده‌ترین رویکرد، رمزگشایی حریصانه (Greedy Decoding) است، که در آن سیستم کورکورانه تنها توکنی را انتخاب می‌کند که بالاترین احتمال را دارد. اگر کلمه "The" شانس ۴۲ درصدی برای ظاهر شدن بعدی داشته باشد و "A" شانس ۳۸ درصدی، رمزگشایی حریصانه هر بار "The" را انتخاب می‌کند، که خروجی را کاملاً قطعی (deterministic) و بسیار تکراری می‌سازد.[2][4]

تابع سافت‌مکس نمرات خام شبکه عصبی را به یک توزیع احتمال تمیز تبدیل می‌کند.

برای شکستن این یکنواختی ماشینی، توسعه‌دهندگان از طریق پارامتری به نام دما، تصادفی بودن کنترل‌شده (استوکاستیسیته) را معرفی می‌کنند. محققان در مؤسسه مهندسی پرامپت در تحلیل آگوست ۲۰۲۴ خود توضیح دادند: «دما به عنوان یک عامل مقیاس‌بندی بر روی لاجیت‌های خام، پیش از تبدیل شدن به احتمالات، عمل می‌کند.»[4]

از نظر ریاضی، مقدار دما لاجیت‌های خام را قبل از اعمال تابع سافت‌مکس تقسیم می‌کند. دمای ۱.۰ توزیع را دقیقاً همانطور که مدل محاسبه کرده است باقی می‌گذارد و فواصل اطمینان اصلی شبکه عصبی را حفظ می‌کند.[4][5]

کاهش دما به زیر ۱.۰—که معمولاً برای وظایف برنامه‌نویسی یا استخراج داده تا ۰.۲ پایین می‌آید—توزیع را تیزتر می‌کند و تفاوت بین احتمالات بالا و پایین را تقویت می‌نماید. برعکس، افزایش آن به ۰.۸ یا ۱.۲ منحنی را مسطح می‌کند، و به توکن‌های با رتبه پایین‌تر شانس آماری قابل توجهی برای انتخاب می‌دهد، که خوانندگان انسانی آن را به عنوان "خلاقیت" درک می‌کنند.[4]

کاهش دما به زیر ۱.۰—که معمولاً برای وظایف برنامه‌نویسی یا استخراج داده تا ۰.۲ پایین می‌آید—توزیع را تیزتر می‌کند و تفاوت بین احتمالات بالا و پایین را تقویت می‌نماید.

با این حال، دما به تنهایی یک آسیب‌پذیری حیاتی ایجاد می‌کند: دنباله طولانی (long tail). در واژگانی متشکل از ۵۰,۰۰۰ توکن، مسطح کردن توزیع به این معنی است که هزاران توکن کاملاً نامرتبط ناگهان کسری از درصد احتمال را به دست می‌آورند. در طول یک تولید ۵۰۰ کلمه‌ای، مدل به ناچار تاس می‌اندازد و یکی از این ناهنجاری‌ها را انتخاب می‌کند، که منجر به توهم (hallucination) یا از دست دادن ناگهانی انسجام گرامری می‌شود.[5]

دماهای پایین‌تر توزیع احتمال را تیزتر می‌کنند، در حالی که دماهای بالاتر آن را مسطح می‌کنند تا تنوع افزایش یابد.

برای کوتاه کردن این دنباله از توکن‌های بی‌ارزش، مهندسان از نمونه‌برداری هسته‌ای (Nucleus Sampling) استفاده می‌کنند که در مستندات API به طور جهانی به عنوان تاپ-پی (Top-P) شناخته می‌شود. تاپ-پی به جای مقیاس‌بندی احتمالات، به عنوان یک نگهبان ریاضی سخت‌گیر عمل می‌کند و توزیع را قبل از وقوع انتخاب تصادفی قطع می‌کند.[3][5]

یک بررسی فنی عمیق در سال ۲۰۲۵ توسط Lundgren.io توضیح داد: «نمونه‌برداری تاپ-پی تضمین می‌کند که ما فقط محتمل‌ترین توکن‌هایی را در نظر می‌گیریم که هسته توزیع را تشکیل می‌دهند.» اگر توسعه‌دهنده‌ای تاپ-پی را روی ۰.۹۰ تنظیم کند، الگوریتم توکن‌ها را از محتمل‌ترین به کم‌احتمال‌ترین مرتب می‌کند و احتمالات آن‌ها را با هم جمع می‌زند، و فوراً هر توکنی را که خارج از آن آستانه تجمعی ۹۰ درصدی قرار گیرد، کنار می‌گذارد.[5]

این بدان معناست که مجموعه توکن‌های موجود به صورت پویا گسترش و انقباض می‌یابد. اگر مدل بسیار مطمئن باشد—مثلاً پیش‌بینی کلمه "States" بعد از "United"—ممکن است ۹۰ درصد برتر فقط شامل دو یا سه توکن باشد. اگر مدل نامطمئن باشد، هسته ممکن است گسترش یابد تا ۵۰ گزینه معتبر را در بر گیرد، و تنوع را بدون به خطر انداختن دنباله طولانی حفظ کند.[4][5]

با این حال، حتی تاپ-پی نیز موارد حاشیه‌ای دارد. هنگامی که یک مدل به شدت نامطمئن است، توزیع آنقدر مسطح می‌شود که جمع‌آوری ۹۰ درصد احتمال مستلزم گنجاندن صدها توکن است، که برخی از آنها از نظر بافتی نامناسب هستند.[1]

این نقص، توسعه نمونه‌برداری مین-پی (Min-P) را به دنبال داشت، یک الگوریتم جدیدتر که در پیش‌چاپ arXiv در سال ۲۰۲۴ شرح داده شد. به جای آستانه تجمعی، «مین-پی یک آستانه پویا بر اساس حداکثر احتمال توکن تعیین می‌کند، و تضمین می‌کند که فقط توکن‌هایی با احتمالی حداقل $p \times P_{max}$ در نظر گرفته شوند.»[1]

در حالی که تاپ-پی از یک آستانه تجمعی استفاده می‌کند، مین-پی برش خود را نسبت به اطمینان محتمل‌ترین توکن مقیاس‌بندی می‌کند.

اگر محتمل‌ترین توکن احتمال ۴۰ درصدی داشته باشد، و مین-پی روی ۰.۱۰ تنظیم شده باشد، هر توکنی با شانس کمتر از ۴ درصد بلافاصله کنار گذاشته می‌شود. این مقیاس‌بندی نسبی از گنجاندن توکن‌های با کیفیت پایین حتی زمانی که توزیع کلی مسطح است جلوگیری می‌کند و یک محافظ محکم‌تر نسبت به نمونه‌برداری هسته‌ای سنتی ارائه می‌دهد.[1][3]

در عمل، سیستم‌های تولیدی به ندرت به یک روش واحد متکی هستند. پیکربندی استاندارد صنعتی هر دو را اعمال می‌کند: دمای ٠.٧ برای مسطح کردن منحنی، و به دنبال آن تاپ-پی ٠.٩٥ برای قطع تمیز دنباله طولانی. توسعه‌دهندگان با تنظیم این دو دایال، یک ماتریس ریاضی ایستا را به موتوری تبدیل می‌کنند که قادر به منطق سخت‌گیرانه و نثر گسترده است.[6]

نکات کلیدی

  1. مدل‌های زبان برای کلمه بعدی یک توزیع احتمال خروجی می‌دهند، نه یک پاسخ قطعی واحد.
  2. دما این احتمالات را مقیاس‌بندی می‌کند، به طوری که مقادیر پایین‌تر پیش‌بینی‌پذیری و مقادیر بالاتر تنوع را افزایش می‌دهند.
  3. نمونه‌برداری هسته‌ای (تاپ-پی) توزیع را کوتاه می‌کند و دنباله طولانی توکن‌های بسیار بعید را برای جلوگیری از توهم کنار می‌گذارد.
  4. روش‌های جدیدتر مانند مین-پی آستانه برش را نسبت به مطمئن‌ترین توکن مقیاس‌بندی می‌کنند و در طول مراحل تولید نامطمئن، محافظ‌های محکم‌تری ارائه می‌دهند.

اصطلاحات کلیدی

لاجیت‌ها (Logits)
نمرات خام و نرمال‌نشده‌ای که توسط لایه نهایی یک شبکه عصبی قبل از تبدیل شدن به احتمالات تولید می‌شوند.
سافت‌مکس (Softmax)
یک تابع ریاضی که لاجیت‌های خام را به یک توزیع احتمال مبتنی بر درصد تبدیل می‌کند که مجموع آن دقیقاً ۱۰۰ درصد است.
رمزگشایی حریصانه
یک روش تولید که همیشه تنها محتمل‌ترین توکن بعدی را انتخاب می‌کند و در نتیجه متنی بسیار قابل پیش‌بینی و تکراری ایجاد می‌شود.
دما (Temperature)
یک پارامتر مقیاس‌بندی که لاجیت‌ها را قبل از سافت‌مکس تقسیم می‌کند؛ مقادیر زیر ۱.۰ مدل را قابل پیش‌بینی‌تر می‌کند، در حالی که مقادیر بالای ۱.۰ تصادفی بودن را افزایش می‌دهد.
نمونه‌برداری هسته‌ای (تاپ-پی)
یک روش فیلترینگ که تمام توکن‌های خارج از درصد تجمعی برتر احتمال را کنار می‌گذارد و به صورت پویا اندازه مجموعه گزینه‌ها را بر اساس اطمینان مدل تغییر می‌دهد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

مهندسان قطعی‌گرا 35%طراحان پرامپت خلاق 35%محققان الگوریتم نمونه‌برداری 30%
  1. [1]arXivمحققان الگوریتم نمونه‌برداری

    Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs

    مطالعه در arXiv
  2. [2]Hugging Faceطراحان پرامپت خلاق

    Decoding Strategies in Large Language Models

    مطالعه در Hugging Face
  3. [3]LLM Samplersمحققان الگوریتم نمونه‌برداری

    Sampling Methods — LLM Samplers 0.1.3 documentation

    مطالعه در LLM Samplers
  4. [4]Prompt Engineering Instituteمهندسان قطعی‌گرا

    Temperature and Top P: How to Tune LLM Outputs

    مطالعه در Prompt Engineering Institute
  5. [5]Technical Deep Dive

    Understanding Temperature and Top P in Large Language Models a Technical Deep Dive

    مطالعه در Technical Deep Dive
  6. [6]تیم سردبیری کوهستان

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.