چگونه نمونهبرداری دما و هستهای خروجی مدلهای زبان را شکل میدهند
مدلهای زبان با محاسبه احتمالات کلمه بعدی، متن تولید میکنند، اما توسعهدهندگان انتخاب نهایی را از طریق فیلترهای ریاضی کنترل میکنند. مهندسان با تنظیم دما و نمونهبرداری هستهای، تعادل دقیقی بین انسجام قابل پیشبینی و تنوع خلاقانه را دیکته میکنند.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- مهندسان قطعیگرا
- طرفدار دماهای پایین و رمزگشایی حریصانه برای تضمین حداکثر دقت واقعی و خروجیهای قابل بازتولید در وظایف برنامهنویسی و داده هستند.
- طراحان پرامپت خلاق
- اولویتشان دماهای بالاتر و نمونهبرداری هستهای گستردهتر است تا مدل را مجبور به ترکیبهای زبانی بدیع و طوفان فکری کنند.
- محققان الگوریتم نمونهبرداری
- تمرکز بر توسعه آستانههای پویا مانند مین-پی دارند که امکان تنوع بالا را بدون خطر توکنهای توهمزای دنباله طولانی فراهم میکند.
دیدگاههایی که این گزارش پوشش نداده
- کاربران نهایی که به پارامترهای API دسترسی ندارند
- مهندسان سختافزار که تأخیر نمونهبرداری را بهینه میکنند
پیش از آنکه یک هوش مصنوعی حتی یک هجا تولید کند، مهندس نرمافزاری که فراخوانی API را پیکربندی میکند، یک انتخاب ریاضی انجام میدهد. توسعهدهنده با تنظیم دو پارامتر مشخص—دما (temperature) و تاپ-پی (top-p)—درست قبل از اجرای درخواست تولید، دقیقاً میزان هرج و مرج آماری مجاز برای تزریق به پاسخ مدل را تعیین میکند.[6]
مدلهای زبان در واقع متن خروجی نمیدهند؛ بلکه یک توزیع احتمال تولید میکنند. هنگامی که یک مدل یک پرامپت را پردازش میکند، لایه نهایی شبکه عصبی آن، نمرات خام و نرمالنشدهای به نام لاجیتها (Logits) را برای هر توکن بعدی ممکن در واژگان خود تولید میکند، که اغلب از ۵۰,۰۰۰ قطعه کلمه متمایز فراتر میرود.[2][5]
این لاجیتهای خام سپس از طریق تابع سافتمکس (Softmax) عبور داده میشوند و به یک توزیع احتمال مبتنی بر درصد تمیز تبدیل میشوند که مجموع آن ۱۰۰ درصد است. همانطور که ماکسیم لابون در یک تحلیل فنی در سال ۲۰۲۴ برای هاگینگ فیس اشاره کرد: «استراتژیهای رمزگشایی نحوه انتخاب توکن بعدی از توزیع احتمال را دیکته میکنند.»[2]
سادهترین رویکرد، رمزگشایی حریصانه (Greedy Decoding) است، که در آن سیستم کورکورانه تنها توکنی را انتخاب میکند که بالاترین احتمال را دارد. اگر کلمه "The" شانس ۴۲ درصدی برای ظاهر شدن بعدی داشته باشد و "A" شانس ۳۸ درصدی، رمزگشایی حریصانه هر بار "The" را انتخاب میکند، که خروجی را کاملاً قطعی (deterministic) و بسیار تکراری میسازد.[2][4]
برای شکستن این یکنواختی ماشینی، توسعهدهندگان از طریق پارامتری به نام دما، تصادفی بودن کنترلشده (استوکاستیسیته) را معرفی میکنند. محققان در مؤسسه مهندسی پرامپت در تحلیل آگوست ۲۰۲۴ خود توضیح دادند: «دما به عنوان یک عامل مقیاسبندی بر روی لاجیتهای خام، پیش از تبدیل شدن به احتمالات، عمل میکند.»[4]
از نظر ریاضی، مقدار دما لاجیتهای خام را قبل از اعمال تابع سافتمکس تقسیم میکند. دمای ۱.۰ توزیع را دقیقاً همانطور که مدل محاسبه کرده است باقی میگذارد و فواصل اطمینان اصلی شبکه عصبی را حفظ میکند.[4][5]
کاهش دما به زیر ۱.۰—که معمولاً برای وظایف برنامهنویسی یا استخراج داده تا ۰.۲ پایین میآید—توزیع را تیزتر میکند و تفاوت بین احتمالات بالا و پایین را تقویت مینماید. برعکس، افزایش آن به ۰.۸ یا ۱.۲ منحنی را مسطح میکند، و به توکنهای با رتبه پایینتر شانس آماری قابل توجهی برای انتخاب میدهد، که خوانندگان انسانی آن را به عنوان "خلاقیت" درک میکنند.[4]
کاهش دما به زیر ۱.۰—که معمولاً برای وظایف برنامهنویسی یا استخراج داده تا ۰.۲ پایین میآید—توزیع را تیزتر میکند و تفاوت بین احتمالات بالا و پایین را تقویت مینماید.
با این حال، دما به تنهایی یک آسیبپذیری حیاتی ایجاد میکند: دنباله طولانی (long tail). در واژگانی متشکل از ۵۰,۰۰۰ توکن، مسطح کردن توزیع به این معنی است که هزاران توکن کاملاً نامرتبط ناگهان کسری از درصد احتمال را به دست میآورند. در طول یک تولید ۵۰۰ کلمهای، مدل به ناچار تاس میاندازد و یکی از این ناهنجاریها را انتخاب میکند، که منجر به توهم (hallucination) یا از دست دادن ناگهانی انسجام گرامری میشود.[5]
برای کوتاه کردن این دنباله از توکنهای بیارزش، مهندسان از نمونهبرداری هستهای (Nucleus Sampling) استفاده میکنند که در مستندات API به طور جهانی به عنوان تاپ-پی (Top-P) شناخته میشود. تاپ-پی به جای مقیاسبندی احتمالات، به عنوان یک نگهبان ریاضی سختگیر عمل میکند و توزیع را قبل از وقوع انتخاب تصادفی قطع میکند.[3][5]
یک بررسی فنی عمیق در سال ۲۰۲۵ توسط Lundgren.io توضیح داد: «نمونهبرداری تاپ-پی تضمین میکند که ما فقط محتملترین توکنهایی را در نظر میگیریم که هسته توزیع را تشکیل میدهند.» اگر توسعهدهندهای تاپ-پی را روی ۰.۹۰ تنظیم کند، الگوریتم توکنها را از محتملترین به کماحتمالترین مرتب میکند و احتمالات آنها را با هم جمع میزند، و فوراً هر توکنی را که خارج از آن آستانه تجمعی ۹۰ درصدی قرار گیرد، کنار میگذارد.[5]
این بدان معناست که مجموعه توکنهای موجود به صورت پویا گسترش و انقباض مییابد. اگر مدل بسیار مطمئن باشد—مثلاً پیشبینی کلمه "States" بعد از "United"—ممکن است ۹۰ درصد برتر فقط شامل دو یا سه توکن باشد. اگر مدل نامطمئن باشد، هسته ممکن است گسترش یابد تا ۵۰ گزینه معتبر را در بر گیرد، و تنوع را بدون به خطر انداختن دنباله طولانی حفظ کند.[4][5]
با این حال، حتی تاپ-پی نیز موارد حاشیهای دارد. هنگامی که یک مدل به شدت نامطمئن است، توزیع آنقدر مسطح میشود که جمعآوری ۹۰ درصد احتمال مستلزم گنجاندن صدها توکن است، که برخی از آنها از نظر بافتی نامناسب هستند.[1]
این نقص، توسعه نمونهبرداری مین-پی (Min-P) را به دنبال داشت، یک الگوریتم جدیدتر که در پیشچاپ arXiv در سال ۲۰۲۴ شرح داده شد. به جای آستانه تجمعی، «مین-پی یک آستانه پویا بر اساس حداکثر احتمال توکن تعیین میکند، و تضمین میکند که فقط توکنهایی با احتمالی حداقل $p \times P_{max}$ در نظر گرفته شوند.»[1]
اگر محتملترین توکن احتمال ۴۰ درصدی داشته باشد، و مین-پی روی ۰.۱۰ تنظیم شده باشد، هر توکنی با شانس کمتر از ۴ درصد بلافاصله کنار گذاشته میشود. این مقیاسبندی نسبی از گنجاندن توکنهای با کیفیت پایین حتی زمانی که توزیع کلی مسطح است جلوگیری میکند و یک محافظ محکمتر نسبت به نمونهبرداری هستهای سنتی ارائه میدهد.[1][3]
در عمل، سیستمهای تولیدی به ندرت به یک روش واحد متکی هستند. پیکربندی استاندارد صنعتی هر دو را اعمال میکند: دمای ٠.٧ برای مسطح کردن منحنی، و به دنبال آن تاپ-پی ٠.٩٥ برای قطع تمیز دنباله طولانی. توسعهدهندگان با تنظیم این دو دایال، یک ماتریس ریاضی ایستا را به موتوری تبدیل میکنند که قادر به منطق سختگیرانه و نثر گسترده است.[6]
نکات کلیدی
- مدلهای زبان برای کلمه بعدی یک توزیع احتمال خروجی میدهند، نه یک پاسخ قطعی واحد.
- دما این احتمالات را مقیاسبندی میکند، به طوری که مقادیر پایینتر پیشبینیپذیری و مقادیر بالاتر تنوع را افزایش میدهند.
- نمونهبرداری هستهای (تاپ-پی) توزیع را کوتاه میکند و دنباله طولانی توکنهای بسیار بعید را برای جلوگیری از توهم کنار میگذارد.
- روشهای جدیدتر مانند مین-پی آستانه برش را نسبت به مطمئنترین توکن مقیاسبندی میکنند و در طول مراحل تولید نامطمئن، محافظهای محکمتری ارائه میدهند.
اصطلاحات کلیدی
- لاجیتها (Logits)
- نمرات خام و نرمالنشدهای که توسط لایه نهایی یک شبکه عصبی قبل از تبدیل شدن به احتمالات تولید میشوند.
- سافتمکس (Softmax)
- یک تابع ریاضی که لاجیتهای خام را به یک توزیع احتمال مبتنی بر درصد تبدیل میکند که مجموع آن دقیقاً ۱۰۰ درصد است.
- رمزگشایی حریصانه
- یک روش تولید که همیشه تنها محتملترین توکن بعدی را انتخاب میکند و در نتیجه متنی بسیار قابل پیشبینی و تکراری ایجاد میشود.
- دما (Temperature)
- یک پارامتر مقیاسبندی که لاجیتها را قبل از سافتمکس تقسیم میکند؛ مقادیر زیر ۱.۰ مدل را قابل پیشبینیتر میکند، در حالی که مقادیر بالای ۱.۰ تصادفی بودن را افزایش میدهد.
- نمونهبرداری هستهای (تاپ-پی)
- یک روش فیلترینگ که تمام توکنهای خارج از درصد تجمعی برتر احتمال را کنار میگذارد و به صورت پویا اندازه مجموعه گزینهها را بر اساس اطمینان مدل تغییر میدهد.
منابع
[1]arXivمحققان الگوریتم نمونهبرداریTurning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs
مطالعه در arXiv →
[2]Hugging Faceطراحان پرامپت خلاقDecoding Strategies in Large Language Models
مطالعه در Hugging Face →
[3]LLM Samplersمحققان الگوریتم نمونهبرداریSampling Methods — LLM Samplers 0.1.3 documentation
مطالعه در LLM Samplers →
[4]Prompt Engineering Instituteمهندسان قطعیگراTemperature and Top P: How to Tune LLM Outputs
مطالعه در Prompt Engineering Institute →
[5]Technical Deep DiveUnderstanding Temperature and Top P in Large Language Models a Technical Deep Dive
مطالعه در Technical Deep Dive →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →عملیات نفوذ سایبری
گزارش نیویورکتایمز: استفاده ایران، چین و شرکتهای اسرائیلی از ایجنتهای هوش مصنوعی برای عملیات نفوذ خودکار
4 منبع
معماری عامل
مرز معماری میان عاملهای واکنشی ساده و مبتنی بر مدل
9 منبع
معماری سیستمها
انواع عوامل هوش مصنوعی (AI Agents) و کاربردهای آنها در دنیای واقعی
3 منبع
AI Architecture
هوش مصنوعی عامل (AI Agent) چیست؟ تفاوت آن با مدلهای زبانی استاندارد
4 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





