مزیت موقعیتی دستورالعمل سیستمی: چگونه قرار دادن دستورات در ابتدای پنجره زمینه، خروجی مدلهای زبان بزرگ را محدود میکند
مدلهای زبان بزرگ سوگیری توجهی مشخصی به شکل U از خود نشان میدهند، به طوری که اطلاعات موجود در ابتدا و انتهای یک پرامپت را به طور قابل اعتمادی پردازش میکنند، اما میانه آن را نادیده میگیرند. محققان در حال توسعه روشهای جدید کالیبراسیون و مرتبسازی هستند تا مدلها را وادار کنند دادهها را بر اساس ارتباط (Relevance) و نه موقعیت مکانی ارزیابی کنند.
به قلم اِلا فرجاد
این خبر را به اشتراک بگذارید
- مهندسان زمینه
- استدلال میکنند که سوگیری موقعیتی یک ویژگی دائمی مدلهای ترانسفورمر است که باید از طریق ساختاردهی دقیق پرامپت و جایگذاری دستورالعمل مدیریت شود.
- جبرگرایان معماری
- معتقدند که سوگیری موقعیتی یک نقص ریاضیاتی در مکانیسم توجه است که باید در سطح استنتاج (Inference) از طریق مرتبسازی یا کالیبراسیون حل شود.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار
- طراحان برنامههای کاربر نهایی
نکات کلیدی
- مدلهای زبان منحنی توجهی به شکل U از خود نشان میدهند که ابتدا و انتهای یک پرامپت را در اولویت قرار میدهد.
- اطلاعاتی که در میانه یک پنجره زمینه طولانی دفن میشوند، اغلب نادیده گرفته شده و منجر به توهمزایی میشوند.
- انتقال دستورالعملهای وظیفه به انتهای یک پرامپت، توانایی مدل برای پیروی از آنها را به طور قابل توجهی بهبود میبخشد.
- محققان در حال توسعه تکنیکهای مرتبسازی توجه و کالیبراسیون هستند تا این سوگیری را در سطح معماری برطرف کنند.
برخی از مهندسان پرامپت استدلال میکنند که دستورالعمل سیستمی (System Prompt) یک محدودیت مطلق است، مجموعهای از قوانین بنیادی که مدل نمیتواند آنها را نادیده بگیرد، زیرا ابتدا پردازش شده و خط مبنا را برای تمام تولیدات بعدی تعیین میکند. برخی دیگر در مقابل میگویند که با رشد پنجرههای زمینه به ۱۲۸,۰۰۰ یا حتی ۱,۰۰۰,۰۰۰ توکن، دستورالعملهای اولیه به طور معمول فراموش میشوند و توسط حجم عظیم متن بعدی شسته میشوند، و دستورالعمل سیستمی را به جای یک قانون آهنین، به یک پیشنهاد شکننده تبدیل میکنند.[3]
این کشمکش در قلب نحوه پردازش زبان توسط هوش مصنوعی مدرن قرار دارد. ترانسفورمرها (Transformers)، معماری زیربنایی مدلهایی مانند GPT-4 و Llama 3، در تئوری توانایی توجه به هر توکنی در پنجره زمینه خود را با وزن برابر دارند. با این حال، در عمل، توجه آنها بسیار نامتوازن است، که توسط الگوهای آماری دادههای آموزشی و مکانیسمهای پوششدهی علّی (Causal Masking) شکل گرفته است.[5]
این پدیده به طور رسمی به عنوان سوگیری موقعیتی (Positional Bias) شناخته میشود و مشهورترین نمود آن، اثر «گم شدن در میانه» است. محققان دانشگاه استنفورد و UC برکلی نشان دادند که وقتی یک مدل زبان با دنبالهای طولانی از اسناد تغذیه میشود، توانایی آن برای بازیابی یک واقعیت خاص به شدت به موقعیت مکانی آن واقعیت بستگی دارد.[1]
اگر اطلاعات مرتبط در همان ابتدای پرامپت قرار گیرد، مدل آن را با دقت بالا بازیابی میکند. اگر در انتهای پرامپت قرار گیرد، دقت دوباره بالا میرود. اما اگر واقعیت حیاتی در میانه یک سند ۳۰ صفحهای دفن شده باشد، عملکرد مدل به طور قابل توجهی کاهش مییابد و یک منحنی دقت مشخص به شکل U ایجاد میکند. همانطور که نویسندگان اشاره میکنند: «عملکرد میتواند هنگام تغییر موقعیت اطلاعات مرتبط به طور قابل توجهی کاهش یابد، که نشان میدهد مدلهای زبان کنونی به طور قوی از اطلاعات موجود در زمینههای ورودی طولانی استفاده نمیکنند.»[1]
این اثر تقدم (Primacy) و اثر تازگی (Recency) منعکسکننده سوگیریهای شناختی انسان است، اما در مدلهای زبان، یک مصنوع ریاضیاتی محسوب میشود. در طول پیشآموزش بر روی میلیاردها پارامتر، مدلها میآموزند که مهمترین اطلاعات برای پیشبینی کلمه بعدی معمولاً در متن بلافاصله قبلی (تازگی) یا در چارچوببندی بنیادی در ابتدای سند (تقدم) یافت میشود.[3]
میانه متن، که اغلب حاوی جزئیات پشتیبان یا پرکننده است، وزنهای توجهی آماری ضعیفتری دریافت میکند. هنگامی که این مدلها بعداً برای پیروی از دستورالعملها تنظیم دقیق (Fine-tuned) میشوند، این سوگیری ریشهدار همچنان باقی میماند. مدل از نظر فنی توکنهای میانی را پردازش میکند، اما مکانیسم توجه (Attention Mechanism) نمیتواند وزن کافی به آنها اختصاص دهد تا بر خروجی نهایی تأثیر بگذارد.[1][3]
پیامدهای این موضوع برای کاربردهای سازمانی جدی است. در سیستمهای تولید تقویتشده با بازیابی (RAG)، که در آنها یک موتور جستجو اسناد مرتبط را بیرون کشیده و به مدل زبان میدهد، ممکن است سیستم با موفقیت سند صحیح را بازیابی کند اما آن را در میانه پنجره زمینه قرار دهد. سپس مدل پاسخی تولید میکند که واقعیت بازیابی شده را نادیده میگیرد و منجر به توهمزایی میشود.[1][5]
سپس مدل پاسخی تولید میکند که واقعیت بازیابی شده را نادیده میگیرد و منجر به توهمزایی میشود.
این مشکل فراتر از بازیابی دادهها، به خود دستورالعملها نیز گسترش مییابد. یک مطالعه در سال ۲۰۲۴ که در مجموعه مقالات ACL منتشر شد، بررسی کرد که چگونه سوگیری موقعیتی بر وظایف تولید دنباله مشروط، مانند ترجمه یک سند طولانی یا خلاصهسازی یک گزارش پیچیده، تأثیر میگذارد.[4]
محققان دریافتند که وقتی دستورالعمل وظیفه در ابتدای یک دنباله ورودی طولانی قرار میگیرد، مدل دچار مشکل میشود. محققان نتیجه گرفتند: «با در نظر گرفتن محلیسازی که توسط مکانیسم خود-توجهی (Self-Attention) مدلهای زبان بزرگ مدلسازی میشود، این مدلها هنگام تولید پاسخ برای جملات ورودی طولانی، با خطر فراموشی دستورالعمل مواجه هستند.» تا زمانی که مدل به انتهای متن میرسد و شروع به تولید پاسخ میکند، دستورالعمل اولیه از توجه فعال آن محو شده است.[4]
انتقال دستورالعمل به انتهای پرامپت—درست قبل از اینکه مدل شروع به تولید کند—بهبودهای چشمگیری ایجاد کرد. در وظایف ترجمه بدون مثال (Zero-shot translation)، انتقال دستورالعمل به انتها، عملکرد را تا ۹.۷ امتیاز BLEU در مقیاس مدلهای ۱ میلیارد، ۷ میلیارد و ۱۳ میلیارد پارامتری بهبود بخشید، بدون اینکه نیاز به تنظیم دقیق یا داده اضافی باشد.[4]
برای مقابله با این مشکل، محققان در حال توسعه مداخلات جدیدی هستند. یک رویکرد، که به عنوان «مرتبسازی توجه» (Attention Sorting) شناخته میشود، تلاش میکند تا زمینه را به صورت پویا در طول تولید دوباره مرتب کند. مدل یک مرحله رمزگشایی (Decoding) انجام میدهد، محاسبه میکند که کدام اسناد بیشترین توجه را دریافت میکنند، و سپس زمینه را طوری مرتب میکند که اسناد با بالاترین توجه در انتها قرار گیرند.[2]
این فرآیند مرتبسازی تکراری، مرتبطترین اطلاعات را به ناحیه تازگی با توجه بالا سوق میدهد و با سوگیری مقابله میکند. اگرچه مرتبسازی توجه از نظر محاسباتی پرهزینه است، اما نشان داده شده که عملکرد مدلهای با زمینه طولانی را در وظایف استدلال پیچیده بهبود میبخشد.[2]
یک تکنیک نوظهور دیگر شامل کالیبره کردن مستقیم سوگیری توجه موقعیتی است. با تخمین منحنی پایه U شکل برای یک پرامپت معین، مدلهای تحلیلی میتوانند امتیازات خام توجه را به صورت ریاضی تنظیم کنند و سوگیری موقعیتی را کسر کنند تا ارتباط معنایی واقعی توکنها را جدا سازند.[5]
این کالیبراسیون به مدل اجازه میدهد تا به طور صادقانه و بر اساس ارتباط، به زمینهها توجه کند، صرف نظر از اینکه در کجای پرامپت قرار گرفتهاند. چارچوبهای نظری اولیه نشان میدهند که این امر میتواند استفاده از زمینه طولانی را به طور قابل توجهی بهبود بخشد، اگرچه مستلزم اصلاح مکانیک استنتاج (Inference Mechanics) زیربنایی مدل است.[5]
تا زمانی که این اصلاحات معماری استاندارد شوند، مهندسی پرامپت دفاع اصلی باقی میماند. به توسعهدهندگان توصیه میشود که محدودیتهای حیاتی، قوانین قالببندی و مرتبطترین اسناد بازیابی شده را در انتهای پرامپت قرار دهند تا اطمینان حاصل شود که هنگام شروع تولید، این موارد در توجه مدل تازه میمانند.[3]
دستورالعمل سیستمی، که به طور سنتی در بالای پنجره زمینه قرار میگیرد، مزیت تقدم خود را حفظ میکند و برای تعاریف کلی شخصیت (Persona) مناسب است. اما برای محدودیتهای عملیاتی سختگیرانه، اثر تازگی بسیار قدرتمندتر است. آخرین دستورالعملی که مدل میخواند، همان دستوری است که به احتمال زیاد از آن پیروی خواهد کرد.[3][4]
اصطلاحات کلیدی
- سوگیری موقعیتی
- تمایل یک مدل زبان برای اختصاص وزن ریاضی نابرابر به توکنها صرفاً بر اساس موقعیت آنها در دنباله ورودی، به جای ارتباط واقعی آنها.
- اثر تقدم
- پدیدهای که در آن یک مدل توجه نامتناسب بالایی به اطلاعات ارائه شده در همان ابتدای یک پرامپت نشان میدهد.
- اثر تازگی
- پدیدهای که در آن یک مدل توجه نامتناسب بالایی به اطلاعات ارائه شده در انتهای یک پرامپت، درست قبل از شروع تولید متن، نشان میدهد.
- مرتبسازی توجه
- یک تکنیک استنتاج که محاسبه میکند کدام اسناد مرتبطتر هستند و آنها را به صورت پویا به انتهای پرامپت منتقل میکند تا از اثر تازگی بهره ببرد.
منابع
[1]ACL Anthologyجبرگرایان معماریLost in the Middle: How Language Models Use Long Contexts
مطالعه در ACL Anthology →
[2]arXivجبرگرایان معماریattention sorting combats recency bias in long context language models
مطالعه در arXiv →
[3]IntuitionLabsمهندسان زمینهLLM Position Bias: Primacy and Recency Effects in Prompts
مطالعه در IntuitionLabs →
[4]ACL Anthologyجبرگرایان معماریInstruction Position Matters in Sequence Generation with Large Language Models
مطالعه در ACL Anthology →
[5]تیم سردبیری کوهستانمهندسان زمینهتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →اخلاق فناوری
هشدار پاپ لئو چهاردهم درباره «بهشت ماشینی» و خطرات هوش مصنوعی در سفر به فرانسه
6 منبع
مقاومت هوش مصنوعی
نقطه کور ریاضیاتی در ایمنی هوش مصنوعی: هنجارهای Lp چگونه بودجههای اختلال خصمانه را تعریف میکنند
11 منبع
حکمرانی هوش مصنوعی
هشدار هیئت سازمان ملل: پس از هک هماهنگ ایجنتهای آزمایشی اوپنایآی، سازوکارهای ایمنی هوش مصنوعی در حال «فروپاشی» است
5 منبع
هوش مصنوعی در زیستشناسی
کشف یک سیستم آنزیمی جدید شبیه به کریسپر توسط هوش مصنوعی کلود
3 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.



