رفتن به محتوای اصلی
Koohestun
توضیح کوهستانسوگیری موقعیتیتحلیل و توضیح· 5 دقیقه مطالعه· در هوش مصنوعی

مزیت موقعیتی دستورالعمل سیستمی: چگونه قرار دادن دستورات در ابتدای پنجره زمینه، خروجی مدل‌های زبان بزرگ را محدود می‌کند

مدل‌های زبان بزرگ سوگیری توجهی مشخصی به شکل U از خود نشان می‌دهند، به طوری که اطلاعات موجود در ابتدا و انتهای یک پرامپت را به طور قابل اعتمادی پردازش می‌کنند، اما میانه آن را نادیده می‌گیرند. محققان در حال توسعه روش‌های جدید کالیبراسیون و مرتب‌سازی هستند تا مدل‌ها را وادار کنند داده‌ها را بر اساس ارتباط (Relevance) و نه موقعیت مکانی ارزیابی کنند.

به قلم اِلا فرجاد

مهندسان زمینه 60%جبرگرایان معماری 40%
مهندسان زمینه
استدلال می‌کنند که سوگیری موقعیتی یک ویژگی دائمی مدل‌های ترانسفورمر است که باید از طریق ساختاردهی دقیق پرامپت و جایگذاری دستورالعمل مدیریت شود.
جبرگرایان معماری
معتقدند که سوگیری موقعیتی یک نقص ریاضیاتی در مکانیسم توجه است که باید در سطح استنتاج (Inference) از طریق مرتب‌سازی یا کالیبراسیون حل شود.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار
  • طراحان برنامه‌های کاربر نهایی

نکات کلیدی

  • مدل‌های زبان منحنی توجهی به شکل U از خود نشان می‌دهند که ابتدا و انتهای یک پرامپت را در اولویت قرار می‌دهد.
  • اطلاعاتی که در میانه یک پنجره زمینه طولانی دفن می‌شوند، اغلب نادیده گرفته شده و منجر به توهم‌زایی می‌شوند.
  • انتقال دستورالعمل‌های وظیفه به انتهای یک پرامپت، توانایی مدل برای پیروی از آن‌ها را به طور قابل توجهی بهبود می‌بخشد.
  • محققان در حال توسعه تکنیک‌های مرتب‌سازی توجه و کالیبراسیون هستند تا این سوگیری را در سطح معماری برطرف کنند.

برخی از مهندسان پرامپت استدلال می‌کنند که دستورالعمل سیستمی (System Prompt) یک محدودیت مطلق است، مجموعه‌ای از قوانین بنیادی که مدل نمی‌تواند آن‌ها را نادیده بگیرد، زیرا ابتدا پردازش شده و خط مبنا را برای تمام تولیدات بعدی تعیین می‌کند. برخی دیگر در مقابل می‌گویند که با رشد پنجره‌های زمینه به ۱۲۸,۰۰۰ یا حتی ۱,۰۰۰,۰۰۰ توکن، دستورالعمل‌های اولیه به طور معمول فراموش می‌شوند و توسط حجم عظیم متن بعدی شسته می‌شوند، و دستورالعمل سیستمی را به جای یک قانون آهنین، به یک پیشنهاد شکننده تبدیل می‌کنند.[3]

این کشمکش در قلب نحوه پردازش زبان توسط هوش مصنوعی مدرن قرار دارد. ترانسفورمرها (Transformers)، معماری زیربنایی مدل‌هایی مانند GPT-4 و Llama 3، در تئوری توانایی توجه به هر توکنی در پنجره زمینه خود را با وزن برابر دارند. با این حال، در عمل، توجه آن‌ها بسیار نامتوازن است، که توسط الگوهای آماری داده‌های آموزشی و مکانیسم‌های پوشش‌دهی علّی (Causal Masking) شکل گرفته است.[5]

این پدیده به طور رسمی به عنوان سوگیری موقعیتی (Positional Bias) شناخته می‌شود و مشهورترین نمود آن، اثر «گم شدن در میانه» است. محققان دانشگاه استنفورد و UC برکلی نشان دادند که وقتی یک مدل زبان با دنباله‌ای طولانی از اسناد تغذیه می‌شود، توانایی آن برای بازیابی یک واقعیت خاص به شدت به موقعیت مکانی آن واقعیت بستگی دارد.[1]

اگر اطلاعات مرتبط در همان ابتدای پرامپت قرار گیرد، مدل آن را با دقت بالا بازیابی می‌کند. اگر در انتهای پرامپت قرار گیرد، دقت دوباره بالا می‌رود. اما اگر واقعیت حیاتی در میانه یک سند ۳۰ صفحه‌ای دفن شده باشد، عملکرد مدل به طور قابل توجهی کاهش می‌یابد و یک منحنی دقت مشخص به شکل U ایجاد می‌کند. همانطور که نویسندگان اشاره می‌کنند: «عملکرد می‌تواند هنگام تغییر موقعیت اطلاعات مرتبط به طور قابل توجهی کاهش یابد، که نشان می‌دهد مدل‌های زبان کنونی به طور قوی از اطلاعات موجود در زمینه‌های ورودی طولانی استفاده نمی‌کنند.»[1]

اثر «گم شدن در میانه» با افزایش طول زمینه، یک منحنی دقت مشخص به شکل U ایجاد می‌کند.

این اثر تقدم (Primacy) و اثر تازگی (Recency) منعکس‌کننده سوگیری‌های شناختی انسان است، اما در مدل‌های زبان، یک مصنوع ریاضیاتی محسوب می‌شود. در طول پیش‌آموزش بر روی میلیاردها پارامتر، مدل‌ها می‌آموزند که مهم‌ترین اطلاعات برای پیش‌بینی کلمه بعدی معمولاً در متن بلافاصله قبلی (تازگی) یا در چارچوب‌بندی بنیادی در ابتدای سند (تقدم) یافت می‌شود.[3]

میانه متن، که اغلب حاوی جزئیات پشتیبان یا پرکننده است، وزن‌های توجهی آماری ضعیف‌تری دریافت می‌کند. هنگامی که این مدل‌ها بعداً برای پیروی از دستورالعمل‌ها تنظیم دقیق (Fine-tuned) می‌شوند، این سوگیری ریشه‌دار همچنان باقی می‌ماند. مدل از نظر فنی توکن‌های میانی را پردازش می‌کند، اما مکانیسم توجه (Attention Mechanism) نمی‌تواند وزن کافی به آن‌ها اختصاص دهد تا بر خروجی نهایی تأثیر بگذارد.[1][3]

پیامدهای این موضوع برای کاربردهای سازمانی جدی است. در سیستم‌های تولید تقویت‌شده با بازیابی (RAG)، که در آن‌ها یک موتور جستجو اسناد مرتبط را بیرون کشیده و به مدل زبان می‌دهد، ممکن است سیستم با موفقیت سند صحیح را بازیابی کند اما آن را در میانه پنجره زمینه قرار دهد. سپس مدل پاسخی تولید می‌کند که واقعیت بازیابی شده را نادیده می‌گیرد و منجر به توهم‌زایی می‌شود.[1][5]

سپس مدل پاسخی تولید می‌کند که واقعیت بازیابی شده را نادیده می‌گیرد و منجر به توهم‌زایی می‌شود.

این مشکل فراتر از بازیابی داده‌ها، به خود دستورالعمل‌ها نیز گسترش می‌یابد. یک مطالعه در سال ۲۰۲۴ که در مجموعه مقالات ACL منتشر شد، بررسی کرد که چگونه سوگیری موقعیتی بر وظایف تولید دنباله مشروط، مانند ترجمه یک سند طولانی یا خلاصه‌سازی یک گزارش پیچیده، تأثیر می‌گذارد.[4]

محققان دریافتند که وقتی دستورالعمل وظیفه در ابتدای یک دنباله ورودی طولانی قرار می‌گیرد، مدل دچار مشکل می‌شود. محققان نتیجه گرفتند: «با در نظر گرفتن محلی‌سازی که توسط مکانیسم خود-توجهی (Self-Attention) مدل‌های زبان بزرگ مدل‌سازی می‌شود، این مدل‌ها هنگام تولید پاسخ برای جملات ورودی طولانی، با خطر فراموشی دستورالعمل مواجه هستند.» تا زمانی که مدل به انتهای متن می‌رسد و شروع به تولید پاسخ می‌کند، دستورالعمل اولیه از توجه فعال آن محو شده است.[4]

انتقال دستورالعمل به انتهای پرامپت—درست قبل از اینکه مدل شروع به تولید کند—بهبودهای چشمگیری ایجاد کرد. در وظایف ترجمه بدون مثال (Zero-shot translation)، انتقال دستورالعمل به انتها، عملکرد را تا ۹.۷ امتیاز BLEU در مقیاس مدل‌های ۱ میلیارد، ۷ میلیارد و ۱۳ میلیارد پارامتری بهبود بخشید، بدون اینکه نیاز به تنظیم دقیق یا داده اضافی باشد.[4]

انتقال دستورالعمل‌ها به انتهای یک پرامپت، توانایی مدل برای پیروی از آن‌ها را به طور قابل توجهی بهبود می‌بخشد.

برای مقابله با این مشکل، محققان در حال توسعه مداخلات جدیدی هستند. یک رویکرد، که به عنوان «مرتب‌سازی توجه» (Attention Sorting) شناخته می‌شود، تلاش می‌کند تا زمینه را به صورت پویا در طول تولید دوباره مرتب کند. مدل یک مرحله رمزگشایی (Decoding) انجام می‌دهد، محاسبه می‌کند که کدام اسناد بیشترین توجه را دریافت می‌کنند، و سپس زمینه را طوری مرتب می‌کند که اسناد با بالاترین توجه در انتها قرار گیرند.[2]

این فرآیند مرتب‌سازی تکراری، مرتبط‌ترین اطلاعات را به ناحیه تازگی با توجه بالا سوق می‌دهد و با سوگیری مقابله می‌کند. اگرچه مرتب‌سازی توجه از نظر محاسباتی پرهزینه است، اما نشان داده شده که عملکرد مدل‌های با زمینه طولانی را در وظایف استدلال پیچیده بهبود می‌بخشد.[2]

یک تکنیک نوظهور دیگر شامل کالیبره کردن مستقیم سوگیری توجه موقعیتی است. با تخمین منحنی پایه U شکل برای یک پرامپت معین، مدل‌های تحلیلی می‌توانند امتیازات خام توجه را به صورت ریاضی تنظیم کنند و سوگیری موقعیتی را کسر کنند تا ارتباط معنایی واقعی توکن‌ها را جدا سازند.[5]

این کالیبراسیون به مدل اجازه می‌دهد تا به طور صادقانه و بر اساس ارتباط، به زمینه‌ها توجه کند، صرف نظر از اینکه در کجای پرامپت قرار گرفته‌اند. چارچوب‌های نظری اولیه نشان می‌دهند که این امر می‌تواند استفاده از زمینه طولانی را به طور قابل توجهی بهبود بخشد، اگرچه مستلزم اصلاح مکانیک استنتاج (Inference Mechanics) زیربنایی مدل است.[5]

مرتب‌سازی توجه به صورت پویا زمینه را دوباره مرتب می‌کند تا اسناد مرتبط را در ناحیه تازگی با توجه بالا قرار دهد.

تا زمانی که این اصلاحات معماری استاندارد شوند، مهندسی پرامپت دفاع اصلی باقی می‌ماند. به توسعه‌دهندگان توصیه می‌شود که محدودیت‌های حیاتی، قوانین قالب‌بندی و مرتبط‌ترین اسناد بازیابی شده را در انتهای پرامپت قرار دهند تا اطمینان حاصل شود که هنگام شروع تولید، این موارد در توجه مدل تازه می‌مانند.[3]

دستورالعمل سیستمی، که به طور سنتی در بالای پنجره زمینه قرار می‌گیرد، مزیت تقدم خود را حفظ می‌کند و برای تعاریف کلی شخصیت (Persona) مناسب است. اما برای محدودیت‌های عملیاتی سخت‌گیرانه، اثر تازگی بسیار قدرتمندتر است. آخرین دستورالعملی که مدل می‌خواند، همان دستوری است که به احتمال زیاد از آن پیروی خواهد کرد.[3][4]

اصطلاحات کلیدی

سوگیری موقعیتی
تمایل یک مدل زبان برای اختصاص وزن ریاضی نابرابر به توکن‌ها صرفاً بر اساس موقعیت آن‌ها در دنباله ورودی، به جای ارتباط واقعی آن‌ها.
اثر تقدم
پدیده‌ای که در آن یک مدل توجه نامتناسب بالایی به اطلاعات ارائه شده در همان ابتدای یک پرامپت نشان می‌دهد.
اثر تازگی
پدیده‌ای که در آن یک مدل توجه نامتناسب بالایی به اطلاعات ارائه شده در انتهای یک پرامپت، درست قبل از شروع تولید متن، نشان می‌دهد.
مرتب‌سازی توجه
یک تکنیک استنتاج که محاسبه می‌کند کدام اسناد مرتبط‌تر هستند و آن‌ها را به صورت پویا به انتهای پرامپت منتقل می‌کند تا از اثر تازگی بهره ببرد.

منابع

پوشش منابع

5 منبع

2 دیدگاه شناسایی‌شده

مهندسان زمینه 60%جبرگرایان معماری 40%
  1. [1]ACL Anthologyجبرگرایان معماری

    Lost in the Middle: How Language Models Use Long Contexts

    مطالعه در ACL Anthology →
  2. [2]arXivجبرگرایان معماری

    attention sorting combats recency bias in long context language models

    مطالعه در arXiv →
  3. [3]IntuitionLabsمهندسان زمینه

    LLM Position Bias: Primacy and Recency Effects in Prompts

    مطالعه در IntuitionLabs →
  4. [4]ACL Anthologyجبرگرایان معماری

    Instruction Position Matters in Sequence Generation with Large Language Models

    مطالعه در ACL Anthology →
  5. [5]تیم سردبیری کوهستانمهندسان زمینه

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.