رفتن به محتوای اصلی
توضیح کوهستانمعماری هوش مصنوعیتحلیل فنی۸ شهریور ۱۴۰۵، ۹:۲۹· 9 دقیقه مطالعه

مدل‌های زبان بزرگ واقعاً چگونه متن تولید می‌کنند: مکانیسم پیش‌بینی توکن بعدی

با وجود توهم استدلال شبیه به انسان، مدل‌های زبان بزرگ بر اساس یک فرض اساساً ریاضی عمل می‌کنند. این سیستم‌ها با تبدیل متن به توکن‌های عددی و محاسبه توزیع‌های احتمال، صرفاً محتمل‌ترین کلمه بعدی را در یک دنباله پیش‌بینی می‌کنند.

به قلم کیان راد

محققان ایمنی هوش مصنوعی 40%توسعه‌دهندگان هوش مصنوعی زایشی 40%دانشمندان علوم شناختی 20%
محققان ایمنی هوش مصنوعی
تمرکز بر رمزگشایی جعبه سیاه LLMها و کاهش خطرات تولید احتمالی.
توسعه‌دهندگان هوش مصنوعی زایشی
تمرکز بر تنظیم پارامترهای تولید برای بهینه‌سازی کاربرد مدل برای برنامه‌های تجاری خاص.
دانشمندان علوم شناختی
بحث در مورد اینکه آیا ویژگی‌های نوظهور پیش‌بینی توکن بعدی، شناخت انسانی را شبیه‌سازی یا تکرار می‌کنند.

نکات کلیدی

  • مدل‌های زبان بزرگ متن را درک نمی‌کنند؛ آن‌ها کلمات را به توکن‌های عددی تبدیل کرده و به صورت ریاضی پردازش می‌کنند.
  • وظیفه اصلی یک LLM پیش‌بینی توکن بعدی است، یعنی محاسبه احتمال آماری کلمه بعدی در یک دنباله.
  • مکانیسم توجه (Attention mechanism) به مدل‌ها اجازه می‌دهد تا ارتباط همه توکن‌ها را به طور همزمان وزن‌دهی کنند و درک زمینه‌ای عمیقی ایجاد کنند.
  • پارامترهایی مانند دما (Temperature) و تاپ-پی (top-p) با صاف کردن یا کوتاه کردن ریاضی توزیع‌های احتمال، تصادفی بودن خروجی را کنترل می‌کنند.
  • توهمات (Hallucinations) رخ می‌دهند زیرا مدل‌ها هنگام تولید پاسخ، احتمال آماری را بر دقت واقعی ترجیح می‌دهند.

ما درباره هوش مصنوعی صحبت می‌کنیم که «توهم می‌زند»، «فکر می‌کند» و «استدلال می‌کند». زبان بازاریابی شرکت‌های بزرگ فناوری، توهم یک ذهن دیجیتالی را تقویت می‌کند و چت‌بات‌ها را به عنوان موجودات شناختی معرفی می‌کند که قبل از ارائه پاسخ‌های عمیق، به سؤالات ما می‌اندیشند. اما در زیر رابط‌های مکالمه‌ای و افعال انسان‌انگارانه، واقعیت یک مدل زبان بزرگ کاملاً ریاضی است. این سیستم‌ها فاقد جهان‌بینی هستند، تعاریف کلماتی را که خروجی می‌دهند درک نمی‌کنند و مونولوگ درونی ندارند. آن‌ها در هسته مطلق خود، موتورهای آماری بسیار پیچیده‌ای هستند که برای انجام یک وظیفه تکراری واحد با سرعت سرسام‌آور طراحی شده‌اند.[5]

آن وظیفه واحد، پیش‌بینی توکن بعدی است. هنگامی که کاربر یک فرمان (prompt) را وارد مدل زبان بزرگ می‌کند، سیستم جمله را برای درک معنای آن نمی‌خواند. در عوض، دنباله داده‌ها را تجزیه و تحلیل می‌کند و احتمال آماری آنچه که منطقاً باید در ادامه بیاید را محاسبه می‌کند. در واقع به طور مداوم از خود یک سؤال می‌پرسد: بر اساس تریلیون‌ها مثال در داده‌های آموزشی من، محتمل‌ترین قطعه متنی که این دنباله دقیق را دنبال می‌کند چیست؟ هوش ظاهری پاسخ، یک ویژگی نوظهور است که از انجام دقیق این پیش‌بینی در میان میلیاردها پارامتر حاصل می‌شود.[4]

برای درک اینکه این مکانیسم پیش‌بینی واقعاً چگونه کار می‌کند، باید به نحوه هضم اطلاعات توسط این مدل‌ها نگاه کنیم. مدل‌های زبان بزرگ انگلیسی، اسپانیایی یا پایتون را نمی‌خوانند؛ آن‌ها اعداد را می‌خوانند. اولین گام در خط لوله تولید، توکن‌سازی (tokenization) است، فرآیندی که در آن متن ورودی خام به قطعات کوچک‌تر و قابل خواندن توسط ماشین تقسیم می‌شود. بسته به معماری خاص مدل، یک توکن ممکن است یک کلمه کامل، یک هجا یا حتی فقط یک کاراکتر منفرد را نشان دهد.

سپس به هر یک از این توکن‌های استخراج‌شده، یک شناسه عددی منحصر به فرد از واژگان ثابت و از پیش تعریف شده مدل اختصاص داده می‌شود. به عنوان مثال، جمله «The cat sat on the mat» از معنای زبانی خود جدا شده و به دنباله‌ای از اعداد صحیح تبدیل می‌شود. این دنباله عددی تنها زبانی است که مدل واقعاً با آن صحبت می‌کند و هر عملیات بعدی در فرآیند تولید کاملاً بر دستکاری این مقادیر صحیح از طریق فرمول‌های ریاضی پیچیده متکی است.

توکن‌سازی (Tokenization) زبان خام انسانی را به اعداد صحیح عددی تبدیل می‌کند که مدل واقعاً آن‌ها را پردازش می‌کند.

هنگامی که متن توکن‌سازی شده و به اعداد صحیح تبدیل شد، آن اعداد به بردارهای با ابعاد بالا معروف به امبدینگ (embeddings) ترجمه می‌شوند. یک امبدینگ معنای معنایی یک توکن را با قرار دادن آن در یک مختصات خاص در یک فضای ریاضی گسترده ثبت می‌کند. در این فضا، کلماتی با معانی یا زمینه‌های مشابه در نهایت از نظر فیزیکی به هم نزدیک‌تر می‌شوند. مدل یاد می‌گیرد که بردار «پادشاه» با «ملکه» به همان روش ریاضی مرتبط است که «مرد» با «زن» مرتبط است و یک نقشه بنیادی از روابط زبانی ایجاد می‌کند.[4]

با این حال، معنای یک کلمه اغلب بسته به زمینه اطراف آن تغییر می‌کند. کلمه «بانک» (bank) وقتی در کنار «رودخانه» قرار می‌گیرد، معنایی کاملاً متفاوت از زمانی دارد که در کنار «پول» قرار می‌گیرد. برای حل این ابهام، مدل‌های زبان بزرگ مدرن به معماری ترنسفورمر (transformer) و به طور خاص به یک فرآیند ریاضی پیشگامانه معروف به مکانیسم توجه (attention mechanism) متکی هستند. این موتور، به مدل اجازه می‌دهد تا زمینه را به صورت پویا پردازش کند، نه اینکه کلمات را به ترتیب سفت و سخت و خطی بخواند.[3][4]

مکانیسم توجه به مدل اجازه می‌دهد تا به طور همزمان به هر توکن در یک دنباله ورودی نگاه کند و ارتباط آن‌ها را با یکدیگر وزن‌دهی کند. این مکانیسم «امتیازات توجه» ریاضی را اختصاص می‌دهد که تعیین می‌کند یک توکن معین چقدر باید روی هر توکن دیگری در جمله تمرکز کند. با محاسبه این امتیازات، مدل می‌تواند تشخیص دهد که کدام صفت‌ها کدام اسم‌ها را تغییر می‌دهند و چگونه فاعل یک جمله با فعلی که چندین کلمه بعد ظاهر می‌شود، مرتبط است.[3]

از طریق لایه‌های متعدد و انباشته این فرآیند خودتوجهی (self-attention)، مدل یک درک عمیقاً زمینه‌سازی شده از دنباله ورودی ایجاد می‌کند. ساختار دستوری، روابط معنایی و جریان منطقی فرمان را ترسیم می‌کند. لایه‌های اولیه در شبکه عصبی معمولاً نحو و دستور زبان اولیه را ثبت می‌کنند، در حالی که لایه‌های عمیق‌تر، معناشناسی پیچیده، منطق و زمینه کلی مورد نیاز برای تولید یک پاسخ منسجم را ثبت می‌کنند.[3]

پس از پردازش کامل دنباله ورودی از طریق لایه‌های توجه، مدل به مرحله نهایی چرخه می‌رسد: پیش‌بینی توکن بعدی. شبکه عصبی مجموعه‌ای از امتیازات عددی خام و نرمال نشده را برای هر توکن در کل واژگان خود خروجی می‌دهد. این امتیازات خام به عنوان لاجیت (logits) شناخته می‌شوند. اگر یک مدل دارای واژگانی متشکل از ۱۰۰,۰۰۰ توکن متمایز باشد، ۱۰۰,۰۰۰ لاجیت مجزا تولید می‌کند که اعداد بالاتر نشان‌دهنده یک باور ریاضی قوی‌تر مبنی بر اینکه آن توکن انتخاب صحیح بعدی است، هستند.[1]

پس از پردازش کامل دنباله ورودی از طریق لایه‌های توجه، مدل به مرحله نهایی چرخه می‌رسد: پیش‌بینی توکن بعدی.

از آنجایی که کار با لاجیت‌های خام به طور مستقیم دشوار است، آن‌ها از طریق یک تابع ریاضی به نام سافت‌مکس (softmax) عبور داده می‌شوند. تابع سافت‌مکس امتیازات خام را به یک توزیع احتمال تمیز تبدیل می‌کند. به هر توکن در واژگان یک شانس درصدی برای اینکه قطعه صحیح بعدی دنباله باشد، اختصاص داده می‌شود و تمام آن درصدها مقیاس‌بندی می‌شوند تا مجموع آن‌ها دقیقاً به ۱۰۰ درصد برسد. توکنی با بالاترین لاجیت، بالاترین احتمال درصدی را دریافت می‌کند.[1]

تابع سافت‌مکس (Softmax) امتیازات عددی خام (لاجیت‌ها) را به یک توزیع احتمال درصدی تمیز تبدیل می‌کند.

اگر یک مدل زبان بزرگ صرفاً قطعی (deterministic) بود، به سادگی به توزیع احتمال سافت‌مکس نگاه می‌کرد و توکنی را با بالاترین درصد در هر بار انتخاب می‌کرد. این رویکرد پایه به عنوان رمزگشایی حریصانه (greedy decoding) شناخته می‌شود. در حالی که رمزگشایی حریصانه متن بسیار قابل پیش‌بینی، پایدار و واقعی تولید می‌کند، اما همچنین تمایل دارد منجر به نثر تکراری، رباتیک و خشکی شود که فاقد واریانس طبیعی گفتار انسان است.

برای اینکه خروجی تولید شده طبیعی‌تر، محاوره‌ای‌تر و «انسانی‌تر» به نظر برسد، توسعه‌دهندگان تصادفی بودن کنترل‌شده‌ای را در مرحله نمونه‌برداری نهایی معرفی می‌کنند. به جای اینکه همیشه انتخاب ریاضی مورد علاقه را برگزیند، مدل از توزیع نمونه‌برداری می‌کند. اینجاست که ابرپارامترهای خارجی مانند دما (temperature) و تاپ-پی (top-p) وارد عمل می‌شوند. این تنظیمات اغلب به عنوان «دکمه‌های خلاقیت» مدل به مصرف‌کنندگان معرفی می‌شوند، اما در واقع فیلترهای ریاضی سخت‌گیرانه‌ای هستند.[1][2]

پارامتر دما با تقسیم لاجیت‌های خام بر یک مقدار خاص قبل از اعمال تابع سافت‌مکس عمل می‌کند. یک تنظیم دمای پایین، مانند ۰٫۲، توزیع احتمال را به صورت ریاضی تیز می‌کند. این کار تفاوت‌ها بین امتیازات را تقویت می‌کند و محتمل‌ترین توکن‌ها را حتی غالب‌تر می‌سازد و توکن‌های نامحتمل را سرکوب می‌کند. این تنظیم برای کدنویسی، استخراج داده یا بازیابی واقعی که در آن دقت و سازگاری به شدت مورد نیاز است، ایده‌آل است.[1][2]

برعکس، تنظیم دمای بالا، مانند ۰٫۸ یا ۱٫۰، توزیع احتمال را به صورت ریاضی صاف می‌کند. این کار شکاف بین بالاترین و پایین‌ترین امتیازات را کاهش می‌دهد و شانس انتخاب توکن‌های با احتمال پایین‌تر را افزایش می‌دهد. مدل در واقع «خلاق» نیست یا خارج از چارچوب فکر نمی‌کند؛ بلکه صرفاً توسط الگوریتم مجبور می‌شود کلمات کم‌تر واضح از نظر آماری را انتخاب کند. سپس خوانندگان انسانی این واریانس آماری را به عنوان تخیل یا استعداد خلاقانه انسان‌انگاری می‌کنند.[1][5]

تنظیم پارامتر دما به صورت ریاضی منحنی احتمال را تیز یا صاف می‌کند و واریانس خروجی را کنترل می‌کند.

نمونه‌برداری تاپ-پی (که به عنوان نمونه‌برداری هسته‌ای نیز شناخته می‌شود)، روش متفاوتی برای کنترل خروجی ارائه می‌دهد. به جای تغییر شکل کل منحنی احتمال مانند دما، تاپ-پی آن را به صورت پویا کوتاه می‌کند. اگر پارامتر تاپ-پی روی ۰٫۹۵ تنظیم شود، مدل فقط زیرمجموعه خاصی از توکن‌های برتر را در نظر می‌گیرد که احتمالات ترکیبی آن‌ها برابر با ۹۵ درصد است. این کار به طور کامل دنباله طولانی گزینه‌های بسیار نامحتمل را کنار می‌گذارد و از تولید مزخرفات کامل توسط مدل جلوگیری می‌کند، در حالی که همچنان امکان واریانس کنترل شده را فراهم می‌سازد.[2]

هنگامی که یک توکن واحد در نهایت از طریق این فرآیند نمونه‌برداری انتخاب می‌شود، به دنباله ورودی اصلی اضافه می‌شود. سپس مدل این دنباله تازه گسترش یافته را می‌گیرد و کل فرآیند را دوباره از نو شروع می‌کند. توکن‌سازی، امبدینگ، امتیازدهی توجه، تولید لاجیت و نمونه‌برداری از ابتدا تکرار می‌شوند تا توکن بعدی و سپس توکن بعدی پیش‌بینی شود و پاسخ قطعه به قطعه ساخته شود.[4]

این حلقه خودرگرسیو (autoregressive) با سرعت سرسام‌آوری ادامه می‌یابد و متن را یک توکن در یک زمان تولید می‌کند تا زمانی که مدل یا یک توکن ویژه «توقف» را پیش‌بینی کند یا به حداکثر حد طول از پیش تعریف شده توسط توسعه‌دهنده برسد. سپس جریان حاصل از شناسه‌های توکن عددی از طریق یک دیتوکن‌ساز (detokenizer) عبور داده می‌شود که اعداد صحیح را دوباره به متن انسانی قابل خواندن که روی صفحه کاربر ظاهر می‌شود، ترجمه می‌کند.[2]

توهم هوش کاملاً از مقیاس محض این عملیات پدید می‌آید. هنگامی که یک مدل ترنسفورمر بر روی تریلیون‌ها کلمه جمع‌آوری شده از اینترنت آموزش داده می‌شود و حاوی صدها میلیارد پارامتر قابل تنظیم است، پیش‌بینی توکن بعدی به اندازه‌ای پیچیده می‌شود که استدلال، منطق و خلاقیت را تقلید کند. مدل شکل آماری زبان انسان را چنان به طور کامل نقشه‌برداری کرده است که حدس‌های ریاضی آن از درک واقعی قابل تشخیص نیستند.[4]

توهم استدلال از مقیاس محاسباتی محض پیش‌بینی توکن‌های بعدی در میان میلیاردها پارامتر پدید می‌آید.

درک این مکانیسم زیربنایی برای پیمایش ایمن در عصر هوش مصنوعی زایشی حیاتی است. هنگامی که یک مدل زبان بزرگ یک سابقه قانونی جعلی را «توهم می‌زند»، یک رویداد تاریخی غیرموجود را اختراع می‌کند، یا یک تشخیص پزشکی به طور خطرناکی نادرست ارائه می‌دهد، دروغ نمی‌گوید یا دچار نقص فنی نشده است. بلکه صرفاً با موفقیت دنباله‌ای از توکن‌ها را تولید می‌کند که احتمال آماری بالایی برای ظاهر شدن در کنار هم داشته‌اند، کاملاً عاری از پایه و اساس واقعی یا تأیید دنیای واقعی.[5]

با تشخیص اینکه این سیستم‌ها موتورهای احتمال هستند نه ذهن‌های دیجیتالی، کاربران می‌توانند فرمان‌های خود را بهتر مهندسی کنند، پارامترهای تولید خود را تنظیم کنند و شک و تردید لازم را نسبت به خروجی حفظ کنند. این فناوری یک پیشرفت عظیم در آمار محاسباتی و پردازش زبان طبیعی است، اما جادوی آن در توانایی ماشین برای فکر کردن نیست – بلکه کاملاً در ریاضیات نهفته است.[5]

پرسش‌های متداول

آیا هوش مصنوعی واقعاً می‌فهمد که من چه می‌پرسم؟

خیر. مدل‌های زبان بزرگ فاقد درک یا آگاهی هستند. آن‌ها از الگوهای ریاضی آموخته شده از حجم عظیمی از داده‌های آموزشی استفاده می‌کنند تا پیش‌بینی کنند کدام کلمات به احتمال آماری بیشتری فرمان شما را دنبال خواهند کرد.

چرا هوش مصنوعی گاهی اوقات پاسخ‌های متفاوتی به یک سؤال می‌دهد؟

این تنوع توسط پارامترهای نمونه‌برداری مانند دما کنترل می‌شود. مگر اینکه دما روی صفر تنظیم شود (کاملاً قطعی)، مدل تصادفی بودن کنترل‌شده‌ای را معرفی می‌کند، انتخاب‌های متفاوتی از کلمات با احتمال بالا را هر بار که پاسخی تولید می‌کند، انجام می‌دهد.

چه چیزی باعث می‌شود هوش مصنوعی توهم بزند یا حقایق را جعل کند؟

توهمات رخ می‌دهند زیرا تنها هدف مدل پیش‌بینی یک دنباله توکن با صدای قابل قبول است، نه تأیید حقیقت. اگر یک گزاره نادرست بر اساس داده‌های آموزشی مدل، احتمال آماری بالایی داشته باشد، مدل آن را با اطمینان تولید خواهد کرد.

چرا مهم است

درک واقعیت مکانیکی نحوه تولید متن توسط هوش مصنوعی، هیجان و انسان‌انگاری پیرامون آن را کنار می‌زند و به کاربران اجازه می‌دهد خروجی‌ها را بهتر کنترل کنند، توهمات (Hallucinations) را کاهش دهند و محدودیت‌های سخت فناوری‌های زایشی (Generative) فعلی را بشناسند.

بررسی عمیق دیدگاه‌ها

محققان ایمنی هوش مصنوعی

تمرکز بر رمزگشایی جعبه سیاه LLMها و کاهش خطرات تولید احتمالی.

این گروه استدلال می‌کند که انسان‌انگاری مدل‌های زبان بزرگ به طور فعال خطرناک است. با رفتار کردن با موتورهای پیش‌بینی توکن بعدی به عنوان موجودات استدلالی، کاربران اعتماد بی‌موردی به متن تولید شده آماری می‌کنند. محققان در این فضا بر تفسیرپذیری مکانیکی تمرکز دارند—تلاش برای نقشه‌برداری دقیق از اینکه چگونه سر توجه خاص و وزن پارامترها منجر به خروجی‌های خاص می‌شوند—تا توهمات، سوگیری و دستورالعمل‌های مضر را قبل از تولید پیش‌بینی و جلوگیری کنند.

توسعه‌دهندگان هوش مصنوعی زایشی

تمرکز بر تنظیم پارامترهای تولید برای بهینه‌سازی کاربرد مدل برای برنامه‌های تجاری خاص.

برای توسعه‌دهندگانی که برنامه‌هایی را بر روی LLMها می‌سازند، ماهیت ریاضی مدل‌ها یک ویژگی است، نه یک اشکال. آن‌ها پارامترهایی مانند دما، تاپ-پی و جریمه‌های فرکانس را به عنوان دکمه‌های کنترل ضروری می‌بینند. با کالیبره کردن دقیق این تنظیمات، توسعه‌دهندگان می‌توانند یک مدل زیربنایی واحد را مجبور کنند که در یک زمینه به عنوان یک موتور جستجوی پایگاه داده واقعی و سفت و سخت عمل کند، و در زمینه‌ای دیگر به عنوان یک شریک طوفان فکری بسیار متغیر و خلاق، و در نتیجه حداکثر قابلیت تجاری API را فراهم آورند.

دانشمندان علوم شناختی

بحث در مورد اینکه آیا ویژگی‌های نوظهور پیش‌بینی توکن بعدی، شناخت انسانی را شبیه‌سازی یا تکرار می‌کنند.

این دیدگاه پیامدهای فلسفی و عصبی مدل‌های ترنسفورمر را بررسی می‌کند. در حالی که اذعان دارند LLMها اساساً موتورهای آماری هستند، برخی از دانشمندان علوم شناختی استدلال می‌کنند که کسب زبان انسانی نیز به شدت به پردازش پیش‌بینی و تشخیص الگو متکی است. بحث بر سر این است که آیا مقیاس‌بندی پیش‌بینی توکن بعدی صرفاً یک توهم متقاعدکننده‌تر از درک ایجاد می‌کند، یا اینکه واقعاً به شکلی ابتدایی از مدل‌سازی شناختی نزدیک می‌شود.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

محققان ایمنی هوش مصنوعی 40%توسعه‌دهندگان هوش مصنوعی زایشی 40%دانشمندان علوم شناختی 20%
  1. [1]IBMتوسعه‌دهندگان هوش مصنوعی زایشی

    What is LLM temperature?

    مطالعه در IBM
  2. [2]IBMتوسعه‌دهندگان هوش مصنوعی زایشی

    LLM parameters, defined

    مطالعه در IBM
  3. [3]GeeksforGeeksتوسعه‌دهندگان هوش مصنوعی زایشی

    Transformer Attention Mechanism in NLP

    مطالعه در GeeksforGeeks
  4. [4]Courseraدانشمندان علوم شناختی

    How Do Large Language Models Work? How AI Understands and Generates Text

    مطالعه در Coursera
  5. [5]تیم سردبیری کوهستانمحققان ایمنی هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.