کالبدشکافی مدلهای زبانی بزرگ: هوش مصنوعی واقعاً چگونه «فکر» میکند؟
پشت پرده پاسخهای شگفتانگیز هوش مصنوعی، هیچ درک یا شعوری وجود ندارد؛ این سیستمها تنها ماشینهای آماری غولپیکری هستند که کلمه بعدی را پیشبینی میکنند.
به قلم نیما موسوی
این خبر را به اشتراک بگذارید
- پژوهشگران هوش مصنوعی
- این سیستمها را به عنوان موتورهای آماری پیچیدهای میبینند که تنها برای بهینهسازی پیشبینی توکن بعدی طراحی شدهاند.
- بازاریابان صنعت فناوری
- تمایل دارند این فناوری را به عنوان سیستمی دارای «استدلال» و «درک» معرفی کنند تا جذابیت تجاری آن را افزایش دهند.
- دانشمندان علوم شناختی
- بر تفاوت بنیادین میان تطبیق الگوهای آماری در ماشینها و درک واقعی در ذهن انسان تاکید میکنند.
چرا مهم است
درک نحوه کارکرد هوش مصنوعی به ما کمک میکند تا فریب بازاریابی شرکتهای فناوری را نخوریم و بدانیم چرا این سیستمها گاهی اطلاعات غلط را با اطمینان کامل ارائه میدهند.
ما با هوش مصنوعی طوری صحبت میکنیم که گویی یک موجود متفکر است. وقتی از چتباتها سوال میپرسیم، آنها با لحنی مطمئن، منطقی و گاهی خلاقانه پاسخ میدهند. شرکتهای فناوری با استفاده از واژگانی مانند «درک کردن»، «استدلال» و «هوش»، این توهم را تقویت میکنند که ما در حال تعامل با یک ذهن دیجیتال هستیم. اما واقعیتِ زیربنایی این سیستمها، بسیار متفاوت از بازاریابیهای پر زرق و برق است.[5]
در هسته مرکزی خود، مدلهای زبانی بزرگ (LLMs) مانند GPT-4 یا Gemini، هیچ چیزی را «نمیفهمند». آنها نه معنای کلمات را میدانند و نه درکی از جهان فیزیکی دارند. آنچه این سیستمها انجام میدهند، یک عملیات ریاضی به شدت پیچیده و در عین حال ساده است: پیشبینی کلمه بعدی. آنها ماشینهای آماری غولپیکری هستند که با بررسی میلیاردها متن، یاد گرفتهاند که پس از یک سری کلمات خاص، محتملترین کلمه بعدی چیست.[1][3]
برای درک این مکانیزم، ابتدا باید بدانیم که هوش مصنوعی متن را چگونه میبیند. انسانها جملات را به صورت مفاهیم پیوسته میخوانند، اما مدلهای زبانی، متن را به قطعات کوچکی به نام «توکن» (Token) خرد میکنند. یک توکن میتواند یک کلمه کامل، بخشی از یک کلمه یا حتی یک علامت نگارشی باشد. مدلهای زبانی در واقع کلمات را نمیخوانند، بلکه توالی این توکنها را پردازش میکنند.[3]
از آنجا که کامپیوترها زبان انسان را نمیفهمند، این توکنها باید به زبان ریاضی ترجمه شوند. این فرآیند «تعبیه» یا Embedding نام دارد. هر توکن به یک بردار (لیستی از اعداد) در یک فضای چندبُعدی تبدیل میشود. کلماتی که معنای مشابهی دارند یا غالباً در کنار هم ظاهر میشوند، در این فضای ریاضی به یکدیگر نزدیکترند. به این ترتیب، مدل به جای درک معنای کلمه «پادشاه»، تنها میداند که مختصات ریاضی این کلمه به «مرد» و «قدرت» نزدیک است.[2]
اما پیشبینی کلمه بعدی بر اساس کلمات قبلی، ایده جدیدی نیست. قابلیت تکمیل خودکار (Autocomplete) در گوشیهای هوشمند سالهاست که این کار را انجام میدهد. تفاوت اصلی در مقیاس و معماری است. در سال ۲۰۱۷، محققان گوگل معماری جدیدی به نام «ترانسفورمر» (Transformer) را معرفی کردند که دنیای پردازش زبان طبیعی را برای همیشه متحول کرد.[4]
قابلیت تکمیل خودکار (Autocomplete) در گوشیهای هوشمند سالهاست که این کار را انجام میدهد.
راز موفقیت ترانسفورمرها در مفهومی به نام «مکانیسم توجه» (Attention Mechanism) نهفته است. در مدلهای قدیمیتر، سیستم متن را کلمه به کلمه و به ترتیب میخواند و به سرعت زمینه (Context) را فراموش میکرد. اما مکانیسم توجه به مدل اجازه میدهد تا تمام کلمات یک متن را به طور همزمان بررسی کند و تشخیص دهد که کدام کلمات، حتی اگر با فاصله زیادی از هم قرار داشته باشند، به یکدیگر مرتبط هستند.[2][4]
برای مثال، در جمله «بانک به دلیل مشکلات مالی بسته شد و او روی نیمکت چوبی آن نشست»، کلمه «آن» میتواند مبهم باشد. مکانیسم توجه با بررسی کل جمله، وزن بیشتری به کلمات «نیمکت» و «چوبی» میدهد و از نظر ریاضی محاسبه میکند که منظور، یک شیء فیزیکی برای نشستن است، نه یک موسسه مالی. این قابلیت به مدل اجازه میدهد تا وابستگیهای طولانیمدت در متن را حفظ کند.[1][4]
این سیستمها چگونه این محاسبات را یاد میگیرند؟ از طریق فرآیندی به نام یادگیری خودنظارتی (Self-supervised learning). در مرحله آموزش، بخش عظیمی از اینترنت شامل کتابها، مقالات، وبسایتها و کدها به مدل داده میشود. سیستم یک جمله را میخواند، کلمه آخر آن را پنهان میکند و سعی میکند آن را حدس بزند.[1]
در ابتدا، حدسهای مدل کاملاً تصادفی و اشتباه است. اما پس از هر حدس، سیستم پاسخ خود را با کلمه واقعی مقایسه میکند و میلیاردها پارامتر داخلی خود را به مقدار بسیار ناچیزی تنظیم میکند تا در دفعه بعد، حدس بهتری بزند. این چرخه تریلیونها بار تکرار میشود تا زمانی که مدل در پیشبینی الگوهای زبانی به مهارت خارقالعادهای دست یابد.[2]
وقتی شما یک پرسش (Prompt) را وارد میکنید، مدل پاسخی از پیش آماده در ذهن ندارد. او حتی کل جمله پاسخ را پیش از تایپ کردن برنامهریزی نمیکند. سیستم تمام متن شما را میخواند، آن را از لایههای توجه عبور میدهد، به هر توکن ممکن در دایره واژگانش یک امتیاز احتمال اختصاص میدهد، محتملترین توکن را انتخاب میکند و آن را روی صفحه مینویسد. سپس کل این فرآیند را برای کلمه بعدی تکرار میکند.[3]
درک این مکانیزم، بزرگترین نقطه ضعف هوش مصنوعی را نیز توضیح میدهد: توهم (Hallucination). از آنجا که مدل هیچ درکی از حقیقت یا واقعیت فیزیکی ندارد و تنها به دنبال تولید متنی است که از نظر آماری «محتمل» و طبیعی به نظر برسد، گاهی اوقات اطلاعات کاملاً غلطی را با لحنی بسیار قاطع و متقاعدکننده تولید میکند. برای مدل، تفاوت بین یک حقیقت علمی و یک دروغ خوشساخت، تنها در توزیع احتمالات ریاضی است.[5]
نکات کلیدی
- مدلهای زبانی بزرگ هیچ درکی از معنای کلمات یا جهان فیزیکی ندارند.
- عملکرد اصلی این سیستمها، پیشبینی آماری کلمه بعدی بر اساس کلمات قبلی است.
- متنها پیش از پردازش به قطعات کوچکی به نام «توکن» و سپس به مختصات ریاضی تبدیل میشوند.
- مکانیسم «توجه» به مدلها اجازه میدهد تا ارتباط معنایی کلمات دور از هم را در یک متن طولانی حفظ کنند.
بررسی عمیق دیدگاهها
دیدگاه پژوهشگران هوش مصنوعی
تمرکز بر معماری ریاضی و محدودیتهای ذاتی سیستمهای پیشبینی توکن.
پژوهشگران و مهندسان یادگیری ماشین، مدلهای زبانی را نه به عنوان موجودات هوشمند، بلکه به عنوان توابع ریاضی بسیار پیچیده میبینند. از دیدگاه آنها، موفقیت این سیستمها ناشی از مقیاس بیسابقه دادهها و قدرت پردازشی است، نه ظهور یک «آگاهی» جدید. آنها تاکید میکنند که بهینهسازی برای پیشبینی کلمه بعدی، لزوماً به معنای توانایی استدلال منطقی یا درک حقایق علمی نیست.
دیدگاه بازاریابان فناوری
استفاده از واژگان انسانی برای توصیف فرآیندهای ماشینی جهت جذب سرمایه و کاربر.
شرکتهای توسعهدهنده هوش مصنوعی غالباً در معرفی محصولات خود از کلماتی مانند «هوشمند»، «خلاق» و «دارای درک عمیق» استفاده میکنند. این رویکرد بازاریابی با هدف ایجاد ارتباط عاطفی بین کاربر و ماشین و همچنین توجیه سرمایهگذاریهای میلیارد دلاری انجام میشود. آنها خروجیهای شگفتانگیز مدل را به عنوان دلیلی بر نزدیک شدن به هوش مصنوعی جامع (AGI) معرفی میکنند.
دیدگاه دانشمندان علوم شناختی
هشدار درباره خطرات انسانانگاری (Anthropomorphism) سیستمهای آماری.
متخصصان علوم شناختی و زبانشناسان هشدار میدهند که مغز انسان به گونهای تکامل یافته که به هر چیزی که زبان تولید میکند، هوش و نیت نسبت دهد. آنها استدلال میکنند که مدلهای زبانی صرفاً «طوطیهای تصادفی» هستند که فرم زبان را بدون درک محتوای آن تقلید میکنند. از دیدگاه این گروه، خطر اصلی خودِ فناوری نیست، بلکه اعتماد بیش از حد انسانها به خروجیهای یک ماشین حساب آماری است.
اصطلاحات کلیدی
- توکن (Token)
- کوچکترین واحد متنی که هوش مصنوعی پردازش میکند؛ میتواند یک کلمه، بخشی از یک کلمه یا یک علامت نگارشی باشد.
- تعبیه (Embedding)
- فرآیند تبدیل کلمات به بردارهای ریاضی در یک فضای چندبُعدی تا کامپیوتر بتواند ارتباط معنایی آنها را درک کند.
- مکانیسم توجه (Attention Mechanism)
- سیستمی که به هوش مصنوعی اجازه میدهد تا میزان اهمیت و ارتباط کلمات مختلف یک جمله را نسبت به یکدیگر محاسبه کند.
- ترانسفورمر (Transformer)
- معماری شبکههای عصبی معرفی شده در سال ۲۰۱۷ که پردازش همزمان تمام کلمات یک متن را امکانپذیر کرد.
- توهم (Hallucination)
- زمانی که هوش مصنوعی اطلاعاتی از نظر گرامری صحیح اما از نظر واقعی کاملاً غلط تولید میکند.
آنچه نمیدانیم
- آیا افزایش صرفِ تعداد پارامترها و دادههای آموزشی میتواند در نهایت منجر به ظهور استدلال واقعی در این مدلها شود؟
- چگونه میتوان مشکل «توهم» را به طور کامل در معماریهایی که بر اساس پیشبینی آماری کار میکنند، برطرف کرد؟
پرسشهای متداول
آیا هوش مصنوعی واقعاً معنی حرفهای من را میفهمد؟
خیر. هوش مصنوعی کلمات شما را به اعداد تبدیل کرده و بر اساس دادههای آموزشی خود، محتملترین پاسخ ریاضی را محاسبه میکند.
چرا هوش مصنوعی گاهی اطلاعات غلط را با اطمینان میگوید؟
زیرا هدف این سیستمها تولید متنی است که از نظر آماری طبیعی به نظر برسد، نه بررسی صحت و سقم حقایق. اگر یک دروغ با الگوی زبانی همخوانی داشته باشد، مدل آن را تولید میکند.
آیا مدل قبل از تایپ کردن، کل جمله را در ذهن خود میسازد؟
خیر. مدلها پاسخ را کلمه به کلمه (توکن به توکن) تولید میکنند و پس از نوشتن هر کلمه، احتمالات را برای کلمه بعدی مجدداً محاسبه میکنند.
منابع
[1]IBMپژوهشگران هوش مصنوعی
What are Large Language Models (LLMs)?
مطالعه در IBM →[2]Akamaiبازاریابان صنعت فناوری
Large language models: A definition
مطالعه در Akamai →[3]Taskadeپژوهشگران هوش مصنوعی
How do large language models actually work?
مطالعه در Taskade →[4]DataCampپژوهشگران هوش مصنوعی
How Transformers Work
مطالعه در DataCamp →[5]تیم سردبیری کوهستاندانشمندان علوم شناختی
تحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.









