رفتن به محتوای اصلی
توضیح کوهستانمعماری هوش مصنوعیتوضیح و تشریح۸ شهریور ۱۴۰۵، ۱:۳۸· 7 دقیقه مطالعه· در هوش مصنوعی

سازوکار تولید مبتنی بر بازیابی افزوده (RAG): چگونه حافظه خارجی توهمات هوش مصنوعی را برطرف می‌کند

با جدا کردن قابلیت‌های استدلالی هوش مصنوعی از پایگاه دانش آن، چارچوبی به نام RAG به مدل‌های زبان اجازه می‌دهد قبل از صحبت کردن، حقایق را جستجو کنند. این معماری به استاندارد سازمانی برای حذف توهمات و ایمن‌سازی داده‌های اختصاصی تبدیل شده است.

به قلم ساناز امامی

پذیرندگان سازمانی 40%محققان هوش مصنوعی 30%مهندسان داده 30%
پذیرندگان سازمانی
تمرکز بر استقرار عملی هوش مصنوعی، این گروه RAG را به دلیل کارایی هزینه و امنیت داده‌هایش ارزشمند می‌داند.
محققان هوش مصنوعی
تمرکز بر معماری مدل، این گروه RAG را به عنوان یک تغییر اساسی در نحوه مدیریت دانش توسط هوش مصنوعی می‌بیند.
مهندسان داده
تمرکز بر زیرساخت، این گروه تأکید می‌کند که هوش مصنوعی تنها به اندازه سیستم جستجویی که به آن تغذیه می‌کند، هوشمند است.

نکات کلیدی

  1. RAG موتور استدلال هوش مصنوعی را از پایگاه دانش آن جدا می‌کند و مدل را وادار می‌کند قبل از پاسخگویی، حقایق را جستجو کند.
  2. این معماری با تثبیت خروجی هوش مصنوعی در اسناد خارجی و تأیید شده، توهمات را به طور قابل توجهی کاهش می‌دهد.
  3. برخلاف تنظیم دقیق، RAG به شرکت‌ها اجازه می‌دهد دانش هوش مصنوعی خود را فوراً و بدون آموزش مجدد پرهزینه به‌روز کنند.
  4. RAG امنیت داده‌ای سخت‌گیرانه‌ای را امکان‌پذیر می‌سازد، زیرا سیستم بازیابی می‌تواند مجوزهای دسترسی کاربر را قبل از واکشی اسناد اعمال کند.

مدل‌های زبان بزرگ اساساً نحوه تعامل انسان‌ها با رایانه‌ها را تغییر داده‌اند، اما یک نقص حیاتی دارند: آنها حتی زمانی که کاملاً اشتباه می‌کنند، به طرز مشهوری مطمئن به نظر می‌رسند. از آنجایی که این مدل‌ها متن را با پیش‌بینی محتمل‌ترین کلمه بعدی بر اساس داده‌های آموزشی خود تولید می‌کنند، فاقد درک واقعی از حقایق هستند. هنگامی که در مورد رویدادهای اخیر، داده‌های اختصاصی شرکت یا دانش دامنه بسیار خاصی که در مجموعه آموزشی آنها نبوده است، سؤال می‌شود، اغلب «توهم» می‌زنند—یعنی پاسخ‌هایی به ظاهر منطقی اما کاملاً ساختگی را اختراع می‌کنند. برای کاربردهای سازمانی، جایی که یک سابقه حقوقی ساختگی یا یک دوز دارویی توهم‌آمیز می‌تواند فاجعه‌بار باشد، این عدم قابلیت اطمینان، مانع اصلی جلوگیری از پذیرش گسترده بوده است.[1][2]

صنعت فناوری حول یک راه‌حل فوق‌العاده ظریف برای این مشکل اجماع پیدا کرده است: تولید مبتنی بر بازیابی افزوده (Retrieval-Augmented Generation) که به طور جهانی با نام RAG شناخته می‌شود. به جای تلاش برای وادار کردن یک شبکه عصبی به حفظ کردن هر واقعیتی در جهان در طول آموزش اولیه، RAG قابلیت‌های استدلالی مدل را از پایگاه دانش آن جدا می‌کند. این روش هوش مصنوعی را از یک آزمون‌دهنده کتاب بسته که متکی به حافظه است، به یک محقق کتاب باز تبدیل می‌کند که قبل از صحبت، پاسخ دقیق را جستجو می‌کند. با تثبیت پاسخ‌های مدل در داده‌های خارجی و قابل تأیید، RAG به معماری بالفعل برای استقرار هوش مصنوعی مولد قابل اعتماد در دنیای واقعی تبدیل شده است.[3][5]

برای درک سازوکار، محققان هوش مصنوعی اغلب از قیاس دادگاه استفاده می‌کنند. یک مدل زبان آماده، مانند یک قاضی بسیار توانمند است که مکانیک قانون را کاملاً درک می‌کند اما هر پرونده‌ای را در تاریخ کشور حفظ نکرده است. هنگامی که یک پرونده بسیار خاص و مبهم مطرح می‌شود، قاضی صرفاً حدس نمی‌زند. در عوض، یک منشی دادگاه را به کتابخانه حقوقی می‌فرستد تا اسناد دقیق و مرتبط را بازیابی کند. در معماری RAG، مدل زبان همان قاضی است و سیستم بازیابی همان منشی است که قبل از نگارش حکم نهایی، زمینه لازم را فراهم می‌کند.[5]

از نظر مکانیکی، یک سیستم RAG در سه مرحله متمایز عمل می‌کند که مدت‌ها قبل از اینکه کاربر یک فرمان (prompt) را تایپ کند، آغاز می‌شود. مرحله اول، آماده‌سازی داده است. یک سازمان دانش داخلی خود—فایل‌های PDF، دستورالعمل‌های منابع انسانی، مستندات فنی یا سوابق مشتری—را می‌گیرد و آن را به بخش‌های کوچک‌تر و قابل هضم به نام «تکه‌ها» (chunks) تقسیم می‌کند. سپس این تکه‌ها از طریق یک مدل تعبیه‌سازی (embedding model) پردازش می‌شوند که متن انسانی را به بردارهای عددی با ابعاد بالا ترجمه می‌کند. این بردارها نشان‌دهنده معنای مفهومی متن هستند و در یک پایگاه داده برداری تخصصی ذخیره می‌شوند و یک کتابخانه قابل جستجوی ریاضی از کل دانش اختصاصی سازمان ایجاد می‌کنند.[2][3]

خط لوله RAG پرسش کاربر را رهگیری می‌کند، حقایق مرتبط را از یک پایگاه داده واکشی می‌کند و هوش مصنوعی را وادار می‌کند که فقط با استفاده از اطلاعات بازیابی شده پاسخ دهد.

مرحله دوم، خود بازیابی است که به محض ارسال یک پرسش توسط کاربر فعال می‌شود. هنگامی که یک کارمند از چت‌بات هوش مصنوعی می‌پرسد: «سیاست به‌روز شده کار از راه دور ما برای سال ۲۰۲۶ چیست؟»، سیستم بلافاصله این سؤال را به مدل زبان نمی‌فرستد. در عوض، سؤال کاربر را به یک بردار عددی تبدیل کرده و پایگاه داده برداری را برای نزدیک‌ترین تطابق‌های ریاضی جستجو می‌کند. پایگاه داده به سرعت تکه‌های خاصی از دستورالعمل منابع انسانی را که در مورد سیاست کار از راه دور ۲۰۲۶ صحبت می‌کنند، شناسایی کرده و آنها را جلو می‌کشد. این جستجوی معنایی تضمین می‌کند که سیستم اطلاعات را بر اساس معنا، و نه فقط تطابق دقیق کلمات کلیدی، بازیابی می‌کند.[1][2]

مرحله دوم، خود بازیابی است که به محض ارسال یک پرسش توسط کاربر فعال می‌شود.

مرحله نهایی، تقویت و تولید است. سیستم RAG سؤال اصلی کاربر را می‌گیرد و تکه‌های متنی بازیابی شده را به طور یکپارچه به آن اضافه می‌کند و یک فرمان جدید «تقویت‌شده» ایجاد می‌کند. در پشت صحنه، مدل زبان یک دستورالعمل بسیار خاص دریافت می‌کند: «فقط با استفاده از متن ارائه‌شده زیر، به سؤال کاربر پاسخ دهید.» با وادار کردن مدل به ترکیب پاسخ خود صرفاً از زمینه تزریق شده، سیستم به طور مؤثری تمایل مدل به حدس زدن را دور می‌زند. خروجی حاصل بسیار دقیق، آگاه به زمینه و—مهم‌تر از همه—می‌تواند شامل ارجاعات مستقیمی باشد که کاربر را به سند منبع دقیق هدایت می‌کند.[1][3]

تأثیر این معماری بر نرخ توهم عمیق است. در محیط‌های آزمایشی دقیق، از جمله جریان‌های کاری سازمانی پیچیده که نیاز به خروجی داده‌های ساختاریافته مانند کد JSON توسط هوش مصنوعی دارند، نشان داده شده است که پیاده‌سازی RAG به طور قابل توجهی تولید ویژگی‌های غلط یا توهم‌آمیز را کاهش می‌دهد. با تثبیت خروجی در قالب‌های بازیابی شده و محدودیت‌های واقعی، توسعه‌دهندگان می‌توانند مدل‌های زبان کوچک‌تر و بسیار کارآمدی را مستقر کنند که به خوبی مدل‌های مرزی عظیم عمل می‌کنند، صرفاً به این دلیل که اطلاعات صحیح را در اختیار دارند.[4]

فراتر از دقت، RAG چالش اقتصادی بزرگی را که به‌روز نگه داشتن هوش مصنوعی است، حل می‌کند. قبل از اینکه RAG به استاندارد صنعتی تبدیل شود، روش اصلی برای آموزش اطلاعات جدید به هوش مصنوعی، «تنظیم دقیق» (fine-tuning) بود—یک فرآیند پرهزینه محاسباتی برای آموزش مجدد وزن‌های داخلی مدل بر روی داده‌های جدید. تنظیم دقیق نیاز به تخصص تخصصی یادگیری ماشین دارد، هزاران دلار برای هر به‌روزرسانی هزینه دارد و منجر به مدلی می‌شود که به محض اتمام آموزش، بلافاصله قدیمی می‌شود. در مقابل، RAG به هیچ آموزش مجددی نیاز ندارد. هنگامی که یک شرکت سیاستی را به‌روز می‌کند، به سادگی فایل PDF جدید را در پایگاه داده برداری قرار می‌دهد و هوش مصنوعی فوراً قوانین جدید را می‌داند.[2][3]

برخلاف تنظیم دقیق سنتی، RAG به سازمان‌ها اجازه می‌دهد پایگاه دانش هوش مصنوعی خود را فوراً و بدون آموزش مجدد مدل زیربنایی به‌روز کنند.

این جداسازی استدلال و داده همچنین یک لایه امنیتی حیاتی را معرفی می‌کند که مدل‌های یکپارچه فاقد آن هستند. در یک مدل زبان استاندارد، هر داده‌ای که در وزن‌های آموزشی گنجانده شده باشد، به طور بالقوه می‌تواند توسط یک فرمان هوشمندانه استخراج شود، و اعمال محدودیت دسترسی بر اساس مجوزهای کاربر را غیرممکن می‌سازد. سیستم‌های RAG این مشکل را با اعمال امنیت فناوری اطلاعات سنتی در لایه بازیابی حل می‌کنند. اگر یک تحلیلگر تازه‌کار از یک سیستم مجهز به RAG، پیش‌بینی‌های درآمد سه‌ماهه چهارم شرکت را بپرسد، سیستم بازیابی اعتبار او را بررسی می‌کند. اگر فاقد مجوز اجرایی باشد، پایگاه داده برداری به سادگی از واکشی اسناد مالی خودداری می‌کند و مدل زبان صادقانه پاسخ می‌دهد که اطلاعات را در اختیار ندارد.[1][6]

با وجود موفقیت تحول‌آفرین، RAG یک راه‌حل کامل و بی‌عیب نیست. این معماری نقطه اصلی شکست را از استدلال مدل زبان به دقت جستجوی سیستم بازیابی منتقل می‌کند. اگر پایگاه داده برداری نتواند سند صحیح را پیدا کند—شاید به این دلیل که استراتژی تکه‌تکه کردن یک پاراگراف حیاتی را نصف کرده است، یا به این دلیل که جستجوی معنایی قصد کاربر را اشتباه متوجه شده است—اطلاعات نامربوط به مدل زبان داده می‌شود. در صنعت هوش مصنوعی، این امر به عنوان آسیب‌پذیری «ورودی نامناسب، خروجی نامناسب» (garbage in, garbage out) شناخته می‌شود. یک سیستم RAG تنها به اندازه عملکرد جستجوی خود هوشمند است.[6]

علاوه بر این، این رویکرد ذاتاً توسط «پنجره زمینه» (context window) مدل زبان محدود می‌شود—حداکثر مقدار متنی که می‌تواند در یک زمان پردازش کند. در حالی که مدل‌های مدرن می‌توانند صدها صفحه متن را به طور همزمان دریافت کنند، تغذیه بیش از حد اطلاعات بازیابی شده به آنها می‌تواند باعث از دست دادن تمرکز شود، پدیده‌ای که محققان آن را «گم شدن در میانه» (lost in the middle) می‌نامند. ممکن است مدل به شدت به اولین و آخرین اسناد ارائه‌شده وزن دهد اما یک بخش حیاتی از شواهد مدفون در مرکز فرمان تقویت‌شده را کاملاً نادیده بگیرد. بهینه‌سازی دقیق اینکه چه مقدار زمینه باید بازیابی شود، همچنان یک حوزه فعال تحقیقات مهندسی است.[6]

پایگاه‌های داده برداری متن انسانی را به مختصات ریاضی تبدیل می‌کنند و به سیستم بازیابی اجازه می‌دهند به جای کلمات کلیدی دقیق، بر اساس معنای مفهومی جستجو کند.

با بلوغ این فناوری، مرز بین مدل زبان و سیستم بازیابی در حال محو شدن است. مرز بعدی «RAG عاملی» (agentic RAG) است، جایی که هوش مصنوعی صرفاً اسناد بازیابی شده را به طور منفعل دریافت نمی‌کند، بلکه فعالانه تصمیم می‌گیرد که چه زمانی باید جستجو کند، پرس‌وجوهای پایگاه داده خود را فرموله می‌کند و ارزیابی می‌کند که آیا اطلاعات بازیابی شده قبل از پاسخگویی کافی است یا خیر. با دادن استقلال به مدل‌های زبان برای تحقیق در مورد نقاط کور خود، صنعت به سیستم‌های هوش مصنوعی نزدیک‌تر می‌شود که نه تنها آگاه، بلکه واقعاً از نظر فکری صادق هستند.[5][6]

اصطلاحات کلیدی

مدل زبان بزرگ (LLM)
یک سیستم هوش مصنوعی که بر روی مقادیر زیادی متن آموزش دیده تا زبان انسان را درک و تولید کند.
توهم
موردی که در آن یک مدل هوش مصنوعی اطلاعات غلط، ساختگی یا بی‌معنی تولید می‌کند در حالی که آن را به عنوان واقعیت ارائه می‌دهد.
پایگاه داده برداری
یک سیستم ذخیره‌سازی تخصصی که داده‌ها را بر اساس معنای مفهومی آنها و نه کلمات کلیدی دقیق، به صورت ریاضی سازماندهی می‌کند.
تعبیه‌سازی
فرآیند تبدیل متن انسانی به آرایه‌های عددی با ابعاد بالا به طوری که هوش مصنوعی بتواند شباهت مفهومی بین اسناد مختلف را اندازه‌گیری کند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

پذیرندگان سازمانی 40%محققان هوش مصنوعی 30%مهندسان داده 30%
  1. [1]IBMپذیرندگان سازمانی

    What is retrieval augmented generation (RAG)?

    مطالعه در IBM
  2. [2]Red Hatپذیرندگان سازمانی

    What is retrieval-augmented generation?

    مطالعه در Red Hat
  3. [3]Databricksپذیرندگان سازمانی

    What Is Retrieval Augmented Generation, or RAG?

    مطالعه در Databricks
  4. [4]arXivمحققان هوش مصنوعی

    Reducing hallucination in structured outputs via Retrieval-Augmented Generation

    مطالعه در arXiv
  5. [5]NVIDIAمحققان هوش مصنوعی

    What Is Retrieval-Augmented Generation, aka RAG?

    مطالعه در NVIDIA
  6. [6]تیم سردبیری کوهستانمهندسان داده

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.