رفتن به محتوای اصلی
Koohestun
توضیح کوهستانحافظه عاملتوضیح معماری· 6 دقیقه مطالعه· در هوش مصنوعی

چگونه عوامل هوش مصنوعی به خاطر می‌آورند: مقایسه پنجره‌های متنی، RAG و ذخیره‌سازی اپیزودیک

با گسترش سیستم‌های خودکار هوش مصنوعی، مهندسان در مورد چگونگی حل مشکل فراموشی دچار اختلاف نظر شده‌اند: آیا باید میلیون‌ها توکن را در حافظه فعال جای داد، یا پایگاه‌های داده ساختاریافته و قابل جستجویی ساخت که عوامل بتوانند در صورت نیاز از آنها یادآوری کنند.

به قلم اِلا فرجاد

مهندسان بازیابی و کارایی 50%طرفداران متن طولانی 30%امنیت و حاکمیت سازمانی 20%
مهندسان بازیابی و کارایی
توسعه‌دهندگانی که بر کارایی هزینه، منبع دقیق و کنترل داده‌های محلی تمرکز دارند.
طرفداران متن طولانی
مهندسانی که پنجره‌های متنی عظیم را بر پایگاه‌های داده خارجی اولویت می‌دهند.
امنیت و حاکمیت سازمانی
سازمان‌هایی که نیازمند اقدامات عامل هوش مصنوعی کاملاً قابل حسابرسی و حاکمیتی هستند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار که معماری پهنای باند حافظه را طراحی می‌کنند و مقیاس‌پذیری متن را محدود می‌سازند.
  • کاربران نهایی عوامل هوش مصنوعی مصرف‌کننده که حافظه یکپارچه بین دستگاهی را بر منبع فنی (Provenance) اولویت می‌دهند.

یک گروه از مهندسان هوش مصنوعی استدلال می‌کنند که سیستم‌های بازیابی یک ترفند موقتی هستند که محکوم به منسوخ شدن توسط مدل‌هایی هستند که می‌توانند میلیون‌ها توکن را در حافظه فعال نگه دارند. از نظر آنها، یک عامل خودکار باید به سادگی هر دستورالعمل، مکالمه گذشته و پایگاه کدی را که ممکن است به آن نیاز داشته باشد، مستقیماً در پنجره متنی خود جذب کند و به شبکه عصبی اجازه دهد توجه خود را در سراسر کل مجموعه هدایت کند. گروه مخالف معتقد است که جای دادن ورودی‌های عظیم در یک پرامپت از نظر محاسباتی بی‌احتیاط و از نظر عملکردی دارای نقص است. آنها استدلال می‌کنند که مدل‌ها به ناچار اطلاعات مدفون شده در میانه ورودی‌های بزرگ را گم می‌کنند و حافظه عاملی واقعی نیازمند یک پایگاه داده خارجی و ساختاریافته است که حقایق و تجربیات تنها زمانی که مرتبط هستند، بازیابی شوند.[5]

این بحث بر سر وضعیت بنیادی بدون حافظه (statelessness) مدل‌های زبان بزرگ متمرکز است. به طور پیش‌فرض، یک مدل هوش مصنوعی هیچ خاطره‌ای از تعاملات گذشته ندارد. هر بار که یک عامل کار جدیدی را شروع می‌کند، با فراموشی کامل از خواب بیدار می‌شود. همانطور که دیوید کورویسیر، مهندس Hugging Face، هنگام ساخت عوامل کدنویسی مشاهده کرد: «هر یک از آنها پروژه‌های من را به عنوان یک غریبه ملاقات می‌کند. استدلال «سه‌شنبه گذشته» با پایان یافتن جلسه ناپدید می‌شود.» برای اینکه یک عامل بتواند به مرور زمان به صورت خودکار عمل کند، به یک معماری حافظه نیاز دارد که فراتر از یک جلسه واحد باقی بماند.[1]

رویکرد سخت‌افزاری و مقیاس‌بندی مدل به این مشکل، پنجره متنی عظیم است. نسخه‌های اخیر Google DeepMind، از جمله مدل Gemini 3.8 Flash Cyber که در برنامه Fairwind آن به کار گرفته شده است، پنجره‌های متنی به اندازه‌ای بزرگ ارائه می‌دهند که کل پایگاه‌های کد سازمانی یا گزارش‌های امنیتی را در یک پرامپت واحد جذب کنند. برای کارهایی که نیاز به ترکیب گسترده دارند، این امر به عامل اجازه می‌دهد تا تمام اطلاعات مرتبط را به طور همزمان در حافظه کاری فعال خود نگه دارد.[2]

با این حال، تکیه انحصاری بر پنجره‌های متنی برای حافظه بلندمدت، تنگناهای عملیاتی شدیدی ایجاد می‌کند. یک بررسی طولانی جلسه را متورم می‌کند تا جایی که هزینه هر دور برای حمل محتوا بیشتر از انجام کار واقعی باشد. راهکار استاندارد صنعت این بوده است که به عامل اجازه داده شود به صورت دوره‌ای یافته‌های خود را خلاصه کند و تنها آن فشرده‌سازی را به جلو ببرد. اما خلاصه‌سازی اغلب جزئیات حیاتی را از بین می‌برد و باعث می‌شود عامل منطق دقیق پشت یک تصمیم گذشته را از دست بدهد.[1]

تولید مبتنی بر بازیابی تقویت‌شده (RAG) به عوامل اجازه می‌دهد تا تجربیات خاص گذشته را جستجو کنند، به جای اینکه کل تاریخچه خود را در حافظه فعال نگه دارند.

جایگزین، تولید مبتنی بر بازیابی تقویت‌شده (RAG) است، جایی که عامل یک پایگاه داده پایدار و قابل جستجو از اقدامات گذشته خود را حفظ می‌کند. ابزار funes که اخیراً توسط Hugging Face منتشر شده است، این کار را با تجزیه گزارش‌های جلسه عامل به یک قالب ساختاریافته نوبت و بلوک، تکه‌تکه‌کردن متن و جاسازی آن در یک مجموعه داده محلی Lance پیاده‌سازی می‌کند. هنگامی که عامل با یک مشکل آشنا روبرو می‌شود، این حافظه اپیزودیک را جستجو می‌کند و بخش دقیق تاریخی را به جای یک خلاصه تقطیر شده، بازیابی می‌کند.[1]

جایگزین، تولید مبتنی بر بازیابی تقویت‌شده (RAG) است، جایی که عامل یک پایگاه داده پایدار و قابل جستجو از اقدامات گذشته خود را حفظ می‌کند.

مکانیک این فرآیند بازیابی متکی بر خطوط لوله جاسازی پیچیده است. هنگامی که یک عامل یک نوبت را کامل می‌کند، سیستم ردیابی را تجزیه می‌کند، متن را تکه‌تکه می‌کند و آن را از طریق یک مدل جاسازی محلی پردازش می‌کند تا بردارهای ریاضی ایجاد کند. سپس یک جستجو، این جستجوی شباهت برداری را با تطبیق کلمات کلیدی سنتی BM25 ترکیب می‌کند، نامزدهای بازیابی شده را با استفاده از یک رمزگذار متقاطع (cross-encoder) بازرتبه‌بندی می‌کند و نتایج را بر اساس تازگی تنظیم می‌کند. این تضمین می‌کند که عامل نه تنها شبیه‌ترین رویداد گذشته از نظر معنایی، بلکه مناسب‌ترین رویداد از نظر متنی را برای کار فعلی خود بازیابی می‌کند.[1]

این معماری «بازیابی-اول» اساساً اقتصاد گردش کار عاملی را تغییر می‌دهد. در معیار «انتقال در مقابل یادآوری»، که توانایی عامل برای بازسازی دانش قبلی را آزمایش می‌کند، یادآوری مبتنی بر بازیابی ارزان‌ترین روش برای حفظ محتوا ثابت شد. این روش تا ۸ برابر ارزان‌تر از نوشتن یک انتقال جامع در یک کار، و ۴ برابر ارزان‌تر در کار دیگر بود، و به طور کامل از هزینه توکن پردازش مکرر پنجره‌های متنی عظیم جلوگیری می‌کرد.[1][5]

فراتر از هزینه، حافظه ساختاریافته منبع دقیق (provenance) را فراهم می‌کند – یک نیاز حیاتی برای استقرار سازمانی. هنگامی که یک عامل تصمیم گذشته را با استفاده از ابزاری مانند funes بازیابی می‌کند، متن اصلی را به همراه عامل خاص، مهر زمانی، جلسه و نوبتی که آن را تولید کرده است، بازمی‌گرداند. این قابلیت ردیابی برای محیط‌های پرمخاطره مانند سیستم‌های امنیت سایبری عاملی که در حال حاضر توسط NVIDIA و CrowdStrike در حال توسعه هستند، ضروری است، جایی که اقدامات دفاعی خودکار باید کاملاً قابل حسابرسی باشند.[1][3]

داده‌های معیار نشان می‌دهد که یادآوری مبتنی بر بازیابی، هزینه توکن عملیاتی حافظه عامل را تا ۸ برابر در مقایسه با انتقال‌های نوشتاری کاهش می‌دهد.

همانطور که جنسن هوانگ، مدیر عامل NVIDIA، در سپتامبر ۲۰۲۶ اشاره کرد: «حملات اکنون خودکار هستند. دفاع نیز باید خودکار باشد»، که مستلزم عواملی است که بتوانند دقیقاً توضیح دهند چرا یک اقدام دفاعی خاص را انجام داده‌اند. علوم شناختی طبقه‌بندی این معماری‌های نوظهور را فراهم می‌کند و حافظه بلندمدت عامل را به دسته‌های معنایی (Semantic) و اپیزودیک (Episodic) تقسیم می‌کند. حافظه معنایی دانش واقعی را ذخیره می‌کند – قوانین یک زبان برنامه‌نویسی، تعاریف آسیب‌پذیری‌های امنیتی، یا معیارهایی که یک مدل مانند موتور خروجی ساختاریافته ۳۵۰ میلیون پارامتری بر اساس آنها اندازه‌گیری می‌شود.[3][4][5]

در مقابل، حافظه اپیزودیک تجربیات خاص گذشته عامل، از جمله آزمایش‌های ناموفق و بن‌بست‌ها را ثبت می‌کند. حافظه رویه‌ای (Procedural) ستون سوم معماری شناختی برای سیستم‌های خودکار را نشان می‌دهد. در حالی که حافظه معنایی حقایق را نگه می‌دارد و حافظه اپیزودیک تجربیات را، حافظه رویه‌ای نحوه رفتار عامل را دیکته می‌کند. این شامل دستورالعمل‌های خاص، گردش کار و سیاست‌های استفاده از ابزار است که اقدامات عامل را کنترل می‌کند. با جدا کردن قوانین رویه‌ای از پنجره متنی فعال، توسعه‌دهندگان می‌توانند رفتار یک عامل را به صورت جهانی به‌روزرسانی کنند بدون اینکه مدل زیربنایی را بازنویسی کنند.[1][5]

حرکت به سمت معماری‌های حافظه محلی و تحت مالکیت همچنین نگرانی‌های مربوط به حاکمیت داده‌ها را برطرف می‌کند. با اجرای کامل مدل‌های جاسازی و بازرتبه‌بندی بر روی سخت‌افزار محلی، توسعه‌دهندگان می‌توانند یک حافظه کاری پایدار ایجاد کنند بدون اینکه داده‌های حساس سازمانی را به سرویس‌های ابری اختصاصی ارسال کنند. این تضمین می‌کند که دانش سازمانی تولید شده توسط عوامل کدنویسی تحت کنترل سازمان باقی می‌ماند، نه اینکه در اکوسیستم یک فروشنده خاص قفل شود.[1]

مسیر سیستم‌های خودکار آینده‌ای ترکیبی را نشان می‌دهد. در حالی که مدل‌های مرزی به گسترش محدودیت‌های متنی خام خود ادامه خواهند داد، کارایی مالی و شناختی بازیابی ساختاریافته آن را ضروری می‌سازد. عاملی که می‌تواند استدلال گذشته خود را به صورت انتخابی به یاد بیاورد، به طور مداوم بهتر از عاملی عمل خواهد کرد که باید هر بار که از خواب بیدار می‌شود، کل تاریخچه خود را دوباره بخواند، و تمرکز را از اینکه یک مدل چقدر می‌تواند بخواند به اینکه چقدر خوب می‌تواند به خاطر بیاورد، تغییر می‌دهد.[5]

نکات کلیدی

  • عوامل هوش مصنوعی ذاتاً فاقد حافظه هستند و هر جلسه جدید را با فراموشی کامل آغاز می‌کنند.
  • پنجره‌های متنی عظیم به مدل‌ها اجازه می‌دهند کل پایگاه‌های کد را جذب کنند، اما پردازش مکرر آنها از نظر محاسباتی گران است.
  • سیستم‌های حافظه مبتنی بر بازیابی (Retrieval) به عوامل اجازه می‌دهند تجربیات گذشته را به صورت محلی جستجو کنند و هزینه‌های توکن را تا ۸ برابر کاهش دهند.
  • حافظه ساختاریافته منبع دقیق (Provenance) را فراهم می‌کند و نشان می‌دهد که عامل دقیقاً چه زمانی و چرا تصمیم قبلی را گرفته است.
  • معماری‌های حافظه محلی، داده‌های حساس سازمانی را به جای ابر اختصاصی، روی دستگاه کاربر نگه می‌دارند.

اصطلاحات کلیدی

هوش مصنوعی عاملی
سیستم‌های هوش مصنوعی طراحی شده برای دنبال کردن اهداف پیچیده به صورت خودکار از طریق برنامه‌ریزی، اجرای ابزارها و انطباق با اطلاعات جدید در طول چند مرحله.
پنجره متنی
حداکثر میزان متن یا داده‌ای که یک مدل هوش مصنوعی می‌تواند در حافظه فعال کاری خود در طول یک تعامل واحد پردازش کند.
تولید مبتنی بر بازیابی تقویت‌شده (RAG)
تکنیکی که در آن یک مدل هوش مصنوعی برای یافتن اطلاعات مرتبط، یک پایگاه داده خارجی را جستجو می‌کند، قبل از تولید پاسخ، به جای تکیه صرف بر آموزش داخلی یا یک پرامپت عظیم.
حافظه اپیزودیک
یک معماری حافظه که اقدامات، تصمیمات و نتایج خاص گذشته یک عامل را در قالبی زمانی یا مبتنی بر جلسه ثبت می‌کند.
منبع (Provenance)
منشأ دقیق و قابل ردیابی یک قطعه اطلاعات، از جمله اینکه کدام عامل آن را تولید کرده، در کدام جلسه و در چه زمانی.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

مهندسان بازیابی و کارایی 50%طرفداران متن طولانی 30%امنیت و حاکمیت سازمانی 20%
  1. [1]Hugging Face Blogمهندسان بازیابی و کارایی

    Give Your Coding Agents a Memory You Own

    مطالعه در Hugging Face Blog
  2. [2]Google AI Blogطرفداران متن طولانی

    Proactive cyber defense for governments and enterprises

    مطالعه در Google AI Blog
  3. [3]NVIDIA Blogامنیت و حاکمیت سازمانی

    NVIDIA and CrowdStrike Strengthen Agentic Cybersecurity Frontier

    مطالعه در NVIDIA Blog
  4. [4]Hugging Face Blogمهندسان بازیابی و کارایی

    Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

    مطالعه در Hugging Face Blog
  5. [5]تیم سردبیری کوهستانمهندسان بازیابی و کارایی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.