رفتن به محتوای اصلی
کوهستان
توضیح کوهستانمعماری هوش مصنوعیمدل‌های زبانی بزرگ· 9 دقیقه مطالعه· در هوش مصنوعی

شبیه‌سازی حافظه در چت‌بات‌ها؛ واقعیت بی‌حافظه در مدل‌های زبانی بزرگ

چت‌بات‌های مدرن هوش مصنوعی طوری رفتار می‌کنند که گویی گفتگوهای قبلی را به یاد دارند، اما مدل‌های پایه در عمل هیچ حافظه‌ای ندارند. نرم‌افزار واسط با هر پرسش جدید، کل تاریخچه گفتگو را بی‌صدا از ابتدا ضمیمه می‌کند و مدل را وامی‌دارد تا کل مکالمه را از نو بخواند.

به قلم اِلا فرجاد

به‌طور خلاصه

  • مدل‌های هوش مصنوعی امروزی بین نوبت‌های مکالمه هیچ حافظه درونی نگه‌داری نمی‌کنند و نرم‌افزار باید تمام پیشینه چت را در هر درخواست دوباره ارسال کند.
  • سازوکار افزودن رونوشت پیشین باعث می‌شود هزینه پردازشی یک گفتگوی ساده، به صورت درجه دوم رشد کند و مکالمات طولانی به شکل تصاعدی هزینه‌بر شوند.
  • وقتی اندازه مکالمه از سقف پنجره بافت بیشتر شود، نرم‌افزار قدیمی‌ترین پیام‌ها را بی‌صدا حذف می‌کند و در نتیجه هوش مصنوعی دستورهای اولیه را فوراً فراموش می‌کند.

هنگامی که یک توسعه‌دهنده سؤالی تکمیلی را به اندپوینت Chat Completions شرکت OpenAI ارسال می‌کند، سیستم به سراغ یک نشست ذخیره‌شده نمی‌رود تا ببیند چند لحظه پیش چه گفته شده است. مدل‌های زبانی بزرگِ زیربنایی، کاملاً بدون حالت (Stateless) هستند؛ یعنی به محض تولید یک پاسخ، حتی یک بایت حافظه درباره درخواست‌های قبلی کاربر نگه نمی‌دارند.[1]

برای ایجاد این توهم که یک گفتگوی پیوسته در جریان است، لایه نرم‌افزاریِ احاطه‌کننده مدل باید بار به‌خاطرسپاری را به دوش بکشد. هر بار که کاربر پیام جدیدی تایپ می‌کند، برنامه آن را به کل رونوشت قبلی پیوند می‌زند؛ یعنی تمام پرسش‌ها و پاسخ‌های پیشین را در قالب یک بسته واحد ادغام می‌کند و مدل را مجبور می‌سازد تا کل مکالمه را از صفر بازخوانی کند.

این سازوکار در مستندات رابط برنامه‌نویسی کاربردی (API) ارائه‌دهندگان بزرگ هوش مصنوعی کاملاً مشهود است. مستندات رسمی شرکت Anthropic برای Messages API این قاعده را صریحاً توضیح می‌دهد: «Messages API بدون حالت است، یعنی شما باید همواره کل تاریخچه مکالمه را به API بفرستید.» سرور هیچ سابقه‌ای از تبادل اطلاعات را برای دور بعدی نگه نمی‌دارد.

به جای ذخیره داده در سرور، برنامه یک آرایه ساختاریافته شامل تاریخچه زمانی گفتگو را ارسال می‌کند که بر اساس گوینده مرتب شده است. این سیستم با تزریق خروجی‌های قبلی خودِ مدل در کنار ورودی‌های گذشته کاربر، زمینه و بافت لازم را مهیا می‌سازد تا مدل بتواند درست مثل یک انسان به سؤالات بعدی پاسخ دهد.[1]

این آرایه دارای فرمت‌بندی دقیقی است تا منبع هر بلوک متنی به تفکیک مشخص شود. یک بسته داده‌ای معمولاً با یک «پیام سیستم» (system message) شروع می‌شود که قوانین بنیادین و شخصیت هوش مصنوعی را تعیین می‌کند. سپس پیام‌های متناوب کاربر شامل درخواست‌های فرد، و پیام‌های دستیار شامل پاسخ‌های قبلی مدل در ادامه قرار می‌گیرند.[1]

آرایه پیام‌ها با تفکیک نقش‌ها، تاریخچه مکالمه را منظم می‌سازد تا مدل تفاوت دستورالعمل‌ها و پاسخ‌های گذشته را درک کند.

توسعه‌دهندگان حتی می‌توانند با دستکاری این آرایه، مدل را به رفتارهای خاصی وادارند. با درج دستی یک پیام ساختگی از طرف دستیار درست در انتهای متن تاریخچه، می‌توان نقطه آغاز پاسخ بعدی مدل را از پیش پر کرد؛ این محدودیت ریاضیاتی مدل را مجبور می‌کند تولید متن را دقیقاً از همان نقطه تعیین‌شده آغاز کند.

معماری فراموشی

این ماهیت بدون حالت بودن یک باگ نرم‌افزاری نیست، بلکه ویژگی ذاتی معماری ترنسفورمر (Transformer) به شمار می‌رود. ترنسفورمر که در مقاله جریان‌ساز سال ۲۰۱۷ پژوهشگران گوگل با عنوان «تنها توجه نیاز است» (Attention Is All You Need) معرفی شد، برای رفع گلوگاه‌های طراحی‌های قبلی هوش مصنوعی شکل گرفت و آگاهانه مفهوم حافظه درونی را کنار گذاشت.[2]

پیش از سال ۲۰۱۷، وظایف پردازش توالی مانند ترجمه به شبکه‌های عصبی بازگشتی (RNN) یا شبکه‌های حافظه کوتاه‌مدت طولانی (LSTM) متکی بودند. این معماری‌های قدیمی‌تر، متن را کلمه به کلمه پردازش می‌کردند و با به‌روزرسانی بردار وضعیت پنهان، نوعی حافظه متحرک می‌ساختند؛ اما از آنجا که گام دوم به گام اول وابسته بود، پردازش موازی روی سخت‌افزارهای مدرن ناممکن می‌شد.[2]

تیم گوگل برین (Google Brain) آن حافظه ترتیبی را با سازوکار خودتوجهی (Self-Attention) جایگزین کرد. همان‌طور که آشیش واسوانی و همکارانش نوشتند، ترنسفورمر «منحصراً بر مکانیسم‌های توجه تکیه می‌کند و نیاز به بازگشت و کانولوشن را به‌طور کامل از بین می‌برد». این جهش به مدل امکان داد تمام کلمات یک توالی را هم‌زمان پردازش کند و سرعت آموزش مدل‌ها را به شکلی باورنکردنی ارتقا دهد.[2]

اما کنار گذاشتن خاصیت بازگشتی به معنای چشم‌پوشی از نگهداری وضعیت پنهان بود. ترنسفورمر یک بلوک متنی را در قالب یک تصویر ایستا و منفرد ارزیابی می‌کند؛ هیچ مکانیسمی برای انتقال وضعیت پنهان از یک فراخوانی API به فراخوانی بعدی وجود ندارد و هر درخواست استنتاج، یک رویداد ریاضیاتی کاملاً مجزا و مستقل محسوب می‌شود.[2]

افزون بر این، وزن‌های عصبی یک مدل زبانیِ مستقر کاملاً ثابت (منجمد) هستند. وقتی کاربر نام خود را به یک چت‌بات می‌گوید، مدل میلیاردها پارامتر خود را برای یادگیری این داده جدید تغییر نمی‌دهد. تنها راهی که مدل می‌تواند در نوبت بعدی نام کاربر را به یاد آورد این است که برنامه واسط صراحتاً آن را در درخواست تازه بگنجاند.[3]

هزینه پنهان گفتگو

این مکانیسم الصاق رونوشت گفتگو، حقیقتی پنهان در محاسبات استنتاج هوش مصنوعی پدید می‌آورد: هزینه محاسباتی گفتگوهای خطی با نرخ درجه دوم (توان دو) رشد می‌کند. از آنجا که کل تاریخچه هر بار مجدداً ارسال می‌شود، تعداد توکن‌هایی که مدل باید پردازش کند در هر تبادل بیشتر می‌شود؛ یعنی درحالی‌که کاربر متنی با حجم ثابت می‌نویسد، سرور کار سنگین‌تری انجام می‌دهد.[3]

یک چت‌بات معمول خدمات پشتیبانی را در نظر بگیرید که در آن کاربر و هوش مصنوعی در هر نوبت دقیقاً ۵۰ توکن متن رد و بدل می‌کنند. در دور اول، کاربر ۵۰ توکن ارسال می‌کند و مدل آن‌ها را پردازش کرده و پاسخی می‌سازد؛ هزینه ورودی اندک است و تاخیر پاسخگویی تقریباً به صفر میل می‌کند.[3]

اما در بیستمین دور همان گفتگو، محاسبات به شدت دگرگون می‌شود. برنامه باید ۱۹ تبادل قبلی را که شامل ۱۹۰۰ توکن است، همراه با پیام جدیدِ ۵۰ توکنی کاربر بفرستد. اکنون مدل باید ۱۹۵۰ توکن ورودی را بخواند و پردازش کند، پیش از آنکه حتی بتواند یک کلمه پاسخ تولید کند.[3]

به علت الصاق رونوشت در هر نوبت، هزینه پردازش در گفتگوهای خطی با نرخ درجه دوم افزایش می‌یابد.

این یعنی دور بیستم به تقریباً ۲۰ برابر قدرت پردازشی ورودیِ بیشتری نسبت به دور اول نیاز دارد. اگر این گفتگو تا ۱۰۰ دور ادامه یابد، مدل در هر بار درخواست نزدیک به ۱۰ هزار توکن را بازخوانی می‌کند؛ بنابراین برای توسعه‌دهندگانی که بر اساس تعداد توکن‌ها هزینه می‌پردازند، حفظ یک گفتگوی طولانی هزینه‌های سرسام‌آوری به بار می‌آورد.[3]

مدیریت سهمیه توکن‌ها

همین مقیاس‌پذیری درجه دوم مشخص می‌کند که چرا ارائه‌دهندگان API صورت‌حساب توکن‌های ورودی و خروجی را جدا می‌کنند. OpenAI برای مدل GPT-4o-mini خود در حال حاضر ۰٫۱۵ دلار به ازای هر میلیون توکن ورودی دریافت می‌کند، در حالی که قیمت توکن‌های خروجی ۰٫۶۰ دلار به ازای هر میلیون است. قیمت ورودی تعمداً پایین نگه داشته شده زیرا توسعه‌دهندگان ناچارند برای توکن‌های تاریخی بارها و بارها پول بپردازند.[1]

این ساختار قیمت‌گذاری، طراحان نرم‌افزار را وادار می‌کند تا میان آگاهی از بافتار گفتگو و هزینه‌های عملیاتی دست به مصالحه‌های سختی بزنند. یک دستیار کدنویسی که کل مخزن کد پروژه را در پیام سیستم جا می‌دهد، پاسخ‌های بسیار دقیقی ارائه خواهد داد؛ اما در ازای هر سؤالی که کاربر بپرسد، هزینه سرسام‌آوری روی دست توسعه‌دهنده می‌گذارد.[3]

توسعه‌دهندگان برای کنترل این مخارج معمولاً از بازیابی افزوده تولید (RAG) استفاده می‌کنند. در این روش، به جای چسباندن یک سند طولانی و ایستا به هر دور، برنامه یک پایگاه‌داده برداری را جستجو می‌کند تا فقط مرتبط‌ترین پاراگراف‌ها را بیابد؛ سپس صرفاً همان چند بخش منتخب را به آرایه ورودی تزریق می‌کند تا با حفظ توکن‌ها در سطحی پایین، زمینه لازم تأمین شود.[3]

برخورد با سقف پنجره بافت

این انباشت پیوسته توکن‌ها در نهایت به سد پنجره بافت (Context Window) برخورد می‌کند. پنجره بافت همان سقف سخت‌افزاری و معماری است که حداکثر حجم متن قابل پردازش در یک گذر توسط ترنسفورمر را تعیین می‌کند؛ اگرچه مدل‌های نخستین به ۱۰۲۴ توکن محدود بودند، اما غول‌های پیشتاز امروزی از ظرفیت‌های بسیار بزرگی بهره می‌برند.[3]

مدل Gemini 1.5 Pro گوگل از پنجره بافتی تا سقف ۲ میلیون توکن پشتیبانی می‌کند و Claude 3.5 Sonnet شرکت آنتروپیک ظرفیتی معادل ۲۰۰ هزار توکن دارد. با این حال، حتی این پنجره‌های فراخ نیز پایان‌پذیرند؛ وقتی رونوشت یک گفتگو از حد معین فراتر رود، برنامه باید پیش از آنکه API با پیام خطا روبرو شود، وارد عمل شود.[3]

توسعه‌دهندگان برای جلوگیری از وقوع خطا از راهبردهای کوتاه‌سازی استفاده می‌کنند. رایج‌ترین روش «پنجره لغزان» است که در آن، به محض نزدیک شدن تعداد توکن‌ها به سقف تعیین‌شده، برنامه قدیمی‌ترین پیام‌ها را از ابتدای آرایه حذف می‌کند. مدل همچنان پیام‌های اخیر را دریافت می‌کند، اما نقطه آغازین گفتگو برای همیشه از دسترس آن پاک می‌شود.[3]

زمانی که متن از ظرفیت پنجره بافت فراتر می‌رود، نرم‌افزار قدیمی‌ترین پیام‌ها را بی‌صدا حذف می‌کند.

به محض اینکه پیامی از آرایه الصاقی حذف شود، مدل آن را در دم فراموش می‌کند. به همین دلیل است که یک چت‌بات ممکن است دستوری پیچیده از دو دقیقه پیش را کاملاً به یاد داشته باشد، اما وقتی درباره شرطی که در آغاز کار وضع کرده‌اید از آن می‌پرسید، دچار توهم و اشتباه شود؛ آن شرط دیگر در متنی که به مدل تحویل داده شده، وجود ندارد.[3]

برنامه‌های پیشرفته‌تر برای حفظ پیوستگی متن، از خلاصه‌سازی بهره می‌گیرند. در این شیوه، به جای حذف کامل نوبت‌های ابتدایی، یک فرآیند پس‌زمینه ۵۰ پیام اول را به مدلی کوچک‌تر می‌فرستد تا خلاصه کوتاهی از آن‌ها آماده کند. سپس این چکیده در پیام سیستم تزریق می‌شود تا هزاران توکن در قالب یک بلوک فشرده نگهداری شوند.[3]

گلوگاه کش KV

در لایه‌های عمیق‌تر، بازخوانی پیاپی یک متن تکراری از نظر بار پردازشی بسیار ناکارآمد است. هنگامی که یک ترنسفورمر توالی توکن‌ها را تحلیل می‌کند، ماتریس‌های کلید (Key) و مقدار (Value) را برای هر کلمه حساب می‌نماید تا نسبت آن با سایر واژه‌ها مشخص شود؛ این محاسبات واسط که در حافظه سرور ذخیره می‌شوند، کش KV نام دارند.[3]

در یک API بدون حالت، سرور درست در همان لحظه‌ای که پاسخ تولید شد، کش KV را دور می‌اندازد. در نتیجه، وقتی کاربر پیام بعدی خود را ارسال می‌کند، سرور باید عین همان محاسبات را برای تاریخچه مکالمات از ابتدا تکرار کند؛ اقدامی که بخش بزرگی از توان پردازشی را برای متنی که ثانیه‌هایی قبل ارزیابی شده بود، تلف می‌کند.[3]

برای رفع این اتلاف منابع، تأمین‌کنندگان زیرساخت هوش مصنوعی اخیراً قابلیت کَش کردن پرامپت (Prompt Caching) را معرفی کرده‌اند. با نگهداری کش KV مکالمات اخیر در حافظه فعال سرور به مدت چند دقیقه، سیستم دیگر نیازی به محاسبه دوباره کل تاریخچه ندارد؛ اگر درخواست جدید با توکن‌های یکسانی شروع شود، سرور از محاسبات زائد صرف‌نظر می‌کند.[3]

کش پرامپت این امکان را فراهم می‌سازد که مقادیر ریاضی رونوشت‌های اخیر در حافظه بماند و از پردازش دوباره متن تکراری جلوگیری شود.

شرکت Anthropic در اواسط سال ۲۰۲۶ امکان کَش پرامپت را برای مدل‌های Claude عرضه کرد و تخفیف‌های قابل‌توجهی برای توکن‌های ورودیِ خوانده‌شده از کش قائل شد. OpenAI نیز رویه‌ای مشابه در پیش گرفت و تخفیف‌های خودکاری برای پرامپت‌های طولانی در مدل‌های اخیر خود اعمال کرد تا جریمه مالی ناشی از چسباندن متن‌های تکراری کاهش یابد.[3]

با وجود این بهینه‌سازی‌ها در سمت سرور، قرارداد بنیادین API همچنان کاملاً بدون حالت است. توسعه‌دهنده نرم‌افزار ناچار است کل زنجیره زمانی را از بستر شبکه انتقال دهد و سرور تنها چک می‌کند که آیا اخیراً این توالی متن را خوانده است یا خیر؛ بار مدیریت تاریخچه همچنان بر دوش سیستم کاربری (کلاینت) باقی می‌ماند.[3]

تصور یک همراه همیشگیِ هوش مصنوعی در نهایت پیروزی مهندسی نرم‌افزار بر محدودیت‌های ساختاری سخت‌افزار است. خودِ مدل گویی در زمان متوقف شده است و با هر بار فراخوانی، با فراموشی مطلق چشم باز می‌کند؛ این تنها عملکرد مداوم برنامه است که امکانی برای تداوم گفتگو فراهم می‌آورد.[3]

این تحلیل چگونه انجام شد

روش
محاسبه مجدد توکن‌های مصرفی تجمعی در طول یک گفتگوی چندنوبته به منظور برآورد دقیق رشد مقیاس‌پذیری هزینه‌های پردازشی.
یافته
از آنجا که کل رونوشت مکالمه به هر درخواست جدید الصاق می‌شود، بار محاسباتی یک گفتگوی ساده با نرخی درجه دوم بالا می‌رود. در دور بیستم از مکالمه‌ای که در هر نوبت ۵۰ توکن تولید می‌کند، مدل ۱۹۵۰ توکن ورودی را صرفاً برای خواندن پیشینه گفتگو بازخوانی می‌نماید که این امر دور بیستم را از حیث توان ورودی حدود ۲۰ برابر گران‌تر از دور نخست می‌سازد.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • ساختار آرایه پیام‌ها در Chat Completions شرکت OpenAI: Full conversation history appended per request — Machine Learning Plus
  • مدیریت وضعیت در Messages API شرکت Anthropic: 0 bytes stored server-side between turns
محدودیت‌های این تحلیل
این تحلیل فرض را بر ثابت بودن طول توکن‌ها در هر دور قرار داده است و بهینه‌سازی‌های نوظهور نظیر کش پرامپت را که هزینه محاسباتی پیشوندهای تکراری را کاهش می‌دهند در نظر نمی‌گیرد.

اصطلاحات کلیدی

رابط بدون حالت (Stateless API)
نوعی رابط کاربری که در آن سرور هیچ حافظه‌ای از درخواست‌های گذشته نگه نمی‌دارد و کاربر موظف است هر بار تمام زمینه مورد نیاز را ارسال کند.
توکن (Token)
واحد بنیادین تشکیل‌دهنده متن در مدل‌های پردازش زبان، که معمولاً معادل یک واژه یا هجا است.
معماری ترنسفورمر (Transformer Architecture)
ساختار بنیادین شبکه‌های عصبی مدرن که کل کلمات یک متن را هم‌زمان پردازش می‌کند و نیاز به بررسی ترتیبی را رفع می‌سازد.
پنجره بافت (Context Window)
سقف ساختاری حداکثر توکن‌هایی که یک مدل می‌تواند در قالب یک فراخوانی بخواند و پردازش کند.
کش KV (KV Cache)
ماتریس‌های ریاضی موقتی که موقع خواندن متن در حافظه سرور نگهداری می‌شوند و پیوند میان واژگان را نشان می‌دهند.
کش پرامپت (Prompt Caching)
بهینه‌سازی سمت سرور که محاسبات کش KV متون قبلی را ذخیره می‌سازد تا مدل از بازخوانی بخش‌های تکراری بی‌نیاز شود.

پرسش‌های متداول

چرا مدل‌های هوش مصنوعی مکالمه را درون خود ذخیره نمی‌کنند؟

وزن‌های عصبی یک مدل مستقرشده منجمد هستند، به این معنی که مدل توان یادگیری حقایق تازه یا تغییر پارامترهای خود برای کاربران را ندارد. تنها در شرایطی می‌تواند به سخنان گذشته ارجاع دهد که آن پیام‌ها عیناً در متنی که در همان لحظه می‌خواند وجود داشته باشند.

اگر طول مکالمه از حد مجاز مدل بیشتر شود چه رخ می‌دهد؟

هر مدل دارای یک سقف معماری به نام پنجره بافت است. وقتی متن الصاق‌شده از این سقف فراتر رود، برنامه واسط بی‌صدا قدیمی‌ترین پیام‌ها را از ابتدای تاریخچه حذف می‌کند و در نتیجه هوش مصنوعی بلافاصله آن‌ها را از یاد می‌برد.

آیا این موضوع به این معناست که با ارسال هر پیام، هزینه کل سوابق گفتگو را می‌پردازم؟

بله. ارائه‌دهندگان بر اساس توکن هزینه دریافت می‌کنند و چون کل تاریخچه با هر پیام دوباره ارسال می‌شود، با طولانی شدن مکالمه، هزینه بازخوانی متن‌های قبلی به شکل تصاعدی رشد می‌کند.

شرکت‌های فناوری چگونه جلوی اتلاف چشمگیر توان پردازشی سرورها را می‌گیرند؟

ارائه‌دهندگان از روشی موسوم به کَش کردن پرامپت بهره می‌برند. با ذخیره محاسبات ریاضی متن‌های اخیر در حافظه فعال سرور به مدت چند دقیقه، در صورتی که ورودی جدید با همان متن شروع شود، سرور از محاسبه دوباره آن متن چشم‌پوشی می‌کند.

بررسی عمیق دیدگاه‌ها

توسعه‌دهندگان نرم‌افزار

توسعه‌دهندگان باید توهم حافظه در هوش مصنوعی را با هزینه‌های تصاعدی توکن‌های API متعادل کنند.

برای مهندسانی که واسط‌های چت‌بات را طراحی می‌کنند، ساختار بدون حالت هم یک موهبت است و هم یک دردسر. این سازوکار کنترل بی‌نقصی بر داده‌های ورودی به مدل می‌دهد و اجازه می‌دهد دستورهای پنهان سیستم، داده‌های جستجوی RAG و حافظه‌های ساختگی دقیقاً در جای مناسب تزریق شوند؛ اما در عین حال، آن‌ها را ملزم می‌کند تا سازوکارهای پیچیده‌ای برای مدیریت وضعیت در سمت کاربر طراحی کنند. هر قابلیتی که چت‌بات را شبیه به انسان جلوه می‌دهد — نظیر به یاد داشتن ترجیحات کاربر — نیازمند این است که توسعه‌دهنده داده‌ها را دستی از پایگاه داده بخواند و بی‌صدا به پرامپت بچسباند؛ اقدامی که با هر دور چت، هزینه‌ها را بالا می‌برد.

مهندسان زیرساخت هوش مصنوعی

تیم‌های زیرساخت، ارسال پیاپی رونوشت‌ها را مانعی جدی بر سر راه پهنای باند حافظه پردازنده‌های گرافیکی قلمداد می‌کنند.

در سطح سخت‌افزار، خواندن مجدد یک تاریخچه ۲۰۰۰ توکنی در هر بار پاسخ‌دهی، اتلاف فاجعه‌بار توان پردازشی است. مهندسان زیرساخت توجه خود را عمیقاً به کش KV معطوف ساخته‌اند؛ همان وضعیت‌های ریاضیاتی موقتی که هنگام پردازش متن در ترنسفورمر ایجاد می‌شوند. از آنجا که پهنای باند حافظه بزرگ‌ترین گلوگاه شتاب‌دهنده‌های مدرن است، حذف و محاسبه دوباره کش KV برای مکالمات تکراری، تعداد کاربران هم‌زمان یک سرور را محدود می‌سازد. همین مسئله موتور محرک موج اخیر برای فراگیر کردن کش پرامپت در صنعت شده تا آن متغیرهای واسط در رم فعال باقی بمانند و نیاز به بازخوانی تکراری نباشد.

کاربران نهایی

مخاطبان عادی چت‌بات‌ها را موجوداتی پیوسته می‌بینند و از فراموشی ناگهانی زمینه‌ها سردرگم می‌شوند.

از نگاه یک کاربر عادی، یک چت‌بات هوش مصنوعی همچون موجودیتی پایدار است که در گذر گفتگو موضوعات را می‌آموزد و به خاطر می‌سپارد. از آنجا که اضافه شدن تاریخچه مکالمه به شکل نامرئی در پس‌زمینه صورت می‌گیرد، کاربران به طور طبیعی فرض می‌کنند که مدل نوعی حافظه درونی مداوم دارد. این پندار نادرست زمانی فرو می‌ریزد که حجم گفتگو به آستانه پنجره بافت برسد و برنامه شروع به حذف پیام‌های اولیه کند. کاربران بارها از اینکه هوش مصنوعی به ناگاه یک دستور دقیق از یک ساعت پیش را فراموش کرده ابراز ناراحتی می‌کنند، بی‌خبر از آنکه آن دستور برای جلوگیری از توقف سیستم، کلاً از ورودی متن حذف شده است.

توسعه‌دهندگان نرم‌افزار 40%مهندسان زیرساخت هوش مصنوعی 40%کاربران نهایی 20%
توسعه‌دهندگان نرم‌افزار
کنترل شفاف بر بافت متن و مدیریت هزینه‌های قطعی API را در اولویت قرار می‌دهند.
مهندسان زیرساخت هوش مصنوعی
بر بهینه‌سازی حافظه سرورها و کاهش محاسبات تکراری در کش KV تمرکز دارند.
کاربران نهایی
انتظار تداوم حافظه شبیه به انسان را دارند و به ساختار فنی زیربنایی توجهی نمی‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار
  • مدافعان حریم خصوصی

منابع

پوشش منابع

3 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان نرم‌افزار 40%مهندسان زیرساخت هوش مصنوعی 40%کاربران نهایی 20%
  1. [1]Machine Learning Plusتوسعه‌دهندگان نرم‌افزار

    What Is the OpenAI Chat Completions API?

    مطالعه در Machine Learning Plus →
  2. [2]arXivمهندسان زیرساخت هوش مصنوعی

    Attention Is All You Need

    مطالعه در arXiv →
  3. [3]تیم سردبیری کوهستانمهندسان زیرساخت هوش مصنوعی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.