رفتن به محتوای اصلی
کوهستان
توضیح کوهستانآموزش بازگشتیفروپاشی مدل· 7 دقیقه مطالعه· در هوش مصنوعی

حذف دُم‌های توزیع در نمونه‌های محدود: چرخه‌های بازگشتی چگونه هوش مصنوعی را به فروپاشی بازگشت‌ناپذیر می‌کشانند

آموزش پیاپی مدل‌های مولد بر پایه خروجی نسل‌های پیشین، سامانه‌های هوش مصنوعی را به گرداب فروپاشی آماری می‌کشاند؛ جایی که با آب رفتن واریانس و حذف داده‌های کم‌تکرار ولی درست، دستگاه تنها میانگین‌های بیش از حد مطمئن تولید می‌کند و دچار نابودی دائمی اطلاعات می‌شود.

به قلم ندا وزیری

به‌طور خلاصه

  1. آموزش مدل‌های هوش مصنوعی بر داده‌های سنتزی به حذف داده‌های حاشیه‌ای و کم‌تکرار در نمونه‌های محدود انجامیده و مفاهیم نادر اما درست را از دامنه توزیع خارج می‌کند.
  2. انقباض واریانس نقش قاتل خاموش تنوع را بازی می‌کند؛ این عامل سرعت انحطاط مدل را دو برابر کرده و باعث جهش نمایی خطا می‌شود، پیش از آنکه ناظر انسانی متوجه تغییر شود.
  3. فروپاشی کامل مدل به‌لحاظ ریاضیاتی با فاین‌تیونینگ ساده جبران‌پذیر نیست و برای بازگرداندن دُم‌های توزیع، کل مدل باید از ابتدا بر پایه داده‌های دست‌نخورده انسانی آموزش ببیند.

مدیران ارشد دنیای فناوری و شیفتگان هوش مصنوعی سال‌هاست وعده می‌دهند که اگر متون تولیدشده توسط بشر ته بکشد، «داده‌های سنتزی» یا مصنوعی سوختی بی‌پایان خواهند بود که قوانین مقیاس‌پذیری شبکه‌های عصبی را برای همیشه سرپا نگه می‌دارند. فرض بنیادین آنها ساده و جذاب بود: مدلی که به بلوغ رسیده، می‌تواند خوراک آموزشی مدل بعدی شود و چرخه‌ای نامحدود و خودکفا از پیشرفت دائمی بسازد. با این حال، شواهد ریاضیاتیِ برآمده از آموزش بازگشتی تصویری دقیقاً برعکس را ترسیم می‌کنند.[6]

هنگامی که مدل‌ها دست به بلعیدن داده‌های تولیدشده توسط اسلاف خود می‌زنند، دچار افت عملکردی تدریجی اما قابل سنجش می‌شوند. این سازوکار ناشی از پدیده‌ای آماری به نام «حذف دُم‌های توزیع در نمونه‌های محدود» است؛ رویدادی ناگزیر که توزیع آماری آموخته‌شده را وادار می‌کند تا به میانگین‌هایی بیش از حد مطمئن و بدون تنوع همگرا شود. نتیجه نهایی، همان تباهی بازگشت‌ناپذیر داده‌ها و محتوایی است که پژوهشگران هوش مصنوعی آن را «فروپاشی مدل» می‌نامند.[1][6]

این افت کیفی ناشی از باگ‌های نرم‌افزاری، اشکالات برنامه‌نویسی یا نقطه‌ضعف معماری خاصی در شبکه‌های عصبی نیست؛ بلکه تاوان ریاضیِ برازش یک توزیع احتمالاتی بر نمونه‌های محدودِ به‌دست‌آمده از یک فرایند مولد قبلی است. هر نسلی که از مدل‌ها آموزش می‌بیند، دقیقاً شبیه نوعی فشرده‌سازی همراه با افت کیفیت (lossy compression) در مقایسه با نسل پیش عمل می‌کند؛ الگوهای بسیار پرتکرار تقویت می‌شوند، در حالی که لایه‌های ظریف و داده‌های نایاب به‌سادگی دور ریخته می‌شوند.[1][4]

مکانیسم‌های خودخواری مدل

پرورش نسل‌های جدید مدل‌های مولد بر مبنای داده‌های ساختگی نسل‌های قبلی، چرخه‌ای خطرناک موسوم به «حلقه خودخوار» یا اتوفاژیک به وجود می‌آورد. مقاله‌ای تجربی و ریاضیاتی که در سال ۲۰۲۳ میلادی توسط علم‌محمد و همکارانش منتشر شد نشان داد بدون تزریق مستمر و کافی داده‌های دست‌اول و واقعی انسانی در هر چرخه، کیفیت یا گوناگونی مدل‌های بعدی دستخوش زوالی قطعی و پیاپی خواهد شد.[3]

مراحل فروپاشی مدل: از پاک‌شدن زودهنگام دُم‌های توزیع تا انقباض شدید واریانس در مراحل پیشرفته.

آنها این بیماری شناختی سیستم‌های هوش مصنوعی را «اختلال خودخواری مدل» (MAD) نامیدند. این عارضه در امتداد نسل‌ها در دو گام متمایز خود را نشان می‌دهد: در مرحله «فروپاشی آغازین»، مدل دسترسی خود را به بخش‌های دورافتاده یا همان دُم‌های توزیع احتمال از دست می‌دهد؛ یعنی واقعیت‌های کم‌شمار اما معتبر، عبارات زبانی نامتعارف و دیدگاه‌های اقلیتی به‌مرور فراموش می‌شوند.[1][3]

در مرحله «فروپاشی پیشرفته»، مدها و خوشه‌های توزیع اصلی به‌شدت به هم گره می‌خورند. مدل به‌سمت برآوردی نقطه‌ای با واریانس بسیار کوچک همگرا می‌شود و پاسخ‌هایی عقیم، همان‌گویانه و کاملاً گسسته از واقعیت دنیای عینی ارائه می‌دهد. سیستم در این نقطه عملاً از تصویر محدودی که خود از جهان پرداخته، مسموم شده است.[1]

حذف دُم‌های توزیع با نمونه‌های محدود چگونه کار می‌کند؟

موتور محرک مراحل اولیه این فروپاشی، همان حذف دُم‌های توزیع ناشی از نمونه‌گیری محدود است. از آنجا که مفاهیم کم‌یاب و تحلیل‌های غیرمعمول به‌ندرت در متن‌های تولیدی انسان‌ها ظاهر می‌شوند، خروجی‌های مدل نسل اول نیز سهم بسیار اندکی از آنها خواهند داشت. وقتی مدل نسل دوم روی خروجی‌های نسل اول بازآموزی می‌شود، این مفاهیم کمیاب بیش از پیش به حاشیه رانده می‌شوند.[1][6]

پس از چند دور بازآموزی پیاپی، مدل به این خروجی‌های نادرست‌خوانده‌شده اما در واقع معتبر، احتمالی نزدیک به صفر نسبت می‌دهد. مسأله این نیست که مدل این داده‌ها را فراموش کرده، بلکه بازنمود آماری آن‌ها به‌لحاظ ریاضیاتی از پیکره متن‌های آموزشی خط خورده است. اطلاعاتی که پیش از این نادر بودند، حال دیگر کاملاً غیب شده‌اند.[1][6]

این حذف آماری دقیقاً از آنجا آب می‌خورد که مدل‌های مولد در هر بار تلاش، تنها می‌توانند تعداد محدودی نمونه خروجی تولید کنند. نمونه‌گیری با حجم محدود ذاتاً مجموعه آموزشیِ نسل بعدی را به‌سمت میانگین سوگیری می‌دهد و دم‌های ضخیم و پربار توزیعِ داده‌های انسانی را به‌شکلی سیستماتیک می‌برد.[1][2]

رشد تصاعدی خطای آزمون هنگام آموزش بازگشتی با داده‌های سنتزی، بدون تزریق پیوسته داده‌های واقعی انسانی.

انقباض واریانس: قاتل خاموش تنوع آماری

سرعت از بین رفتن این داده‌ها محصول دو نیروی هم‌راستاست: انحراف میانگینِ تخمین‌زده‌شده و انقباض یا کوچک‌شدن واریانسِ برآوردشده. پژوهش‌های حوزه آموزش بازگشتی نشان می‌دهد این دو محرک آماری، سهمی کم‌وبیش یکسان در اتلاف کل اطلاعات ایفا می‌کنند.[4][6]

هنگامی که واریانس مستقیماً بر اساس داده‌های سنتزی برآورد می‌شود — رفتاری که تمامی مدل‌های تجاری و عملی ناگزیر به آن متوسل می‌شوند — شتاب تخریب در مقایسه با حالت ایده‌آلی که واریانسِ واقعی در دسترس است، دو برابر می‌شود. این ویژگی، انقباض واریانس را به قاتلی خاموش بدل می‌سازد که دُم‌های آماری را برای همیشه ریشه‌کن می‌کند؛ مدت‌ها پیش از آنکه انحراف میانگین توجه ناظران انسانی را جلب کند.[4][6]

از آنجا که خروجی‌های تولیدی مدل از نظر قواعد دستوری، روانی متن و ساختار ظاهری بسیار صیقلی باقی می‌مانند، تشخیص تخریب در مراحل اولیه کار آسانی نیست. جملات شسته‌رفته و خوش‌آهنگ‌اند، اما تنوع معرفت‌شناختی درون آنها تهی گشته و با سامانه‌ای مواجهیم که با اعتماد‌به‌نفسی توخالی، پاسخ‌هایی یکدست، تخت و تکراری تولید می‌کند.[1][6]

شکست قوانین مقیاس‌پذیری

تکیه همه‌جانبه بر محتوای برآمده از مدل‌ها، قوانین اساسی مقیاس‌پذیری عصبی (Neural Scaling Laws) را که ضامن پیشرفت‌های حیرت‌انگیز اخیر هوش مصنوعی بوده‌اند، از کار می‌اندازد. در سال ۲۰۲۴، یک چارچوب نظری به سرپرستی دوهماتوب، کمپه و فنگ اثبات کرد مدل‌هایی که با داده‌های سنتزی پرورانده می‌شوند، نهایتاً به یک دیوار سخت و سقف غیرقابل عبور عملکردی برخورد می‌کنند.[2]

یافته‌های آنها پرده از حقیقتی تکان‌دهنده برداشت: سهمی بسیار ناچیز از داده‌های مصنوعی — حتی در حد ۱ درصد از کل مجموعه آموزشی — کافی است تا جرقه فروپاشی مدل زده شود. وقتی این خط قرمز رد شود، افزودن روزافزون داده‌ها دیگر کمکی به بهبود کارایی نخواهد کرد و رابطه خطی سنتی میان حجم داده و توانایی مدل از هم می‌پاشد.[2]

حلقه خودخواری: هر نسل جدید درست مثل یک فشرده‌سازی همراه با افت کیفیت روی نسل پیشین عمل می‌کند.

در رژیم‌های دارای پارامترهای فراوان (Over-parameterized)، این شیوه آموزش بازگشتی بی‌بروبرگرد به رشد تصاعدی خطا ختم می‌شود. خطای آزمون متناسب با شمار چرخه‌ها به‌شکل خطی اوج می‌گیرد؛ به این معنی که با افزایش نسل‌های مدل، سنتز دوباره و مداوم داده‌ها، یادگیری پیش‌رونده را به‌لحاظ ریاضیاتی ناممکن می‌سازد.[2][4]

سراب بازسازی مدل با فاین‌تیونینگ

یکی از هولناک‌ترین یافته‌ها پیرامون پدیده فروپاشی مدل، عدم تقارن شدید میان سرعت تخریب و هزینه جبران آن است. در حالی که سقوط کیفی بسیار تند اتفاق می‌افتد — معمولاً ظرف پنج نسل متوالی — برگرداندن خسارت به‌شدت کند، طاقت‌فرسا و پرهزینه از نظر توان پردازشی است.[3][6]

مدلی که دچار آلودگی داده‌ایِ بازگشتی شده، هرگز با چند ترفند فاین‌تیونینگ (Fine-tuning) سطحی احیا نخواهد شد. فاین‌تیونینگ صرفاً لایه‌های بالایی شبکه عصبی را دستکاری می‌کند؛ در حالی که دانایی و ریزه‌کاری‌های عمیق مربوط به دم‌های توزیع در ژرفای لایه‌هایی ثبت شده بودند که با تنظیمات لایه‌های بیرونی به‌روز نمی‌شوند.[6]

در نتیجه، بازگرداندن دُم‌های از دست‌رفته مستلزم بازآموزی کامل مدل از نقطه صفر بر بستری از متون پاک و دست‌نخورده انسانی است. همین موضوع، فروپاشی مدل را به یک بدهی فنی دائمی برای شرکت‌هایی تبدیل می‌کند که سازوکار غربالگری قدرتمندی برای تفکیک محتوای سنتزی از داده‌های ورودی خود ندارند.[1][6]

راهکارهای اصلاحی و ضرورت بی‌بدیل داده‌های واقعی

مهار این فروپاشی نیازمند بازنگری ساختاری در نحوه پالایش و گردآوری داده‌هاست. مستقیم‌ترین راهکار، سیاست «تجمع داده‌ها» به جای «جایگزینی داده‌ها» به شمار می‌رود. پژوهش سال ۲۰۲۴ گرست‌گراسر و همکاران نشان داد اگر داده‌های نسل‌های متوالی سنتزی در کنار داده‌های دست‌اول انباشته شوند (نه اینکه جای آنها را بگیرند)، خطای آزمون سقفی محدود پیدا می‌کند و خطر فروپاشی مطلق برطرف می‌شود.[5]

افت گام‌به‌گام بازیابی تنوع در طول نسل‌های متوالی در یک چرخه آموزش اتوفاژیک.

روش‌های تجربی دیگر شامل بهره‌گیری از داده‌های سنتز‌شده به‌عنوان هدایتگر منفی (Negative Guidance) است تا مدل را از فضای حالت سنتزی دور کرده و به توزیع داده‌های واقعی سوق دهد. با وجود این، اگر پیکره داده‌های پایه‌ای فاقد تنوع اصیل باشد، چنین شیوه‌هایی تنها زمان رسیدن به بن‌بست نهایی را به تاخیر می‌اندازند.[3][6]

در نهایت، ادامه مقیاس‌پذیری پایدار مدل‌های بنیادی در گرو حفظ و صیانت از دُم‌های توزیع آماری است. اگر بنا باشد هوش مصنوعی پیچیدگی‌ها، تناقضات و ظرافت‌های جهان انسانی را لمس و بازآفرینی کند، چاره‌ای جز دسترسی مستمر به جریانی زنده و پایان‌ناپذیر از خلاقیت‌های بشری نخواهد داشت.[1][6]

این تحلیل چگونه انجام شد

روش
محاسبه مسیر اتلاف کل اطلاعات از طریق تلفیق نرخ انقباض واریانس در آموزش بازگشتی مولد با روند رشد تصاعدی خطا که در قوانین مقیاس‌پذیریِ مدل‌های دارای پارامترهای فراوان مشاهده می‌شود.
یافته
افت کل اطلاعات در مدلی که به‌طور بازگشتی آموزش می‌بیند، از یک منحنی نمایی شتاب‌گیرنده تبعیت می‌کند که در آن، انقباض واریانس دُم‌های آماری را برای همیشه می‌زداید، پیش از آنکه انحراف میانگین حتی برای انسان‌ها قابل رویت باشد؛ امری که جبران فروپاشی را بدون بازآموزی از صفر، ناممکن می‌سازد.
داده‌هایی که بر پایهٔ آن‌ها کار کردیم
  • ضریب تخریب ناشی از انقباض واریانس: 2x rate vs known variance — arXiv
  • مسیر رشد تصاعدی خطا در آموزش بازگشتی: Exponential error growth — arXiv
محدودیت‌های این تحلیل
این تحلیل فرض را بر جایگزینی داده‌های آموزشی در یک حجم محاسباتی ثابت گذاشته است، نه انباشت مستمر هر دو گروه داده‌های واقعی و سنتزی در طول نسل‌های پیاپی.

اصطلاحات کلیدی

فروپاشی مدل (Model Collapse)
فرایندی انحطاطی که طی آن مدل‌های مولد در اثر آموزش دیدن روی خروجی‌های ساختگی خود، تنوع و اطلاعات ارزشمند آماری را به‌مرور از دست می‌دهند.
حذف دُم‌های توزیع در نمونه‌های محدود (Finite-Sample Tail Erasure)
ناپدید شدن گام‌به‌گام داده‌های کم‌تکرار اما معتبر از توزیع آموخته‌شده مدل، که به دلیل سهم اندک آنها در نمونه‌گیری‌های دارای اندازه محدود رخ می‌دهد.
اختلال خودخواری مدل (MAD)
سندروم کاهش تدریجی کیفیت و گوناگونی خروجی‌ها هنگامی که یک مدل مولد در چرخه‌ای بسته، از داده‌های مصنوعی خودش تغذیه می‌کند.
انقباض واریانس (Variance Contraction)
پدیده‌ای آماری که در آن خروجی‌های مدل به‌طرز فزاینده‌ای باریک و محدود به میانگین شده و با از دست دادن تنوع، رفتاری بیش از حد مطمئن و کلیشه‌ای بروز می‌دهند.
قوانین مقیاس‌پذیری عصبی (Neural Scaling Laws)
معادلات ریاضیاتی که پیش‌بینی می‌کنند با افزایش تعداد پارامترها و حجم داده‌های آموزشی، عملکرد یک شبکه عصبی تا چه میزان ارتقا می‌یابد.

پرسش‌های متداول

آیا می‌توان مدلی را که دچار فروپاشی شده، با فاین‌تیونینگ اصلاح کرد؟

خیر. فاین‌تیونینگ تنها وزن‌های لایه‌های بالایی شبکه را دگرگون می‌کند، در حالی که اطلاعات ظریف و موارد استثناییِ دُم توزیع در ژرفای لایه‌ها ذخیره شده بودند. احیای تنوع واقعی، نیازمند بازآموزی مدل از پایه با داده‌های ناب و دست‌نخورده انسانی است.

آیا فروپاشی مدل به صورت آنی و ناگهانی رخ می‌دهد؟

این زوال روندی تدریجی دارد. فروپاشی آغازین به‌آرامی موارد کم‌تکرار و دیدگاه‌های نادر را پاک می‌کند، در حالی که فروپاشی پیشرفته پس از گذشت چند نسل متوالی، به تولید محتواهای گره‌خورده، تکراری و بی‌ربط با دنیای واقعی منجر می‌شود.

توسعه‌دهندگان چگونه می‌توانند جلوی سندرم خودخواری مدل را بگیرند؟

مطمئن‌ترین شیوه تا این لحظه، راهبرد انباشت داده است؛ به طوری که داده‌های تاریخی و انسانی به جای حذف یا جایگزینی کامل، با خروجی‌های سنتزی ترکیب شده و همگی به نسل‌های بعدی خورانده شوند.

بررسی عمیق دیدگاه‌ها

ریاضی‌دانان نظری

پژوهشگرانی که ناگزیری آماری و ساختاریِ فروپاشی توزیع داده‌ها را مدل‌سازی و اثبات می‌کنند.

این گروه فروپاشی مدل را نه یک مانع مهندسی گذرا، بلکه یک قید تخطی‌ناپذیر ریاضیاتی می‌دانند. آنان با بررسی فرایند بازگشتی از دریچه توزیع‌های دُم‌ضخیم و تقریب‌های گاوسی اثبات می‌کنند که نمونه‌گیری متناهی ناگزیر دُم‌های توزیع را قطع می‌کند. محاسبات آنها نشان می‌دهد که کوچک شدن پیوسته واریانس در کنار انحراف میانگین، افزایش نمایی خطا را در نسل‌های متعدد قطعی می‌سازد؛ بدین معنا که جایگزینی ورودی‌های انسانی با متون ساختگی بدون شک به زوال قطعی خواهد انجامید.

حامیان انباشت داده

پژوهشگرانی که باور دارند حفظ و مخلوط‌کردن داده‌های اصلی انسانی با داده‌های جدید، مانع فروپاشی کامل می‌شود.

این گروه با دستکاری در فرضیات گردش کار آموزش، حتمی‌بودن فروپاشی را زیر سوال می‌برند. به عقیده آنها، فروپاشی تنها زمانی رخ می‌دهد که داده‌های ماشینی جایگزین کامل مجموعه‌های پیشین شوند. مستندات تجربی و فرضی این محققان حاکی از آن است که اگر داده‌های انسانی نسل اول همواره ذخیره شده و با تولیدات جدید تلفیق گردند، خطای مدل به یک حد آستانه متناهی می‌رسد و کنترل می‌شود. در دیدگاه آنان، کلید حل بحران، ره‌گیری سفت‌وسخت اصالت داده‌ها و پاسداری از آنهاست، نه کنار گذاشتن کامل داده‌های ترکیبی.

خوش‌بینان داده‌های سنتزی

فعالان صنعت که داده‌های مصنوعی را تنها راه پیش‌روی شرکت‌ها برای ادامه توسعه مدل‌های هوش مصنوعی می‌دانند.

این دسته از متخصصان در شرایطی که ذخایر متنی ارزشمند وب رو به اتمام است، استفاده از داده‌های سنتزی را تنها مسیر زنده نگه‌داشتن پیشرفت شبکه‌های عصبی می‌شمارند. استدلال آنها این است که با بهره‌گیری از فیلترهای پیشرفته، یادگیری تقویتی بر مبنای بازخورد انسانی (RLHF) و متدهای هدایت منفی، می‌توان جلوی افت کیفیت را گرفت. تمرکز اصلی این جناح بر مهندسی دقیق ابزارهایی است که بتوانند سیگنال‌های مفید را از میان خروجی‌های هوش مصنوعی استخراج کنند، بدون آنکه اثر انقباض واریانس به سیستم سرایت کند.

ریاضی‌دانان نظری 40%حامیان انباشت داده 35%خوش‌بینان داده‌های سنتزی 25%
ریاضی‌دانان نظری
پژوهشگرانی که ناگزیری آماری و ساختاریِ فروپاشی توزیع داده‌ها را مدل‌سازی و اثبات می‌کنند.
حامیان انباشت داده
پژوهشگرانی که باور دارند حفظ و مخلوط‌کردن داده‌های اصلی انسانی با داده‌های جدید، مانع فروپاشی کامل می‌شود.
خوش‌بینان داده‌های سنتزی
فعالان صنعت که داده‌های مصنوعی را تنها راه پیش‌روی شرکت‌ها برای ادامه توسعه مدل‌های هوش مصنوعی می‌دانند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • توسعه‌دهندگان تجاری هوش مصنوعی که به‌طور کامل به خطوط لوله داده‌های سنتزی متکی شده‌اند
  • نیروی کار انسانی ناظر و برچسب‌گذار داده‌ها که موقعیت شغلی‌شان در معرض حذف قرار دارد

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

ریاضی‌دانان نظری 40%حامیان انباشت داده 35%خوش‌بینان داده‌های سنتزی 25%
  1. [1]arXivحامیان انباشت داده

    The Curse of Recursion: Training on Generated Data Makes Models Forget

    مطالعه در arXiv →
  2. [2]arXivحامیان انباشت داده

    A Tale of Tails: Model Collapse as a Change of Scaling Laws

    مطالعه در arXiv →
  3. [3]arXivحامیان انباشت داده

    Self-Consuming Generative Models Go MAD

    مطالعه در arXiv →
  4. [4]arXivحامیان انباشت داده

    A theoretical basis for model collapse in recursive training

    مطالعه در arXiv →
  5. [5]arXivحامیان انباشت داده

    Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data

    مطالعه در arXiv →
  6. [6]تیم سردبیری کوهستانخوش‌بینان داده‌های سنتزی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.