رفتن به محتوای اصلی
Koohestun
توضیح کوهستانتولید ویدیومقاله تشریحی· 7 دقیقه مطالعه· در هوش مصنوعی

چگونه لایه‌های توجه زمانی، پیوستگی فریم‌ها را در تولید ویدیوی هوش مصنوعی تضمین می‌کنند

برای جلوگیری از تبدیل شدن ویدیوهای تولیدشده با هوش مصنوعی به توهمات بصری لرزان، مدل‌ها باید اشیا را در طول فضا و زمان ردیابی کنند. یک گلوگاه ریاضی در نحوه پردازش این ابعاد توسط لایه‌های توجه، باعث تغییر مسیر به سمت معماری‌های ترکیبی شده است.

به قلم کوروش پاکزاد

نوآوران معماری 40%توسعه‌دهندگان مبتنی بر کارایی 35%سنتز تحلیلی 25%
نوآوران معماری
تمرکز بر حل گلوگاه پیوستگی فیزیکی از طریق مکانیزم‌های توجه جدید.
توسعه‌دهندگان مبتنی بر کارایی
تمرکز بر حفظ توجیه محاسباتی تولید ویدیو برای استقرار متن‌باز.
سنتز تحلیلی
تمرکز بر محدودیت‌های ریاضیاتی که معماری مدل را دیکته می‌کنند.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار
  • تولیدکنندگان تجاری ویدیو

یک مدل زبانی با نگاه به متنی که تازه نوشته است، کلمه بعدی را در یک توالی پیش‌بینی می‌کند و بر یک زنجیره یک‌بعدی از زمینه تکیه دارد. یک تولیدکننده ویدیوی هوش مصنوعی دقیقاً همین کار را با پیکسل‌ها انجام می‌دهد، اما با یک تفاوت حیاتی: باید فریم بعدی را پیش‌بینی کند در حالی که همزمان هندسه فضایی فریم قبلی را به خاطر می‌سپارد. اگر نتواند هر دو بُعد را به‌طور همزمان ردیابی کند، کل صحنه به یک توهم بصری لرزان و از نظر فیزیکی غیرممکن فرو می‌پاشد.

هنگامی که شرکت اوپن‌ای‌آی در اوایل سال ۲۰۲۴ تولید ویدیوهای یک دقیقه‌ای را به نمایش گذاشت، صنعت متوجه شد که حفظ پیوستگی فیزیکی در میان صدها فریم متوالی، گلوگاه اصلی در ویدیوی زایشی است. در حالی که تولیدکنندگان تصویر مانند استیبل دیفیوژن تنها نیاز به درک چیدمان دوبعدی یک تصویر واحد دارند، مدل‌های ویدیویی باید اطمینان حاصل کنند که یک شیء شکل، نورپردازی و مسیر خود را در حین حرکت در زمان حفظ می‌کند. این الزام — یعنی ردیابی اشیا هنگام حرکت در فضا و زمان — معماری زیربنایی را مجبور می‌کند تا حجم تصاعدی و بسیار بزرگتری از داده‌ها را پردازش کند.

موتور ریاضیاتی که این ردیابی را ممکن می‌سازد، مکانیزم توجه نامیده می‌شود. در یک معماری استاندارد ترانسفورمر، مکانیزم توجه به مدل اجازه می‌دهد تا برای درک زمینه، به تمام بخش‌های داده به‌طور همزمان نگاه کند. برای متن، این به معنای مقایسه هر کلمه در یک جمله با تمام کلمات دیگر است. برای ویدیو، این یعنی مقایسه پیکسل‌های یک فریم با پیکسل‌های فریم دیگر، که به شبکه اجازه می‌دهد بفهمد خوشه‌ای از پیکسل‌های قهوه‌ای که در سراسر صفحه حرکت می‌کنند، همان سگی است که یک ثانیه پیش وجود داشت.[1]

اما اعمال مستقیم این مکانیزم روی ویدیو، بار محاسباتی خردکننده‌ای ایجاد می‌کند. یک ویدیوی استاندارد یک دقیقه‌ای که با نرخ ۲۴ فریم بر ثانیه تولید می‌شود، شامل ۱۴۴۰ فریم مجزا است. اگر هر یک از این فریم‌ها به ۱۰۲۴ قطعه فضایی تقسیم شود، مدل باید تقریباً ۱.۵ میلیون توکن را در هر توالی پردازش کند. از آنجا که مکانیزم توجه نیازمند مقایسه هر توکن با تمام توکن‌های دیگر برای ایجاد زمینه است، با طولانی‌تر شدن یا پرجزئیات‌تر شدن ویدیو، نیازهای پردازشی به‌طور تصاعدی افزایش می‌یابد. این امر یک محدودیت ریاضی سخت ایجاد می‌کند که نشان می‌دهد یک شبکه عصبی استاندارد پیش از پر شدن حافظه‌اش، چه مقدار داده خام ویدیویی را می‌تواند هضم کند.[4]

توجه سه‌بعدی کامل به‌صورت توانی مقیاس‌پذیر می‌شود که استفاده از آن را برای ویدیوهای طولانی و باکیفیت از نظر محاسباتی غیرممکن می‌سازد.

اگر یک مدل تلاش کند از «توجه سه‌بعدی کامل» استفاده کند — یعنی مقایسه تک‌تک توکن‌ها با تمام توکن‌های دیگر در کل ویدیو — پیچیدگی محاسباتی به‌صورت توانی با طول زمان و وضوح فضایی مقیاس‌پذیر می‌شود. این ریاضیات که به‌صورت او(تی به توان ۲ در ان به توان ۲) بیان می‌شود، به این معناست که دو برابر کردن نرخ فریم و دو برابر کردن وضوح، هزینه محاسبات را صرفاً چهار برابر نمی‌کند؛ بلکه آن را در شانزده ضرب می‌کند. برای ویدیوهای با کیفیت بالا، توجه سه‌بعدی کامل به قدری گران تمام می‌شود که تنها برای رندر کردن چند ثانیه ویدیو، به خوشه‌های سرور عظیمی نیاز است.[1]

برای ویدیوهای با کیفیت بالا، توجه سه‌بعدی کامل به قدری گران تمام می‌شود که تنها برای رندر کردن چند ثانیه ویدیو، به خوشه‌های سرور عظیمی نیاز است.

مقیاس عظیم این محاسبه همان چیزی است که تولید ویدیوی فشرده‌نشده را روی سخت‌افزارهای فعلی از نظر ریاضی غیرممکن می‌سازد. از آنجا که مجموع توکن‌های مکانی-زمانی برای یک ویدیوی استاندارد یک دقیقه‌ای به ۱.۵ میلیون می‌رسد، اعمال توجه سه‌بعدی کامل نیازمند خط پایه نظریِ ۲.۲۵ تریلیون عملیات توجه در هر لایه است. این دقیقاً همان سقف ریاضی را استخراج می‌کند که ثابت می‌کند چرا توجه سه‌بعدی خالص نمی‌تواند بدون تجزیه معماری برای تولید ویدیوهای یک دقیقه‌ای مقیاس‌پذیر شود، و محققان را مجبور می‌کند تا به دنبال میان‌برهایی باشند که حجم توکن‌ها را بدون از بین بردن پیوستگی فیزیکی ویدیو کاهش دهند.[5]

برای حل این مشکل، محققان یک راهکار جایگزین به نام «توجه مکانی-زمانی تجزیه‌شده» توسعه دادند. به جای نگاه کردن به همه‌چیز به‌طور همزمان، توجه تجزیه‌شده مسئله را به دو مرحله جداگانه و ارزان‌تر تقسیم می‌کند. ابتدا، یک لایه توجه فضایی تنها به پیکسل‌های درون یک فریم واحد نگاه می‌کند و چیدمان صحنه را تعیین می‌کند. سپس، یک لایه توجه زمانی در طول زمان نگاه می‌کند — اما نکته حیاتی اینجاست که فقط به مختصات فضایی دقیقاً یکسان در فریم‌های قبلی و بعدی نگاه می‌کند. این جداسازی به مدل اجازه می‌دهد تا ابتدا تصویر دوبعدی را پردازش کرده و سپس آن تصاویر را به‌صورت متوالی به هم متصل کند، که این کار تعداد مقایسه‌هایی را که شبکه باید در طول هر مرحله تولید انجام دهد، به‌شدت کاهش می‌دهد.[1][4]

این تجزیه، بار محاسباتی را به‌شدت کاهش می‌دهد و آموزش مدل‌هایی مانند اوپن-سورا را روی سخت‌افزارهای استاندارد ممکن می‌سازد. با این حال، یک نقطه کور معماری شدید برای اشیای بزرگ و با حرکت سریع ایجاد می‌کند. اگر سگی در سراسر صفحه بدود، مکان پیکسل‌های آن از یک فریم به فریم دیگر تغییر می‌کند. از آنجا که لایه توجه زمانی تنها مختصات فضایی یکسان را در طول زمان ردیابی می‌کند، در واقع حرکت سگ را نمی‌بیند. بلکه صرفاً می‌بیند که سگ از یک بخش ناپدید شده و در بخش مجاور ظاهر می‌شود.[1][4]

این امر مدل را مجبور می‌کند تا حدس بزند شیء به کجا رفته است. همان‌طور که محققانِ پشت معماری فریم‌دی‌آی‌تی اشاره می‌کنند، این طراحی پیچیدگی یادگیری را افزایش می‌دهد و تضمین پیوستگی در سطح شیء را در میان فریم‌ها دشوار می‌سازد، و شبکه را مجبور می‌کند تا بر انتقال ضمنی سنگین بین لایه‌ها تکیه کند. وقتی این انتقال ضمنی با شکست مواجه می‌شود، شیء دچار اعوجاج شده، ذوب می‌شود یا پیوستگی فیزیکی خود را از دست می‌دهد — همان مصنوعات بصری بارزی که تولید ویدیوی هوش مصنوعی در روزهای ابتدایی با آن شناخته می‌شد. شبکه می‌داند که شیء باید وجود داشته باشد، اما چون لایه توجه زمانی نمی‌تواند حرکت قطری آن را در سراسر شبکه فضایی ردیابی کند، پیکسل‌ها پراکنده شده و به‌طور نادرست دوباره شکل می‌گیرند.[1]

برای پر کردن شکاف میان کارایی محاسباتی و پیوستگی فیزیکی، معماری‌های جدید در تلاشند تا نحوه عملکرد توجه زمانی را اصلاح کنند. یک رویکرد به نام «توجه ماتریسی»، کل یک فریم را به عنوان یک ماتریس واحد پردازش می‌کند نه توکن‌های مجزا. با توجه به کل فریم‌ها به جای مختصات فضایی ایزوله، توجه ماتریسی ساختار کلی صحنه را حفظ می‌کند و به مدل اجازه می‌دهد تا حرکت‌های قابل‌توجه را بدون تحمل جریمه توانیِ توجه سه‌بعدی کامل ردیابی کند. این رویکرد ترکیبی به شبکه اجازه می‌دهد تا تشخیص دهد یک شیء از سمت چپ صفحه به سمت راست حرکت کرده است، و یکپارچگی هندسی آن را بدون نیاز به ۲.۲۵ تریلیون عملیاتی که یک مکانیزم توجه سه‌بعدی خالص می‌طلبد، حفظ کند.[1]

ماژول‌های توجه زمانی سازگار با حرکت تنها ۲.۹ درصد سربار پارامتر به شبکه‌های پایه تولید تصویر اضافه می‌کنند.

راه‌حل نوظهور دیگر، «توجه زمانی سازگار با حرکت» است. این مکانیزم به جای برخورد یکسان با تمام محتوای ویدیو، میدان دریافت خود را بر اساس آنچه در صحنه رخ می‌دهد به‌طور پویا تنظیم می‌کند. برای توالی‌هایی با حرکت زیاد، مکانیزم توجه به‌صورت محلی در میان فریم‌ها متمرکز می‌شود تا جزئیاتی که به‌سرعت تغییر می‌کنند را حفظ کند. برای صحنه‌های ثابت، دید خود را به‌صورت سراسری گسترش می‌دهد تا پیوستگی پس‌زمینه را اعمال کند. با انتقال قدرت پردازشی به جایی که بیشترین نیاز به آن وجود دارد، شبکه از هدر دادن محاسبات روی پس‌زمینه‌های ثابت جلوگیری می‌کند و در عین حال اطمینان حاصل می‌کند که سوژه‌های با حرکت سریع، توجه لازم برای جلوگیری از اعوجاج را دریافت می‌کنند.[2]

توجه تجزیه‌شده ابتدا چیدمان فضایی یک فریم منفرد را پردازش کرده و سپس تغییرات زمانی در میان فریم‌ها را به‌طور جداگانه بررسی می‌کند.

در آزمایش‌ها، این رویکرد سازگار با حرکت تنها ۲۵.۸ میلیون پارامتر قابل آموزش — یعنی فقط ۲.۹ درصد از شبکه پایه — را اضافه کرد، در حالی که پس از آموزش روی ۱۰۰ هزار ویدیوی نمونه، به پیوستگی ویدیویی رقابتی دست یافت. فراتر از خود معماری، محققان در حال توسعه کنترل‌های زمان استنتاج مانند تمپو-کنترل نیز هستند که نقشه‌های توجه متقاطع را در طول تولید هدایت می‌کنند. این امر به کاربران اجازه می‌دهد تا دقیقاً زمان ظاهر شدن یک عنصر بصری خاص را بدون آموزش مجدد مدل زیربنایی دیکته کنند. با حرکت صنعت به سمت تولید ویدیوهای طولانی‌تر و با وضوح بالاتر، مدل‌هایی در نهایت موفق خواهند شد که بفهمند چگونه حرکت را در طول زمان ردیابی کنند، بدون آنکه ریاضیاتی را که تولید ویدیو را ممکن می‌سازد، در هم بشکنند.[2][3]

نکات کلیدی

  1. تولیدکنندگان ویدیوی هوش مصنوعی از مکانیزم‌های توجه برای ردیابی اشیا در فریم‌های متوالی استفاده می‌کنند.
  2. توجه سه‌بعدی کامل به‌صورت توانی مقیاس‌پذیر می‌شود که استفاده از آن را برای ویدیوهای طولانی و باکیفیت از نظر محاسباتی غیرممکن می‌سازد.
  3. توجه تجزیه‌شده با جداسازی فضا و زمان در محاسبات صرفه‌جویی می‌کند، اما در ردیابی اشیای با حرکت سریع دچار مشکل می‌شود.
  4. معماری‌های جدید مانند توجه ماتریسی کل فریم‌ها را به‌یکباره پردازش می‌کنند تا ساختار کلی صحنه حفظ شود.
  5. ماژول‌های سازگار با حرکت تمرکز خود را بر اساس میزان حرکت در یک توالی خاص به‌طور پویا تنظیم می‌کنند.

اصطلاحات کلیدی

مکانیزم توجه
فرآیند ریاضیاتی که به یک شبکه عصبی اجازه می‌دهد تا هنگام پیش‌بینی، اهمیت بخش‌های مختلف داده‌های ورودی را بسنجد.
توجه سه‌بعدی کامل
رویکردی که در آن یک مدل تک‌تک پیکسل‌های هر فریم را با تمام پیکسل‌های دیگر در کل توالی ویدیو مقایسه می‌کند.
توجه تجزیه‌شده
یک میان‌بر محاسباتی که ابتدا چیدمان فضایی یک فریم منفرد را پردازش کرده و سپس تغییرات زمانی در میان فریم‌ها را به‌طور جداگانه بررسی می‌کند.
فضای پنهان
یک نمایش ریاضی فشرده از داده‌ها که در آن مدل‌های هوش مصنوعی پردازش‌های خود را پیش از رمزگشایی نتیجه به پیکسل‌های قابل مشاهده انجام می‌دهند.

منابع

پوشش منابع

5 منبع

3 دیدگاه شناسایی‌شده

نوآوران معماری 40%توسعه‌دهندگان مبتنی بر کارایی 35%سنتز تحلیلی 25%
  1. [1]arXivنوآوران معماری

    FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

    مطالعه در arXiv
  2. [2]arXivنوآوران معماری

    Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion

    مطالعه در arXiv
  3. [3]arXivنوآوران معماری

    TempoControl: Temporal Attention Guidance for Text-to-Video Models

    مطالعه در arXiv
  4. [4]HPC-AI Techتوسعه‌دهندگان مبتنی بر کارایی

    Open-Sora: Democratizing Efficient Video Production for All

    مطالعه در HPC-AI Tech
  5. [5]تیم سردبیری کوهستانسنتز تحلیلی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.