رفتن به محتوای اصلی
Koohestun
هوش مصنوعی سری زمانیانتشار مدل· 4 دقیقه مطالعه· در هوش مصنوعی

انتشار مدل سری زمانی Granite PatchTST-FM-r2 توسط IBM با مجوز تجاری و قابلیت Zero-Shot

شرکت IBM یک مدل پایه سری زمانی با ۳۸۵ میلیون پارامتر منتشر کرده است که توانایی پیش‌بینی بدون نیاز به آموزش مجدد (zero-shot) و تشخیص ناهنجاری را دارد. این مدل با مجوز دوگانه برای استفاده تجاری عرضه شده و مستقیماً با پلتفرم‌های داده‌های جریانی ادغام می‌شود تا سیگنال‌های زنده تجاری را پردازش کند.

به قلم ساناز امامی

تیم‌های داده سازمانی 40%محققان معماری هوش مصنوعی 35%ارائه‌دهندگان زیرساخت جریانی 25%
تیم‌های داده سازمانی
تمرکز بر آزادی عملیاتی ارائه‌شده توسط مجوزهای منعطف و استقرار محلی.
محققان معماری هوش مصنوعی
برجسته کردن تغییر ساختاری از ترانسفورمرهای خالص به طراحی‌های مبتنی بر کانفورمر.
ارائه‌دهندگان زیرساخت جریانی
تاکید بر گذار از پردازش دسته‌ای به استنتاج بلادرنگ روی جریان‌های داده زنده.

دیدگاه‌هایی که این گزارش پوشش نداده

  • دانشمندان داده مستقل
  • فروشندگان سیستم‌های پیش‌بینی انحصاری

چرا مهم است

پیش‌بینی سری‌های زمانی، محرک اصلی تصمیمات حیاتی کسب‌وکارهاست؛ از مدیریت موجودی زنجیره تامین گرفته تا متعادل‌سازی بار سرورها. IBM با انتشار یک مدل قدرتمند zero-shot تحت مجوزی سازگار با تجارت، به شرکت‌ها اجازه می‌دهد تا پیش‌بینی‌های در سطح سازمانی را به‌صورت محلی مستقر کنند و نیاز به آموزش دستی مدل‌های سفارشی برای هر مجموعه داده جدید را از بین ببرند.

در ۹ سپتامبر ۲۰۲۶، شرکت IBM یک فایل safetensors با حجم ۳٫۰۷ گیگابایت را در پلتفرم Hugging Face Hub بارگذاری کرد و مدل سری زمانی Granite PatchTST-FM-r2 را در دسترس عموم قرار داد. این سیستم ۳۸۵ میلیون پارامتری همراه با وزن‌های باز، پایپ‌لاین استنتاج و کدهای بنچمارک قابل‌تکرار عرضه شد. این مدل که برای پیش‌بینی مقادیر آینده در داده‌های نمونه‌برداری‌شده منظم طراحی شده است، جریان‌های کاری سازمانی مانند متعادل‌سازی بار انرژی، تقاضای خرده‌فروشی و تله‌متری ماشین‌آلات را هدف قرار می‌دهد.[1][4]

پیش‌بینی سری‌های زمانی بر اندازه‌گیری‌های مرتب‌شده متکی است؛ مانند فروش روزانه، مصرف ساعتی برق یا خوانش سنسورها در طول زمان. از نظر تاریخی، تیم‌های علم داده مجبور بوده‌اند برای هر مجموعه داده خاص، یک مدل یادگیری ماشین مجزا را آموزش داده و نگهداری کنند. این رویکرد پراکنده، بار عملیاتی عظیمی را برای شرکت‌هایی که هزاران معیار متمایز را ردیابی می‌کنند، ایجاد می‌کند.[3]

تیم تحقیقاتی IBM در بیانیه انتشار خود نوشت: «مدل‌های پایه سری زمانی در حال تغییر نحوه ساخت سیستم‌های پیش‌بینی هستند. کاربران به‌جای آموزش و نگهداری یک مدل مجزا برای هر مجموعه داده، می‌توانند از یک مدل ازپیش‌آموزش‌دیده استفاده کرده و پیش‌بینی‌ها را به‌صورت zero-shot تولید کنند.»[1]

این مدل، داده‌ها را از طریق یک مکانیزم وصله‌بندی (patching) پردازش می‌کند. PatchTST-FM-r2 به‌جای خواندن تک‌تک نقاط داده، سری‌های زمانی را به وصله‌هایی در سطح زیرسری برداری می‌کند. این سیستم از وصله‌هایی با ۵۰ درصد هم‌پوشانی و وزن‌دهی پنجره همینگ استفاده می‌کند تا مرزهای بین قطعات داده را هموار کرده و یک پیش‌بینی پیوسته ارائه دهد.[1][6]

این مدل بلوک‌های استاندارد ترانسفورمر را با بلوک‌های کانفورمر جایگزین می‌کند و توجه برای الگوهای بلندمدت را با کانولوشن برای ساختارهای محلی ترکیب می‌کند.

معماری داخلی این مدل نشان‌دهنده یک تغییر قابل‌توجه نسبت به نسخه قبلی خود، یعنی PatchTST-FM-r1 است. IBM بلوک‌های استاندارد ترانسفورمر را با ۳۰ بلوک کانفورمر جایگزین کرد؛ طراحی خاصی که در ابتدا برای پردازش گفتار توسعه یافته بود.[2][6]

هر بلوک کانفورمر، یک مکانیزم توجه به خودِ چندسَره را با یک لایه کانولوشن زمانی احاطه می‌کند. جزء کانولوشن، ساختارهای زمانی کوتاه‌مدت و الگوهای محلی را ثبت می‌کند و مکانیزم توجه را آزاد می‌گذارد تا روی روابط بلندمدت در یک پنجره زمینه تاریخی تا سقف ۸۱۹۲ گام تمرکز کند.[2][6]

هر بلوک کانفورمر، یک مکانیزم توجه به خودِ چندسَره را با یک لایه کانولوشن زمانی احاطه می‌کند.

برای استقرارهای سازمانی، یک مقدار پیش‌بینی‌شده واحد به‌ندرت کافی است. مدل PatchTST-FM-r2 پیش‌بینی‌های احتمالی تولید کرده و ۹۹ چندک متمایز را خروجی می‌دهد. این ویژگی به یک برنامه‌ریز زنجیره تامین اجازه می‌دهد تا نقاط سفارش مجدد را بر اساس صدک ۹۰ام تقاضای موردانتظار تنظیم کند، نه اینکه به یک پیش‌بینی نقطه‌ای خشک و انعطاف‌ناپذیر که عدم قطعیت را نادیده می‌گیرد، تکیه کند.[3][4]

انتشار این مدل با ادغام آن در پایپ‌لاین‌های داده زنده همزمان شده است. شرکت‌های IBM و Confluent در ۱ سپتامبر ۲۰۲۶ یک برنامه دسترسی زودهنگام را راه‌اندازی کردند که مدل‌های سری زمانی Granite را مستقیماً وارد Confluent Cloud می‌کند.[5]

از طریق Apache Flink SQL، تیم‌ها می‌توانند مدل‌های پیش‌بینی و تشخیص ناهنجاری را روی جریان‌های داده زنده فراخوانی کنند. نتایج استنتاج مجدداً در تاپیک‌های Kafka نوشته می‌شوند و به مدل اجازه می‌دهند تا بر اساس وضعیت فعلی کسب‌وکار عمل کند، نه داده‌های دسته‌ای قدیمی.[5]

مدل PatchTST-FM-r2 در بنچمارک GIFT-Eval در میان مدل‌های zero-shot قابل‌تکرار در رتبه دوم و در میان مدل‌های دارای مجوزهای تجاری منعطف در رتبه اول قرار دارد.

در بنچمارک GIFT-Eval که مدل‌ها را در سناریوهای مختلف پیش‌بینی ارزیابی می‌کند، PatchTST-FM-r2 به میانگین هندسی امتیاز احتمال رتبه‌بندی پیوسته (CRPS) برابر با ۰٫۴۶۷ و خطای مقیاس‌شده مطلق میانگین (MASE) برابر با ۰٫۶۸۴۶ دست یافت.[1][2]

تا ۸ سپتامبر ۲۰۲۶، این امتیازات، مدل را در رتبه دوم کلی در میان مدل‌های zero-shot قابل‌تکرار قرار می‌دهد و تنها پس از مدل TimesFM-3 گوگل ایستاده است.[1][2]

وجه تمایز تعیین‌کننده PatchTST-FM-r2 مجوز آن است. درحالی‌که بسیاری از مدل‌های با وزن باز دارای محدودیت‌های غیرتجاری هستند، IBM این نسخه را با مجوز دوگانه تحت Apache 2.0 و OpenMDW 1.0 بنیاد لینوکس منتشر کرد.[1][4]

این مدل مستقیماً با پلتفرم‌های جریانی مانند Confluent Cloud ادغام می‌شود و به آن اجازه می‌دهد سیگنال‌های زنده تجاری را بدون تاخیرهای پردازش دسته‌ای پردازش کند.

در تحلیلی از Compendia Labs آمده است: «پیش‌بینی سری‌های زمانی یکی از آخرین حوزه‌های یادگیری ماشین است که در آن شرکت‌ها هنوز مدل‌ها را به‌صورت دستی برای هر مجموعه داده آموزش می‌دهند؛ همچنین حوزه‌ای است که در آن عبارت 'وزن‌های باز' اغلب در سکوت به معنای 'فقط برای تحقیق' است.» این مجوز منعطف، موانع قانونی برای استقرار این مدل ۳۸۵ میلیون پارامتری در محیط‌های تجاری و درون‌سازمانی را برطرف می‌کند.[4]

نکات کلیدی

  1. شرکت IBM مدل Granite PatchTST-FM-r2 را که یک مدل پایه ۳۸۵ میلیون پارامتری برای پیش‌بینی سری‌های زمانی است، منتشر کرد.
  2. این مدل به‌صورت zero-shot عمل می‌کند و بدون نیاز به آموزش مجددِ مختص به وظیفه، روی داده‌های ناآشنا پیش‌بینی تولید می‌کند.
  3. یک معماری به‌روزشده کانفورمر، پنجره‌های زمینه تاریخی را تا سقف ۸۱۹۲ گام پردازش می‌کند.
  4. این مدل ۹۹ چندک متمایز را خروجی می‌دهد و به‌جای پیش‌بینی‌های نقطه‌ای واحد، محدوده‌های احتمالی ارائه می‌کند.
  5. مجوز دوگانه تحت Apache 2.0 و OpenMDW 1.0 مسیر را برای استقرار تجاری نامحدود هموار می‌کند.

اصطلاحات کلیدی

داده‌های سری زمانی
دنباله‌ای از نقاط داده که در فواصل زمانی متوالی و با فاصله‌های مساوی جمع‌آوری یا ثبت می‌شوند، مانند فروش روزانه یا دمای ساعتی سرورها.
یادگیری Zero-shot
توانایی یک مدل یادگیری ماشین برای انجام یک وظیفه روی داده‌هایی که قبلاً هرگز ندیده است، بدون نیاز به آموزش اضافی.
پیش‌بینی چندک (Quantile)
یک رویکرد آماری که به‌جای ارائه یک عدد تخمینی واحد، محدوده‌ای از نتایج ممکن و احتمالات آن‌ها را پیش‌بینی می‌کند.
بلوک کانفورمر (Conformer)
یک معماری شبکه عصبی که مکانیزم‌های توجه به خود را با لایه‌های کانولوشن ترکیب می‌کند تا هم زمینه سراسری و هم الگوهای محلی را ثبت کند.
امتیاز احتمال رتبه‌بندی پیوسته (CRPS)
معیاری که برای ارزیابی دقت پیش‌بینی‌های احتمالی استفاده می‌شود، جایی که امتیاز پایین‌تر نشان‌دهنده عملکرد بهتر است.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

تیم‌های داده سازمانی 40%محققان معماری هوش مصنوعی 35%ارائه‌دهندگان زیرساخت جریانی 25%
  1. [1]Hugging Face Blogمحققان معماری هوش مصنوعی

    IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license

    مطالعه در Hugging Face Blog
  2. [2]Unite.aiمحققان معماری هوش مصنوعی

    IBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model

    مطالعه در Unite.ai
  3. [3]Superpower Daily

    IBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model

    مطالعه در Superpower Daily
  4. [4]Compendia Labsتیم‌های داده سازمانی

    IBM Granite PatchTST-FM-r2: Top Zero-Shot Forecasting Model Under Apache-2.0 — Dispatch

    مطالعه در Compendia Labs
  5. [5]IBMارائه‌دهندگان زیرساخت جریانی

    IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud

    مطالعه در IBM
  6. [6]LinkLootارائه‌دهندگان زیرساخت جریانی

    IBM's Granite Time Series PatchTST-FM-r2 brings open weights, probabilistic forecasts, and a commercial-friendly dual license to zero-shot time-series forecasting

    مطالعه در LinkLoot

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.