رفتن به محتوای اصلی
کوهستان
هوش مصنوعی سری زمانیانتشار مدل· 4 دقیقه مطالعه· در هوش مصنوعی

انتشار مدل سری زمانی Granite PatchTST-FM-r2 توسط IBM با مجوز تجاری و قابلیت Zero-Shot

شرکت IBM یک مدل پایه سری زمانی با ۳۸۵ میلیون پارامتر منتشر کرده است که توانایی پیش‌بینی بدون نیاز به آموزش مجدد (zero-shot) و تشخیص ناهنجاری را دارد. این مدل با مجوز دوگانه برای استفاده تجاری عرضه شده و مستقیماً با پلتفرم‌های داده‌های جریانی ادغام می‌شود تا سیگنال‌های زنده تجاری را پردازش کند.

به قلم ساناز امامی

در ۹ سپتامبر ۲۰۲۶، شرکت IBM یک فایل safetensors با حجم ۳٫۰۷ گیگابایت را در پلتفرم Hugging Face Hub بارگذاری کرد و مدل سری زمانی Granite PatchTST-FM-r2 را در دسترس عموم قرار داد. این سیستم ۳۸۵ میلیون پارامتری همراه با وزن‌های باز، پایپ‌لاین استنتاج و کدهای بنچمارک قابل‌تکرار عرضه شد. این مدل که برای پیش‌بینی مقادیر آینده در داده‌های نمونه‌برداری‌شده منظم طراحی شده است، جریان‌های کاری سازمانی مانند متعادل‌سازی بار انرژی، تقاضای خرده‌فروشی و تله‌متری ماشین‌آلات را هدف قرار می‌دهد.[1][4]

پیش‌بینی سری‌های زمانی بر اندازه‌گیری‌های مرتب‌شده متکی است؛ مانند فروش روزانه، مصرف ساعتی برق یا خوانش سنسورها در طول زمان. از نظر تاریخی، تیم‌های علم داده مجبور بوده‌اند برای هر مجموعه داده خاص، یک مدل یادگیری ماشین مجزا را آموزش داده و نگهداری کنند. این رویکرد پراکنده، بار عملیاتی عظیمی را برای شرکت‌هایی که هزاران معیار متمایز را ردیابی می‌کنند، ایجاد می‌کند.[3]

تیم تحقیقاتی IBM در بیانیه انتشار خود نوشت: «مدل‌های پایه سری زمانی در حال تغییر نحوه ساخت سیستم‌های پیش‌بینی هستند. کاربران به‌جای آموزش و نگهداری یک مدل مجزا برای هر مجموعه داده، می‌توانند از یک مدل ازپیش‌آموزش‌دیده استفاده کرده و پیش‌بینی‌ها را به‌صورت zero-shot تولید کنند.»[1]

این مدل، داده‌ها را از طریق یک مکانیزم وصله‌بندی (patching) پردازش می‌کند. PatchTST-FM-r2 به‌جای خواندن تک‌تک نقاط داده، سری‌های زمانی را به وصله‌هایی در سطح زیرسری برداری می‌کند. این سیستم از وصله‌هایی با ۵۰ درصد هم‌پوشانی و وزن‌دهی پنجره همینگ استفاده می‌کند تا مرزهای بین قطعات داده را هموار کرده و یک پیش‌بینی پیوسته ارائه دهد.[1][6]

این مدل بلوک‌های استاندارد ترانسفورمر را با بلوک‌های کانفورمر جایگزین می‌کند و توجه برای الگوهای بلندمدت را با کانولوشن برای ساختارهای محلی ترکیب می‌کند.

معماری داخلی این مدل نشان‌دهنده یک تغییر قابل‌توجه نسبت به نسخه قبلی خود، یعنی PatchTST-FM-r1 است. IBM بلوک‌های استاندارد ترانسفورمر را با ۳۰ بلوک کانفورمر جایگزین کرد؛ طراحی خاصی که در ابتدا برای پردازش گفتار توسعه یافته بود.[2][6]

هر بلوک کانفورمر، یک مکانیزم توجه به خودِ چندسَره را با یک لایه کانولوشن زمانی احاطه می‌کند. جزء کانولوشن، ساختارهای زمانی کوتاه‌مدت و الگوهای محلی را ثبت می‌کند و مکانیزم توجه را آزاد می‌گذارد تا روی روابط بلندمدت در یک پنجره زمینه تاریخی تا سقف ۸۱۹۲ گام تمرکز کند.[2][6]

برای استقرارهای سازمانی، یک مقدار پیش‌بینی‌شده واحد به‌ندرت کافی است. مدل PatchTST-FM-r2 پیش‌بینی‌های احتمالی تولید کرده و ۹۹ چندک متمایز را خروجی می‌دهد. این ویژگی به یک برنامه‌ریز زنجیره تامین اجازه می‌دهد تا نقاط سفارش مجدد را بر اساس صدک ۹۰ام تقاضای موردانتظار تنظیم کند، نه اینکه به یک پیش‌بینی نقطه‌ای خشک و انعطاف‌ناپذیر که عدم قطعیت را نادیده می‌گیرد، تکیه کند.[3][4]

انتشار این مدل با ادغام آن در پایپ‌لاین‌های داده زنده همزمان شده است. شرکت‌های IBM و Confluent در ۱ سپتامبر ۲۰۲۶ یک برنامه دسترسی زودهنگام را راه‌اندازی کردند که مدل‌های سری زمانی Granite را مستقیماً وارد Confluent Cloud می‌کند.[5]

از طریق Apache Flink SQL، تیم‌ها می‌توانند مدل‌های پیش‌بینی و تشخیص ناهنجاری را روی جریان‌های داده زنده فراخوانی کنند. نتایج استنتاج مجدداً در تاپیک‌های Kafka نوشته می‌شوند و به مدل اجازه می‌دهند تا بر اساس وضعیت فعلی کسب‌وکار عمل کند، نه داده‌های دسته‌ای قدیمی.[5]

مدل PatchTST-FM-r2 در بنچمارک GIFT-Eval در میان مدل‌های zero-shot قابل‌تکرار در رتبه دوم و در میان مدل‌های دارای مجوزهای تجاری منعطف در رتبه اول قرار دارد.

در بنچمارک GIFT-Eval که مدل‌ها را در سناریوهای مختلف پیش‌بینی ارزیابی می‌کند، PatchTST-FM-r2 به میانگین هندسی امتیاز احتمال رتبه‌بندی پیوسته (CRPS) برابر با ۰٫۴۶۷ و خطای مقیاس‌شده مطلق میانگین (MASE) برابر با ۰٫۶۸۴۶ دست یافت.[1][2]

تا ۸ سپتامبر ۲۰۲۶، این امتیازات، مدل را در رتبه دوم کلی در میان مدل‌های zero-shot قابل‌تکرار قرار می‌دهد و تنها پس از مدل TimesFM-3 گوگل ایستاده است.[1][2]

وجه تمایز تعیین‌کننده PatchTST-FM-r2 مجوز آن است. درحالی‌که بسیاری از مدل‌های با وزن باز دارای محدودیت‌های غیرتجاری هستند، IBM این نسخه را با مجوز دوگانه تحت Apache 2.0 و OpenMDW 1.0 بنیاد لینوکس منتشر کرد.[1][4]

این مدل مستقیماً با پلتفرم‌های جریانی مانند Confluent Cloud ادغام می‌شود و به آن اجازه می‌دهد سیگنال‌های زنده تجاری را بدون تاخیرهای پردازش دسته‌ای پردازش کند.

در تحلیلی از Compendia Labs آمده است: «پیش‌بینی سری‌های زمانی یکی از آخرین حوزه‌های یادگیری ماشین است که در آن شرکت‌ها هنوز مدل‌ها را به‌صورت دستی برای هر مجموعه داده آموزش می‌دهند؛ همچنین حوزه‌ای است که در آن عبارت 'وزن‌های باز' اغلب در سکوت به معنای 'فقط برای تحقیق' است.» این مجوز منعطف، موانع قانونی برای استقرار این مدل ۳۸۵ میلیون پارامتری در محیط‌های تجاری و درون‌سازمانی را برطرف می‌کند.[4]

بررسی عمیق دیدگاه‌ها

تیم‌های داده سازمانی

تمرکز بر آزادی عملیاتی ارائه‌شده توسط مجوزهای منعطف و استقرار محلی.

برای دپارتمان‌های علم داده شرکتی، اصطکاک اصلی در پذیرش مدل‌های پایه اغلب بیشتر قانونی است تا فنی. بسیاری از مدل‌های «باز» دارای بندهای غیرتجاری هستند که از استفاده آن‌ها در سیستم‌های تولیدی جلوگیری می‌کند. با مجوز دوگانه PatchTST-FM-r2 تحت Apache 2.0 و OpenMDW 1.0، شرکت IBM به سازمان‌ها اجازه می‌دهد تا مدل را در محیط‌های امن خود میزبانی کنند. این امر تضمین می‌کند که داده‌های عملیاتی حساس مانند حجم تراکنش‌های مالی یا تله‌متری انحصاری هرگز نیازی به انتقال به یک API شخص ثالث ندارند.

محققان معماری هوش مصنوعی

برجسته کردن تغییر ساختاری از ترانسفورمرهای خالص به طراحی‌های مبتنی بر کانفورمر.

محققان یادگیری ماشین به مکانیزم‌های داخلی مدل به‌عنوان مهم‌ترین دستاورد آن اشاره می‌کنند. با جایگزینی بلوک‌های استاندارد ترانسفورمر با بلوک‌های کانفورمر، این معماری تایید می‌کند که داده‌های سری زمانی به یک سوگیری استقرایی محلی قوی نیاز دارند. لایه‌های کانولوشن زمانی الگوهای فوری و کوتاه‌مدت را مدیریت می‌کنند، که این امر مکانیزم توجه را آزاد می‌گذارد تا روابط فصلی بلندمدت را در سراسر پنجره زمینه ۸۱۹۲ گامی ترسیم کند. این رویکرد ترکیبی مستقیماً در جایگاه بالای مدل در بنچمارک GIFT-Eval نقش دارد.

ارائه‌دهندگان زیرساخت جریانی

تاکید بر گذار از پردازش دسته‌ای به استنتاج بلادرنگ روی جریان‌های داده زنده.

مهندسان زیرساخت این مدل را به‌عنوان یک کاتالیزور برای هوش عملیاتی بلادرنگ می‌بینند. از طریق ادغام با پلتفرم‌هایی مانند Confluent Cloud و Apache Flink، مدل‌های پایه در حال خروج از محیط‌های ایزوله علم داده و ورود مستقیم به پایپ‌لاین‌های داده زنده هستند. این امر به سیستم‌ها اجازه می‌دهد تا تشخیص ناهنجاری و پیش‌بینی را روی سیگنال‌های زنده تجاری مانند تله‌متری سنسورها یا فعالیت‌های پرداخت اجرا کنند و اقدامات پایین‌دستی خودکار را پیش از آنکه یک فرآیند دسته‌ای حتی رویداد را ثبت کند، آغاز نمایند.

نکات کلیدی

  1. شرکت IBM مدل Granite PatchTST-FM-r2 را که یک مدل پایه ۳۸۵ میلیون پارامتری برای پیش‌بینی سری‌های زمانی است، منتشر کرد.
  2. این مدل به‌صورت zero-shot عمل می‌کند و بدون نیاز به آموزش مجددِ مختص به وظیفه، روی داده‌های ناآشنا پیش‌بینی تولید می‌کند.
  3. یک معماری به‌روزشده کانفورمر، پنجره‌های زمینه تاریخی را تا سقف ۸۱۹۲ گام پردازش می‌کند.
  4. این مدل ۹۹ چندک متمایز را خروجی می‌دهد و به‌جای پیش‌بینی‌های نقطه‌ای واحد، محدوده‌های احتمالی ارائه می‌کند.

آنچه نمی‌دانیم

  • عملکرد تعمیم‌یافته zero-shot این مدل در مقایسه با مدل‌های به‌شدت تنظیم‌شده و مختص به مجموعه داده در کاربردهای صنعتی خاص چگونه خواهد بود.
  • آیا معماری کانفورمر برای وظایف سری زمانی به‌طور کارآمدی تا تعداد پارامترهای میلیاردی مقیاس‌پذیر خواهد بود یا خیر.
  • سربار محاسباتی پردازش پنجره‌های زمینه ۸۱۹۲ گامی چگونه بر تاخیر بلادرنگ در محیط‌های جریانی با توان عملیاتی بالا تاثیر می‌گذارد.

روند رویداد

  1. نوامبر ۲۰۲۲

    محققان معماری اولیه PatchTST را معرفی کرده و کارایی برداری کردن سری‌های زمانی به وصله‌ها را نشان دادند.

  2. ۲۰۲۳

    شرکت IBM نسل اول مدل‌های پایه سری زمانی Granite خود از جمله PatchTST-FM-r1 را منتشر کرد.

  3. ۱ سپتامبر ۲۰۲۶

    شرکت‌های IBM و Confluent یک برنامه دسترسی زودهنگام راه‌اندازی کردند که مدل‌های سری زمانی Granite را به جریان‌های داده زنده می‌آورد.

  4. ۹ سپتامبر ۲۰۲۶

    شرکت IBM مدل ۳۸۵ میلیون پارامتری PatchTST-FM-r2 را به‌صورت باز تحت مجوزهای Apache 2.0 و OpenMDW 1.0 منتشر کرد.

تیم‌های داده سازمانی 40%محققان معماری هوش مصنوعی 35%ارائه‌دهندگان زیرساخت جریانی 25%
تیم‌های داده سازمانی
تمرکز بر آزادی عملیاتی ارائه‌شده توسط مجوزهای منعطف و استقرار محلی.
محققان معماری هوش مصنوعی
برجسته کردن تغییر ساختاری از ترانسفورمرهای خالص به طراحی‌های مبتنی بر کانفورمر.
ارائه‌دهندگان زیرساخت جریانی
تاکید بر گذار از پردازش دسته‌ای به استنتاج بلادرنگ روی جریان‌های داده زنده.

دیدگاه‌هایی که این گزارش پوشش نداده

  • دانشمندان داده مستقل
  • فروشندگان سیستم‌های پیش‌بینی انحصاری

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

تیم‌های داده سازمانی 40%محققان معماری هوش مصنوعی 35%ارائه‌دهندگان زیرساخت جریانی 25%
  1. [1]Hugging Face Blogمحققان معماری هوش مصنوعی

    IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license

    مطالعه در Hugging Face Blog →
  2. [2]Unite.aiمحققان معماری هوش مصنوعی

    IBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model

    مطالعه در Unite.ai →
  3. [3]Superpower Daily

    IBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model

    مطالعه در Superpower Daily →
  4. [4]Compendia Labsتیم‌های داده سازمانی

    IBM Granite PatchTST-FM-r2: Top Zero-Shot Forecasting Model Under Apache-2.0 — Dispatch

    مطالعه در Compendia Labs →
  5. [5]IBMارائه‌دهندگان زیرساخت جریانی

    IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud

    مطالعه در IBM →
  6. [6]LinkLootارائه‌دهندگان زیرساخت جریانی

    IBM's Granite Time Series PatchTST-FM-r2 brings open weights, probabilistic forecasts, and a commercial-friendly dual license to zero-shot time-series forecasting

    مطالعه در LinkLoot →

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاه‌ها، هر روز و رایگان.