انتشار مدل سری زمانی Granite PatchTST-FM-r2 توسط IBM با مجوز تجاری و قابلیت Zero-Shot
شرکت IBM یک مدل پایه سری زمانی با ۳۸۵ میلیون پارامتر منتشر کرده است که توانایی پیشبینی بدون نیاز به آموزش مجدد (zero-shot) و تشخیص ناهنجاری را دارد. این مدل با مجوز دوگانه برای استفاده تجاری عرضه شده و مستقیماً با پلتفرمهای دادههای جریانی ادغام میشود تا سیگنالهای زنده تجاری را پردازش کند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
در ۹ سپتامبر ۲۰۲۶، شرکت IBM یک فایل safetensors با حجم ۳٫۰۷ گیگابایت را در پلتفرم Hugging Face Hub بارگذاری کرد و مدل سری زمانی Granite PatchTST-FM-r2 را در دسترس عموم قرار داد. این سیستم ۳۸۵ میلیون پارامتری همراه با وزنهای باز، پایپلاین استنتاج و کدهای بنچمارک قابلتکرار عرضه شد. این مدل که برای پیشبینی مقادیر آینده در دادههای نمونهبرداریشده منظم طراحی شده است، جریانهای کاری سازمانی مانند متعادلسازی بار انرژی، تقاضای خردهفروشی و تلهمتری ماشینآلات را هدف قرار میدهد.[1][4]
پیشبینی سریهای زمانی بر اندازهگیریهای مرتبشده متکی است؛ مانند فروش روزانه، مصرف ساعتی برق یا خوانش سنسورها در طول زمان. از نظر تاریخی، تیمهای علم داده مجبور بودهاند برای هر مجموعه داده خاص، یک مدل یادگیری ماشین مجزا را آموزش داده و نگهداری کنند. این رویکرد پراکنده، بار عملیاتی عظیمی را برای شرکتهایی که هزاران معیار متمایز را ردیابی میکنند، ایجاد میکند.[3]
تیم تحقیقاتی IBM در بیانیه انتشار خود نوشت: «مدلهای پایه سری زمانی در حال تغییر نحوه ساخت سیستمهای پیشبینی هستند. کاربران بهجای آموزش و نگهداری یک مدل مجزا برای هر مجموعه داده، میتوانند از یک مدل ازپیشآموزشدیده استفاده کرده و پیشبینیها را بهصورت zero-shot تولید کنند.»[1]
این مدل، دادهها را از طریق یک مکانیزم وصلهبندی (patching) پردازش میکند. PatchTST-FM-r2 بهجای خواندن تکتک نقاط داده، سریهای زمانی را به وصلههایی در سطح زیرسری برداری میکند. این سیستم از وصلههایی با ۵۰ درصد همپوشانی و وزندهی پنجره همینگ استفاده میکند تا مرزهای بین قطعات داده را هموار کرده و یک پیشبینی پیوسته ارائه دهد.[1][6]
معماری داخلی این مدل نشاندهنده یک تغییر قابلتوجه نسبت به نسخه قبلی خود، یعنی PatchTST-FM-r1 است. IBM بلوکهای استاندارد ترانسفورمر را با ۳۰ بلوک کانفورمر جایگزین کرد؛ طراحی خاصی که در ابتدا برای پردازش گفتار توسعه یافته بود.[2][6]
هر بلوک کانفورمر، یک مکانیزم توجه به خودِ چندسَره را با یک لایه کانولوشن زمانی احاطه میکند. جزء کانولوشن، ساختارهای زمانی کوتاهمدت و الگوهای محلی را ثبت میکند و مکانیزم توجه را آزاد میگذارد تا روی روابط بلندمدت در یک پنجره زمینه تاریخی تا سقف ۸۱۹۲ گام تمرکز کند.[2][6]
برای استقرارهای سازمانی، یک مقدار پیشبینیشده واحد بهندرت کافی است. مدل PatchTST-FM-r2 پیشبینیهای احتمالی تولید کرده و ۹۹ چندک متمایز را خروجی میدهد. این ویژگی به یک برنامهریز زنجیره تامین اجازه میدهد تا نقاط سفارش مجدد را بر اساس صدک ۹۰ام تقاضای موردانتظار تنظیم کند، نه اینکه به یک پیشبینی نقطهای خشک و انعطافناپذیر که عدم قطعیت را نادیده میگیرد، تکیه کند.[3][4]
انتشار این مدل با ادغام آن در پایپلاینهای داده زنده همزمان شده است. شرکتهای IBM و Confluent در ۱ سپتامبر ۲۰۲۶ یک برنامه دسترسی زودهنگام را راهاندازی کردند که مدلهای سری زمانی Granite را مستقیماً وارد Confluent Cloud میکند.[5]
از طریق Apache Flink SQL، تیمها میتوانند مدلهای پیشبینی و تشخیص ناهنجاری را روی جریانهای داده زنده فراخوانی کنند. نتایج استنتاج مجدداً در تاپیکهای Kafka نوشته میشوند و به مدل اجازه میدهند تا بر اساس وضعیت فعلی کسبوکار عمل کند، نه دادههای دستهای قدیمی.[5]
در بنچمارک GIFT-Eval که مدلها را در سناریوهای مختلف پیشبینی ارزیابی میکند، PatchTST-FM-r2 به میانگین هندسی امتیاز احتمال رتبهبندی پیوسته (CRPS) برابر با ۰٫۴۶۷ و خطای مقیاسشده مطلق میانگین (MASE) برابر با ۰٫۶۸۴۶ دست یافت.[1][2]
تا ۸ سپتامبر ۲۰۲۶، این امتیازات، مدل را در رتبه دوم کلی در میان مدلهای zero-shot قابلتکرار قرار میدهد و تنها پس از مدل TimesFM-3 گوگل ایستاده است.[1][2]
وجه تمایز تعیینکننده PatchTST-FM-r2 مجوز آن است. درحالیکه بسیاری از مدلهای با وزن باز دارای محدودیتهای غیرتجاری هستند، IBM این نسخه را با مجوز دوگانه تحت Apache 2.0 و OpenMDW 1.0 بنیاد لینوکس منتشر کرد.[1][4]
در تحلیلی از Compendia Labs آمده است: «پیشبینی سریهای زمانی یکی از آخرین حوزههای یادگیری ماشین است که در آن شرکتها هنوز مدلها را بهصورت دستی برای هر مجموعه داده آموزش میدهند؛ همچنین حوزهای است که در آن عبارت 'وزنهای باز' اغلب در سکوت به معنای 'فقط برای تحقیق' است.» این مجوز منعطف، موانع قانونی برای استقرار این مدل ۳۸۵ میلیون پارامتری در محیطهای تجاری و درونسازمانی را برطرف میکند.[4]
بررسی عمیق دیدگاهها
تیمهای داده سازمانی
تمرکز بر آزادی عملیاتی ارائهشده توسط مجوزهای منعطف و استقرار محلی.
برای دپارتمانهای علم داده شرکتی، اصطکاک اصلی در پذیرش مدلهای پایه اغلب بیشتر قانونی است تا فنی. بسیاری از مدلهای «باز» دارای بندهای غیرتجاری هستند که از استفاده آنها در سیستمهای تولیدی جلوگیری میکند. با مجوز دوگانه PatchTST-FM-r2 تحت Apache 2.0 و OpenMDW 1.0، شرکت IBM به سازمانها اجازه میدهد تا مدل را در محیطهای امن خود میزبانی کنند. این امر تضمین میکند که دادههای عملیاتی حساس مانند حجم تراکنشهای مالی یا تلهمتری انحصاری هرگز نیازی به انتقال به یک API شخص ثالث ندارند.
محققان معماری هوش مصنوعی
برجسته کردن تغییر ساختاری از ترانسفورمرهای خالص به طراحیهای مبتنی بر کانفورمر.
محققان یادگیری ماشین به مکانیزمهای داخلی مدل بهعنوان مهمترین دستاورد آن اشاره میکنند. با جایگزینی بلوکهای استاندارد ترانسفورمر با بلوکهای کانفورمر، این معماری تایید میکند که دادههای سری زمانی به یک سوگیری استقرایی محلی قوی نیاز دارند. لایههای کانولوشن زمانی الگوهای فوری و کوتاهمدت را مدیریت میکنند، که این امر مکانیزم توجه را آزاد میگذارد تا روابط فصلی بلندمدت را در سراسر پنجره زمینه ۸۱۹۲ گامی ترسیم کند. این رویکرد ترکیبی مستقیماً در جایگاه بالای مدل در بنچمارک GIFT-Eval نقش دارد.
ارائهدهندگان زیرساخت جریانی
تاکید بر گذار از پردازش دستهای به استنتاج بلادرنگ روی جریانهای داده زنده.
مهندسان زیرساخت این مدل را بهعنوان یک کاتالیزور برای هوش عملیاتی بلادرنگ میبینند. از طریق ادغام با پلتفرمهایی مانند Confluent Cloud و Apache Flink، مدلهای پایه در حال خروج از محیطهای ایزوله علم داده و ورود مستقیم به پایپلاینهای داده زنده هستند. این امر به سیستمها اجازه میدهد تا تشخیص ناهنجاری و پیشبینی را روی سیگنالهای زنده تجاری مانند تلهمتری سنسورها یا فعالیتهای پرداخت اجرا کنند و اقدامات پاییندستی خودکار را پیش از آنکه یک فرآیند دستهای حتی رویداد را ثبت کند، آغاز نمایند.
نکات کلیدی
- شرکت IBM مدل Granite PatchTST-FM-r2 را که یک مدل پایه ۳۸۵ میلیون پارامتری برای پیشبینی سریهای زمانی است، منتشر کرد.
- این مدل بهصورت zero-shot عمل میکند و بدون نیاز به آموزش مجددِ مختص به وظیفه، روی دادههای ناآشنا پیشبینی تولید میکند.
- یک معماری بهروزشده کانفورمر، پنجرههای زمینه تاریخی را تا سقف ۸۱۹۲ گام پردازش میکند.
- این مدل ۹۹ چندک متمایز را خروجی میدهد و بهجای پیشبینیهای نقطهای واحد، محدودههای احتمالی ارائه میکند.
آنچه نمیدانیم
- عملکرد تعمیمیافته zero-shot این مدل در مقایسه با مدلهای بهشدت تنظیمشده و مختص به مجموعه داده در کاربردهای صنعتی خاص چگونه خواهد بود.
- آیا معماری کانفورمر برای وظایف سری زمانی بهطور کارآمدی تا تعداد پارامترهای میلیاردی مقیاسپذیر خواهد بود یا خیر.
- سربار محاسباتی پردازش پنجرههای زمینه ۸۱۹۲ گامی چگونه بر تاخیر بلادرنگ در محیطهای جریانی با توان عملیاتی بالا تاثیر میگذارد.
روند رویداد
نوامبر ۲۰۲۲
محققان معماری اولیه PatchTST را معرفی کرده و کارایی برداری کردن سریهای زمانی به وصلهها را نشان دادند.
۲۰۲۳
شرکت IBM نسل اول مدلهای پایه سری زمانی Granite خود از جمله PatchTST-FM-r1 را منتشر کرد.
۱ سپتامبر ۲۰۲۶
شرکتهای IBM و Confluent یک برنامه دسترسی زودهنگام راهاندازی کردند که مدلهای سری زمانی Granite را به جریانهای داده زنده میآورد.
۹ سپتامبر ۲۰۲۶
شرکت IBM مدل ۳۸۵ میلیون پارامتری PatchTST-FM-r2 را بهصورت باز تحت مجوزهای Apache 2.0 و OpenMDW 1.0 منتشر کرد.
- تیمهای داده سازمانی
- تمرکز بر آزادی عملیاتی ارائهشده توسط مجوزهای منعطف و استقرار محلی.
- محققان معماری هوش مصنوعی
- برجسته کردن تغییر ساختاری از ترانسفورمرهای خالص به طراحیهای مبتنی بر کانفورمر.
- ارائهدهندگان زیرساخت جریانی
- تاکید بر گذار از پردازش دستهای به استنتاج بلادرنگ روی جریانهای داده زنده.
دیدگاههایی که این گزارش پوشش نداده
- دانشمندان داده مستقل
- فروشندگان سیستمهای پیشبینی انحصاری
منابع
[1]Hugging Face Blogمحققان معماری هوش مصنوعیIBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
مطالعه در Hugging Face Blog →
[2]Unite.aiمحققان معماری هوش مصنوعیIBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model
مطالعه در Unite.ai →
[3]Superpower DailyIBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model
مطالعه در Superpower Daily →
[4]Compendia Labsتیمهای داده سازمانیIBM Granite PatchTST-FM-r2: Top Zero-Shot Forecasting Model Under Apache-2.0 — Dispatch
مطالعه در Compendia Labs →
[5]IBMارائهدهندگان زیرساخت جریانیIBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud
مطالعه در IBM →
[6]LinkLootارائهدهندگان زیرساخت جریانیIBM's Granite Time Series PatchTST-FM-r2 brings open weights, probabilistic forecasts, and a commercial-friendly dual license to zero-shot time-series forecasting
مطالعه در LinkLoot →
بیشتر در هوش مصنوعی
مشاهده همه →فشردهسازی مدل
چگونه هرس بدون ساختار، ۹۰ درصد از وزنهای یک مدل را بدون افت دقت حذف میکند
7 منبع
هوش مصنوعی سازمانی
اقتصاد لورا (LoRA): چگونه تنظیم دقیق با بهرهوری پارامتر، هوش مصنوعی سازمانی را دموکراتیزه میکند
6 منبع
فرآیند آنگستروم
معماری تراشه A16 تیاسامسی با انتقال برق از پشت برای پردازندههای هوش مصنوعی نسل بعد رونمایی شد
8 منبع
سختافزار هوش مصنوعی
اوپنایآی و جانی آیو برای دستگاه هوش مصنوعی بدون نمایشگر، فروش ۱۰۰ میلیونی در سال ۲۰۲۶ را هدف گرفتهاند
6 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





