انتشار مدل سری زمانی Granite PatchTST-FM-r2 توسط IBM با مجوز تجاری و قابلیت Zero-Shot
شرکت IBM یک مدل پایه سری زمانی با ۳۸۵ میلیون پارامتر منتشر کرده است که توانایی پیشبینی بدون نیاز به آموزش مجدد (zero-shot) و تشخیص ناهنجاری را دارد. این مدل با مجوز دوگانه برای استفاده تجاری عرضه شده و مستقیماً با پلتفرمهای دادههای جریانی ادغام میشود تا سیگنالهای زنده تجاری را پردازش کند.
به قلم ساناز امامی
این خبر را به اشتراک بگذارید
- تیمهای داده سازمانی
- تمرکز بر آزادی عملیاتی ارائهشده توسط مجوزهای منعطف و استقرار محلی.
- محققان معماری هوش مصنوعی
- برجسته کردن تغییر ساختاری از ترانسفورمرهای خالص به طراحیهای مبتنی بر کانفورمر.
- ارائهدهندگان زیرساخت جریانی
- تاکید بر گذار از پردازش دستهای به استنتاج بلادرنگ روی جریانهای داده زنده.
دیدگاههایی که این گزارش پوشش نداده
- دانشمندان داده مستقل
- فروشندگان سیستمهای پیشبینی انحصاری
چرا مهم است
پیشبینی سریهای زمانی، محرک اصلی تصمیمات حیاتی کسبوکارهاست؛ از مدیریت موجودی زنجیره تامین گرفته تا متعادلسازی بار سرورها. IBM با انتشار یک مدل قدرتمند zero-shot تحت مجوزی سازگار با تجارت، به شرکتها اجازه میدهد تا پیشبینیهای در سطح سازمانی را بهصورت محلی مستقر کنند و نیاز به آموزش دستی مدلهای سفارشی برای هر مجموعه داده جدید را از بین ببرند.
در ۹ سپتامبر ۲۰۲۶، شرکت IBM یک فایل safetensors با حجم ۳٫۰۷ گیگابایت را در پلتفرم Hugging Face Hub بارگذاری کرد و مدل سری زمانی Granite PatchTST-FM-r2 را در دسترس عموم قرار داد. این سیستم ۳۸۵ میلیون پارامتری همراه با وزنهای باز، پایپلاین استنتاج و کدهای بنچمارک قابلتکرار عرضه شد. این مدل که برای پیشبینی مقادیر آینده در دادههای نمونهبرداریشده منظم طراحی شده است، جریانهای کاری سازمانی مانند متعادلسازی بار انرژی، تقاضای خردهفروشی و تلهمتری ماشینآلات را هدف قرار میدهد.[1][4]
پیشبینی سریهای زمانی بر اندازهگیریهای مرتبشده متکی است؛ مانند فروش روزانه، مصرف ساعتی برق یا خوانش سنسورها در طول زمان. از نظر تاریخی، تیمهای علم داده مجبور بودهاند برای هر مجموعه داده خاص، یک مدل یادگیری ماشین مجزا را آموزش داده و نگهداری کنند. این رویکرد پراکنده، بار عملیاتی عظیمی را برای شرکتهایی که هزاران معیار متمایز را ردیابی میکنند، ایجاد میکند.[3]
تیم تحقیقاتی IBM در بیانیه انتشار خود نوشت: «مدلهای پایه سری زمانی در حال تغییر نحوه ساخت سیستمهای پیشبینی هستند. کاربران بهجای آموزش و نگهداری یک مدل مجزا برای هر مجموعه داده، میتوانند از یک مدل ازپیشآموزشدیده استفاده کرده و پیشبینیها را بهصورت zero-shot تولید کنند.»[1]
این مدل، دادهها را از طریق یک مکانیزم وصلهبندی (patching) پردازش میکند. PatchTST-FM-r2 بهجای خواندن تکتک نقاط داده، سریهای زمانی را به وصلههایی در سطح زیرسری برداری میکند. این سیستم از وصلههایی با ۵۰ درصد همپوشانی و وزندهی پنجره همینگ استفاده میکند تا مرزهای بین قطعات داده را هموار کرده و یک پیشبینی پیوسته ارائه دهد.[1][6]
معماری داخلی این مدل نشاندهنده یک تغییر قابلتوجه نسبت به نسخه قبلی خود، یعنی PatchTST-FM-r1 است. IBM بلوکهای استاندارد ترانسفورمر را با ۳۰ بلوک کانفورمر جایگزین کرد؛ طراحی خاصی که در ابتدا برای پردازش گفتار توسعه یافته بود.[2][6]
هر بلوک کانفورمر، یک مکانیزم توجه به خودِ چندسَره را با یک لایه کانولوشن زمانی احاطه میکند. جزء کانولوشن، ساختارهای زمانی کوتاهمدت و الگوهای محلی را ثبت میکند و مکانیزم توجه را آزاد میگذارد تا روی روابط بلندمدت در یک پنجره زمینه تاریخی تا سقف ۸۱۹۲ گام تمرکز کند.[2][6]
هر بلوک کانفورمر، یک مکانیزم توجه به خودِ چندسَره را با یک لایه کانولوشن زمانی احاطه میکند.
برای استقرارهای سازمانی، یک مقدار پیشبینیشده واحد بهندرت کافی است. مدل PatchTST-FM-r2 پیشبینیهای احتمالی تولید کرده و ۹۹ چندک متمایز را خروجی میدهد. این ویژگی به یک برنامهریز زنجیره تامین اجازه میدهد تا نقاط سفارش مجدد را بر اساس صدک ۹۰ام تقاضای موردانتظار تنظیم کند، نه اینکه به یک پیشبینی نقطهای خشک و انعطافناپذیر که عدم قطعیت را نادیده میگیرد، تکیه کند.[3][4]
انتشار این مدل با ادغام آن در پایپلاینهای داده زنده همزمان شده است. شرکتهای IBM و Confluent در ۱ سپتامبر ۲۰۲۶ یک برنامه دسترسی زودهنگام را راهاندازی کردند که مدلهای سری زمانی Granite را مستقیماً وارد Confluent Cloud میکند.[5]
از طریق Apache Flink SQL، تیمها میتوانند مدلهای پیشبینی و تشخیص ناهنجاری را روی جریانهای داده زنده فراخوانی کنند. نتایج استنتاج مجدداً در تاپیکهای Kafka نوشته میشوند و به مدل اجازه میدهند تا بر اساس وضعیت فعلی کسبوکار عمل کند، نه دادههای دستهای قدیمی.[5]
در بنچمارک GIFT-Eval که مدلها را در سناریوهای مختلف پیشبینی ارزیابی میکند، PatchTST-FM-r2 به میانگین هندسی امتیاز احتمال رتبهبندی پیوسته (CRPS) برابر با ۰٫۴۶۷ و خطای مقیاسشده مطلق میانگین (MASE) برابر با ۰٫۶۸۴۶ دست یافت.[1][2]
تا ۸ سپتامبر ۲۰۲۶، این امتیازات، مدل را در رتبه دوم کلی در میان مدلهای zero-shot قابلتکرار قرار میدهد و تنها پس از مدل TimesFM-3 گوگل ایستاده است.[1][2]
وجه تمایز تعیینکننده PatchTST-FM-r2 مجوز آن است. درحالیکه بسیاری از مدلهای با وزن باز دارای محدودیتهای غیرتجاری هستند، IBM این نسخه را با مجوز دوگانه تحت Apache 2.0 و OpenMDW 1.0 بنیاد لینوکس منتشر کرد.[1][4]
در تحلیلی از Compendia Labs آمده است: «پیشبینی سریهای زمانی یکی از آخرین حوزههای یادگیری ماشین است که در آن شرکتها هنوز مدلها را بهصورت دستی برای هر مجموعه داده آموزش میدهند؛ همچنین حوزهای است که در آن عبارت 'وزنهای باز' اغلب در سکوت به معنای 'فقط برای تحقیق' است.» این مجوز منعطف، موانع قانونی برای استقرار این مدل ۳۸۵ میلیون پارامتری در محیطهای تجاری و درونسازمانی را برطرف میکند.[4]
نکات کلیدی
- شرکت IBM مدل Granite PatchTST-FM-r2 را که یک مدل پایه ۳۸۵ میلیون پارامتری برای پیشبینی سریهای زمانی است، منتشر کرد.
- این مدل بهصورت zero-shot عمل میکند و بدون نیاز به آموزش مجددِ مختص به وظیفه، روی دادههای ناآشنا پیشبینی تولید میکند.
- یک معماری بهروزشده کانفورمر، پنجرههای زمینه تاریخی را تا سقف ۸۱۹۲ گام پردازش میکند.
- این مدل ۹۹ چندک متمایز را خروجی میدهد و بهجای پیشبینیهای نقطهای واحد، محدودههای احتمالی ارائه میکند.
- مجوز دوگانه تحت Apache 2.0 و OpenMDW 1.0 مسیر را برای استقرار تجاری نامحدود هموار میکند.
اصطلاحات کلیدی
- دادههای سری زمانی
- دنبالهای از نقاط داده که در فواصل زمانی متوالی و با فاصلههای مساوی جمعآوری یا ثبت میشوند، مانند فروش روزانه یا دمای ساعتی سرورها.
- یادگیری Zero-shot
- توانایی یک مدل یادگیری ماشین برای انجام یک وظیفه روی دادههایی که قبلاً هرگز ندیده است، بدون نیاز به آموزش اضافی.
- پیشبینی چندک (Quantile)
- یک رویکرد آماری که بهجای ارائه یک عدد تخمینی واحد، محدودهای از نتایج ممکن و احتمالات آنها را پیشبینی میکند.
- بلوک کانفورمر (Conformer)
- یک معماری شبکه عصبی که مکانیزمهای توجه به خود را با لایههای کانولوشن ترکیب میکند تا هم زمینه سراسری و هم الگوهای محلی را ثبت کند.
- امتیاز احتمال رتبهبندی پیوسته (CRPS)
- معیاری که برای ارزیابی دقت پیشبینیهای احتمالی استفاده میشود، جایی که امتیاز پایینتر نشاندهنده عملکرد بهتر است.
منابع
[1]Hugging Face Blogمحققان معماری هوش مصنوعیIBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
مطالعه در Hugging Face Blog →
[2]Unite.aiمحققان معماری هوش مصنوعیIBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model
مطالعه در Unite.ai →
[3]Superpower DailyIBM Releases Granite PatchTST-FM-R2 Zero-Shot Time Series Model
مطالعه در Superpower Daily →
[4]Compendia Labsتیمهای داده سازمانیIBM Granite PatchTST-FM-r2: Top Zero-Shot Forecasting Model Under Apache-2.0 — Dispatch
مطالعه در Compendia Labs →
[5]IBMارائهدهندگان زیرساخت جریانیIBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud
مطالعه در IBM →
[6]LinkLootارائهدهندگان زیرساخت جریانیIBM's Granite Time Series PatchTST-FM-r2 brings open weights, probabilistic forecasts, and a commercial-friendly dual license to zero-shot time-series forecasting
مطالعه در LinkLoot →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →واترمارک هوش مصنوعی
واترمارکهای نامرئی هوش مصنوعی واقعاً چگونه کار میکنند: پشتپردهی برچسبگذاری متون مصنوعی
5 منبع
معماری عامل
ترجمه چرخه اودا: عاملهای هوش مصنوعی خودکار چگونه مشاهده، جهتیابی، تصمیمگیری و اقدام میکنند
7 منبع
تولید ویدیو
چگونه لایههای توجه زمانی، پیوستگی فریمها را در تولید ویدیوی هوش مصنوعی تضمین میکنند
5 منبع
همسویی مدل
چگونه ترجیحات انسانی مدل پاداش را برای همسویی رفتار هوش مصنوعی آموزش میدهند
7 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





