ارزیابی رایانههای مجهز به NPU در مقابل معماریهای استاندارد برای بهروزرسانی ناوگان سازمانی
مقایسهای کمی بین واحدهای پردازش عصبی اختصاصی (NPU) و معماریهای سنتی CPU و GPU برای بارهای کاری محلی در محیطهای سازمانی.
به قلم غزل بختیاری
این خبر را به اشتراک بگذارید
- فروشندگان سختافزار
- تولیدکنندگان تراشه و توسعهدهندگان سیستم عامل که NPU را به عنوان یک پایه اجباری برای محاسبات آینده ترویج میکنند.
- منتقدان مستقل سختافزار
- تحلیلگران فنی که عملکرد واقعی به ازای هر وات و استفاده نرمافزاری از سیلیکون جدید را ارزیابی میکنند.
- خریداران فناوری اطلاعات سازمانی
- مدیران ناوگان که هزینههای سرمایهای را در مقابل دستاوردهای واقعی بهرهوری و الزامات امنیتی متعادل میکنند.
در تاریخ ۲۰ مه ۲۰۲۴، مایکروسافت با الزامی کردن واحد پردازش عصبی (NPU) با توان ۴۰ ترافلاپس (TOPS) برای نامگذاری «Copilot+»، تعریف پایه سختافزاری ویندوز را تغییر داد و چرخههای خرید سازمانی را یک شبه دگرگون کرد. پیش از آن تاریخ، لپتاپها برای انجام وظایف محاسباتی کاملاً به پردازندههای مرکزی و کارتهای گرافیک متکی بودند. معرفی یک بلوک سیلیکونی اختصاصی برای ضرب ماتریسی، بخشهای فناوری اطلاعات را مجبور کرد تا چرخههای بهروزرسانی سختافزاری خود را بازنگری کنند. اکنون، با آغاز فصل خرید ۲۰۲۶، مدیران ناوگان با بازاری متلاشی مواجه هستند: یا هزینه اضافی برای سیلیکون مجهز به NPU بپردازند، یا به معماریهای استانداردی که بهطور قابل اعتمادی جریانهای کاری سازمانی را پشتیبانی کردهاند، پایبند بمانند.[1]
زبان بازاریابی پیرامون این دستگاهها به شدت بر اصطلاح «رایانه شخصی هوش مصنوعی» (AI PC) تکیه دارد و جهشی اساسی در نحوه عملکرد رایانهها را القا میکند. در واقعیت، NPU صرفاً یک مدار مجتمع کاربرد-خاص (ASIC) است که برای انجام محاسبات ۸ بیتی صحیح (INT8) با کارایی بالا طراحی شده است. شبکههای عصبی، که فناوری زیربنایی یادگیری ماشین مدرن هستند، برای پردازش دادهها به میلیونها مورد از این محاسبات ساده نیاز دارند. در حالی که یک CPU استاندارد میتواند این محاسبات را انجام دهد، اما این کار را به شکلی ناکارآمد، با مصرف برق قابل توجه و تولید گرما انجام میدهد.[2][4]
قابلیت اصلی که NPU ارائه میدهد، عملکرد جدیدی نیست، بلکه بهرهوری انرژی برای بارهای کاری مداوم پسزمینه است. در وایتپیپر معماری Core Ultra اینتل آمده است: «NPU به طور خاص برای بارهای کاری هوش مصنوعی با شدت کم و مداوم طراحی شده است تا بار را از روی CPU و GPU بردارد و عمر باتری را حفظ کند.» هنگامی که کاربر پسزمینه خود را در یک تماس ویدیویی محو میکند، NPU میتواند مدل بینایی کامپیوتری را مدیریت کند در حالی که بین ۲ تا ۵ وات برق مصرف میکند. یک کارت گرافیک موبایل مجزا که دقیقاً همان کار را انجام میدهد، ممکن است بین ۲۰ تا ۱۱۵ وات برق بکشد و باتری لپتاپ را به سرعت تخلیه کند.[2]
با این حال، روایت کارایی هنگامی که در مورد بارهای کاری محاسباتی لحظهای (burst-compute)، مانند تولید متن از طریق یک مدل زبان بزرگ محلی، به کار میرود، دچار تزلزل میشود. NPUها از نظر وات به شدت کارآمد هستند، اما توان عملیاتی کلی آنها نسبتاً پایین است. در تستهای بنچمارک انجام شده توسط Puget Systems، تولید یک پاسخ ۵۰۰ کلمهای با استفاده از یک مدل ۸ میلیارد پارامتری، تقریباً ۱۵ ثانیه طول کشید. در حالی که یک GPU موبایل اختصاصی، همان دستور را در کمتر از ۲ ثانیه تکمیل کرد.
این اختلاف در زمان تکمیل، محاسبات انرژی را به طور اساسی تغییر میدهد. از آنجا که GPU کار را بیش از هفت برابر سریعتر به پایان میرساند، خیلی زودتر به حالت توان بیکار باز میگردد. کل انرژی مصرف شده به ازای هر توکن تولید شده اغلب بین دو پردازنده تقریباً یکسان است، که مزیت باتری NPU را برای وظایف تولید فعال از بین میبرد. NPU در کارهایی که به طور مداوم اجرا میشوند، مانند حذف نویز صوتی، عالی عمل میکند، اما در ارائه مزیت ملموس برای کارهایی که نیاز به انفجارهای محاسباتی فوری و عظیم دارند، دچار مشکل است.[5]
این اختلاف در زمان تکمیل، محاسبات انرژی را به طور اساسی تغییر میدهد.
پشتیبانی نرمافزاری همچنان مهمترین گلوگاه برای استفاده از NPU است. اکثر برنامههای سازمانی هنوز کامپایل نشدهاند تا مستقیماً این بلوکهای سیلیکونی جدید را هدف قرار دهند. در عوض، نرمافزار به لایههای انتزاعی مانند ONNX runtime یا Windows Machine Learning APIs متکی است. اگر برنامهای صراحتاً NPU را فراخوانی نکند، سیستم عامل به طور پیشفرض بار کاری را به GPU یا CPU هدایت میکند. در نتیجه، بسیاری از بخشهای فناوری اطلاعات در حال استقرار لپتاپهای مجهز به NPU هستند که در آنها سیلیکون اختصاصی در طول یک روز کاری استاندارد کاملاً بیکار میماند.[1][3]
محدودیتهای حافظه، استقرار بارهای کاری هوش مصنوعی محلی را پیچیدهتر میکند. مدلهای یادگیری ماشین برای کار کردن به مقادیر قابل توجهی حافظه سریع نیاز دارند. مشخصات Copilot+ مایکروسافت کف سخت ۱۶ گیگابایت رم را تعیین کرد، اما توسعهدهندگان و منتقدان سختافزار به طور مداوم اشاره میکنند که ۳۲ گیگابایت حداقل واقعبینانه برای اجرای مدلهای محلی در کنار برنامههای سازمانی استاندارد مانند مرورگرهای وب و مجموعههای بهرهوری است. ارتقاء یک ناوگان به ۳۲ گیگابایت رم اغلب افزایش هزینهای شدیدتر از خود NPU به همراه دارد.[1]
هزینه اضافی مالی برای سختافزار مجهز به NPU قابل اندازهگیری است. به طور متوسط، خریداران سازمانی ۱۵۰ تا ۳۰۰ دلار حق بیمه برای هر واحد لپتاپهایی که دارای جدیدترین پردازندههای Intel Core Ultra یا Qualcomm Snapdragon X Elite هستند، در مقایسه با سختافزار نسل قبلی که هنوز در دسترس است، میپردازند. برای ناوگانی متشکل از ۵۰۰۰ دستگاه، این افزایش هزینه سرمایهای تا ۱.۵ میلیون دلار را نشان میدهد که تقریباً به طور کامل با وعده قابلیتهای نرمافزاری آینده توجیه میشود، نه کاربرد فعلی.[3][5]
وابستگی به فروشنده (Vendor lock-in) خطر دیگری را برای پذیرندگان اولیه ایجاد میکند. ابزارهای نرمافزاری مورد استفاده برای بهینهسازی مدلها برای NPUها بسیار اختصاصی هستند. اینتل کیت ابزار OpenVINO خود را ترویج میکند، در حالی که کوالکام به موتور پردازش عصبی Snapdragon (SNPE) متکی است. یک سازمان که ابزارهای هوش مصنوعی محلی سفارشی را بهینهسازی شده برای NPU یک فروشنده میسازد، ممکن است متوجه شود که آن ابزارها عملکرد ضعیفی دارند یا اصلاً روی سختافزار رقیب اجرا نمیشوند، که انعطافپذیری خرید آینده را پیچیده میکند.[2][3]
قویترین استدلال برای اجرای محلی—و به تبع آن، سختافزار مورد نیاز برای پشتیبانی از آن—امنیت دادهها است. هنگامی که یک کارمند دادههای مالی حساس یا کدهای اختصاصی را در یک مدل زبان بزرگ مبتنی بر ابر (Cloud LLM) جایگذاری میکند، آن دادهها از محیط امن شرکت خارج میشوند. اجرای مدلهای کوچکتر به صورت محلی تضمین میکند که مالکیت فکری هرگز از شبکه عبور نمیکند. برای صنایع بسیار قانونگذاری شده مانند امور مالی و مراقبتهای بهداشتی، هزینه اضافی سختافزار به راحتی به عنوان یک هزینه امنیتی توجیه میشود تا یک بهبود بهرهوری.[4]
ارزیابی این مصالحه مستلزم تفکیک قابلیتهای عرضه شده از نقشه راه اعلام شده است. در حال حاضر، NPU یک جزء بسیار تخصصی برای صرفهجویی در مصرف باتری برای کنفرانس ویدیویی و پردازش صوتی است. هنوز یک شتابدهنده عمومی برای بهرهوری سازمانی نیست. خریداران باید هزینه اضافی فوری را در برابر احتمال بهروزرسانی پشته نرمافزاری خاص خود برای استفاده از محاسبات ماتریسی INT8 در طول عمر سه تا چهار ساله سختافزار، بسنجند.[5]
چرا مهم است
خریداران فناوری اطلاعات سازمانی در حال حاضر بر اساس وعدههای بازاریابی برای «آیندهنگری»، ۱۵۰ تا ۳۰۰ دلار حق بیمه برای هر واحد لپتاپ مجهز به NPU میپردازند. درک اینکه آیا بارهای کاری محلی واقعاً از این تراشهها استفاده میکنند یا خیر، تعیین میکند که آیا این هزینه اضافی بازدهی سرمایهگذاری دارد یا صرفاً بودجه هزینههای سرمایهای را هدر میدهد.
آنچه نمیدانیم
- نرمافزارفروشان مستقل با چه سرعتی برنامههای سازمانی قدیمی را بهروزرسانی میکنند تا مستقیماً سختافزار NPU را هدف قرار دهند.
- آیا مدلهای زبان بزرگ محلی آینده برای اجرا کارآمد بر روی NPUها بدون گلوگاههای شدید پهنای باند حافظه بهینهسازی خواهند شد.
منابع
[1]Microsoft Hardware Dev Centerفروشندگان سختافزارWindows Hardware Compatibility Program: Copilot+ PC Requirements
مطالعه در Microsoft Hardware Dev Center →
[2]Intel Technical Libraryفروشندگان سختافزارIntel Core Ultra Processor Architecture and NPU Specifications
مطالعه در Intel Technical Library →
[3]Qualcomm Developer Networkفروشندگان سختافزارSnapdragon X Elite Hexagon NPU Performance Guide
مطالعه در Qualcomm Developer Network →
[4]IEEE Xploreمنتقدان مستقل سختافزارPower Efficiency of Dedicated Neural Accelerators in Mobile Form Factors
مطالعه در IEEE Xplore →
[5]تیم سردبیری کوهستانخریداران فناوری اطلاعات سازمانیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
بیشتر در متا
مشاهده همه →معیارهای جستجو
لگاریتم در مبنای دویی که موتورهای جستجو را مجبور میکند صفحه اول را در اولویت قرار دهند
8 منبع
قوانین کار
چرا قانون کار ایران غربالگری سلامت روان کارکنان دولت را نادیده میگیرد؟
3 منبع
معماری پایگاه داده
چگونه OLTP سرعت نوشتن را به حداکثر میرساند، در حالی که OLAP برای تجمیع دادهها بهینهسازی شده است
5 منبع
ادبیات کلاسیک
مقایسه سبک شعری و مضامین فلسفی حافظ و سعدی: دو قله غزل فارسی
4 منبع
هر زاویه. هر روز.
دریافت متا اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





