رفتن به محتوای اصلی
توضیح کوهستانسخت‌افزار هوش مصنوعیتحلیل و توضیح۱۰ شهریور ۱۴۰۵، ۱۵:۵۰· 5 دقیقه مطالعه

سازوکار شتاب‌دهی هوش مصنوعی: مقایسه پردازنده‌های گرافیکی (GPU)، تنسور (TPU) و مدارهای مجتمع خاص منظوره (ASIC) برای آموزش و استنتاج

در حالی که پردازنده‌های گرافیکی (GPU) در حال حاضر بر فضای هوش مصنوعی مسلط هستند، ریاضیات زیربنایی شبکه‌های عصبی، صنعت را به سمت سخت‌افزارهای تخصصی سوق می‌دهد. درک تفاوت‌های معماری بین GPUها، TPUها و ASICهای سفارشی نشان می‌دهد که چگونه این صنعت در حال معاوضه انعطاف‌پذیری با کارایی محاسباتی خام است.

به قلم آرش رضایی

طرفداران سخت‌افزار عمومی 40%توسعه‌دهندگان سیلیکون سفارشی 40%طرفداران محاسبات لبه 20%
طرفداران سخت‌افزار عمومی
استدلال می‌کنند که سرعت بالای تحقیقات هوش مصنوعی، ASICهای تخصصی را بسیار پرخطر می‌سازد و انعطاف‌پذیری GPUها را در اولویت قرار می‌دهند.
توسعه‌دهندگان سیلیکون سفارشی
استدلال می‌کنند که محدودیت‌های برق و حرارت، GPUها را برای استنتاج در مقیاس جهانی ناپایدار می‌سازد و ASICهای سفارشی را ضروری می‌کند.
طرفداران محاسبات لبه
بر آوردن هوش مصنوعی به دستگاه‌های مصرف‌کننده تمرکز دارند، جایی که ASICها تنها راه برای برآورده کردن محدودیت‌های سخت باتری هستند.

چرا مهم است

با افزایش مقیاس مدل‌های هوش مصنوعی به تریلیون‌ها پارامتر، محدودیت‌های فیزیکی برق و خنک‌سازی به گلوگاه‌های اصلی پیشرفت تبدیل شده‌اند. گذار از GPUهای عمومی به ASICهای فوق تخصصی تعیین می‌کند که کدام شرکت‌ها توانایی مالی برای استقرار هوش مصنوعی نسل بعدی را دارند و آیا این فناوری می‌تواند به طور کارآمد روی دستگاه‌های مصرف‌کننده اجرا شود یا خیر.

تصور رایج این است که «تراشه هوش مصنوعی» صرفاً نسخه‌ای بسیار قدرتمندتر از پردازنده‌ای است که درون یک لپ‌تاپ استاندارد قرار دارد. در واقع، پردازنده‌هایی که رونق هوش مصنوعی را هدایت می‌کنند، لزوماً از CPUهای سنتی باهوش‌تر نیستند؛ بلکه به طرز عمیقی ساده‌ترند، اما هزاران واحد از آن‌ها به صورت هماهنگ کار می‌کنند. داستان شتاب‌دهی هوش مصنوعی در مورد ساخت یک ماشین حساب سریع‌تر نیست، بلکه در مورد طراحی مجدد اساسی نحوه حرکت داده‌ها در سیلیکون برای حل یک مشکل ریاضی خاص است: ضرب ماتریسی.[3][6]

برای درک اینکه چرا سخت‌افزار تخصصی ضروری است، باید به واحد پردازش مرکزی سنتی (CPU) نگاه کرد. CPU یک متخصص عمومی است که برای اجرای سریع دستورالعمل‌های پیچیده و متوالی طراحی شده است. این واحد شبیه یک سرآشپز ماهر است که می‌تواند هر غذایی را به بهترین شکل بپزد، اما تنها یک غذا را در یک زمان. هنگامی که وظیفه آموزش یک شبکه عصبی به آن محول می‌شود، که نیازمند میلیون‌ها عملیات حسابی ساده به طور همزمان است، CPU به یک گلوگاه جدی تبدیل می‌شود.[3][5]

واحدهای پردازش گرافیکی (GPU) در ابتدا برای رندر کردن گرافیک بازی‌های ویدیویی با محاسبه همزمان رنگ میلیون‌ها پیکسل طراحی شدند. این معماری که به عنوان «یک دستور، داده‌های چندگانه» (SIMD) شناخته می‌شود، دقیقاً همان چیزی بود که یادگیری عمیق به آن نیاز داشت. یک GPU مدرن شامل ده‌ها هزار هسته ساده است. اگر CPU یک سرآشپز ماهر باشد، GPU ارتشی از کارگران فست‌فود است: هر کدام به تنهایی توانایی کمتری دارند، اما می‌توانند در زمانی که سرآشپز یک غذا آماده می‌کند، ده هزار همبرگر تولید کنند.[1][5]

با این حال، GPUها با یک محدودیت فیزیکی به نام «دیوار حافظه» روبرو هستند. در حجم کاری هوش مصنوعی، محاسبه واقعی – یعنی ضرب دو عدد در یکدیگر – فوق‌العاده سریع است، اما بازیابی آن اعداد از حافظه تراشه زمان می‌برد و مقادیر زیادی انرژی مصرف می‌کند. GPU همچنان به یک معماری سنتی متکی است که در آن داده‌ها باید دائماً بین ثبات‌های حافظه و هسته‌های محاسباتی جابه‌جا شوند و این امر باعث ایجاد ترافیک سنگین روی سیلیکون می‌شود.[1][4]

معاوضه بین انعطاف‌پذیری و کارایی، چشم‌انداز سخت‌افزار هوش مصنوعی را تعریف می‌کند.

این ناکارآمدی باعث شد گوگل واحد پردازش تنسور (TPU) را توسعه دهد. برخلاف GPU، که هنوز به اندازه کافی انعطاف‌پذیر است تا گرافیک رندر کند یا ارز دیجیتال استخراج کند، TPU یک مدار مجتمع خاص منظوره (ASIC) است که منحصراً برای ریاضیات تنسور زیربنای شبکه‌های عصبی طراحی شده است. این واحد، تطبیق‌پذیری گسترده GPU را با کارایی فوق‌العاده در یک حوزه خاص معاوضه می‌کند.[2][4]

نوآوری اصلی TPU، «آرایه سیستولیک» (Systolic Array) است. به جای بازیابی داده‌ها از حافظه برای هر محاسبه، TPU داده‌ها را از طریق یک شبکه عظیم از واحدهای منطق و محاسبات (ALU) – که اغلب ۲۵۶ در ۲۵۶ واحد عرض دارند – پمپاژ می‌کند. همانطور که داده‌ها مانند جریان خون در قلب از این شبکه عبور می‌کنند، هر ALU یک محاسبه را انجام داده و نتیجه را مستقیماً به همسایه خود منتقل می‌کند. این امر دسترسی به حافظه را به شدت کاهش می‌دهد، در مصرف انرژی صرفه‌جویی کرده و توان عملیاتی را افزایش می‌دهد.[2][5]

آرایه‌های سیستولیک به TPUها اجازه می‌دهند داده‌ها را مستقیماً بین واحدهای محاسباتی منتقل کنند و از دیوار حافظه عبور کنند.
به جای بازیابی داده‌ها از حافظه برای هر محاسبه، TPU داده‌ها را از طریق یک شبکه عظیم از واحدهای منطق و محاسبات (ALU) – که اغلب ۲۵۶ در ۲۵۶ واحد عرض دارند – پمپاژ می‌کند.

الزامات سخت‌افزاری برای هوش مصنوعی به وضوح به دو فاز تقسیم می‌شوند: آموزش (Training) و استنتاج (Inference). آموزش یک مدل شبیه ساختن یک مغز است. این کار مستلزم پردازش تریلیون‌ها کلمه یا تصویر و به‌روزرسانی مداوم وزن‌های داخلی مدل است. این فاز به انعطاف‌پذیری شدید و ریاضیات با دقت بالا، معمولاً اعداد ممیز شناور ۱۶ بیتی یا ۳۲ بیتی، نیاز دارد، زیرا مدل دائماً در حال تنظیم پارامترهای خود است.[1][3]

GPUها در حال حاضر بر فاز آموزش تسلط دارند زیرا ماهیت قابل برنامه‌ریزی آن‌ها به محققان اجازه می‌دهد تا معماری‌های جدید مدل را آزمایش کنند. اگر یک آزمایشگاه تحقیقاتی راه جدیدی برای ساختاردهی یک شبکه عصبی ابداع کند، یک GPU می‌تواند برای اجرای آن مجدداً برنامه‌ریزی شود. اما یک ASIC که برای یک معماری خاص سیم‌کشی شده است، برای هر چیز دیگری بی‌فایده خواهد بود.[1][4]

از سوی دیگر، استنتاج (Inference) عمل استفاده از مدل آموزش‌دیده برای تولید پاسخ است. این فرآیند تنها یک گذر رو به جلو است و وزن‌ها ثابت شده‌اند. استنتاج به دقت ریاضی مشابه آموزش نیاز ندارد. مدل‌ها می‌توانند «کوانتیزه» شوند – یعنی فشرده‌سازی شوند تا از اعداد صحیح ۸ بیتی یا حتی ۴ بیتی استفاده کنند – بدون اینکه کیفیت خروجی به طور قابل توجهی کاهش یابد.[3][5]

از آنجایی که استنتاج یک وظیفه ثابت و تکراری است، هدف ایده‌آلی برای ASICهای سفارشی محسوب می‌شود. یک ASIC معماری خاص شبکه عصبی را مستقیماً در سیلیکون سیم‌کشی می‌کند. با حذف تمام منطق کنترلی مورد نیاز برای انعطاف‌پذیری، یک ASIC می‌تواند تقریباً تمام بودجه ترانزیستوری خود را به محاسبات خالص اختصاص دهد و در نتیجه، به دستاوردهای کارایی عظیمی منجر شود.[2][4]

ASICهای سفارشی، افزایش کارایی عظیم در مصرف انرژی برای استنتاج ارائه می‌دهند، مشروط بر اینکه معماری مدل بدون تغییر باقی بماند.

این معاوضه بسیار سخت است: یک ASIC ممکن است برای اجرای یک مدل خاص بسیار کم‌مصرف‌تر از GPU باشد، اما اگر صنعت هوش مصنوعی فردا یک معماری ریاضی جدید اختراع کند، آن ASIC به یک وزنه‌کاغذ گران‌قیمت تبدیل می‌شود. یک GPU می‌تواند به سادگی یک به‌روزرسانی نرم‌افزاری جدید دانلود کند؛ در حالی که یک ASIC باید به صورت فیزیکی بازطراحی و تولید شود، فرآیندی که سال‌ها و ده‌ها میلیون دلار هزینه دارد.[1][2][4]

آرایه‌های گیت قابل برنامه‌ریزی میدانی (FPGAs) یک راه حل میانی در این نبرد معماری ارائه می‌دهند. آن‌ها مدارهای مجتمعی هستند که گیت‌های منطقی داخلی‌شان می‌توانند پس از تولید توسط کاربر پیکربندی مجدد شوند. اگرچه FPGAها به اندازه یک ASIC خالص سریع یا به اندازه یک GPU در دسترس نیستند، اما به مهندسان سخت‌افزار اجازه می‌دهند تا تراشه را به صورت فیزیکی برای مطابقت با یک مدل هوش مصنوعی جدید، بدون نیاز به انتظار برای یک چرخه ساخت جدید، بازسیم‌کشی کنند.[1][3]

تفاوت‌های معماری، اقتصاد صنعت هوش مصنوعی را دیکته می‌کنند. شرکت‌های بزرگ مقیاس (Hyperscalers) به شدت انگیزه دارند تا حجم کاری استنتاج را از GPUهای گران‌قیمت به ASICهای سفارشی خود منتقل کنند تا هزینه‌های سرسام‌آور برق برای ارائه خدمات هوش مصنوعی به میلیون‌ها کاربر را کاهش دهند. با تثبیت معماری بنیادی مدل‌ها، ریسک مالی قفل کردن این طراحی‌ها در ASICهای سیم‌کشی شده کاهش می‌یابد و راه را برای تراشه‌های فوق‌کارآمدی که در همه جا، از مراکز داده عظیم گرفته تا تلفن‌های هوشمند مصرف‌کننده، مستقر می‌شوند، هموار می‌کند.[4][5][6]

نکات کلیدی

  • شتاب‌دهی هوش مصنوعی متکی بر پردازش موازی برای انجام همزمان میلیون‌ها عملیات ضرب ماتریسی است.
  • GPUها بر آموزش هوش مصنوعی تسلط دارند زیرا تعادلی بین محاسبات موازی عظیم و انعطاف‌پذیری نرم‌افزاری ارائه می‌دهند.
  • TPUها از آرایه‌های سیستولیک برای انتقال مستقیم داده‌ها بین واحدهای محاسباتی استفاده می‌کنند و از «دیوار حافظه» پرمصرف عبور می‌کنند.
  • ASICها برای وظایف خاص سیم‌کشی شده‌اند و کارایی فوق‌العاده‌ای برای استنتاج ارائه می‌دهند، اما هیچ انعطاف‌پذیری برای معماری‌های جدید ندارند.
  • صنعت هوش مصنوعی در حال دوشاخه شدن است: GPUها برای آموزش مدل‌های پیشرو، و ASICهای سفارشی برای اجرای کارآمد آن‌ها در مقیاس بزرگ.

آنچه نمی‌دانیم

  • اینکه آیا معماری ترنسفورمر به اندازه کافی غالب خواهد ماند تا سرمایه‌گذاری هنگفت فعلی در ASICهای سفارشی را توجیه کند.
  • با چه سرعتی پارادایم‌های سخت‌افزاری جایگزین، مانند محاسبات نوری یا تراشه‌های آنالوگ، ممکن است اکوسیستم فعلی مبتنی بر سیلیکون را مختل کنند.
  • نقطه دقیقی که در آن محدودیت‌های فیزیکی کوچک‌سازی سیلیکون، افزایش کارایی تراشه‌های تخصصی هوش مصنوعی را متوقف خواهد کرد.

اصطلاحات کلیدی

SIMD (Single Instruction, Multiple Data)
یک معماری پردازشی که در آن یک دستور واحد به طور همزمان روی چندین نقطه داده اجرا می‌شود و به شدت توسط GPUها مورد استفاده قرار می‌گیرد.
Systolic Array
شبکه‌ای از واحدهای محاسباتی که داده‌ها را در یک جریان ریتمیک مستقیماً به یکدیگر منتقل می‌کنند و نیاز به دسترسی مداوم به حافظه اصلی را به حداقل می‌رسانند.
Inference
فازی که در آن یک مدل هوش مصنوعی کاملاً آموزش‌دیده برای تولید پیش‌بینی‌ها، متن یا تصاویر بر اساس ورودی‌های جدید کاربر مستقر می‌شود.
Quantization
فرآیند فشرده‌سازی یک مدل هوش مصنوعی با کاهش دقت ریاضی وزن‌های آن، که امکان اجرای سریع‌تر و مصرف حافظه کمتر را فراهم می‌کند.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

طرفداران سخت‌افزار عمومی 40%توسعه‌دهندگان سیلیکون سفارشی 40%طرفداران محاسبات لبه 20%
  1. [1]NextPCBطرفداران سخت‌افزار عمومی

    GPU vs TPU vs ASIC vs FPGA: Which AI Chip Dominates in 2027?

    مطالعه در NextPCB
  2. [2]NextPCBطرفداران سخت‌افزار عمومی

    What Is an AI ASIC? TPU vs GPU vs ASIC for Machine Learning Workloads

    مطالعه در NextPCB
  3. [3]TechTargetطرفداران سخت‌افزار عمومی

    A guide to AI chip architectures

    مطالعه در TechTarget
  4. [4]Compute Collegeتوسعه‌دهندگان سیلیکون سفارشی

    GPU vs TPU vs Custom ASIC Compared

    مطالعه در Compute College
  5. [5]Directed Researchتوسعه‌دهندگان سیلیکون سفارشی

    A Deep Dive into AI Chip Architectures

    مطالعه در Directed Research
  6. [6]تیم سردبیری کوهستانطرفداران محاسبات لبه

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.