چگونه مدلهای هوش مصنوعی محلی روی سختافزار معمولی اجرا میشوند: سازوکار کوانتیزیشن
کوانتیزیشن (کوانتومسازی) با کاهش دقت ریاضی مدلهای زبانی عظیم، آنها را فشرده میکند و این امکان را فراهم میسازد که هوش مصنوعی قدرتمند به طور کامل و آفلاین روی لپتاپهای مصرفکننده استاندارد اجرا شود.
به قلم آرش رضایی
این خبر را به اشتراک بگذارید
- حامیان متنباز
- استدلال میکنند که استنتاج محلی، دسترسی به هوش مصنوعی را دموکراتیزه کرده و از انحصار شرکتها جلوگیری میکند.
- متخصصان حریم خصوصی
- تأکید میکنند که اجرای محلی مدلها، حاکمیت مطلق دادهها را تضمین میکند.
- ارائهدهندگان زیرساخت ابری
- معتقدند که هوش مصنوعی در مقیاس تولیدی همچنان به مراکز داده متمرکز نیاز دارد.
آنچه نمیدانیم
- اینکه آیا معماریهای سختافزاری آینده با افزایش چشمگیر پهنای باند حافظه پایه، کوانتیزیشن را غیرضروری خواهند کرد یا خیر.
- تکنیکهای کوانتیزیشن ۱ بیتی و ۲ بیتی تا چه حد میتوانند بدون تخریب کامل قابلیتهای استدلالی مدل، مقیاسپذیر باشند.
هوش مصنوعی شیوه کار ما را متحول کرده است، اما اتکا به مدلهای مبتنی بر فضای ابری با محدودیتهای قابل توجهی همراه است. هر دستوری که به یک سرور متمرکز ارسال میشود، شامل یک ریزتراکنش است، به اتصال دائمی اینترنت نیاز دارد و کاربران را مجبور میکند دادههای بالقوه حساس خود را به شخص ثالثی بسپارند. اجرای مستقیم یک مدل زبان بزرگ روی لپتاپ شخصی این مشکلات را حل میکند و قابلیت آفلاین و حریم خصوصی کامل را ارائه میدهد. با این حال، حجم عظیم ریاضی این مدلها یک مانع فیزیکی بزرگ برای سختافزارهای مصرفکننده استاندارد ایجاد میکند.
برای درک مقیاس این مشکل، ردپای حافظه یک مدل استاندارد و بسیار توانمند را در نظر بگیرید که حاوی هشت میلیارد پارامتر است. این مدل در حالت خام و فشردهنشده، تقریباً ۱۶ گیگابایت حافظه دسترسی تصادفی ویدئویی (VRAM) نیاز دارد تا فقط در حافظه بارگذاری شود، چه رسد به تولید متن.[4]
این نیاز اولیه فوراً اکثریت قریب به اتفاق لپتاپها و دسکتاپهای مصرفکننده را از دور خارج میکند. اکثر دستگاههای استاندارد با ۸ یا ۱۶ گیگابایت حافظه کلی سیستم عرضه میشوند که باید با سیستم عامل و سایر برنامهها به اشتراک گذاشته شود و فضای کافی برای میزبانی یک موتور استدلالی در سطح پیشرفته باقی نمیماند.
راهحل این گلوگاه سختافزاری، یک تکنیک فشردهسازی ریاضی است که به عنوان کوانتیزیشن (Quantization) شناخته میشود. این سازوکار نامرئی است که هوش مصنوعی محلی را امکانپذیر میسازد و به شبکههای عصبی عظیم اجازه میدهد کوچک شوند و به طور مؤثر روی دستگاههایی که مردم از قبل دارند، اجرا شوند.
در هسته خود، یک مدل زبان بزرگ، پایگاه دانش عظیم خود را به صورت میلیاردها مقدار عددی به نام «وزنها» (Weights) ذخیره میکند. در طول مرحله آموزش اولیه در مراکز داده عظیم، این وزنها در قالبی با دقت بالا ذخیره میشوند که معمولاً اعداد ممیز شناور ۳۲ بیتی (FP32) یا ۱۶ بیتی (FP16) هستند.[1][2]
این دقت شدید در طول آموزش کاملاً ضروری است تا ظرافتهای میکروسکوپی و دقیق زبان و منطق انسانی را به تصویر بکشد. با این حال، هنگامی که مدل به طور کامل آموزش دیده و برای استنتاج (Inference) مستقر میشود—مرحلهای که در آن واقعاً دستورات را میخواند و متن تولید میکند—آن سطح از دقت تبدیل به یک بار عملیاتی میشود.[2]
کوانتیزیشن به طور سیستماتیک دقت این وزنها را کاهش میدهد و آنها را از ممیز شناور ۱۶ بیتی به اعداد صحیح بسیار کوچکتر ۸ بیتی یا ۴ بیتی (INT8 یا INT4) نگاشت میکند. مدل مجبور میشود محاسبات داخلی خود را به نزدیکترین عدد صحیح موجود در محدوده بسیار کوچکتری از گزینهها گرد کند.[1]
این فرآیند از نظر مفهومی مشابه فشردهسازی یک عکس RAW با وضوح بالا به یک فایل JPEG استاندارد است. حجم فایل به شدت کاهش مییابد و در حالی که مقداری از دادههای سطح پیکسل به طور دائمی در این تبدیل از دست میرود، تصویر حاصل از نظر بصری برای چشم انسان غیرقابل تشخیص باقی میماند.[4]
این فرآیند از نظر مفهومی مشابه فشردهسازی یک عکس RAW با وضوح بالا به یک فایل JPEG استاندارد است.
با کاهش تعداد بیتهایی که باید برای هر محاسبه پردازش شوند، کوانتیزیشن به طور همزمان به دو بهینهسازی حیاتی دست مییابد. اول، ردپای حافظه فیزیکی مدل را به شدت کوچک میکند و دوم، سرعتی را که سختافزار میتواند هر کلمه جدید را تولید کند، به طور قابل توجهی افزایش میدهد.[1]
پیشرفتی که این تکنیک را به جریان اصلی آورد، ایجاد llama.cpp بود، یک کتابخانه متنباز C++ که توسط مهندس نرمافزار، گئورگی گرگانوف (Georgi Gerganov)، توسعه یافت. این پروژه که در ابتدا برای اجرای مدل LLaMA متا روی مکبوکهای استاندارد بدون کارت گرافیک اختصاصی طراحی شده بود، اساساً چشمانداز هوش مصنوعی را تغییر داد.[5][6]
در کنار این کتابخانه نرمافزاری، جامعه توسعهدهندگان، نوع فایل GGUF (فرمت یکپارچه تولید شده توسط GPT) را توسعه دادند. GGUF به استاندارد بالفعل برای استنتاج محلی تبدیل شد، زیرا به رایانه اجازه میدهد بار محاسباتی را به طور هوشمندانه بین سختافزار موجود خود تقسیم کند.[5]
هنگامی که یک مدل GGUF بارگذاری میشود، سیستم میتواند تا حد امکان لایههای شبکه عصبی را به واحد پردازش گرافیکی (GPU) پرسرعت منتقل کند، در حالی که لایههای باقیمانده را به طور یکپارچه به واحد پردازش مرکزی (CPU) استاندارد اختصاص میدهد. این رویکرد ترکیبی تضمین میکند که حتی دستگاههای فاقد کارت گرافیک پیشرفته نیز میتوانند در انقلاب هوش مصنوعی مشارکت کنند.[6]
با این حال، کوانتیزیشن اساساً یک بازی مصالحه است. توسعهدهندگان از این موضوع به عنوان «مثلث کوانتیزیشن» یاد میکنند: کاربر باید دائماً بین مصرف VRAM، سرعت تولید و دقت مدل تعادل برقرار کند، با این آگاهی که بهینهسازی یکی ناگزیر دیگری را کاهش میدهد.[3]
برای اکثریت قریب به اتفاق کاربران، سطح کوانتیزیشن ۴ بیتی—به طور خاص نوعی که به عنوان Q4_K_M شناخته میشود—نقطه بهینه پارِتو (Pareto-optimal) را نشان میدهد. این سطح بهترین تعادل ممکن بین فشردهسازی و قابلیت را ارائه میدهد.[3][4]
در سطح Q4_K_M، یک مدل استاندارد ۷ میلیارد پارامتری از حجم زیاد ۱۴ گیگابایت به ۴.۵ گیگابایت بسیار قابل مدیریت کاهش مییابد. با وجود این کاهش عظیم در اندازه، مدل تقریباً ۹۵ تا ۹۷ درصد از قابلیتهای استدلالی با دقت کامل خود را حفظ میکند.[3]
این نسبت فشردهسازی خاص، آستانهای است که هوش مصنوعی محلی را واقعاً در دسترس قرار میدهد. این بدان معناست که یک لپتاپ مدرن استاندارد با ۸ گیگابایت حافظه یکپارچه میتواند به راحتی مدل را بارگذاری کند، سیستم عامل را اجرا کند و متن را به سرعت و بدون از کار افتادن تولید نماید.[4]
برای کاربرانی که وظایف بسیار ساختاریافته و حساس به دقت مانند کدنویسی پیشرفته یا ریاضیات پیچیده را انجام میدهند، ارتقا به کوانتیزیشن ۸ بیتی (Q8_0) عملکردی تقریباً بدون افت کیفیت ارائه میدهد. اگرچه این کار نیاز VRAM را در مقایسه با ۴ بیتی دو برابر میکند، اما خطاهای منطقی نادری را که توسط فشردهسازی سنگین ایجاد میشوند، از بین میبرد.[3][4]
در نهایت، کوانتیزیشن سازوکاری است که هوش مصنوعی را دموکراتیزه میکند. با شکستن اتکای مطلق به هایپراسکیلرهای متمرکز و محاسبات ابری گرانقیمت، موتورهای استدلالی قدرتمند، خصوصی و آفلاین را مستقیماً در اختیار کاربران روزمره قرار میدهد.[7]
نکات کلیدی
- کوانتیزیشن مدلهای عظیم هوش مصنوعی را با کاهش دقت عددی وزنهای داخلی آنها فشرده میکند.
- این فشردهسازی به مدلهای زبان بزرگ اجازه میدهد تا به طور کامل و آفلاین روی لپتاپهای مصرفکننده استاندارد اجرا شوند.
- سطح کوانتیزیشن ۴ بیتی (Q4_K_M) تقریباً ۹۵ درصد از کیفیت مدل را حفظ میکند در حالی که ردپای حافظه آن را نزدیک به ۷۰ درصد کاهش میدهد.
- استنتاج محلی هوش مصنوعی، حریم خصوصی کامل دادهها را تضمین میکند، زیرا دستورات حساس هرگز دستگاه کاربر را ترک نمیکنند.
- کتابخانه متنباز llama.cpp و فرمت فایل GGUF فناوریهای اساسی هستند که این تحول را ممکن میسازند.
چرا مهم است
اجرای محلی هوش مصنوعی، حریم خصوصی کامل دادهها را تضمین میکند، هزینههای اشتراک ماهانه را حذف مینماید و به کاربران اجازه میدهد بدون اتکا به ارائهدهندگان ابری متمرکز، برنامههای آفلاین بسازند.
اصطلاحات کلیدی
- کوانتیزیشن (Quantization)
- فرآیند کاهش دقت عددی وزنهای یک مدل هوش مصنوعی برای صرفهجویی در حافظه و افزایش سرعت.
- VRAM (حافظه دسترسی تصادفی ویدئویی)
- حافظه تخصصی روی کارت گرافیک که برای ذخیره و پردازش دادههای پیچیده مانند مدلهای هوش مصنوعی استفاده میشود.
- FP۱۶ (ممیز شناور ۱۶ بیتی)
- یک قالب عددی با دقت بالا که معمولاً در طول آموزش مدلهای هوش مصنوعی استفاده میشود.
- INT۴ (عدد صحیح ۴ بیتی)
- یک قالب عددی بسیار فشرده که در مدلهای کوانتیزهشده برای کاهش شدید حجم فایل استفاده میشود.
- llama.cpp
- یک کتابخانه نرمافزاری متنباز که به مدلهای زبان بزرگ اجازه میدهد تا به طور کارآمد روی سختافزار مصرفکننده اجرا شوند.
منابع
[1]IBMارائهدهندگان زیرساخت ابریWhat is quantization?
مطالعه در IBM →
[2]TensorWaveارائهدهندگان زیرساخت ابریLLM Quantization Explained
مطالعه در TensorWave →
[3]KunalGanglani.comحامیان متنبازLLM Quantization Levels Compared: Q4_K_M vs Q8_0 vs FP16
مطالعه در KunalGanglani.com →
[4]Micro Centerارائهدهندگان زیرساخت ابریWhat is LLM quantization and why does it matter?
مطالعه در Micro Center →
[5]Wikipediaحامیان متنبازllama.cpp
مطالعه در Wikipedia →
[6]GitHubحامیان متنبازggml-org/llama.cpp
مطالعه در GitHub →
[7]تیم سردبیری کوهستانمتخصصان حریم خصوصیتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.


