رفتن به محتوای اصلی
توضیح کوهستانهوش مصنوعی محلیتوضیح و تشریح۶ شهریور ۱۴۰۵، ۳:۲۳· 5 دقیقه مطالعه· در هوش مصنوعی

چگونه مدل‌های هوش مصنوعی محلی روی سخت‌افزار معمولی اجرا می‌شوند: سازوکار کوانتیزیشن

کوانتیزیشن (کوانتوم‌سازی) با کاهش دقت ریاضی مدل‌های زبانی عظیم، آن‌ها را فشرده می‌کند و این امکان را فراهم می‌سازد که هوش مصنوعی قدرتمند به طور کامل و آفلاین روی لپ‌تاپ‌های مصرف‌کننده استاندارد اجرا شود.

به قلم آرش رضایی

حامیان متن‌باز 40%متخصصان حریم خصوصی 35%ارائه‌دهندگان زیرساخت ابری 25%
حامیان متن‌باز
استدلال می‌کنند که استنتاج محلی، دسترسی به هوش مصنوعی را دموکراتیزه کرده و از انحصار شرکت‌ها جلوگیری می‌کند.
متخصصان حریم خصوصی
تأکید می‌کنند که اجرای محلی مدل‌ها، حاکمیت مطلق داده‌ها را تضمین می‌کند.
ارائه‌دهندگان زیرساخت ابری
معتقدند که هوش مصنوعی در مقیاس تولیدی همچنان به مراکز داده متمرکز نیاز دارد.

آنچه نمی‌دانیم

  • اینکه آیا معماری‌های سخت‌افزاری آینده با افزایش چشمگیر پهنای باند حافظه پایه، کوانتیزیشن را غیرضروری خواهند کرد یا خیر.
  • تکنیک‌های کوانتیزیشن ۱ بیتی و ۲ بیتی تا چه حد می‌توانند بدون تخریب کامل قابلیت‌های استدلالی مدل، مقیاس‌پذیر باشند.

هوش مصنوعی شیوه کار ما را متحول کرده است، اما اتکا به مدل‌های مبتنی بر فضای ابری با محدودیت‌های قابل توجهی همراه است. هر دستوری که به یک سرور متمرکز ارسال می‌شود، شامل یک ریزتراکنش است، به اتصال دائمی اینترنت نیاز دارد و کاربران را مجبور می‌کند داده‌های بالقوه حساس خود را به شخص ثالثی بسپارند. اجرای مستقیم یک مدل زبان بزرگ روی لپ‌تاپ شخصی این مشکلات را حل می‌کند و قابلیت آفلاین و حریم خصوصی کامل را ارائه می‌دهد. با این حال، حجم عظیم ریاضی این مدل‌ها یک مانع فیزیکی بزرگ برای سخت‌افزارهای مصرف‌کننده استاندارد ایجاد می‌کند.

برای درک مقیاس این مشکل، ردپای حافظه یک مدل استاندارد و بسیار توانمند را در نظر بگیرید که حاوی هشت میلیارد پارامتر است. این مدل در حالت خام و فشرده‌نشده، تقریباً ۱۶ گیگابایت حافظه دسترسی تصادفی ویدئویی (VRAM) نیاز دارد تا فقط در حافظه بارگذاری شود، چه رسد به تولید متن.[4]

این نیاز اولیه فوراً اکثریت قریب به اتفاق لپ‌تاپ‌ها و دسکتاپ‌های مصرف‌کننده را از دور خارج می‌کند. اکثر دستگاه‌های استاندارد با ۸ یا ۱۶ گیگابایت حافظه کلی سیستم عرضه می‌شوند که باید با سیستم عامل و سایر برنامه‌ها به اشتراک گذاشته شود و فضای کافی برای میزبانی یک موتور استدلالی در سطح پیشرفته باقی نمی‌ماند.

راه‌حل این گلوگاه سخت‌افزاری، یک تکنیک فشرده‌سازی ریاضی است که به عنوان کوانتیزیشن (Quantization) شناخته می‌شود. این سازوکار نامرئی است که هوش مصنوعی محلی را امکان‌پذیر می‌سازد و به شبکه‌های عصبی عظیم اجازه می‌دهد کوچک شوند و به طور مؤثر روی دستگاه‌هایی که مردم از قبل دارند، اجرا شوند.

مثلث کوانتیزیشن مصالحه‌های ضروری هنگام فشرده‌سازی یک مدل هوش مصنوعی را نشان می‌دهد.

در هسته خود، یک مدل زبان بزرگ، پایگاه دانش عظیم خود را به صورت میلیاردها مقدار عددی به نام «وزن‌ها» (Weights) ذخیره می‌کند. در طول مرحله آموزش اولیه در مراکز داده عظیم، این وزن‌ها در قالبی با دقت بالا ذخیره می‌شوند که معمولاً اعداد ممیز شناور ۳۲ بیتی (FP32) یا ۱۶ بیتی (FP16) هستند.[1][2]

این دقت شدید در طول آموزش کاملاً ضروری است تا ظرافت‌های میکروسکوپی و دقیق زبان و منطق انسانی را به تصویر بکشد. با این حال، هنگامی که مدل به طور کامل آموزش دیده و برای استنتاج (Inference) مستقر می‌شود—مرحله‌ای که در آن واقعاً دستورات را می‌خواند و متن تولید می‌کند—آن سطح از دقت تبدیل به یک بار عملیاتی می‌شود.[2]

کوانتیزیشن به طور سیستماتیک دقت این وزن‌ها را کاهش می‌دهد و آن‌ها را از ممیز شناور ۱۶ بیتی به اعداد صحیح بسیار کوچک‌تر ۸ بیتی یا ۴ بیتی (INT8 یا INT4) نگاشت می‌کند. مدل مجبور می‌شود محاسبات داخلی خود را به نزدیک‌ترین عدد صحیح موجود در محدوده بسیار کوچک‌تری از گزینه‌ها گرد کند.[1]

این فرآیند از نظر مفهومی مشابه فشرده‌سازی یک عکس RAW با وضوح بالا به یک فایل JPEG استاندارد است. حجم فایل به شدت کاهش می‌یابد و در حالی که مقداری از داده‌های سطح پیکسل به طور دائمی در این تبدیل از دست می‌رود، تصویر حاصل از نظر بصری برای چشم انسان غیرقابل تشخیص باقی می‌ماند.[4]

این فرآیند از نظر مفهومی مشابه فشرده‌سازی یک عکس RAW با وضوح بالا به یک فایل JPEG استاندارد است.

با کاهش تعداد بیت‌هایی که باید برای هر محاسبه پردازش شوند، کوانتیزیشن به طور همزمان به دو بهینه‌سازی حیاتی دست می‌یابد. اول، ردپای حافظه فیزیکی مدل را به شدت کوچک می‌کند و دوم، سرعتی را که سخت‌افزار می‌تواند هر کلمه جدید را تولید کند، به طور قابل توجهی افزایش می‌دهد.[1]

پیشرفتی که این تکنیک را به جریان اصلی آورد، ایجاد llama.cpp بود، یک کتابخانه متن‌باز C++ که توسط مهندس نرم‌افزار، گئورگی گرگانوف (Georgi Gerganov)، توسعه یافت. این پروژه که در ابتدا برای اجرای مدل LLaMA متا روی مک‌بوک‌های استاندارد بدون کارت گرافیک اختصاصی طراحی شده بود، اساساً چشم‌انداز هوش مصنوعی را تغییر داد.[5][6]

کتابخانه متن‌باز llama.cpp امکان تقسیم مدل‌ها بین حافظه CPU و GPU را فراهم می‌کند.

در کنار این کتابخانه نرم‌افزاری، جامعه توسعه‌دهندگان، نوع فایل GGUF (فرمت یکپارچه تولید شده توسط GPT) را توسعه دادند. GGUF به استاندارد بالفعل برای استنتاج محلی تبدیل شد، زیرا به رایانه اجازه می‌دهد بار محاسباتی را به طور هوشمندانه بین سخت‌افزار موجود خود تقسیم کند.[5]

هنگامی که یک مدل GGUF بارگذاری می‌شود، سیستم می‌تواند تا حد امکان لایه‌های شبکه عصبی را به واحد پردازش گرافیکی (GPU) پرسرعت منتقل کند، در حالی که لایه‌های باقیمانده را به طور یکپارچه به واحد پردازش مرکزی (CPU) استاندارد اختصاص می‌دهد. این رویکرد ترکیبی تضمین می‌کند که حتی دستگاه‌های فاقد کارت گرافیک پیشرفته نیز می‌توانند در انقلاب هوش مصنوعی مشارکت کنند.[6]

با این حال، کوانتیزیشن اساساً یک بازی مصالحه است. توسعه‌دهندگان از این موضوع به عنوان «مثلث کوانتیزیشن» یاد می‌کنند: کاربر باید دائماً بین مصرف VRAM، سرعت تولید و دقت مدل تعادل برقرار کند، با این آگاهی که بهینه‌سازی یکی ناگزیر دیگری را کاهش می‌دهد.[3]

برای اکثریت قریب به اتفاق کاربران، سطح کوانتیزیشن ۴ بیتی—به طور خاص نوعی که به عنوان Q4_K_M شناخته می‌شود—نقطه بهینه پارِتو (Pareto-optimal) را نشان می‌دهد. این سطح بهترین تعادل ممکن بین فشرده‌سازی و قابلیت را ارائه می‌دهد.[3][4]

کوانتیزیشن ۴ بیتی، ردپای حافظه یک مدل را تقریباً ۷۰ درصد کاهش می‌دهد.

در سطح Q4_K_M، یک مدل استاندارد ۷ میلیارد پارامتری از حجم زیاد ۱۴ گیگابایت به ۴.۵ گیگابایت بسیار قابل مدیریت کاهش می‌یابد. با وجود این کاهش عظیم در اندازه، مدل تقریباً ۹۵ تا ۹۷ درصد از قابلیت‌های استدلالی با دقت کامل خود را حفظ می‌کند.[3]

این نسبت فشرده‌سازی خاص، آستانه‌ای است که هوش مصنوعی محلی را واقعاً در دسترس قرار می‌دهد. این بدان معناست که یک لپ‌تاپ مدرن استاندارد با ۸ گیگابایت حافظه یکپارچه می‌تواند به راحتی مدل را بارگذاری کند، سیستم عامل را اجرا کند و متن را به سرعت و بدون از کار افتادن تولید نماید.[4]

برای کاربرانی که وظایف بسیار ساختاریافته و حساس به دقت مانند کدنویسی پیشرفته یا ریاضیات پیچیده را انجام می‌دهند، ارتقا به کوانتیزیشن ۸ بیتی (Q8_0) عملکردی تقریباً بدون افت کیفیت ارائه می‌دهد. اگرچه این کار نیاز VRAM را در مقایسه با ۴ بیتی دو برابر می‌کند، اما خطاهای منطقی نادری را که توسط فشرده‌سازی سنگین ایجاد می‌شوند، از بین می‌برد.[3][4]

در نهایت، کوانتیزیشن سازوکاری است که هوش مصنوعی را دموکراتیزه می‌کند. با شکستن اتکای مطلق به هایپراسکیلرهای متمرکز و محاسبات ابری گران‌قیمت، موتورهای استدلالی قدرتمند، خصوصی و آفلاین را مستقیماً در اختیار کاربران روزمره قرار می‌دهد.[7]

نکات کلیدی

  • کوانتیزیشن مدل‌های عظیم هوش مصنوعی را با کاهش دقت عددی وزن‌های داخلی آن‌ها فشرده می‌کند.
  • این فشرده‌سازی به مدل‌های زبان بزرگ اجازه می‌دهد تا به طور کامل و آفلاین روی لپ‌تاپ‌های مصرف‌کننده استاندارد اجرا شوند.
  • سطح کوانتیزیشن ۴ بیتی (Q4_K_M) تقریباً ۹۵ درصد از کیفیت مدل را حفظ می‌کند در حالی که ردپای حافظه آن را نزدیک به ۷۰ درصد کاهش می‌دهد.
  • استنتاج محلی هوش مصنوعی، حریم خصوصی کامل داده‌ها را تضمین می‌کند، زیرا دستورات حساس هرگز دستگاه کاربر را ترک نمی‌کنند.
  • کتابخانه متن‌باز llama.cpp و فرمت فایل GGUF فناوری‌های اساسی هستند که این تحول را ممکن می‌سازند.

چرا مهم است

اجرای محلی هوش مصنوعی، حریم خصوصی کامل داده‌ها را تضمین می‌کند، هزینه‌های اشتراک ماهانه را حذف می‌نماید و به کاربران اجازه می‌دهد بدون اتکا به ارائه‌دهندگان ابری متمرکز، برنامه‌های آفلاین بسازند.

اصطلاحات کلیدی

کوانتیزیشن (Quantization)
فرآیند کاهش دقت عددی وزن‌های یک مدل هوش مصنوعی برای صرفه‌جویی در حافظه و افزایش سرعت.
VRAM (حافظه دسترسی تصادفی ویدئویی)
حافظه تخصصی روی کارت گرافیک که برای ذخیره و پردازش داده‌های پیچیده مانند مدل‌های هوش مصنوعی استفاده می‌شود.
FP۱۶ (ممیز شناور ۱۶ بیتی)
یک قالب عددی با دقت بالا که معمولاً در طول آموزش مدل‌های هوش مصنوعی استفاده می‌شود.
INT۴ (عدد صحیح ۴ بیتی)
یک قالب عددی بسیار فشرده که در مدل‌های کوانتیزه‌شده برای کاهش شدید حجم فایل استفاده می‌شود.
llama.cpp
یک کتابخانه نرم‌افزاری متن‌باز که به مدل‌های زبان بزرگ اجازه می‌دهد تا به طور کارآمد روی سخت‌افزار مصرف‌کننده اجرا شوند.

منابع

پوشش منابع

7 منبع

3 دیدگاه شناسایی‌شده

حامیان متن‌باز 40%متخصصان حریم خصوصی 35%ارائه‌دهندگان زیرساخت ابری 25%
  1. [1]IBMارائه‌دهندگان زیرساخت ابری

    What is quantization?

    مطالعه در IBM
  2. [2]TensorWaveارائه‌دهندگان زیرساخت ابری

    LLM Quantization Explained

    مطالعه در TensorWave
  3. [3]KunalGanglani.comحامیان متن‌باز

    LLM Quantization Levels Compared: Q4_K_M vs Q8_0 vs FP16

    مطالعه در KunalGanglani.com
  4. [4]Micro Centerارائه‌دهندگان زیرساخت ابری

    What is LLM quantization and why does it matter?

    مطالعه در Micro Center
  5. [5]Wikipediaحامیان متن‌باز

    llama.cpp

    مطالعه در Wikipedia
  6. [6]GitHubحامیان متن‌باز

    ggml-org/llama.cpp

    مطالعه در GitHub
  7. [7]تیم سردبیری کوهستانمتخصصان حریم خصوصی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.