رفتن به محتوای اصلی
Koohestun
هوش مصنوعی متن‌بازتحلیل فناوری· 4 دقیقه مطالعه· در هوش مصنوعی

انتشار مدل متن‌باز Ternary Bonsai 2: فشرده‌سازی بی‌سابقه مدل ۲۷ میلیارد پارامتری به ۵.۹ گیگابایت

شرکت PrismML مدل هوش مصنوعی Ternary Bonsai 2 27B را منتشر کرد که با استفاده از معماری سه‌گانه، حجم مدل را بیش از ۹ برابر کاهش داده و امکان اجرای محلی آن را روی لپ‌تاپ‌های معمولی فراهم می‌کند.

به قلم ندا وزیری

توسعه‌دهندگان هوش مصنوعی محلی 45%پژوهشگران و دانشمندان داده 35%ارائه‌دهندگان خدمات ابری 20%
توسعه‌دهندگان هوش مصنوعی محلی
این گروه اجرای مدل‌های قدرتمند روی سخت‌افزارهای خانگی را راهی برای تضمین حریم خصوصی و کاهش شدید هزینه‌ها می‌دانند.
پژوهشگران و دانشمندان داده
دانشمندان این حوزه، استفاده از چرخش هادامارد و کوانتیزاسیون سه‌گانه را یک نقطه عطف علمی در فشرده‌سازی مدل‌ها می‌دانند.
ارائه‌دهندگان خدمات ابری
این گروه معتقدند برای کاربردهای سازمانی در مقیاس کلان، دقت مطلق همچنان نیازمند مدل‌های دیتاسنتر است.

دیدگاه‌هایی که این گزارش پوشش نداده

  • تولیدکنندگان سخت‌افزار سرور

نکات کلیدی

  1. مدل Ternary Bonsai 2 27B حجم یک مدل ۵۴ گیگابایتی را به ۵.۹ گیگابایت کاهش داده است.
  2. این مدل از معماری وزن‌های سه‌گانه (-۱، ۰، +۱) با میانگین ۱.۷۲ بیت بر وزن استفاده می‌کند.
  3. با وجود فشرده‌سازی ۹ برابری، ۹۸.۲ درصد از توانایی استدلال نسخه اصلی حفظ شده است.
  4. مدل دارای پنجره زمینه ۲۶۲ هزار توکنی بوده و از پردازش همزمان متن و تصویر پشتیبانی می‌کند.
  5. این سیستم به صورت متن‌باز (Apache 2.0) منتشر شده و روی لپ‌تاپ‌های معمولی قابل اجراست.

چرا مهم است

این دستاورد به معنای پایان وابستگی مطلق به سرورهای ابری گران‌قیمت برای اجرای هوش مصنوعی پیشرفته است. اکنون توسعه‌دهندگان و کاربران عادی می‌توانند مدل‌های قدرتمند را مستقیماً روی رایانه‌های شخصی خود اجرا کنند، که این امر هزینه‌ها را به شدت کاهش داده و دسترسی به فناوری را دموکراتیزه می‌کند.

تصور کنید یک مدل هوش مصنوعی با ۲۷ میلیارد پارامتر که در حالت عادی به ۵۴ گیگابایت حافظه و سخت‌افزارهای گران‌قیمت سرور نیاز دارد، به قدری فشرده شود که تنها ۵.۹ گیگابایت فضا اشغال کند. این دقیقاً همان مقیاسی است که شرکت PrismML با انتشار مدل متن‌باز Ternary Bonsai 2 27B در اواسط سپتامبر ۲۰۲۶ به آن دست یافته است. این مدل که بر پایه معماری قدرتمند Qwen3.8-27B ساخته شده، مرزهای اجرای محلی هوش مصنوعی را جابجا کرده و قدرت پردازشی سطح دیتاسنترها را به لپ‌تاپ‌های روزمره آورده است.[1][2]

برای درک این جهش فناوری، باید به مکانیسم زیربنایی آن یعنی «کوانتیزاسیون سه‌گانه» (Ternary Quantization) نگاه کرد. در شبکه‌های عصبی سنتی، وزن‌ها معمولاً با دقت ۱۶ بیتی (FP16) ذخیره می‌شوند که به هر پارامتر اجازه می‌دهد هزاران مقدار مختلف را به خود بگیرد. اما در Bonsai 2، هر وزن مجبور است تنها یکی از سه حالت ممکن را داشته باشد: منفی یک، صفر، یا مثبت یک. این محدودیت شدید باعث می‌شود حجم اطلاعات هر وزن به حدود ۱.۵۸ بیت کاهش یابد و در نتیجه اندازه کلی مدل به شکل چشمگیری کوچک شود.[3]

با این حال، فشرده‌سازی به این شدت معمولاً به فروپاشی توانایی استدلال مدل منجر می‌شود. PrismML برای حل این مشکل از یک ترفند ریاضی هوشمندانه استفاده کرده است. آن‌ها هر ۱۲۸ وزن سه‌گانه را در یک گروه قرار داده و یک ضریب مقیاس‌بندی ۱۶ بیتی مشترک به آن‌ها اختصاص داده‌اند. علاوه بر این، پیش از اعمال مقادیر سه‌گانه، از یک چرخش ریاضی به نام «هادامارد» (Hadamard Rotation) در بلوک‌های ۱۰۲۴ تایی استفاده می‌شود تا بار اطلاعاتی به طور یکنواخت در سراسر شبکه توزیع شود و از افت کیفیت جلوگیری گردد.[3][4]

نتیجه این مهندسی دقیق، حفظ ۹۸.۲ درصد از عملکرد مدل اصلی در بنچمارک‌های استاندارد است. در حالی که مدل‌های فشرده‌شده قبلی در وظایف پیچیده‌ای مانند برنامه‌نویسی و ریاضیات دچار افت شدید می‌شدند، Bonsai 2 27B توانسته است امتیازات خود را در این حوزه‌ها تقریباً هم‌سطح با نسخه ۵۴ گیگابایتی نگه دارد. این مدل در ۱۴ آزمون مختلف استدلالی، میانگین امتیاز ۸۴.۷۸ را کسب کرده است که نشان‌دهنده پایداری شگفت‌انگیز آن در پردازش‌های عمیق است.[1][2][3]

نتیجه این مهندسی دقیق، حفظ ۹۸.۲ درصد از عملکرد مدل اصلی در بنچمارک‌های استاندارد است.

فراتر از متن، این مدل یک سیستم چندوجهی (Multimodal) است که می‌تواند تصاویر و اسناد بصری را نیز درک و تحلیل کند. برج بینایی (Vision Tower) این مدل به صورت جداگانه با حجم کمتر از یک گیگابایت بارگذاری می‌شود و به کاربر اجازه می‌دهد عکس‌ها، نمودارها و فایل‌های PDF را مستقیماً به مدل وارد کرده و درباره آن‌ها سوال بپرسد. این قابلیت، کاربردهای مدل را در تحلیل داده‌های محلی به شدت گسترش می‌دهد.[1][4]

یکی دیگر از ویژگی‌های برجسته Bonsai 2، پشتیبانی از پنجره زمینه (Context Window) عظیم ۲۶۲ هزار توکنی است. این بدان معناست که کاربر می‌تواند کل یک پایگاه کد برنامه‌نویسی، یک قرارداد حقوقی طولانی، یا ده‌ها مقاله علمی را به صورت یکجا وارد مدل کند. حفظ چنین ظرفیتی در یک مدل فشرده محلی، به لطف استفاده از معماری توجه ترکیبی (Hybrid-Attention) در ستون فقرات مدل امکان‌پذیر شده است که مصرف حافظه را در پردازش متن‌های طولانی بهینه می‌کند.[2][3]

در دنیای واقعی، سرعت اجرای این مدل روی سخت‌افزارهای مصرفی خیره‌کننده است. بر اساس گزارش‌ها، Bonsai 2 می‌تواند روی یک کارت گرافیک NVIDIA RTX 5090 تا ۱۴۳ توکن در ثانیه و روی پردازنده لپ‌تاپ Apple M5 Max تا ۴۷ توکن در ثانیه تولید کند. این سرعت بالا، همراه با قابلیت‌های فراخوانی ابزار (Tool Calling)، آن را به گزینه‌ای ایده‌آل برای اجرای دستیارهای برنامه‌نویسی خودکار و گردش‌کارهای چندمرحله‌ای تبدیل کرده است.[2][4]

انتشار این مدل تحت مجوز کاملاً باز Apache 2.0، یک پیروزی بزرگ برای جامعه متن‌باز محسوب می‌شود. توسعه‌دهندگان و شرکت‌ها اکنون می‌توانند بدون پرداخت هزینه‌های اشتراک API یا نگرانی درباره حریم خصوصی داده‌های خود در سرورهای ابری، از یک هوش مصنوعی پیشرفته استفاده تجاری کنند. Ternary Bonsai 2 نشان داد که آینده هوش مصنوعی لزوماً در انحصار ابررایانه‌های غول‌پیکر نیست، بلکه می‌تواند در کوله‌پشتی هر کاربری جای بگیرد.[1][2]

بررسی عمیق دیدگاه‌ها

توسعه‌دهندگان هوش مصنوعی محلی

تأکید بر استقلال از سرویس‌های ابری و حفظ حریم خصوصی.

این گروه معتقدند که اجرای مدل‌های قدرتمند روی سخت‌افزارهای خانگی، وابستگی به APIهای پولی را از بین می‌برد. آن‌ها تأکید دارند که توانایی اجرای دستیارهای برنامه‌نویسی و تحلیلگران اسناد به صورت آفلاین، حریم خصوصی داده‌ها را تضمین کرده و هزینه‌های عملیاتی استارتاپ‌ها را به شدت کاهش می‌دهد. از دیدگاه آن‌ها، این مدل‌ها قدرت پردازشی را دموکراتیزه می‌کنند.

پژوهشگران فشرده‌سازی مدل

تمرکز بر دستاورد علمی کوانتیزاسیون سه‌گانه بدون افت کیفیت استدلال.

دانشمندان این حوزه، استفاده از چرخش هادامارد و کوانتیزاسیون سه‌گانه را یک نقطه عطف علمی می‌دانند. از دیدگاه آن‌ها، اثبات این موضوع که می‌توان مدل‌ها را به زیر ۲ بیت فشرده کرد بدون آنکه توانایی استدلال ریاضی و منطقی آن‌ها فرو بپاشد، مسیر را برای ساخت مدل‌های بسیار بزرگتر روی سخت‌افزارهای محدود هموار می‌کند. این دستاورد نشان می‌دهد که هوش مصنوعی لزوماً به دقت ۱۶ بیتی وابسته نیست.

ارائه‌دهندگان زیرساخت ابری

تأکید بر نیاز به مدل‌های با دقت کامل برای کاربردهای حساس سازمانی.

اگرچه این گروه پیشرفت‌های فشرده‌سازی را تحسین می‌کنند، اما استدلال می‌کنند که برای کاربردهای سازمانی در مقیاس کلان، دقت مطلق و پایداری سرویس همچنان نیازمند مدل‌های با دقت کامل (FP16) در دیتاسنترها است. آن‌ها معتقدند مدل‌های محلی مکمل سرویس‌های ابری هستند و برای وظایفی که به بالاترین سطح از دقت نیاز دارند، زیرساخت‌های ابری همچنان بی‌رقیب باقی خواهند ماند.

منابع

پوشش منابع

4 منبع

3 دیدگاه شناسایی‌شده

توسعه‌دهندگان هوش مصنوعی محلی 45%پژوهشگران و دانشمندان داده 35%ارائه‌دهندگان خدمات ابری 20%
  1. [1]PR Newswireارائه‌دهندگان خدمات ابری

    PrismML today announced Bonsai 2 27B, its new flagship model based on Qwen3.8 27B

    مطالعه در PR Newswire
  2. [2]DataCampتوسعه‌دهندگان هوش مصنوعی محلی

    Bonsai 2 27B: Run a 27B AI Locally on Your Laptop

    مطالعه در DataCamp
  3. [3]PrismMLپژوهشگران و دانشمندان داده

    Ternary Bonsai 2 27B

    مطالعه در PrismML
  4. [4]GitHubتوسعه‌دهندگان هوش مصنوعی محلی

    PrismML-Eng/Bonsai-demo

    مطالعه در GitHub

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.