انتشار مدل متنباز Ternary Bonsai 2: فشردهسازی بیسابقه مدل ۲۷ میلیارد پارامتری به ۵.۹ گیگابایت
شرکت PrismML مدل هوش مصنوعی Ternary Bonsai 2 27B را منتشر کرد که با استفاده از معماری سهگانه، حجم مدل را بیش از ۹ برابر کاهش داده و امکان اجرای محلی آن را روی لپتاپهای معمولی فراهم میکند.
به قلم ندا وزیری
این خبر را به اشتراک بگذارید
- توسعهدهندگان هوش مصنوعی محلی
- این گروه اجرای مدلهای قدرتمند روی سختافزارهای خانگی را راهی برای تضمین حریم خصوصی و کاهش شدید هزینهها میدانند.
- پژوهشگران و دانشمندان داده
- دانشمندان این حوزه، استفاده از چرخش هادامارد و کوانتیزاسیون سهگانه را یک نقطه عطف علمی در فشردهسازی مدلها میدانند.
- ارائهدهندگان خدمات ابری
- این گروه معتقدند برای کاربردهای سازمانی در مقیاس کلان، دقت مطلق همچنان نیازمند مدلهای دیتاسنتر است.
دیدگاههایی که این گزارش پوشش نداده
- تولیدکنندگان سختافزار سرور
نکات کلیدی
- مدل Ternary Bonsai 2 27B حجم یک مدل ۵۴ گیگابایتی را به ۵.۹ گیگابایت کاهش داده است.
- این مدل از معماری وزنهای سهگانه (-۱، ۰، +۱) با میانگین ۱.۷۲ بیت بر وزن استفاده میکند.
- با وجود فشردهسازی ۹ برابری، ۹۸.۲ درصد از توانایی استدلال نسخه اصلی حفظ شده است.
- مدل دارای پنجره زمینه ۲۶۲ هزار توکنی بوده و از پردازش همزمان متن و تصویر پشتیبانی میکند.
- این سیستم به صورت متنباز (Apache 2.0) منتشر شده و روی لپتاپهای معمولی قابل اجراست.
چرا مهم است
این دستاورد به معنای پایان وابستگی مطلق به سرورهای ابری گرانقیمت برای اجرای هوش مصنوعی پیشرفته است. اکنون توسعهدهندگان و کاربران عادی میتوانند مدلهای قدرتمند را مستقیماً روی رایانههای شخصی خود اجرا کنند، که این امر هزینهها را به شدت کاهش داده و دسترسی به فناوری را دموکراتیزه میکند.
تصور کنید یک مدل هوش مصنوعی با ۲۷ میلیارد پارامتر که در حالت عادی به ۵۴ گیگابایت حافظه و سختافزارهای گرانقیمت سرور نیاز دارد، به قدری فشرده شود که تنها ۵.۹ گیگابایت فضا اشغال کند. این دقیقاً همان مقیاسی است که شرکت PrismML با انتشار مدل متنباز Ternary Bonsai 2 27B در اواسط سپتامبر ۲۰۲۶ به آن دست یافته است. این مدل که بر پایه معماری قدرتمند Qwen3.8-27B ساخته شده، مرزهای اجرای محلی هوش مصنوعی را جابجا کرده و قدرت پردازشی سطح دیتاسنترها را به لپتاپهای روزمره آورده است.[1][2]
برای درک این جهش فناوری، باید به مکانیسم زیربنایی آن یعنی «کوانتیزاسیون سهگانه» (Ternary Quantization) نگاه کرد. در شبکههای عصبی سنتی، وزنها معمولاً با دقت ۱۶ بیتی (FP16) ذخیره میشوند که به هر پارامتر اجازه میدهد هزاران مقدار مختلف را به خود بگیرد. اما در Bonsai 2، هر وزن مجبور است تنها یکی از سه حالت ممکن را داشته باشد: منفی یک، صفر، یا مثبت یک. این محدودیت شدید باعث میشود حجم اطلاعات هر وزن به حدود ۱.۵۸ بیت کاهش یابد و در نتیجه اندازه کلی مدل به شکل چشمگیری کوچک شود.[3]
با این حال، فشردهسازی به این شدت معمولاً به فروپاشی توانایی استدلال مدل منجر میشود. PrismML برای حل این مشکل از یک ترفند ریاضی هوشمندانه استفاده کرده است. آنها هر ۱۲۸ وزن سهگانه را در یک گروه قرار داده و یک ضریب مقیاسبندی ۱۶ بیتی مشترک به آنها اختصاص دادهاند. علاوه بر این، پیش از اعمال مقادیر سهگانه، از یک چرخش ریاضی به نام «هادامارد» (Hadamard Rotation) در بلوکهای ۱۰۲۴ تایی استفاده میشود تا بار اطلاعاتی به طور یکنواخت در سراسر شبکه توزیع شود و از افت کیفیت جلوگیری گردد.[3][4]
نتیجه این مهندسی دقیق، حفظ ۹۸.۲ درصد از عملکرد مدل اصلی در بنچمارکهای استاندارد است. در حالی که مدلهای فشردهشده قبلی در وظایف پیچیدهای مانند برنامهنویسی و ریاضیات دچار افت شدید میشدند، Bonsai 2 27B توانسته است امتیازات خود را در این حوزهها تقریباً همسطح با نسخه ۵۴ گیگابایتی نگه دارد. این مدل در ۱۴ آزمون مختلف استدلالی، میانگین امتیاز ۸۴.۷۸ را کسب کرده است که نشاندهنده پایداری شگفتانگیز آن در پردازشهای عمیق است.[1][2][3]
نتیجه این مهندسی دقیق، حفظ ۹۸.۲ درصد از عملکرد مدل اصلی در بنچمارکهای استاندارد است.
فراتر از متن، این مدل یک سیستم چندوجهی (Multimodal) است که میتواند تصاویر و اسناد بصری را نیز درک و تحلیل کند. برج بینایی (Vision Tower) این مدل به صورت جداگانه با حجم کمتر از یک گیگابایت بارگذاری میشود و به کاربر اجازه میدهد عکسها، نمودارها و فایلهای PDF را مستقیماً به مدل وارد کرده و درباره آنها سوال بپرسد. این قابلیت، کاربردهای مدل را در تحلیل دادههای محلی به شدت گسترش میدهد.[1][4]
یکی دیگر از ویژگیهای برجسته Bonsai 2، پشتیبانی از پنجره زمینه (Context Window) عظیم ۲۶۲ هزار توکنی است. این بدان معناست که کاربر میتواند کل یک پایگاه کد برنامهنویسی، یک قرارداد حقوقی طولانی، یا دهها مقاله علمی را به صورت یکجا وارد مدل کند. حفظ چنین ظرفیتی در یک مدل فشرده محلی، به لطف استفاده از معماری توجه ترکیبی (Hybrid-Attention) در ستون فقرات مدل امکانپذیر شده است که مصرف حافظه را در پردازش متنهای طولانی بهینه میکند.[2][3]
در دنیای واقعی، سرعت اجرای این مدل روی سختافزارهای مصرفی خیرهکننده است. بر اساس گزارشها، Bonsai 2 میتواند روی یک کارت گرافیک NVIDIA RTX 5090 تا ۱۴۳ توکن در ثانیه و روی پردازنده لپتاپ Apple M5 Max تا ۴۷ توکن در ثانیه تولید کند. این سرعت بالا، همراه با قابلیتهای فراخوانی ابزار (Tool Calling)، آن را به گزینهای ایدهآل برای اجرای دستیارهای برنامهنویسی خودکار و گردشکارهای چندمرحلهای تبدیل کرده است.[2][4]
انتشار این مدل تحت مجوز کاملاً باز Apache 2.0، یک پیروزی بزرگ برای جامعه متنباز محسوب میشود. توسعهدهندگان و شرکتها اکنون میتوانند بدون پرداخت هزینههای اشتراک API یا نگرانی درباره حریم خصوصی دادههای خود در سرورهای ابری، از یک هوش مصنوعی پیشرفته استفاده تجاری کنند. Ternary Bonsai 2 نشان داد که آینده هوش مصنوعی لزوماً در انحصار ابررایانههای غولپیکر نیست، بلکه میتواند در کولهپشتی هر کاربری جای بگیرد.[1][2]
بررسی عمیق دیدگاهها
توسعهدهندگان هوش مصنوعی محلی
تأکید بر استقلال از سرویسهای ابری و حفظ حریم خصوصی.
این گروه معتقدند که اجرای مدلهای قدرتمند روی سختافزارهای خانگی، وابستگی به APIهای پولی را از بین میبرد. آنها تأکید دارند که توانایی اجرای دستیارهای برنامهنویسی و تحلیلگران اسناد به صورت آفلاین، حریم خصوصی دادهها را تضمین کرده و هزینههای عملیاتی استارتاپها را به شدت کاهش میدهد. از دیدگاه آنها، این مدلها قدرت پردازشی را دموکراتیزه میکنند.
پژوهشگران فشردهسازی مدل
تمرکز بر دستاورد علمی کوانتیزاسیون سهگانه بدون افت کیفیت استدلال.
دانشمندان این حوزه، استفاده از چرخش هادامارد و کوانتیزاسیون سهگانه را یک نقطه عطف علمی میدانند. از دیدگاه آنها، اثبات این موضوع که میتوان مدلها را به زیر ۲ بیت فشرده کرد بدون آنکه توانایی استدلال ریاضی و منطقی آنها فرو بپاشد، مسیر را برای ساخت مدلهای بسیار بزرگتر روی سختافزارهای محدود هموار میکند. این دستاورد نشان میدهد که هوش مصنوعی لزوماً به دقت ۱۶ بیتی وابسته نیست.
ارائهدهندگان زیرساخت ابری
تأکید بر نیاز به مدلهای با دقت کامل برای کاربردهای حساس سازمانی.
اگرچه این گروه پیشرفتهای فشردهسازی را تحسین میکنند، اما استدلال میکنند که برای کاربردهای سازمانی در مقیاس کلان، دقت مطلق و پایداری سرویس همچنان نیازمند مدلهای با دقت کامل (FP16) در دیتاسنترها است. آنها معتقدند مدلهای محلی مکمل سرویسهای ابری هستند و برای وظایفی که به بالاترین سطح از دقت نیاز دارند، زیرساختهای ابری همچنان بیرقیب باقی خواهند ماند.
منابع
[1]PR Newswireارائهدهندگان خدمات ابریPrismML today announced Bonsai 2 27B, its new flagship model based on Qwen3.8 27B
مطالعه در PR Newswire →
[2]DataCampتوسعهدهندگان هوش مصنوعی محلیBonsai 2 27B: Run a 27B AI Locally on Your Laptop
مطالعه در DataCamp →
[3]PrismMLپژوهشگران و دانشمندان دادهTernary Bonsai 2 27B
مطالعه در PrismML →
[4]GitHubتوسعهدهندگان هوش مصنوعی محلیPrismML-Eng/Bonsai-demo
مطالعه در GitHub →
نظرات
بیشتر در هوش مصنوعی
مشاهده همه →شبکههای عصبی
چگونه نرمالسازی دستهای (Batch Normalization) همگرایی شبکههای عمیق را شتاب میبخشد
7 منبع
مکانیک الگوریتم
چگونه جستجوی درخت مونت کارلو با استفاده از فرمول UCB1 بین اکتشاف و بهرهبرداری تعادل ایجاد میکند
3 منبع
تولید انبوه انساننما
راهاندازی اولین کارخانه تولید انبوه رباتهای انساننما در چین با ظرفیت ۱۰ هزار دستگاه در سال
4 منبع
هوش مصنوعی عاملی
چگونه عامل کار ChatGPT اوپنایآی، هوش مصنوعی را از دستوردهی ساده به واگذاری چندساعته وظایف تغییر میدهد
7 منبع
هر زاویه. هر روز.
دریافت هوش مصنوعی اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.





