چرا استقرار هوش مصنوعی متنباز اغلب از اجاره آن گرانتر تمام میشود؟
مدیر مالی OpenAI اخیراً ادعا کرده است که مدلهای بسته این شرکت اکنون از نظر هزینه، جایگزینهای متنباز را شکست میدهند. محاسبات پشت استقرار هوش مصنوعی سازمانی نشان میدهد که چرا حق تا حد زیادی با اوست.
به قلم کاوان رامین
این خبر را به اشتراک بگذارید
- ارائهدهندگان تجاری API
- توسعهدهندگان مدلهای بسته استدلال میکنند که تجمیع توان پردازشی و زیرساختهای بهینهشده، APIهای آنها را به ازای هر وظیفه ارزانتر میکند.
- پذیرندگان سازمانی هوش مصنوعی
- سازمانهایی که هوش مصنوعی را مستقر میکنند، روی هزینه کل مالکیت تمرکز دارند و حقوق مهندسان را در برابر تعرفه توکنها میسنجند.
- حامیان متنباز
- طرفداران وزنهای باز، حاکمیت دادهها و کنترل حریم خصوصی را بر اقتصاد صرفِ مبتنی بر توکن ترجیح میدهند.
دیدگاههایی که این گزارش پوشش نداده
- مشارکتکنندگان مستقل متنباز
- تولیدکنندگان سختافزار
چرا مهم است
این فرض که نرمافزار متنباز ذاتاً ارزانتر است، در هوش مصنوعی مولد رنگ میبازد؛ جایی که هزینه سختافزار، نیروی متخصص و توان پردازشی بلااستفاده میتواند به سرعت از قیمت توکنهای API پیشی بگیرد و سازمانها را مجبور کند در بودجههای هوش مصنوعی خود تجدید نظر کنند.
نکات کلیدی
- شرکت OpenAI ادعا میکند که استقرار مدلهای بسته آن در زیرساختهای ابری اکنون ارزانتر از جایگزینهای متنباز است.
- استقرار یک مدل زبانی بزرگ متنباز سالانه بین ۱۲۵,۰۰۰ تا ۸۲۰,۰۰۰ دلار برای زیرساخت و نیروی متخصص هزینه دارد.
- بهرهوری سختافزار تعیینکننده هزینه است؛ پردازندههای گرافیکی بیکار باعث میشوند توکنهای خودمیزبان بسیار گرانتر از توکنهای تجمیعشده API تمام شوند.
- ارائهدهندگان تجاری از صرفهجویی به مقیاس و کش کردن پرامپت برای کاهش هزینه واحد هوشمندی استفاده میکنند.
استقرار یک مدل زبانی بزرگ متنباز اغلب گرانتر از اجاره یک مدل بسته تمام میشود، زیرا هزینه هوشمندی دیگر در نرمافزار نیست، بلکه در سیلیکون و نیروی متخصصی است که برای سرپا نگه داشتن آن نیاز دارید. سارا فرایر (Sarah Friar)، مدیر مالی OpenAI، در ۸ سپتامبر ۲۰۲۶ در کنفرانس فناوری Communacopia گلدمن ساکس این موضوع را به صراحت بیان کرد و گفت که این شرکت در حال حاضر رقبای متنباز خود را از نظر هزینه کنار میزند.[1][2]
فرایر خاطرنشان کرد که OpenAI روی بخشهای تخصصی مانند طراحی تراشه و علوم زیستی تمرکز کرده است؛ جایی که سازمانها خواهان بازگشت سرمایه قابلسنجش از هزینههای هوش مصنوعی خود هستند. فرایر با اشاره به مدل محبوب با وزنهای باز شرکت Z.ai گفت: «برای مثال، اگر در حال استقرار Luna هستید و آن را با GLM 5.3 در لایه ابری مقایسه کنید، ما ارزانتر هستیم.» او افزود که کاهش ۸۰ درصدی قیمت مدل ارزانتر Luna متعلق به OpenAI، اخیراً باعث افزایش ۱۰ برابری استفاده از آن شده است.[1][2]
این ادعا، یک فرض دیرینه در دنیای فناوری را هدف قرار میدهد: اینکه نرمافزار متنباز، چون دانلودش رایگان است، ذاتاً اجرای ارزانتری دارد. در نرمافزارهای سنتی، این موضوع تا حد زیادی صحت دارد. اما در هوش مصنوعی مولد، وزنهای مدل (Model weights) رایگان هستند، در حالی که زیرساخت مورد نیاز برای سرویسدهی آنها اصلاً رایگان نیست.[6]
محاسبات مربوط به استنتاج (Inference) مدلهای زبانی بزرگ، این تناقض را توضیح میدهد. هزینه استنتاج اساساً همان زمانِ پردازنده گرافیکی (GPU) به ازای هر توکن است. بر اساس تحلیل سپتامبر ۲۰۲۶ شرکت CloudZero، هزینه توکنهای خروجی در بین ارائهدهندگان بزرگ تقریباً پنج برابر توکنهای ورودی است، زیرا تولید متوالی توکنها کار سختتری نسبت به خواندن موازی آنهاست.[5]
وقتی یک سازمان یک مدل متنباز را دانلود میکند، در واقع هزینهها را از تعرفههای شفاف API به هزینههای پنهان عملیاتی منتقل میکند. گزارش مارس ۲۰۲۶ موسسه AI Superior نشان داد که استقرار یک مدل زبانی بزرگ متنباز برای اکثر سازمانها سالانه بین ۱۲۵,۰۰۰ تا ۸۲۰,۰۰۰ دلار هزینه در بر دارد.[3]
نیروی متخصص مورد نیاز برای نگهداری این سیستمها، بخش عظیمی از این هزینه پایه را تشکیل میدهد. استقرارهای داخلی در مقیاس حداقلی به حداقل سه تا چهار مهندس نیاز دارند، در حالی که سیستمهای در مقیاس سازمانی ۱۵ مهندس یا بیشتر میطلبند. با توجه به اینکه یک مهندس یادگیری ماشین سالانه حدود ۲۰۰,۰۰۰ دلار هزینه دارد، AI Superior خاطرنشان میکند که یک مهندس «باید معادل ۶.۶ میلیارد توکن در فراخوانیهای API برای شما صرفهجویی کند تا فقط هزینه حقوق خودش جبران شود.»[3]
نیروی متخصص مورد نیاز برای نگهداری این سیستمها، بخش عظیمی از این هزینه پایه را تشکیل میدهد.
بهرهوری سختافزار، تله بزرگ دیگری برای استقرارهای خودمیزبان (Self-hosted) است. هزینه یک ساعت استفاده از GPU چه ۲۰۰۰ توکن در ثانیه تولید کند و چه ۲۷,۰۰۰ توکن، یکسان است. هزینه هر توکن برابر است با نرخ ساعتی تقسیم بر توان عملیاتی واقعی؛ موضوعی که میزان بهرهوری را به متغیر اصلی در اقتصاد هوش مصنوعی تبدیل میکند.[6]
شرکت Cerebrium، ارائهدهنده زیرساخت هوش مصنوعی، در ژوئیه ۲۰۲۶ بنچمارکهای داخلی خود را منتشر کرد که این مقیاس را نشان میدهد. سرویسدهی یک مدل متنباز ۱۲۰ میلیارد پارامتری با سرعت ۱۲ میلیون توکن در دقیقه، به حدود ۲۱ نمونه از پردازندههای گرافیکی دوگانه NVIDIA H100 نیاز دارد. با قیمت ۰.۱۱۶۰۴ دلار در دقیقه برای هر نمونه، این پیکربندی در بارگذاری کامل و پیوسته، ماهانه حدود ۱۰۵,۰۰۰ دلار هزینه خواهد داشت.[4]
مشکل اکثر سازمانها این است که حجم کاری آنها پیوسته نیست. اگر این ۲۱ نمونه در طول شب یا در دورههای کمترافیک بیکار بمانند، هزینه هر توکن تولید شده سر به فلک میکشد. ارائهدهندگان تجاری API مانند OpenAI و Anthropic با تجمیع ترافیک میلیونها کاربر، از این امر جلوگیری کرده و با اشباع نگه داشتن GPUهای خود، هزینههای واحد را پایین نگه میدارند.[4][6]
ارائهدهندگان API همچنین از صرفهجویی به مقیاس عظیمی در کش کردن پرامپتها (Prompt caching) بهره میبرند. برای مثال، Anthropic خواندن از کش را با ۹۰ درصد تخفیف محاسبه میکند که هزینه ورودی مدل Claude Sonnet 4.6 آن را از ۳.۰۰ دلار به ۰.۳۰ دلار به ازای هر یک میلیون توکن کاهش میدهد. استقرارهای متنباز هم میتوانند کش کردن را پیادهسازی کنند، اما دستیابی به نرخ موفقیت بالا در کش، نیازمند مهندسی پیچیدهای است.[5]
شرکت CloudZero یک مطالعه موردی از ProjectDiscovery، شرکت سازنده اسکنر امنیتی متنباز Nuclei را برجسته کرد. تیم مهندسی با خارج کردن حافظه کاری پویا از پرامپت سیستم و تنظیم نقاط توقف صریح برای کش، نرخ موفقیت کش خود را از ۷ درصد به ۸۴ درصد افزایش داد و کل هزینههای مدل زبانی بزرگ را تا ۷۰ درصد در میان ۹.۸ میلیارد توکن کاهش داد.[5]
با وجود این معایب هزینهای، هوش مصنوعی متنباز همچنان برای بسیاری از سازمانها حیاتی است. محرکهای اصلی این امر شامل حاکمیت دادهها، کنترل حریم خصوصی و توانایی تنظیم دقیق (Fine-tune) مدلها برای وظایف بسیار خاص در یک دامنه است، بدون اینکه نیازی به ارسال دادههای اختصاصی به سرور شخص ثالث باشد.[6]
همانطور که فرایر در کنفرانس گلدمن ساکس اشاره کرد، وزنهای باز جایگاه خود را در اکوسیستم دارند، اما مشتریان برای پشته جامع، توان پردازشی، یکپارچهسازی دادهها و قابلیت اطمینان سازمانی پول پرداخت میکنند. تا زمانی که قیمت سیلیکونهای تخصصی سقوط نکند، مدل رایگان متنباز همچنان یک انتخاب استقرار لوکس برای کسانی باقی خواهد ماند که توانایی پرداخت هزینه زیرساخت اجرای آن را دارند.[1][6]
اصطلاحات کلیدی
- استنتاج (Inference)
- فرآیندی که در آن یک مدل آموزشدیده هوش مصنوعی بر اساس دادههای ورودی زنده، یک خروجی یا پیشبینی تولید میکند.
- وزنهای مدل (Model Weights)
- پارامترهای آموختهشده و مقادیر ریاضی که نحوه تصمیمگیری یک مدل هوش مصنوعی را تعریف میکنند و اغلب به صورت عمومی در پروژههای متنباز منتشر میشوند.
- کش کردن پرامپت (Prompt Caching)
- تکنیکی که در آن یک سیستم هوش مصنوعی نسخه پردازششده متن ورودی پرکاربرد را ذخیره میکند تا از محاسبه مجدد آن در درخواستهای آینده جلوگیری کند.
- توکن (Token)
- واحد بنیادی دادهها که توسط یک مدل زبانی بزرگ پردازش میشود و تقریباً معادل یک کلمه یا بخشی از یک کلمه است.
پرسشهای متداول
چرا توکنهای خروجی گرانتر از توکنهای ورودی هستند؟
تولید متوالی توکنها ایجاب میکند که مدل هر کلمه را یکییکی پردازش کند، که از نظر محاسباتی سختتر و کندتر از خواندن موازی یک دسته بزرگ از توکنهای ورودی است.
کش کردن پرامپت چیست؟
کش کردن پرامپت به مدل هوش مصنوعی اجازه میدهد تا متن ورودی که مکرراً پردازش شده را ذخیره و مجدداً استفاده کند، که این کار توان پردازشی مورد نیاز برای درخواستهای بعدی را به میزان قابلتوجهی کاهش داده و هزینهها را پایین میآورد.
چرا بهرهوری پردازنده گرافیکی (GPU) تا این حد مهم است؟
هزینه ساعتی یک GPU چه در حال پردازش هزاران توکن باشد و چه بیکار بماند، یکسان است. بهرهوری بالا این هزینه ثابت را بین توکنهای بیشتری سرشکن کرده و قیمت واحد استنتاج را کاهش میدهد.
منابع
[1]Channel News Asiaارائهدهندگان تجاری APIOpenAI offers AI for chip design, touts cost advantage over open-source, CFO says
مطالعه در Channel News Asia →
[2]The Economic Timesارائهدهندگان تجاری APIOpenAI is pushing its AI into specialized industries and undercutting open-source rivals on cost
مطالعه در The Economic Times →
[3]AI Superiorپذیرندگان سازمانی هوش مصنوعیOpen source LLM deployment costs $125K-$820K/year minimum
مطالعه در AI Superior →
[4]Cerebriumپذیرندگان سازمانی هوش مصنوعیInference Cost at Scale: The Tokens-Per-Minute Math
مطالعه در Cerebrium →
[5]CloudZeroپذیرندگان سازمانی هوش مصنوعیWhat does LLM inference cost per token actually mean?
مطالعه در CloudZero →
[6]تیم سردبیری کوهستانتحلیل تیم سردبیری کوهستان
مطالعه در تیم سردبیری کوهستان →
نظرات
هر زاویه. هر روز.
دریافت فناوری اخبار همراه با پوشش کامل منابع و تحلیل دیدگاهها، مستقیم در صندوق ورودی شما.

