یک تحلیل هزینه جدید نشان میدهد که میزبانی شخصی (self-hosting) یک مدل زبانی بزرگ تنها زمانی از APIهای تجاری پیشی میگیرد که یک کسبوکار ماهانه تقریباً ۵ تا ۱۰ میلیون توکن ورودی پردازش کند. برای هر کسی که در حال بودجهبندی خدمات هوش مصنوعی است، نقطه سربهسر تعیین میکند که آیا جذابیت وزنهای باز (open weights) «رایگان» به صرفهجویی واقعی تبدیل میشود یا خیر.
مدل API
ارائهدهندگان API به ازای هر توکن هزینه دریافت میکنند و تمام مسائل مربوط به سختافزار، برق و سیستم خنککننده را مدیریت میکنند. نرخهای عمومی فعلی عبارتند از:
- Claude Sonnet 5 – ۲ دلار به ازای هر میلیون توکن ورودی
- GPT-5.6 – حدود ۱ دلار به ازای هر میلیون توکن ورودی
- Meta Muse Spark – ۱.۲۵ دلار به ازای هر میلیون توکن ورودی، ۴.۲۵ دلار به ازای هر میلیون توکن خروجی
این مدل به صورت «پرداخت به میزان مصرف» (pay-as-you-go) است. وقتی ترافیک به صفر برسد، صورتحساب نیز صفر میشود. کاربران همچنین از دردسرهای خرابی GPU، بهروزرسانیهای فریمور و برنامهریزی ظرفیت در امان میمانند.
مدل میزبانی شخصی (Self-Hosting)
اجرای یک مدل با وزنهای باز روی سختافزار خودتان به این معناست که صرفنظر از میزان استفاده، هزینه محاسباتی بر عهده شماست. یک واحد NVIDIA H100 — که انتخابی رایج برای استنتاج (inference) مدلهای زبانی بزرگ است — هزینههای زیر را دارد:
- ۲ تا ۳ دلار در ساعت در سرویسهای ابری عمومی GPU
- ۷ تا ۱۲ دلار در ساعت در پلتفرمهای ابری بزرگ (AWS, Azure)
این یعنی تقریباً ۱,۸۰۰ تا ۲,۰۰۰ دلار در ماه برای کارکرد مداوم یک واحد H100. قیمت سختافزار تنها بخش قابل مشاهده صورتحساب است.
نقطه تلاقی اعداد
این تحلیل نشان میدهد که میزبانی شخصی زمانی از APIهای ممتاز ارزانتر میشود که حجم توکنهای ورودی ماهانه به محدوده ۵ تا ۱۰ میلیون برسد. پایینتر از این آستانه، نرخهای API به ازای هر توکن برنده هستند. در حجمهای ۱۰۰ میلیون توکن در ماه یا بیشتر، خط هزینه صرفاً سختافزاری به زیر خط API میرود و میزبانی شخصی را روی کاغذ جذاب نشان میدهد.
هزینههای عملیاتی پنهان
اجاره GPU تنها حدود ۳۰ درصد از هزینه واقعی اجرای یک مدل در محیط عملیاتی است. مابقی هزینهها مربوط به موارد زیر است:
- شبکه و ذخیرهسازی – لینکهای با پهنای باند بالا و دیسکهای سریع، تأخیر (latency) را پایین نگه میدارند.
- افزونگی و نظارت – نمونههای متعدد (instances)، بررسی سلامت (health checks) و خط لولههای هشدار، هم هزینههای نرمافزاری و هم سختافزاری را افزایش میدهند.
- استعدادهای مهندسی – آنلاین نگه داشتن مطمئن یک مدل معمولاً به ۱.۵ تا ۲ مهندس تماموقت نیاز دارد. با نرخهای بازار، این موضوع ۲۷۰,۰۰۰ تا ۵۵۰,۰۰۰ دلار به هزینههای سالانه میافزاید.
وقتی این لایهها اضافه شوند، صرفهجویی ظاهری ناشی از سختافزار به تنهایی به سرعت از بین میرود.
چه کسانی باید میزبانی شخصی را مد نظر قرار دهند
میزبانی شخصی تنها تحت شرایط خاصی منطقی است:
- حجم بسیار بالا و مداوم – سازمان باید بهطور منظم از آستانه ۵ میلیون توکن فراتر رود، در غیر این صورت قیمت API به ازای هر توکن کمتر باقی میماند.
- محدودیتهای نظارتی یا حریم خصوصی دادهها – برخی بخشها ارسال دادههای اختصاصی یا شخصی به نقاط پایانی (endpoints) شخص ثالث را ممنوع میکنند.
- سفارشیسازی تخصصی یا تضمین تأخیر – زمانی که یک مدل باید روی دادههای داخلی تنظیم دقیق (fine-tune) شود یا پاسخهای زیر یک ثانیه ارائه دهد، مالکیت زیرساخت میتواند توجیهپذیر باشد.
اگر هیچکدام از این فشارها وجود نداشته باشد، هزینههای پنهان کارکنان و زیرساخت اغلب بر صرفهجویی در سختافزار غلبه میکند.
یک استراتژی ترکیبی
اکثر تیمهایی که به مقیاسی میرسند که در آن میزبانی شخصی امکانپذیر است، همچنان از یک رویکرد ترکیبی استفاده میکنند:
- شروع با APIها – آنها ارزان هستند، به سرعت ادغام میشوند و برای آزمایش یا حجمهای کاری کم، عالی هستند.
- مهاجرت جریانهای پرحجم – زمانی که تعداد توکنها بهطور مداوم از نقطه سربهسر فراتر رفت، آن خط لولهها را به یک کلاستر داخلی منتقل کنید.
- حفظ یک شبکه ایمنی – درخواستهای گاهبهگاه یا ناگهانی را روی API نگه دارید تا از تخصیص بیش از حد منابع در محل (on-prem) جلوگیری شود.
محاسبات توکن را بهطور منظم انجام دهید، سپس هزینههای عملیاتی را که در قیمتهای خام سختافزار لحاظ نشده است، به آن اضافه کنید. تصمیماتی که بر اساس این تصویر کامل گرفته شوند، بسیار کمتر احتمال دارد که تحت تأثیر افسانهها قرار گیرند.
نتیجهگیری
اگر محصول هوش مصنوعی شما ماهانه کمتر از چند میلیون توکن پردازش میکند، سادهترین و ارزانترین راه همچنان فراخوانی یک API است. تنها زمانی که تقاضای مداوم و پرحجم، انطباق سختگیرانه یا نیازهای تأخیر سفارشی ایجاد شود، میزبانی شخصی از نظر مالی مقرونبهصرفه میشود — و حتی در آن زمان نیز، پیش از آنکه پیروزی خود را بر فضای ابری اعلام کنید، باید هزینه پنهان نیروی انسانی و زیرساخت را نیز در نظر بگیرید.
