یک تحلیل هزینه جدید نشان می‌دهد که میزبانی شخصی (self-hosting) یک مدل زبانی بزرگ تنها زمانی از APIهای تجاری پیشی می‌گیرد که یک کسب‌وکار ماهانه تقریباً ۵ تا ۱۰ میلیون توکن ورودی پردازش کند. برای هر کسی که در حال بودجه‌بندی خدمات هوش مصنوعی است، نقطه سر‌به‌سر تعیین می‌کند که آیا جذابیت وزن‌های باز (open weights) «رایگان» به صرفه‌جویی واقعی تبدیل می‌شود یا خیر.

مدل API

ارائه‌دهندگان API به ازای هر توکن هزینه دریافت می‌کنند و تمام مسائل مربوط به سخت‌افزار، برق و سیستم خنک‌کننده را مدیریت می‌کنند. نرخ‌های عمومی فعلی عبارتند از:

  • Claude Sonnet 5 – ۲ دلار به ازای هر میلیون توکن ورودی
  • GPT-5.6 – حدود ۱ دلار به ازای هر میلیون توکن ورودی
  • Meta Muse Spark – ۱.۲۵ دلار به ازای هر میلیون توکن ورودی، ۴.۲۵ دلار به ازای هر میلیون توکن خروجی

این مدل به صورت «پرداخت به میزان مصرف» (pay-as-you-go) است. وقتی ترافیک به صفر برسد، صورت‌حساب نیز صفر می‌شود. کاربران همچنین از دردسرهای خرابی GPU، به‌روزرسانی‌های فریم‌ور و برنامه‌ریزی ظرفیت در امان می‌مانند.

مدل میزبانی شخصی (Self-Hosting)

اجرای یک مدل با وزن‌های باز روی سخت‌افزار خودتان به این معناست که صرف‌نظر از میزان استفاده، هزینه محاسباتی بر عهده شماست. یک واحد NVIDIA H100 — که انتخابی رایج برای استنتاج (inference) مدل‌های زبانی بزرگ است — هزینه‌های زیر را دارد:

  • ۲ تا ۳ دلار در ساعت در سرویس‌های ابری عمومی GPU
  • ۷ تا ۱۲ دلار در ساعت در پلتفرم‌های ابری بزرگ (AWS, Azure)

این یعنی تقریباً ۱,۸۰۰ تا ۲,۰۰۰ دلار در ماه برای کارکرد مداوم یک واحد H100. قیمت سخت‌افزار تنها بخش قابل مشاهده صورت‌حساب است.

نقطه تلاقی اعداد

این تحلیل نشان می‌دهد که میزبانی شخصی زمانی از APIهای ممتاز ارزان‌تر می‌شود که حجم توکن‌های ورودی ماهانه به محدوده ۵ تا ۱۰ میلیون برسد. پایین‌تر از این آستانه، نرخ‌های API به ازای هر توکن برنده هستند. در حجم‌های ۱۰۰ میلیون توکن در ماه یا بیشتر، خط هزینه صرفاً سخت‌افزاری به زیر خط API می‌رود و میزبانی شخصی را روی کاغذ جذاب نشان می‌دهد.

هزینه‌های عملیاتی پنهان

اجاره GPU تنها حدود ۳۰ درصد از هزینه واقعی اجرای یک مدل در محیط عملیاتی است. مابقی هزینه‌ها مربوط به موارد زیر است:

  • شبکه و ذخیره‌سازی – لینک‌های با پهنای باند بالا و دیسک‌های سریع، تأخیر (latency) را پایین نگه می‌دارند.
  • افزونگی و نظارت – نمونه‌های متعدد (instances)، بررسی سلامت (health checks) و خط لوله‌های هشدار، هم هزینه‌های نرم‌افزاری و هم سخت‌افزاری را افزایش می‌دهند.
  • استعدادهای مهندسی – آنلاین نگه داشتن مطمئن یک مدل معمولاً به ۱.۵ تا ۲ مهندس تمام‌وقت نیاز دارد. با نرخ‌های بازار، این موضوع ۲۷۰,۰۰۰ تا ۵۵۰,۰۰۰ دلار به هزینه‌های سالانه می‌افزاید.

وقتی این لایه‌ها اضافه شوند، صرفه‌جویی ظاهری ناشی از سخت‌افزار به تنهایی به سرعت از بین می‌رود.

چه کسانی باید میزبانی شخصی را مد نظر قرار دهند

میزبانی شخصی تنها تحت شرایط خاصی منطقی است:

  • حجم بسیار بالا و مداوم – سازمان باید به‌طور منظم از آستانه ۵ میلیون توکن فراتر رود، در غیر این صورت قیمت API به ازای هر توکن کمتر باقی می‌ماند.
  • محدودیت‌های نظارتی یا حریم خصوصی داده‌ها – برخی بخش‌ها ارسال داده‌های اختصاصی یا شخصی به نقاط پایانی (endpoints) شخص ثالث را ممنوع می‌کنند.
  • سفارشی‌سازی تخصصی یا تضمین تأخیر – زمانی که یک مدل باید روی داده‌های داخلی تنظیم دقیق (fine-tune) شود یا پاسخ‌های زیر یک ثانیه ارائه دهد، مالکیت زیرساخت می‌تواند توجیه‌پذیر باشد.

اگر هیچ‌کدام از این فشارها وجود نداشته باشد، هزینه‌های پنهان کارکنان و زیرساخت اغلب بر صرفه‌جویی در سخت‌افزار غلبه می‌کند.

یک استراتژی ترکیبی

اکثر تیم‌هایی که به مقیاسی می‌رسند که در آن میزبانی شخصی امکان‌پذیر است، همچنان از یک رویکرد ترکیبی استفاده می‌کنند:

  1. شروع با APIها – آن‌ها ارزان هستند، به سرعت ادغام می‌شوند و برای آزمایش یا حجم‌های کاری کم، عالی هستند.
  2. مهاجرت جریان‌های پرحجم – زمانی که تعداد توکن‌ها به‌طور مداوم از نقطه سر‌به‌سر فراتر رفت، آن خط لوله‌ها را به یک کلاستر داخلی منتقل کنید.
  3. حفظ یک شبکه ایمنی – درخواست‌های گاه‌به‌گاه یا ناگهانی را روی API نگه دارید تا از تخصیص بیش از حد منابع در محل (on-prem) جلوگیری شود.

محاسبات توکن را به‌طور منظم انجام دهید، سپس هزینه‌های عملیاتی را که در قیمت‌های خام سخت‌افزار لحاظ نشده است، به آن اضافه کنید. تصمیماتی که بر اساس این تصویر کامل گرفته شوند، بسیار کمتر احتمال دارد که تحت تأثیر افسانه‌ها قرار گیرند.

نتیجه‌گیری

اگر محصول هوش مصنوعی شما ماهانه کمتر از چند میلیون توکن پردازش می‌کند، ساده‌ترین و ارزان‌ترین راه همچنان فراخوانی یک API است. تنها زمانی که تقاضای مداوم و پرحجم، انطباق سخت‌گیرانه یا نیازهای تأخیر سفارشی ایجاد شود، میزبانی شخصی از نظر مالی مقرون‌به‌صرفه می‌شود — و حتی در آن زمان نیز، پیش از آنکه پیروزی خود را بر فضای ابری اعلام کنید، باید هزینه پنهان نیروی انسانی و زیرساخت را نیز در نظر بگیرید.