شرکت‌ها با سرعت زیادی در حال گسترش زیرساخت‌های هوش مصنوعی هستند، اما یک «شکاف محاسباتی» (compute gap) رو به گسترش میان هزینه‌های سرمایه‌ای و نظارت عملیاتی در حال ظهور است. در حالی که سازمان‌ها برای تأمین سخت‌افزار عجله دارند، متوجه می‌شوند که توانایی آن‌ها در اندازه‌گیری اقتصاد واحد (unit economics) و میزان بهره‌وری GPU با سرعت سرمایه‌گذاری همخوانی ندارد.

شکاف محاسباتی: سرمایه‌گذاری سریع در مقابل دید کم

مطالعه پژوهشی VentureBeat Pulse روی ۱۰۷ شرکت، نشان‌دهنده یک گسست آشکار در چرخه حیات هوش مصنوعی است. شرکت‌ها سرمایه خود را صرف زیرساخت‌ها می‌کنند اما فاقد ابزارهای سنجش (telemetry) برای مدیریت آن‌ها هستند. تمایل به هزینه کردن به شدت در حال افزایش است، اما بلوغ مرحله تولید همچنان پایین است؛ تنها ۲۱٪ از شرکت‌های مورد بررسی، هوش مصنوعی را در مقیاس تولید اجرا می‌کنند.

بحرانی‌ترین نشانه، ناکارآمدی است. ۸۳ درصد از شرکت‌ها میزان بهره‌وری GPU خود را ۵۰ درصد یا کمتر گزارش می‌دهند. بدتر از آن، کمتر از نصف آن‌ها (۴۴٪) می‌توانند با دقت هزینه‌های واقعی محاسبات هوش مصنوعی خود را ردیابی کنند. بنابراین، سرمایه‌گذاری‌های سنگین و پرشتاب بدون دید لازم برای هدایت اقتصاد بلندمدت انجام می‌شوند.

تغییر پویایی تأمین‌کنندگان و نرخ ریزش بالا

ابرهای مقیاس‌پذیر بزرگ (hyperscalers) سنتی و APIهای مدل، بر این حوزه تسلط دارند. Google Cloud با ۴۸٪ از میزان استفاده در صدر قرار دارد و پس از آن Microsoft Azure (۲۹٪)، AWS (۲۲٪) و Oracle Cloud (۲۲٪) قرار دارند. مصرف مدل‌ها حول محور Gemini (۴۱٪) و OpenAI (۴۰٪) متمرکز است. ابرهای تخصصی هوش مصنوعی مانند CoreWeave، Lambda و Together کمتر از ۲٪ از بازار را در اختیار دارند.

نوسان بالا است. ۶۴ درصد از شرکت‌ها قصد دارند ظرف دوازده ماه آینده تأمین‌کننده زیرساخت خود را تغییر داده یا به آن اضافه کنند و ۳۸٪ قصد دارند این کار را در فصل آینده انجام دهند. ادغام با زیرساخت‌های موجود عامل ۴۱٪ از این تصمیمات است، در حالی که کل هزینه مالکیت (TCO) ۳۵٪ از آن‌ها را شامل می‌شود. تنها ۸٪ قیمت‌های اصلی توکن را دلیل اصلی ذکر کرده‌اند.

مرز بعدی: ابرهای تخصصی و پهنای باند حافظه

شرکت‌هایی که از مرحله آزمایش فراتر می‌روند، چشم به ابرهای تخصصی هوش مصنوعی دوخته‌اند. ۴۵ درصد قصد دارند در سال آینده چنین تأمین‌کنندگانی را ارزیابی کنند که این بزرگترین حوزه برنامه‌ریزی شده برای ارزیابی است.

یک محدودیت فنی جدید در حال ظهور است: پهنای باند حافظه (memory bandwidth)، و نه قدرت محاسباتی خام GPU، محدودکننده استنتاج (inference) در مقیاس بزرگ خواهد بود. تنها حدود ۲۰٪ از شرکت‌ها از این گلوگاه آگاه هستند یا اقداماتی برای رفع آن انجام می‌دهند. برای توسعه‌دهندگان و مدیران ارشد فناوری (CTOs)، تسلط بر پهنای باند، مرز بین استنتاج مقیاس‌پذیر و هزینه‌های افسارگسیخته خواهد بود.

نکات کلیدی

  • ناکارآمدی یک قاعده است: ۸۳٪ از شرکت‌ها GPUها را با بهره‌وری ≤ ۵۰٪ اجرا می‌کنند؛ کمتر از نصف آن‌ها می‌توانند هزینه‌های محاسباتی را به دقت ردیابی کنند.
  • نرخ ریزش تأمین‌کنندگان بالا است: ۶۴٪ قصد دارند ظرف یک سال تأمین‌کننده خود را تغییر داده یا اضافه کنند که اولویت آن‌ها ادغام (۴۱٪) و TCO (۳۵٪) است.
  • حرکت به سمت تخصصی‌سازی: ۴۵٪ برای پر کردن شکاف محاسباتی، ابرهای تخصصی هوش مصنوعی را ارزیابی خواهند کرد.
  • احتمال بروز مشکل پهنای باند حافظه: تقریباً ۲۰٪ از شرکت‌ها این گلوگاه نوظهور را شناسایی کرده یا به آن رسیدگی می‌کنند.

مقاله

نظرسنجی پژوهشی VentureBeat Pulse از ۱۰۷ شرکت نشان می‌دهد که ۸۳٪ از آن‌ها GPUها را با نصف ظرفیت یا کمتر اجرا می‌کنند، در حالی که تنها ۴۴٪ می‌توانند هزینه دقیق هر ساعت محاسبات را تعیین کنند. این عدم تطابق باعث شده است که ۶۴٪ از پاسخ‌دهندگان قصد داشته باشند ظرف سال آینده تأمین‌کننده زیرساخت خود را تغییر داده یا به آن اضافه کنند.

چرا «شکاف محاسباتی» اکنون اهمیت دارد

اعداد اصلی تصویری تکان‌دهنده را ترسیم می‌کنند: هزینه‌های هوش مصنوعی بالا می‌رود، اما بلوغ مرحله تولید عقب می‌ماند. تنها ۲۱٪ از شرکت‌ها می‌گویند هوش مصنوعی را در مقیاس تولید اجرا می‌کنند، به این معنی که بیشتر سرمایه‌گذاری‌ها در آزمایشگاه‌ها، اثبات‌های مفهوم (PoC) یا سخت‌افزارهای بلااستفاده باقی مانده است. بهره‌وری پایین GPU مستقیماً به اتلاف سرمایه منجر می‌شود؛ سرورهایی که نیمی از ظرفیت آن‌ها پر نشده است، همچنان برق مصرف می‌کنند، نیاز به خنک‌سازی دارند و فضای رک را اشغال می‌کنند. وقتی کمتر از نصف سازمان‌ها بتوانند هزینه هر GPU را ردیابی کنند، بودجه‌بندی به حدس و گمان تبدیل می‌شود و مدیران مالی (CFOs) با یک جعبه سیاه روبرو می‌شوند که می‌تواند بودجه فناوری یک سال را منفجر کند.

چگونه به اینجا رسیدیم

این هیاهو زمانی شروع شد که ابرهای مقیاس‌پذیر بزرگ (hyperscalers)، نمونه‌های مخصوص هوش مصنوعی و APIهای مدل-به‌عنوان-سرویس (model-as-a-service) را عرضه کردند. اکنون Google Cloud میزبان ۴۸٪ از حجم کاری‌های مورد بررسی است و پس از آن Microsoft Azure (۲۹٪)، AWS (۲۲٪) و Oracle Cloud (۲۲٪) قرار دارند. مصرف مدل‌ها نیز مشابه این تقسیم‌بندی است، به طوری که Gemini و OpenAI هر کدام تقریباً ۴۰٪ از میزان استفاده را به خود اختصاص داده‌اند. جذابیت این مدل مشخص بود: یک ابر قابل اعتماد، GPUهای آماده برای اجرا و مدل پرداخت به میزان مصرف (pay-as-you-go) که هزینه‌های شفاف را وعده می‌داد.

این مطالعه یک هزینه پنهان را فاش می‌کند. دشواری‌های ادغام، عامل اصلی تصمیم برای جابجایی است: ۴۱٪ به سختیِ پیوند دادن زیرساخت تأمین‌کننده با خط لوله‌های (pipelines) موجود اشاره می‌کنند، در حالی که ۳۵٪ به کل هزینه مالکیت (TCO) اشاره دارند. تنها ۸٪ می‌گویند قیمت‌های اصلی توکن آن‌ها را منصرف می‌کند، که نشان می‌دهد قیمت‌های خام اهمیت کمتری نسبت به تناسب با اکوسیستم دارند.

مخاطرات برای تأمین‌کنندگان و خریداران

برای سه ابر بزرگ، سهم بازار غالب به آن‌ها قدرت چانه‌زنی می‌دهد، اما قصد تغییر تأمین‌کننده (churn intent)، نشان‌دهنده فرسایش این سلطه است.

خریداران با دو ریسک روبرو هستند. نخست، تداوم نرخ پایین بهره‌وری باعث افزایش هزینه به ازای هر عملیات استنتاج یا آموزش مدل می‌شود که توجیه اقتصادی هوش مصنوعی را از بین می‌برد. دوم، عدم شفافیت در هزینه‌ها مانع از برنامه‌ریزی استراتژیک می‌شود؛ بدون داشتن اقتصاد واحد شفاف، توجیه سرمایه‌گذاری‌های بیشتر یا تعیین قیمت برای محصولات ارتقایافته با هوش مصنوعی دشوار خواهد بود.

ظهور ابرهای تخصصی هوش مصنوعی

ابرهای تخصصی هوش مصنوعی — CoreWeave، Lambda و Together — در حال حاضر کمتر از ۲ درصد از بازار را در اختیار دارند. چهل و پنج درصد از شرکت‌ها می‌گویند که در سال آینده این ارائه‌دهندگان تخصصی را ارزیابی خواهند کرد، که این موضوع آن را به بزرگ‌ترین حوزه برنامه‌ریزی شده برای ارزیابی تأمین‌کنندگان تبدیل می‌کند. ارزش پیشنهادی آن‌ها بر پایه یکپارچگی بیشتر با زنجیره‌های ابزار هوش مصنوعی، صورت‌حساب‌های دقیق‌تر و سخت‌افزاری تنظیم‌شده برای بارهای کاری هوش مصنوعی استوار است که می‌تواند بهره‌وری GPU را بسیار بالاتر از سقف ۵۰ درصدی که امروزه گریبان‌گیر اکثر شرکت‌هاست، ببرد.

یک نقطه کور فنی: پهنای باند حافظه

بحث سخت‌افزار در حال تغییر است. با گسترش بارهای کاری استنتاج، پهنای باند حافظه — یعنی سرعت جابه‌جایی داده‌ها به داخل و خارج از یک GPU — به یک گلوگاه تبدیل می‌شود و بر قدرت محاسباتی خام سایه می‌اندازد. با این حال، تنها حدود ۲۰ درصد از شرکت‌های مورد بررسی، یا این محدودیت را تشخیص داده‌اند و یا در حال برداشتن گام‌هایی برای رفع آن هستند. نادیده گرفتن پهنای باند می‌تواند به این معنا باشد که حتی یک GPU با بهره‌وری کامل نیز نمی‌تواند نرخ انتقال داده مورد نیاز را فراهم کند، که منجر به افزایش تعداد نمونه‌ها (instances) و هزینه‌های بالاتر می‌شود.

دیدگاه مقابل: هیپراسکالرها همچنان تسلط دارند

زود است که دوران هیپراسکالرها را پایان‌یافته اعلام کنیم. مقیاس، حضور جهانی و قراردادهای سازمانی موجود، همچنان آن‌ها را به انتخاب پیش‌فرض برای بسیاری تبدیل می‌کند. نظرسنجی نشان می‌دهد که اکثریت بارهای کاری همچنان روی این پلتفرم‌ها باقی مانده‌اند و برای سازمان‌هایی با استراتژی‌های چندابری (multi-cloud) تثبیت‌شده، اینرسی ممکن است بر جذابیت بهره‌وری بالاتر غلبه کند. علاوه بر این، سهم محدود ابرهای تخصصی از بازار نشان می‌دهد که اگرچه علاقه بالایی وجود دارد، اما مهاجرت تدریجی خواهد بود.

آنچه باید در آینده زیر نظر داشت

  • محدودیت‌های پهنای باند حافظه: با رشد بارهای کاری استنتاج، پهنای باند ممکن است به یک گلوگاه حیاتی تبدیل شود و بر انتخاب سخت‌افزار و تصمیمات معماری تأثیر بگذارد.

نکات کلیدی

  • ناکارآمدی یک امر عادی است: ۸۳ درصد از شرکت‌ها از GPUها با بهره‌وری کمتر یا مساوی ۵۰ درصد استفاده می‌کنند؛ تنها ۴۴ درصد می‌توانند هزینه‌های محاسباتی را به دقت ردیابی کنند.
  • تغییر تأمین‌کننده بسیار رایج است: ۶۴ درصد قصد دارند ظرف یک سال یک ارائه‌دهنده زیرساخت جدید جایگزین کنند یا به لیست خود اضافه کنند که دلیل اصلی آن یکپارچگی (۴۱ درصد) و هزینه کل مالکیت (TCO) (۳۵ درصد) است.
  • ابرهای تخصصی در حال رشد هستند: ۴۵ درصد در دوازده ماه آینده ابرهای تخصصی هوش مصنوعی را ارزیابی خواهند کرد تا شکاف محاسباتی را پر کنند.
  • پهنای باند حافظه یک محدودیت قریب‌الوقوع است: تقریباً ۲۰ درصد از شرکت‌ها از این گلوگاه نوظهور آگاه هستند یا در حال رسیدگی به آن می‌باشند.

شکاف بین هزینه‌های هوش مصنوعی و شفافیت اقتصادی دیگر یک موضوع حاشیه‌ای نیست؛ این مسئله استراتژی‌های تدارکات را بازتعریف کرده و باعث مهاجرت به سمت ارائه‌دهندگانی می‌شود که می‌توانند ثابت کنند هر دلار با بازدهی بیشتری به کار گرفته می‌شود.