شرکتها با سرعت زیادی در حال گسترش زیرساختهای هوش مصنوعی هستند، اما یک «شکاف محاسباتی» (compute gap) رو به گسترش میان هزینههای سرمایهای و نظارت عملیاتی در حال ظهور است. در حالی که سازمانها برای تأمین سختافزار عجله دارند، متوجه میشوند که توانایی آنها در اندازهگیری اقتصاد واحد (unit economics) و میزان بهرهوری GPU با سرعت سرمایهگذاری همخوانی ندارد.
شکاف محاسباتی: سرمایهگذاری سریع در مقابل دید کم
مطالعه پژوهشی VentureBeat Pulse روی ۱۰۷ شرکت، نشاندهنده یک گسست آشکار در چرخه حیات هوش مصنوعی است. شرکتها سرمایه خود را صرف زیرساختها میکنند اما فاقد ابزارهای سنجش (telemetry) برای مدیریت آنها هستند. تمایل به هزینه کردن به شدت در حال افزایش است، اما بلوغ مرحله تولید همچنان پایین است؛ تنها ۲۱٪ از شرکتهای مورد بررسی، هوش مصنوعی را در مقیاس تولید اجرا میکنند.
بحرانیترین نشانه، ناکارآمدی است. ۸۳ درصد از شرکتها میزان بهرهوری GPU خود را ۵۰ درصد یا کمتر گزارش میدهند. بدتر از آن، کمتر از نصف آنها (۴۴٪) میتوانند با دقت هزینههای واقعی محاسبات هوش مصنوعی خود را ردیابی کنند. بنابراین، سرمایهگذاریهای سنگین و پرشتاب بدون دید لازم برای هدایت اقتصاد بلندمدت انجام میشوند.
تغییر پویایی تأمینکنندگان و نرخ ریزش بالا
ابرهای مقیاسپذیر بزرگ (hyperscalers) سنتی و APIهای مدل، بر این حوزه تسلط دارند. Google Cloud با ۴۸٪ از میزان استفاده در صدر قرار دارد و پس از آن Microsoft Azure (۲۹٪)، AWS (۲۲٪) و Oracle Cloud (۲۲٪) قرار دارند. مصرف مدلها حول محور Gemini (۴۱٪) و OpenAI (۴۰٪) متمرکز است. ابرهای تخصصی هوش مصنوعی مانند CoreWeave، Lambda و Together کمتر از ۲٪ از بازار را در اختیار دارند.
نوسان بالا است. ۶۴ درصد از شرکتها قصد دارند ظرف دوازده ماه آینده تأمینکننده زیرساخت خود را تغییر داده یا به آن اضافه کنند و ۳۸٪ قصد دارند این کار را در فصل آینده انجام دهند. ادغام با زیرساختهای موجود عامل ۴۱٪ از این تصمیمات است، در حالی که کل هزینه مالکیت (TCO) ۳۵٪ از آنها را شامل میشود. تنها ۸٪ قیمتهای اصلی توکن را دلیل اصلی ذکر کردهاند.
مرز بعدی: ابرهای تخصصی و پهنای باند حافظه
شرکتهایی که از مرحله آزمایش فراتر میروند، چشم به ابرهای تخصصی هوش مصنوعی دوختهاند. ۴۵ درصد قصد دارند در سال آینده چنین تأمینکنندگانی را ارزیابی کنند که این بزرگترین حوزه برنامهریزی شده برای ارزیابی است.
یک محدودیت فنی جدید در حال ظهور است: پهنای باند حافظه (memory bandwidth)، و نه قدرت محاسباتی خام GPU، محدودکننده استنتاج (inference) در مقیاس بزرگ خواهد بود. تنها حدود ۲۰٪ از شرکتها از این گلوگاه آگاه هستند یا اقداماتی برای رفع آن انجام میدهند. برای توسعهدهندگان و مدیران ارشد فناوری (CTOs)، تسلط بر پهنای باند، مرز بین استنتاج مقیاسپذیر و هزینههای افسارگسیخته خواهد بود.
نکات کلیدی
- ناکارآمدی یک قاعده است: ۸۳٪ از شرکتها GPUها را با بهرهوری ≤ ۵۰٪ اجرا میکنند؛ کمتر از نصف آنها میتوانند هزینههای محاسباتی را به دقت ردیابی کنند.
- نرخ ریزش تأمینکنندگان بالا است: ۶۴٪ قصد دارند ظرف یک سال تأمینکننده خود را تغییر داده یا اضافه کنند که اولویت آنها ادغام (۴۱٪) و TCO (۳۵٪) است.
- حرکت به سمت تخصصیسازی: ۴۵٪ برای پر کردن شکاف محاسباتی، ابرهای تخصصی هوش مصنوعی را ارزیابی خواهند کرد.
- احتمال بروز مشکل پهنای باند حافظه: تقریباً ۲۰٪ از شرکتها این گلوگاه نوظهور را شناسایی کرده یا به آن رسیدگی میکنند.
مقاله
نظرسنجی پژوهشی VentureBeat Pulse از ۱۰۷ شرکت نشان میدهد که ۸۳٪ از آنها GPUها را با نصف ظرفیت یا کمتر اجرا میکنند، در حالی که تنها ۴۴٪ میتوانند هزینه دقیق هر ساعت محاسبات را تعیین کنند. این عدم تطابق باعث شده است که ۶۴٪ از پاسخدهندگان قصد داشته باشند ظرف سال آینده تأمینکننده زیرساخت خود را تغییر داده یا به آن اضافه کنند.
چرا «شکاف محاسباتی» اکنون اهمیت دارد
اعداد اصلی تصویری تکاندهنده را ترسیم میکنند: هزینههای هوش مصنوعی بالا میرود، اما بلوغ مرحله تولید عقب میماند. تنها ۲۱٪ از شرکتها میگویند هوش مصنوعی را در مقیاس تولید اجرا میکنند، به این معنی که بیشتر سرمایهگذاریها در آزمایشگاهها، اثباتهای مفهوم (PoC) یا سختافزارهای بلااستفاده باقی مانده است. بهرهوری پایین GPU مستقیماً به اتلاف سرمایه منجر میشود؛ سرورهایی که نیمی از ظرفیت آنها پر نشده است، همچنان برق مصرف میکنند، نیاز به خنکسازی دارند و فضای رک را اشغال میکنند. وقتی کمتر از نصف سازمانها بتوانند هزینه هر GPU را ردیابی کنند، بودجهبندی به حدس و گمان تبدیل میشود و مدیران مالی (CFOs) با یک جعبه سیاه روبرو میشوند که میتواند بودجه فناوری یک سال را منفجر کند.
چگونه به اینجا رسیدیم
این هیاهو زمانی شروع شد که ابرهای مقیاسپذیر بزرگ (hyperscalers)، نمونههای مخصوص هوش مصنوعی و APIهای مدل-بهعنوان-سرویس (model-as-a-service) را عرضه کردند. اکنون Google Cloud میزبان ۴۸٪ از حجم کاریهای مورد بررسی است و پس از آن Microsoft Azure (۲۹٪)، AWS (۲۲٪) و Oracle Cloud (۲۲٪) قرار دارند. مصرف مدلها نیز مشابه این تقسیمبندی است، به طوری که Gemini و OpenAI هر کدام تقریباً ۴۰٪ از میزان استفاده را به خود اختصاص دادهاند. جذابیت این مدل مشخص بود: یک ابر قابل اعتماد، GPUهای آماده برای اجرا و مدل پرداخت به میزان مصرف (pay-as-you-go) که هزینههای شفاف را وعده میداد.
این مطالعه یک هزینه پنهان را فاش میکند. دشواریهای ادغام، عامل اصلی تصمیم برای جابجایی است: ۴۱٪ به سختیِ پیوند دادن زیرساخت تأمینکننده با خط لولههای (pipelines) موجود اشاره میکنند، در حالی که ۳۵٪ به کل هزینه مالکیت (TCO) اشاره دارند. تنها ۸٪ میگویند قیمتهای اصلی توکن آنها را منصرف میکند، که نشان میدهد قیمتهای خام اهمیت کمتری نسبت به تناسب با اکوسیستم دارند.
مخاطرات برای تأمینکنندگان و خریداران
برای سه ابر بزرگ، سهم بازار غالب به آنها قدرت چانهزنی میدهد، اما قصد تغییر تأمینکننده (churn intent)، نشاندهنده فرسایش این سلطه است.
خریداران با دو ریسک روبرو هستند. نخست، تداوم نرخ پایین بهرهوری باعث افزایش هزینه به ازای هر عملیات استنتاج یا آموزش مدل میشود که توجیه اقتصادی هوش مصنوعی را از بین میبرد. دوم، عدم شفافیت در هزینهها مانع از برنامهریزی استراتژیک میشود؛ بدون داشتن اقتصاد واحد شفاف، توجیه سرمایهگذاریهای بیشتر یا تعیین قیمت برای محصولات ارتقایافته با هوش مصنوعی دشوار خواهد بود.
ظهور ابرهای تخصصی هوش مصنوعی
ابرهای تخصصی هوش مصنوعی — CoreWeave، Lambda و Together — در حال حاضر کمتر از ۲ درصد از بازار را در اختیار دارند. چهل و پنج درصد از شرکتها میگویند که در سال آینده این ارائهدهندگان تخصصی را ارزیابی خواهند کرد، که این موضوع آن را به بزرگترین حوزه برنامهریزی شده برای ارزیابی تأمینکنندگان تبدیل میکند. ارزش پیشنهادی آنها بر پایه یکپارچگی بیشتر با زنجیرههای ابزار هوش مصنوعی، صورتحسابهای دقیقتر و سختافزاری تنظیمشده برای بارهای کاری هوش مصنوعی استوار است که میتواند بهرهوری GPU را بسیار بالاتر از سقف ۵۰ درصدی که امروزه گریبانگیر اکثر شرکتهاست، ببرد.
یک نقطه کور فنی: پهنای باند حافظه
بحث سختافزار در حال تغییر است. با گسترش بارهای کاری استنتاج، پهنای باند حافظه — یعنی سرعت جابهجایی دادهها به داخل و خارج از یک GPU — به یک گلوگاه تبدیل میشود و بر قدرت محاسباتی خام سایه میاندازد. با این حال، تنها حدود ۲۰ درصد از شرکتهای مورد بررسی، یا این محدودیت را تشخیص دادهاند و یا در حال برداشتن گامهایی برای رفع آن هستند. نادیده گرفتن پهنای باند میتواند به این معنا باشد که حتی یک GPU با بهرهوری کامل نیز نمیتواند نرخ انتقال داده مورد نیاز را فراهم کند، که منجر به افزایش تعداد نمونهها (instances) و هزینههای بالاتر میشود.
دیدگاه مقابل: هیپراسکالرها همچنان تسلط دارند
زود است که دوران هیپراسکالرها را پایانیافته اعلام کنیم. مقیاس، حضور جهانی و قراردادهای سازمانی موجود، همچنان آنها را به انتخاب پیشفرض برای بسیاری تبدیل میکند. نظرسنجی نشان میدهد که اکثریت بارهای کاری همچنان روی این پلتفرمها باقی ماندهاند و برای سازمانهایی با استراتژیهای چندابری (multi-cloud) تثبیتشده، اینرسی ممکن است بر جذابیت بهرهوری بالاتر غلبه کند. علاوه بر این، سهم محدود ابرهای تخصصی از بازار نشان میدهد که اگرچه علاقه بالایی وجود دارد، اما مهاجرت تدریجی خواهد بود.
آنچه باید در آینده زیر نظر داشت
- محدودیتهای پهنای باند حافظه: با رشد بارهای کاری استنتاج، پهنای باند ممکن است به یک گلوگاه حیاتی تبدیل شود و بر انتخاب سختافزار و تصمیمات معماری تأثیر بگذارد.
نکات کلیدی
- ناکارآمدی یک امر عادی است: ۸۳ درصد از شرکتها از GPUها با بهرهوری کمتر یا مساوی ۵۰ درصد استفاده میکنند؛ تنها ۴۴ درصد میتوانند هزینههای محاسباتی را به دقت ردیابی کنند.
- تغییر تأمینکننده بسیار رایج است: ۶۴ درصد قصد دارند ظرف یک سال یک ارائهدهنده زیرساخت جدید جایگزین کنند یا به لیست خود اضافه کنند که دلیل اصلی آن یکپارچگی (۴۱ درصد) و هزینه کل مالکیت (TCO) (۳۵ درصد) است.
- ابرهای تخصصی در حال رشد هستند: ۴۵ درصد در دوازده ماه آینده ابرهای تخصصی هوش مصنوعی را ارزیابی خواهند کرد تا شکاف محاسباتی را پر کنند.
- پهنای باند حافظه یک محدودیت قریبالوقوع است: تقریباً ۲۰ درصد از شرکتها از این گلوگاه نوظهور آگاه هستند یا در حال رسیدگی به آن میباشند.
شکاف بین هزینههای هوش مصنوعی و شفافیت اقتصادی دیگر یک موضوع حاشیهای نیست؛ این مسئله استراتژیهای تدارکات را بازتعریف کرده و باعث مهاجرت به سمت ارائهدهندگانی میشود که میتوانند ثابت کنند هر دلار با بازدهی بیشتری به کار گرفته میشود.
