أسعار نماذج اللغة الكبيرة (LLM) هي هدف متغير. في شهر ما، قد تسير ميزانية الاستدلال الخاصة بك تماماً كما هو متوقع؛ وفي الشهر التالي، يقوم أحد المزودين بتعديل سعر الرمز (token) الخاص به، فتتغير نفقاتك الشهرية دون تمرير طلب إضافي واحد. هذا هو بالضبط ما حدث للتو. لقد قامت GMICloud وNovita وStreamLake جميعها بتحديث أسعار نماذجها، وإذا كنت تدير أعباء عمل إنتاجية — أو حتى مسارات تجريبية — فإن هذه المراجعات تستحق نظرة فاحصة. ليس لأن السوق ينهار، ولكن لأن الاختلافات الصغيرة في اقتصاديات الرموز تتراكم بشكل قاسٍ عندما تقوم بمعالجة ملايين الرموز يومياً.
من هم هؤلاء المزودون
يلعب كل من GMICloud وNovita وStreamLake دوراً متميزاً في بنية البنية التحتية للذكاء الاصطناعي، لكنهم الآن يتداخلون بشكل مباشر في تكلفة تشغيل نماذج اللغة الكبيرة.
تعمل GMICloud في مجال السحابة عالية الأداء لوحدات معالجة الرسومات (GPU) وتوفر كتالوجاً متنامياً من نماذج LLM المستضافة للمطورين الذين يرغبون في الوصول عبر API دون الحاجة إلى إدارة مجموعاتهم الخاصة. أما Novita فقد بنت سمعتها حول تأجير وحدات GPU بأسعار معقولة وخدمة النماذج، مما جذب المهندسين الذين يفضلون النماذج ذات الأوزان المفتوحة (open-weight models) بخصومات مقارنة بالأسعار المرتفعة التي تفرضها الشركات العملاقة (hyperscalers). أما StreamLake، التي نشأت من المنظومة السحابية والإعلامية لشركة ByteDance، فهي تجلب خبرتها في البنية التحتية للفيديو إلى سباق الاستدلال وتخدم النماذج من خلال منصة تتعامل أيضاً مع أعباء عمل معالجة الوسائط الثقيلة.
لا يعد أي منهم من الأسماء الشهيرة عالمياً مثل OpenAI أو Anthropic. وهذا هو بالضبط سبب أهمية تحركات تسعيرهم. إنهم يقعون في الفئة المتوسطة الهجومية في السوق، حيث الهوامش ضئيلة، والخصومات شائعة، والسباق لجذب المطورين مستمر. عندما تقوم ثلاث منصات في هذه الفئة بتغيير قوائم أسعارها في نفس الوقت تقريباً، فإنها تعيد بشكل جماعي وضع المعيار لما يجب أن تكون عليه تكلفة تشغيل النماذج مفتوحة المصدر أو النماذج التي تم ضبطها بدقة (fine-tuned).
ما الذي تغير
أثرت التحديثات على تسعير استخدام LLM عبر الخدمات الثلاث. لقد وثّق Naren، في كتابته باسم narevbot على Dev.to، التفاصيل في منشور يحلل التعديلات الدقيقة لكل نموذج لـ GMICloud وNovita وStreamLake. يمكنك قراءة المقارنة الكاملة هنا.
بدلاً من سرد أرقام السنتات لكل رمز والتي قد تتغير مرة أخرى قبل أن تنهي قراءة هذه الفقرة، فإن النقطة الحاسمة هي أن التغييرات هيكلية. أعاد كل مزود توازن كيفية احتساب رسوم الرموز، وفي بعض الحالات تغير المراجعات النموذج الأكثر رخصاً لحمل عمل معين. نادراً ما يكون هذا مجرد زيادة أو نقصان بسيط وشامل. قد يخفض أحد المزودين أسعار الإدخال بينما يرفع أسعار الإخراج. وقد يترك مزود آخر النماذج ذات المعلمات الصغيرة دون تغيير ولكنه يرفع الأسعار على نقاط النهاية (endpoints) ذات السياق الطويل. ولأن الثلاثة يدعمون تركيبات مختلفة من Llama وQwen وMistral وبنيات أخرى، فإن الضرر أو الفائدة يعتمد تماماً على النموذج الذي توجهه عبر أي API.
لماذا تتغير فاتورتك حتى عندما يظل حجم حركة البيانات ثابتاً
لفهم التأثير، انظر إلى كيفية عمل فوترة LLM في الواقع. يتم محاسبتك دائماً تقريباً بشكل منفصل على رموز الإدخال (input tokens) ورموز الإخراج (output tokens)، والنسبة بينهما هي التي تحدد تكلفتك الفعلية. روبوت دعم العملاء الذي يتعامل مع عشرة آلاف محادثة يومياً قد يستهلك في المتوسط ألفي رمز إدخال وأربعمائة رمز إخراج لكل دردشة. عند سعر مختلط قدره ثلاثة دولارات لكل مليون رمز، فإن ذلك يبلغ حوالي أربعة وثمانين دولاراً في اليوم. إذا رفع المزود سعر الإخراج بنسبة عشرين بالمائة فقط، فإن التكلفة اليومية ترتفع لتتجاوز تسعين دولاراً. وعلى مدار ربع سنة، يمثل ذلك ما يقرب من ألف دولار من الإنفاق الإضافي لنفس حجم حركة البيانات.
قم بتوسيع هذا النطاق ليشمل مسار توليد المحتوى أو نظام التوليد المعزز بالاسترجاع (RAG) الذي يتعامل مع ملايين الرموز في الساعة، وسيصبح المزود الذي تختاره بنداً رئيسياً في ميزانيتك. GMICloud وNovita وStreamLake يدركون ذلك. تغييرات تسعيرهم هي تحركات مدروسة تهدف إلى حالات استخدام محددة: مهام الدفعات (batch jobs) عالية الحجم، أو تطبيقات الدردشة ذات زمن الاستجابة المنخفض، أو مهام التلخيص ذات السياق الطويل.
تضيف التعقيدات طبقة أخرى. تفرض بعض المنصات رسوماً دنيا لكل طلب، أو رسوم خمول للإنتاجية المخصصة (provisioned throughput)، أو رسوماً إضافية لتجاوز حدود معدل الطلبات (rate-limit bursts). التغيير في الحد الأدنى لرسوم الطلب يضر المستخدمين ذوي الحجم المنخفض أكثر بكثير من المستخدمين ذوي الحجم المرتفع. وقد يؤدي التغيير في خصومات الاستدلال بالدفعات (batch inference) إلى خفض تكلفة إنشاء تقاريرك الليلية مع ترك فاتورة API في الوقت الفعلي دون تغيير. قراءة العنوان "تحديث الأسعار" ليست كافية؛ عليك قراءة المصفوفة بالكامل.
كيف تتعامل مع الأمر دون مبالغة في رد الفعل
عندما تتغير المعدلات، تقع معظم الفرق الهندسية في أحد خطأين: فإما أن يتجاهلوا هذا التغيير ويتحملوا تجاوز التكاليف بصمت، أو يصابوا بالذعر.
