قام باحث مستقل بتسجيل كل رمز (token) استهلكه وكيله البحثي المدعوم بالنماذج اللغوية الكبيرة (LLM) لمدة شهر، مما أدى إلى خفض الفاتورة بنسبة 31%. انخفض الإنفاق من 945 دولاراً إلى 651 دولاراً، بينما ارتفع معدل النجاح قليلاً من 91% إلى 93%، وهي نتيجة سيلاحظها أي شخص يدير سير عمل للذكاء الاصطناعي حساس للتكلفة.
لماذا كانت البيانات على مستوى الرموز (tokens) مهمة
يرى معظم مستخدمي النماذج اللغوية الكبيرة (LLM) الفاتورة النهائية فقط - وهو مبلغ إجمالي يخفي تكلفة كل مهمة فرعية. قام وكيل الباحث بثلاثة إجراءات أساسية: البحث في ملفات هيئة الأوراق المالية والبورصات (SEC)، وصياغة التقارير، ودمج عمليات التوليف البحثي. وبدون بيانات دقيقة، لم يكن بإمكانه معرفة ما إذا كان مبلغ الـ 312 دولاراً الذي دفعه في يونيو قد أُنفق بشكل جيد.
للكشف عن التسرب الخفي، أضاف طبقة تسجيل باستخدام PostgreSQL التقطت اسم النموذج، وعدد الرموز، ونوع المهمة، والتكلفة لكل استدعاء. وبعد 30 يوماً، رسمت البيانات صورة واضحة:
- البحث في ملفات SEC – 41% من إجمالي الإنفاق
- صياغة التقارير – 28%
- التوليف البحثي – 17%
- فحوصات الجودة – 9%
- متنوع – 5%
أظهرت الأرقام أن الخطوة الأكثر تكلفة لم تكن النموذج نفسه، بل كيفية تغذية الوكيل لنتائج البحث الخام في الأوامر (prompts).
ثلاث تعديلات أدت إلى التوفير
1. لخص قبل إرسال الأمر (prompt)
في الأصل، كان الوكيل يحشو 20 نتيجة بحث خام في كل أمر، مما يؤدي إلى تضخم المدخلات بعدد كبير من الرموز. فقام بإدراج ملخص رخيص أولاً، مما قلل المدخلات بشكل كبير. انخفضت التكلفة لكل مهمة بحث من 0.84 دولار إلى 0.19 دولار - أي انخفاض بنسبة 77%.
2. توجيه الفحوصات البسيطة إلى نموذج أرخص
كانت فحوصات الجودة تُجرى على نموذج متطور بتكلفة 0.09 دولار لكل فحص. فقام باستبداله بنموذج أقل سعراً لمعظم فحوصات النجاح/الفشل، مما خفض سعر الفحص الواحد إلى 0.01 دولار. أجاب النموذج الأرخص بشكل صحيح في 89% من المرات؛ وأي فشل يتم تصعيده إلى النموذج الأصلي، مما يحافظ على الدقة مع خفض التكلفة بنسبة 87%.
3. تخطي الفحوصات عندما تكون الثقة عالية
أضاف قاعدة لتجاوز خطوة فحص الجودة كلما كان معدل النجاح التاريخي للمهمة مرتفعاً وكان طول المخرجات ضمن الحدود المتوقعة. أدى ذلك إلى إلغاء حوالي 60% من الفحوصات التي كانت ستُجرى على أي حال.
العائد
مع تطبيق التغييرات الثلاثة، بدا السجل الشهري كما يلي:
- إجمالي الإنفاق: 945 دولاراً ← 651 دولاراً (خفض بنسبة 31%)
- تكلفة البحث في SEC لكل مهمة: 0.84 دولار ← 0.19 دولار (خفض بنسبة 77%)
- تكلفة فحص الجودة لكل مهمة: 0.09 دولار ← 0.01 دولار (خفض بنسبة 87%)
- معدل النجاح الإجمالي: 91% ← 93%
يشير معدل النجاح الأعلى إلى أن الأوامر (prompts) الأقصر قللت من الضجيج وساعدت النموذج على التركيز على السؤال الجوهري.
تحذيرات ونقاط مقابلة
يعتمد هذا النهج على افتراضين. أولاً، يجب أن يحتفظ الملخص الأرخص بمعلومات كافية للاستدلال اللاحق؛ فإذا تخلص من التفاصيل المهمة، فقد تتأثر جودة المخرجات. ثانياً، النموذج الأقل تكلفة المستخدم لفحوصات الجودة ليس مثالياً؛ فدقة الـ 89% تعني أن نسبة صغيرة من الأخطاء لا تزال تصل إلى المنتج النهائي، رغم أن مسار التصعيد يمسك بمعظمها. قد يحتاج المستخدمون ذوو الاحتياجات الصارمة للامتثال إلى عتبات أكثر دقة أو خطوات تحقق إضافية.
ماذا يعني هذا لممارسي النماذج اللغوية الكبيرة (LLM)
- لوحات البيانات التفصيلية هي الفائزة. تخفي تقارير الإنفاق رفيعة المستوى هدر الرموز (tokens). إن تسجيل الاستخدام لكل مهمة يكشف عن أوجه عدم الكفاءة التي كانت ستظل مخفية لولا ذلك.
- النماذج الرائدة (Frontier models) ليست مطلوبة دائماً. يمكن للنموذج الرخيص ضغط البيانات أو اتخاذ قرارات ثنائية بسيطة دون المساس بالجودة الإجمالية.
غالباً ما تكون التكلفة الخفية لوكيل LLM هي العمل غير المقاس الذي يقوم به. من خلال تتبع تدفق الرموز وتطبيق تحسينات مستهدفة، حول الباحث فاتورة شهرية قدرها 945 دولاراً إلى عملية أكثر رشاقة بتكلفة 651 دولاراً مع دفع الأداء نحو الأعلى. بالنسبة لأي شخص يضع ميزانية لأعباء عمل الذكاء الاصطناعي، فإن الدرس واضح: قم بقياس كل رمز، ثم اترك البيانات تملي عليك أين يجب التقليص.
