أعلنت مايكروسوفت عن إطار عمل BitNet مفتوح المصدر، وهو أداة تتيح للمطورين تشغيل نماذج اللغة الكبيرة (LLMs) ذات الـ 1-بت على وحدة معالجة مركزية (CPU) واحدة، وتدعي تحقيق زيادة في السرعة تصل إلى ستة أضعاف مقارنة بأكواد الاستدلال الحالية التي تعتمد على وحدة المعالجة المركزية فقط.
لماذا تهم نماذج الـ 1-بت
تستخدم معظم نماذج اللغة الكبيرة الحديثة أرقام الفاصلة العائمة (floating-point) بدقة 16 أو 32 بت، مما يؤدي إلى تضخم استهلاك الذاكرة واستهلاك الطاقة. يستبدل BitNet تلك الأرقام بعمليات حسابية بدقة "1.58 بت"، مما يحصر كل وزن في القيم –1 أو 0 أو +1. يؤدي هذا الاختزال إلى تقليص حجم النموذج بشكل كبير؛ حيث يمكن لشبكة مكونة من 100 مليار معلمة (parameter) أن تعمل على معالج من فئة أجهزة الكمبيوتر المحمولة. يجب على المطورين تدريب النماذج من الصفر باستخدام بنية BitNet؛ فالأمر ليس مجرد عملية تحويل بسيطة.
مكاسب الأداء المُبلغ عنها
- الإنتاجية (Throughput): 5-7 توكنات (tokens) في الثانية على نواة وحدة معالجة مركزية (CPU) واحدة.
- السرعة مقابل llama.cpp: أسرع بمقدار 2.37 إلى 6.17 مرة على معالجات x86.
- استهلاك الطاقة: طاقة أقل بنسبة تصل إلى 82.2% على نفس الأجهزة.
- الذاكرة: متطلبات ذاكرة وصول عشوائي (RAM) أقل بمقدار 16 إلى 32 مرة.
يحتوي النموذج الرائد الذي تم إصداره مع قاعدة الكود، BitNet-b1.58-2B-4T، على 2.4 مليار معلمة. وتوفر مايكروسوفت البرنامج بموجب ترخيص MIT المرن، مما يدعو أي شخص لبناء نماذج 1-بت خاصة به أو تعديلها أو إعادة توزيعها.
حالات الاستخدام الموجهة للحوسبة الطرفية (Edge-first)
يفتح تشغيل الاستدلال (inference) دون الحاجة إلى وحدة معالجة رسومات (GPU) الأبواب أمام التطبيقات التي تعمل دون اتصال بالإنترنت أو التطبيقات الحساسة للخصوصية. إذ يمكن لأجهزة إنترنت الأشياء (IoT) الصغيرة، والطائرات بدون طيار المستخدمة في الميدان، وأجهزة الكمبيوتر المحمولة التي تفتقر إلى اتصال بالإنترنت، دمج قدرات لغوية محلياً. كما أن انخفاض استهلاك الطاقة يجذب الأجهزة التي تعمل بالبطاريات.
ما هي القيود
تتمثل العقبة الأكبر في التدريب من الصفر. فلا يمكن ببساطة "تكميم البتات" (bit-quantized) للنماذج مفتوحة المصدر الحالية مثل Llama وتحويلها إلى تنسيق BitNet؛ بل يجب إعادة بنائها باستخدام نظام الأوزان ثلاثي القيم.
من المستفيد، ومن سيبقى على حاله
- الشركات الناشئة والهواة: قد تؤدي تكاليف الأجهزة المنخفضة إلى تسريع التجارب وبناء النماذج الأولية للمنتجات.
- الشركات ذات سياسات سيادة البيانات الصارمة: يتيح الاستدلال المحلي (On-premise) تجنب إرسال البيانات إلى مزودي الخدمات السحابية.
- مختبرات الذكاء الاصطناعي واسعة النطاق: من المرجح أن تستمر في استخدام وحدات معالجة الرسومات (GPUs) للتدريب والخدمة عالية الإنتاجية، حيث لا تزال السرعة الخام أمراً بالغ الأهمية.
ما الذي يجب مراقبته لاحقاً
- تبني المجتمع: سيظهر عدد النماذج التابعة لجهات خارجية والمدربة بتنسيق BitNet مدى سرعة نمو النظام البيئي.
- تكامل الأدوات: قد يؤدي التوافق مع خطوط أنابيب التدريب ومنصات النشر الشائعة إلى جعل إطار العمل أكثر سهولة في الاستخدام.
- اختبارات الأداء في العالم الحقيقي: ستكشف القياسات المستقلة للدقة وزمن الاستجابة واستهلاك الطاقة على أجهزة متنوعة عما إذا كانت المكاسب المزعومة صامدة خارج المختبر.
- مزيد من أبحاث التكميم (quantization): إذا تمكن الباحثون من خفض عرض البتات بشكل أكبر دون التضحية بالجودة، فسيصبح حلم الاعتماد على وحدة المعالجة المركزية فقط أكثر واقعية.
يثبت BitNet أن تشغيل نماذج لغوية ضخمة على المعالجات اليومية أمر ممكن تقنياً، لكنه لا يلغي الحاجة إلى وحدات معالجة الرسومات (GPUs) في سيناريوهات الأداء العالي. قد يساهم إطار العمل في إضفاء الطابع الديمقراطي على الذكاء الاصطناعي لشريحة أوسع من المطورين، بينما ستظل أعباء العمل الحسابية الثقيلة التي تقود الأبحاث المتطورة متمحورة حول وحدات معالجة الرسومات (GPU) في المستقبل المنظور.
