ما وراء نماذج Transformers: الشركات الناشئة التي تعيد تعريف العصر القادم للنماذج اللغوية الكبيرة (LLMs)

يواجه عصر نماذج Transformers عنق زجاجة جوهرياً مع وصول المتطلبات الحسابية للنماذج اللغوية الكبيرة (LLMs) إلى نقطة حرجة. وبينما وضعت ورقة "Attention Is All You Need" البحثية الصادرة عام 2017 الأساس لطفرة الذكاء الاصطناعي الحالية، يتسابق جيل جديد من الشركات الناشئة الآن لاستبدال البنية الأساسية أو إعادة ابتكارها لتحقيق كفاءة حقيقية.

عنق زجاجة Transformers: لماذا تفشل آلية الانتباه الكثيف (Dense Attention)

لما يقرب من عقد من الزمان، كانت نماذج Transformers هي المحرك لصناعة الذكاء الاصطناعي، مدعومة بآلية تُعرف باسم "الانتباه الكثيف" (dense attention). تقوم هذه العملية بمقارنة كل رمز (token) في كتلة نصية مع كل رمز آخر عبر عمليات ضرب واسعة النطاق. ورغم دقتها العالية في التقاط المعنى الدلالي، إلا أن تعقيدها الرياضي يتوسع بشكل سيئ.

على سبيل المثال، قد يتطلب مستند مكون من 10,000 كلمة من نموذج Transformer إجراء حوالي 50 مليون عملية ضرب. يؤدي هذا النمو التربيعي في الحوسبة إلى تحديين هائلين: استهلاك هائل للطاقة ونوافذ سياق (context windows) محدودة. ومع التقارير التي تشير إلى أن OpenAI ستنفق 50 مليار دولار على الحوسبة هذا العام، وتوقعات بمضاعفة الطلب على كهرباء مراكز البيانات بحلول عام 2030، فإن الصناعة تصطدم بجدار من التكلفة والفيزياء على حد سواء.

إعادة التفكير في الانتباه: صعود الآليات المتفرقة (Sparse Mechanisms)

لحل أزمة الكفاءة، تحاول عدة شركات ناشئة الابتعاد عن الانتباه الكثيف والتوجه نحو "الانتباه المتفرق" (sparse attention). فبدلاً من حساب كل زوج ممكن من الكلمات، يركز الانتباه المتفرق فقط على الروابط الأكثر صلة، مما يقلل بشكل كبير من العبء الحسابي.

وتعد شركة Subquadratic الناشئة، ومقرها ميامي، رائدة في هذا المجال من خلال نموذجها SubQ. وخلافاً للآليات المتفرقة السابقة التي واجهت صعوبة في الحفاظ على الدقة، تزعم Subquadratic أن تقنيتها تضاهي النماذج اللغوية الكبيرة (LLMs) السائدة في المهام المتخصصة مثل البرمجة والبحث. يتضمن نهجهم نظاماً ديناميكياً يحدد الكلمات التي تهم بالفعل لنص معين بشكل فوري، بدلاً من إهدار الدورات الحسابية على الرموز غير ذات الصلة.

الاحتفاظ بالطاقة (Power Retention): التوجه نحو الملخصات المتتابعة (Rolling Summaries)

يتضمن نهج آخر الابتعاد عن آلية الانتباه تماماً. حيث تقود شركة Manifest AI، ومقرها سان فرانسيسكو، تقنية تسمى "الاحتفاظ بالطاقة" (power retention). وبينما تحاول نماذج الانتباه المتفرق مثل SubQ لا تزال الحفاظ على صورة تقريبية لنافذة السياق بأكملها، يعمل "الاحتفاظ بالطاقة" من خلال تزويد النموذج بملخص متتابع لذاكرته.

مع دخول معلومات جديدة إلى نافذة السياق، يحدد النموذج البيانات الأقل صلة ويحذفها، مما يضمن بقاء العبء الحسابي قابلاً للإدارة بغض النظر عن حجم المدخلات. وقد أثبتت Manifest AI بالفعل جدوى هذا النهج من خلال:

  • تحويل نموذج StarCoder مفتوح المصدر إلى PowerCoder باستخدام تقنية الاحتفاظ بالطاقة.
  • إصدار Brumby، وهو نموذج تزعم أنه ينافس نماذج Qwen مفتوحة المصدر الشهيرة من Alibaba.

إن القدرة على تكييف نماذج Transformers الحالية لتصبح نماذج "احتفاظ بالطاقة" بأقل قدر من إعادة التدريب تشير إلى أن الانتقال إلى "LLMs+" — الجيل القادم من النماذج — قد يحدث بشكل أسرع بكثير مما كان متوقعاً.

خلاصات رئيسية

  • حدود Transformers: التوسع التربيعي للانتباه الكثيف يجعل تشغيل النماذج اللغوية الكبيرة (LLMs) الحالية مكلفاً للغاية ويصعب توسيع نطاقه لمجموعات البيانات الضخمة أو الاستدلال طويل المدى.
  • التفرق مقابل الاحتفاظ: تهاجم الشركات الناشئة المشكلة من جانبين: تقوم Subquadratic بتحسين الانتباه عبر الحسابات المتفرقة (SubQ)، بينما تقوم Manifest AI باستبداله بملخصات متتابعة (Power Retention).
  • الضرورة الاقتصادية: مع وصول تكاليف حوسبة الذكاء الاصطناعي إلى عشرات المليارات من الدولارات، فإن الفائز في عصر الذكاء الاصطناعي القادم سيكون على الأرجح هو من يجد حلاً للكفاءة بدلاً من مجرد التوسع في الحجم.