كشفت DeepMind النقاب عن DiffusionGemma هذا الأسبوع، وهو نموذج لغوي مفتوح الأوزان يمكنه توليد ما يقرب من 1,500 توكن في الثانية على وحدة معالجة رسومات H100 واحدة، بينما يصل نموذج Gemma 4 القياسي إلى ما يقرب من 303 توكن في الثانية. وتكتسب هذه الزيادة في السرعة أهمية كبيرة لأنها قد تقلص عنق زجاجة زمن الاستجابة (latency) الذي يبطئ الوكلاء المدعومين بالذكاء الاصطناعي في التطبيقات التي تعمل في الوقت الفعلي.
كيف يكسر DiffusionGemma نمط التوليد "توكن تلو الآخر"
تولد معظم النماذج اللغوية الحديثة النصوص بشكل ذاتي الانحدار (autoregressively): حيث تتنبأ بتوكن واحد، ثم تغذيه مرة أخرى في النموذج، ثم تتنبأ بالتوكن التالي. تفرض حلقة "من اليسار إلى اليمين" هذه اقتراناً وثيقاً بين الحوسبة والذاكرة، لأن أوزان النموذج يجب الوصول إليها لكل توكن على حدة. يستبدل DiffusionGemma هذه الحلقة بعملية انتشار منفصلة (discrete diffusion process) تعامل كتلة مكونة من 256 توكن ككتلة واحدة من البيانات المشوشة. بعد ذلك، يقوم النموذج بإزالة الضجيج (denoises) عن الكتلة بأكملها بالتوازي، مما ينقل عبء العمل من عمليات البحث المتكررة عن الأوزان إلى كمية أكبر من الحوسبة لكل خطوة. وفي الأجهزة التي تتفوق في العمليات الحسابية المتوازية، مثل Nvidia H100، تؤتي هذه المقايضة ثمارها.
لماذا تهم السرعة وكلاء الذكاء الاصطناعي
عادةً ما تقوم الوكلاء المستقلون بتشغيل دورة من البحث والتلخيص والاختبار. قد تتضمن كل خطوة عدة استدعاءات للنموذج، لذا فإن أي تأخير في زمن الاستجابة لكل توكن يتراكم بسرعة. عندما يتوقف النموذج، يتراكم مسار عمل الوكيل بالكامل، مما يؤدي إلى زيادة التكاليف وتدهور تجربة المستخدم.
المقايضة في الأداء
تأتي سرعة DiffusionGemma بتكلفة ملموسة في القدرة الخام. ففي معيار AIME — وهو مجموعة اختبارات تقيس الاستدلال والواقعية وفهم اللغة — سجل DiffusionGemma 69.1، بينما وصل Gemma 4 إلى 88.3. كما يظهر نهج الانتشار نقاط ضعف في المخرجات القصيرة جداً و"تأتأة" التوكنات العرضية، حيث يكرر النص المولد نفسه أو يتردد. وعندما يقوم أكثر من 32 مستخدماً بالاستعلام من النموذج في وقت واحد، تتلاشى الميزة المتوازية وتلحق بها الطريقة ذاتية الانحدار القياسية في إجمالي معدل الإنتاجية.
أين يناسب كل نهج
تشير البيانات إلى استراتيجية نشر هجينة:
- نماذج الانتشار (Diffusion models) للمهام ذات التزامن المنخفض والحساسة لزمن الاستجابة التي لا تتطلب استدلالاً عميقاً — مثل توليد المطالبات (prompts) القصيرة، أو ملء القوالب، أو إنتاج مسودات النصوص.
- النماذج ذاتية الانحدار (Autoregressive models) لأعباء العمل ذات التزامن العالي، أو الاستدلال المعقد، أو التوليد طويل الصيغة حيث تفوق الدقة أهمية السرعة الخام.
ما يعنيه هذا التحول للبنية التحتية للذكاء الاصطناعي
إذا أمكن تحقيق مكاسب السرعة من خلال إعادة التفكير في خوارزمية التوليد بدلاً من مجرد زيادة حجم النموذج، فإن أكبر مكاسب الكفاءة قد تأتي من تحسينات "البنية التحتية الأساسية". كما تعني هذه المقايضة أنه يجب على المطورين قبول انخفاض طفيف في الجودة لبعض حالات الاستخدام.
وجهة نظر معارضة: هل الانتشار جاهز للاستخدام الواسع؟
تعاني عملية تنفيذ الانتشار مع المطالبات القصيرة ويمكن أن تنتج مخرجات متذبذبة.
ما يجب مراقبته لاحقاً
- دراسات التوسع: هل ستتمكن نماذج الانتشار الأكبر من سد فجوة القدرة مع الحفاظ على السرعة؟
- تحسينات الأجهزة: مع تطور وحدات معالجة الرسومات (GPUs)، قد يتغير التوازن بين خطوات الانتشار كثيفة الحوسبة والأنظمة ذاتية الانحدار كثيفة الأوزان مرة أخرى.
- خوارزميات التوجيه: ستكشف النماذج الأولية لموجهات النماذج المدركة للمهام عن مدى إمكانية تقليص زمن استجابة النظام الإجمالي من خلال الاختيار الديناميكي.
الخلاصة
يثبت DiffusionGemma أن إعادة التفكير في حلقة التوليد الأساسية يمكن أن يقلص زمن الاستجابة دون إضافة المزيد من الرقائق. هذه التقنية ليست بديلاً كلياً للنماذج ذاتية الانحدار، ولكنها توفر أداة مقنعة لمكدس ذكاء اصطناعي هجين حيث يتم موازنة السرعة والدقة بناءً على كل مهمة. ومن المرجح أن يتم الحكم على الموجة القادمة من البنية التحتية للذكاء الاصطناعي ليس فقط من خلال حجم النموذج، ولكن من خلال مدى ذكاء توجيه العمل عبر المحرك المناسب.
