نموذج Bonsai 27B 1-bit الجديد من PrismML يتناسب مع ملف بحجم 3.9 جيجابايت ويعمل بسرعة تقارب 11 توكن (token) في الثانية على هاتف iPhone 17 Pro Max، مما يثبت أن نموذجاً لغوياً بـ 27 مليار معلمة (parameter) يمكن أن يعمل على هاتف ذكي استهلاكي. تكمن أهمية هذا الادعاء في أنه يدفع حدود الذكاء الاصطناعي على الأجهزة، مما يعد بمساعدين أوفلاين (offline) أكثر ثراءً دون الحاجة لإرسال البيانات إلى السحابة.

لماذا يهم هذا التقليص

يبلغ حجم نموذج Bonsai 27B كامل الدقة 54.7 جيجابايت. ومن خلال تكميم (quantising) النموذج إلى تمثيل أحادي البت (single-bit)، تمكنت PrismML من تقليصه إلى 3.9 جيجابايت، أي خفض الحجم بمقدار 14 ضعفاً. هذا الضغط يجعل النموذج قابلاً للتخزين تقنياً على هواتف iPhone المتطورة، وهو حد كان يستبعد سابقاً أي شيء يتجاوز بضع مئات من الميجابايت.

أداء النموذج على أجهزة Apple

قامت PrismML ببناء النموذج ليعمل على حزمة MLX من Apple، وهي مجموعة من واجهات برمجة التطبيقات (APIs) التي تتيح للمطورين تشغيل الشبكات العصبية مباشرة على المحرك العصبي (neural engine). وفي اختباراتها الخاصة، أنتج النموذج ما يقرب من 11 توكن في كل ثانية على هاتف iPhone 17 Pro Max. وعبر 15 اختباراً معيارياً للنماذج اللغوية، احتفظ إصدار الـ 1-bit بنسبة 89.5% من درجات جودة النموذج الأصلي، مما يشير إلى أن الضغط لم يضعف فائدته.

القيود العملية التي ستواجهها

  • ضغط الذاكرة – الملف بحجم 3.9 جيجابايت يتناسب مع الجهاز، لكن النموذج يحتاج أيضاً إلى ذاكرة تخزين مؤقت للمفاتيح والقيم (KV cache) لتخزين السياق الأخير. وتنمو هذه الذاكرة مع طول المحادثة ويمكن أن ترفع استهلاك ذاكرة الوصول العشوائي (RAM) في الهاتف، مما قد يؤدي إلى إبطاء السرعة.
  • الحرارة والبطارية – تشغيل شبكة بـ 27 مليار معلمة يمثل عبئاً على المحرك العصبي. تميل الهواتف إلى السخونة تحت الحمل المستمر، وستقوم إدارة الحرارة في Apple بتقليل الأداء لحماية الأجهزة. لم تصدر PrismML أرقاماً ملموسة حول استهلاك البطارية، لذا تظل التكلفة الفعلية لنمط الاستخدام اليومي غير معروفة.
  • خصوصية الجهاز – ينطبق ادعاء الأداء على أحدث هاتف iPhone 17 Pro Max. تفتقر هواتف iPhone الأقدم، أو أجهزة iOS من الفئات الأدنى، أو هواتف Android إلى نفس قدرات المحرك العصبي، وستشهد استدلالاً (inference) أبطأ أو قد لا يتناسب حجم النموذج معها على الإطلاق.

من المستفيد، ومن قد يتخلف عن الركب

يمكن لمطوري التطبيقات التي تولي الأولوية للخصوصية الآن استضافة نموذج لغوي كبير على الجهاز، مما يحافظ على بيانات المستخدم على الهاتف. قد يعني ذلك مساعدين صوتيين أكثر استجابة، أو ترجمة أوفلاين، أو توليد نصوص سياقية دون الحاجة إلى اشتراك سحابي.

سيفتقد مصنعو Android ومستخدمو الهواتف المتوسطة لهذه الميزة. يعتمد النموذج على حزمة Apple المملوكة لها، لذا فإن نفس عملية الضغط لن تعمل تلقائياً على الأنظمة البيئية الأخرى.

ما يزال بحاجة إلى اختبار

تأتي أرقام PrismML من اختبارات معيارية داخلية. يحتاج المختبرون المستقلون إلى التحقق من معدلات التوكن في الثانية عبر جلسات ممتدة، وقياس استهلاك البطارية الفعلي، وتقييم مدى سرعة تدهور الأداء مع توسع ذاكرة الـ KV cache. إن الاستخدام في العالم الحقيقي — مثل الدردشة لمدة ساعة، أو بث المحتوى، أو تشغيل النموذج جنباً إلى جنب مع تطبيقات أخرى — سيكشف ما إذا كان رقم 11 توكن في الثانية سيصمد خارج المختبر الخاضع للرقابة.

الخلاصة

يظهر نموذج Bonsai 27B أن النماذج اللغوية ذات الـ 27 مليار معلمة يمكن ضغطها بما يكفي لتعمل على هاتف iPhone رائد، مما يوفر جودة كاملة تقريباً بسرعة متواضعة. يعتمد هذا الاختراق على حزمة MLX من Apple ولا يزال يواجه عقبات عملية: العبء الإضافي على الذاكرة، والتقليل الحراري للأداء، والتأثير غير المعروف على البطارية. إذا أكدت الاختبارات اللاحقة هذه الادعاءات، فقد ينتقل الذكاء الاصطناعي على الأجهزة من مجرد عروض تجريبية محدودة إلى تطبيقات يومية — بشرط أن تتقلص الفجوة في الأجهزة بين هواتف iOS الرائدة وبقية السوق.