قام أحد المطورين بأخذ نموذج لغوي يحتوي على 350 مليون معلمة (parameter)، وقام بضبطه بدقة (fine-tuned)، ونشره كمساعد ذكاء اصطناعي يعمل بكامل وظائفه داخل أي متصفح ويب حديث — دون الحاجة إلى استدعاءات للخادم، أو مفاتيح API، أو فواتير سحابية.
يرفق المشروع أوزان النموذج (model's weights) مع صفحة ويب ثابتة، مما يسمح للوكيل (agent) باختيار الأدوات، وربط الوسائط (arguments)، وحل المراجع مثل "الثاني"، ورفض الإجابة عند نقص المعلومات — كل ذلك بينما تظل بياناتك على جهازك الخاص.
كيف تم بناء الوكيل القائم على المتصفح
كانت نقطة البداية هي عائلة LFM2.5 من LiquidAI، وتحديداً الإصدارات التي تحتوي على 230 مليون و350 مليون معلمة.
بدلاً من حشو كتالوجات المنتجات أو جداول الأسعار داخل النموذج، قام المدرب بتعليمه أنماط التفاعل. لا يعرف الوكيل أبداً رمز SKU محدد؛ بل يتعلم كيفية:
- اختيار الأداة المناسبة لطلب معين.
- ربط الوسائط والمعرفات الصحيحة بتلك الأداة.
- تفسير المراجع الغامضة ("درزن"، "الثاني").
- جلب نص خارجي واستخدامه للإجابة على الأسئلة.
- الرفض عندما تكون المعلومات المطلوبة مفقودة.
- الحفاظ على موضوع المحادثة.
مجموعة الأدوات ثابتة عن عمد: list_items و get_item و search_knowledge و add_to_cart و remove_from_cart و clear_cart و checkout و navigate. إن تجميد قائمة الأدوات يمنع النموذج من حفظ معرفات الأدوات (tool IDs) ويحافظ على صغر حجم بيانات الضبط الدقيق.
هناك ثلاثة خيارات هندسية تجعل النظام خفيف الوزن:
- قائمة أدوات مجمدة – يرى النموذج قائمة ثابتة من الإجراءات، لذا لا يحتاج إلى مفردات كبيرة من أسماء الأدوات.
- RAG كأداة – يعمل التوليد المعزز بالاسترجاع (RAG) مثل أي وظيفة أخرى. يستدعي الوكيل
search_knowledgeلجلب النص، ثم يدرج ذلك النص مباشرة في استجابته، مما يتجنب خط أنابيب استرجاع منفصل قد يضيف تأخيراً (latency) وعبئاً على الذاكرة. - فك التشفير المقيد بالقواعد (Grammar-constrained decoding) – أثناء التوليد، يتبع فك التشفير قواعد بسيطة تجبر المخرجات على اتخاذ هيكل استدعاء أدوات صالح. يزيل هذا القيد الرموز (tokens) الضائعة ويقلل من الأوامر المشوهة.
استخدم التدريب تقنية تقطير البيانات الاصطناعية (synthetic data distillation). حدد المؤلف 18 وصفة تفاعل، تصف كل منها تبادلاً نموذجياً بين المستخدم والمساعد. قام نموذج "معلم" أكبر بتوليد جانب اللغة الطبيعية، بينما أنتج نص برمجي حتمي (deterministic script) تنسيق استدعاء الأدوات الدقيق. استهلكت عملية الضبط الدقيق حوالي 30 مليون رمز (token) وتناسب وحدة معالجة رسومات (GPU) واحدة بذاكرة 16 جيجابايت.
لماذا يهم التشغيل على الجهاز
- الخصوصية – تظل جميع مطالبات المستخدم (prompts) في ذاكرة المتصفح. لا تخرج أي بيانات عن بُعد (telemetry) من الجهاز، وهو أمر مهم للاستفسارات الحساسة.
- القدرة على العمل دون اتصال – نظرًا لأن النموذج مخزن مؤقتاً محلياً، يعمل المساعد بدون اتصال بالإنترنت، مما يفتح آفاقاً للعمل الميداني أو السفر.
- التكلفة – يزيل إرسال ملفات النموذج الثابتة الحاجة إلى خوادم استدلال (inference servers) تعمل بقدرات GPU بشكل متكرر أو رسوم API لكل استدعاء.
- سهولة الوصول – يصبح التنقل المدفوع بالصوت عبر واجهات الويب المعقدة ممكناً على الأجهزة ذات المواصفات المنخفضة، مما يوسع نطاق تطبيقات الويب للمستخدمين الذين يعتمدون على التقنيات المساعدة.
تنقل هذه المزايا النقاش من "هل يمكن لنموذج ضخم الإجابة على هذا؟" إلى "ما مدى صغر حجم النموذج مع استمرار تقديم مساعدة مفيدة؟"
القيود المحتملة
لا يمكن لنموذج بهذا الحجم الاحتفاظ بحقائق موسوعية. عندما يطلب المستخدم سعر منتج معين أو عنوان خبر حديث، يقوم المساعد إما باسترداد المعلومات عبر search_knowledge أو يرفض بأدب. يحمي هذا التصميم الخصوصية ولكنه يربط النظام أيضاً بجودة وحداثة مصدر معرفته الخارجي.
ما الذي يجب مراقبته لاحقاً
يتوفر العرض التجريبي العام على رابط GitHub Pages بسيط، والكود المصدري متاح علناً.
الخلاصة: من خلال تعليم نموذج لغوي كبير (LLM) متواضع الحجم اتباع قواعد أدوات صارمة ومعاملة الاسترجاع كمجرد وظيفة أخرى، يمكن للمطورين تقديم مساعد ذكاء اصطناعي مفيد يعيش بالكامل داخل المتصفح — مما يوفر الخصوصية، والاستخدام دون اتصال، وتكلفة سحابية صفرية دون التضحية بالقدرات الحوارية الأساسية.
