تشغيل وكيل LLM في متصفحك
تستقر معظم المساعدات الذكية في مراكز البيانات. فهي تحتاج إلى مفتاح API، وخادم، وتفرض رسومًا مقابل كل طلب.
لقد قمت ببناء شيء مختلف.
لقد قمت بضبط نماذج LiquidAI LFM2.5 (بأحجام 230 مليون و350 مليون معلمة) بدقة لتعمل بالكامل داخل متصفحك — دون الحاجة إلى خادم أو تكاليف سحابية.
كان الهدف هو جعل النموذج صغيرًا بما يكفي ليتم إرساله مع صفحة الويب.
النموذج لا يخزن حقائق حول منتجات محددة؛ بل يتعلم الأنماط. يمكن لنموذج واحد صغير أن يدير مقهى، أو متجر بقالة، أو أي متجر آخر دون الحاجة إلى إعادة تدريب.
ما يفعله النموذج
- يختار الأداة المناسبة للمهمة
- يربط الوسائط (arguments) ومعرفات العناصر (item IDs) بشكل صحيح
- يفهم الإشارات مثل "الثاني" أو "درزن"
- يستخدم النصوص المسترجعة للإجابة على الأسئلة
- يرفض الإجابة عند نقص المعلومات
- يعيد توجيه المحادثة عندما تخرج عن الموضوع
كيف بنيته
- تجميد مجموعة من ثماني أدوات (search، add_to_cart، checkout، إلخ)
- التعامل مع RAG كأداة بدلاً من كونه مسار معالجة منفصل
- تطبيق فك التشفير المقيد بالقواعد (grammar-constrained decoding) لضمان الدقة
- إنشاء مجموعة بيانات اصطناعية من 18 وصفة تفاعل
- الضبط الدقيق (Fine-tuning) على 30 مليون رمز (tokens) باستخدام وحدة معالجة رسومات واحدة بسعة 16 جيجابايت
التركيز في التدريب لقد دربت النموذج على السلوكيات، وليس على قوائم الكلمات المحظورة. فبدلاً من حظر الكلمات، علمته كيفية توجيه المحادثات بلباقة.
لماذا يهم هذا الأمر
- الخصوصية: بياناتك لا تغادر جهازك أبدًا
- الاستخدام دون اتصال: يعمل بدون اتصال بالإنترنت
- التكلفة: صفر من فواتير الاستدلال (inference)
- سهولة الوصول: يجعل واجهات المستخدم المعقدة قابلة للتنقل عبر الصوت
النموذج صغير، لكنه مفيد. توقف عن التساؤل عما إذا كانت النماذج العملاقة يمكنها أداء المهام، واسأل بدلاً من ذلك عن مدى صغر النموذج الذي يمكن أن يظل مفيدًا على الجهاز.
Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe
قام Lajos Bencz بضبط نموذج لغوي مكون من 350 مليون معلمة بدقة ليعمل بالكامل داخل متصفح الويب، محولاً صفحة ثابتة إلى مساعد تسوق مستقل لا يحتاج إلى مفتاح API، ولا خادم، ولا تكاليف استدلال سحابية. والنتيجة هي ذكاء اصطناعي يركز على الخصوصية وقادر على العمل دون اتصال، ويمكنه إدارة مقهى أو متجر بقالة أو أي كتالوج مماثل دون الحاجة إلى إعادة تدريبه لكل مجال.
لماذا يتم تشغيل LLM في المتصفح
تعيش معظم المساعدات الذكية في مراكز البيانات. حيث تنتقل كل استعلام عبر الإنترنت، وتصل إلى API، وتتسبب في رسوم لكل طلب. هذا الإعداد يسرب بيانات المستخدم، ويتطلب شبكة، وتتراكم تكاليفه بسرعة في الفاتورة. نقل النموذج إلى العميل (client) يقضي على هذه المشكلات؛ حيث تبقى البيانات على الجهاز المحلي، ويعمل المساعد عند انقطاع الشبكة، وتنخفض تكاليف الاستدلال إلى الصفر.
كيف تم بناء النموذج
- اختيار النموذج – بدأ باستخدام LiquidAI LFM2.5، بنسختي 230 مليون و350 مليون معلمة. حجمهما يسمح لصفحة الويب العادية بتنزيلهما.
- مجموعة الأدوات – تم برمجة ثماني أدوات (search، add_to_cart، checkout، إلخ) بشكل ثابت داخل الوكيل. يتعلم النموذج الأداة التي يجب استدعاؤها وكيفية تمرير الوسائط مثل معرفات العناصر.
- RAG كأداة – تم التعامل مع التوليد المعزز بالاسترجاع (RAG) كأداة أخرى قابلة للاستدعاء، مما بسط البنية التحتية.
- فك التشفير المقيد بالقواعد – تم تقييد فك التشفير بصيغة استدعاء الأدوات الصحيحة، مما قلل بشكل كبير من المخرجات المشوهة.
- البيانات الاصطناعية – تم تحويل 18 وصفة تفاعل (مثل "أضف درزن دونات") إلى مجموعة بيانات مكونة من 30 مليون رمز تم إنشاؤها باستخدام وحدة معالجة رسومات واحدة بسعة 16 جيجابايت.
- التدريب المرتكز على السلوك – بدلاً من قوائم الحظر، ركز الضبط الدقيق على توجيه المحادثة: إعادة توجيه الدردشة الخارجة عن الموضوع بلباقة، والرفض عند نقص المعلومات، وتأكيد الإشارات الغامضة مثل "الثاني".
تم إجراء الضبط الدقيق على وحدة معالجة رسومات واحدة بسعة 16 جيجابايت.
ما يمكن للوكيل فعله
- اختيار الأدوات – يقرر ما إذا كان الاستعلام يحتاج إلى بحث، أو تحديث سلة التسوق، أو وظيفة أخرى.
- معالجة الوسائط – يحلل معرفات العناصر، والكميات، والواصفات (مثل "درزن") ويمررها بشكل صحيح.
- حل الإشارات – يربط عبارات مثل "الثاني" بالعنصر المناسب في القائمة المسترجعة.
- إجابات مدفوعة بـ RAG – يجلب النص ذي الصلة ويدمجه في الردود.
- الرفض اللبق – يرفض الإجابة عند غياب المعلومات المطلوبة بدلاً من الهلوسة.
- توجيه المحادثة – يعيد الملاحظات الخارجة عن الموضوع نحو المهمة دون كسر تدفق الحديث.
يُظهر العرض التجريبي المباشر (https://lajosbencz.github.io/frontend-agent/) الوكيل وهو يتعامل مع تدفق تجارة إلكترونية بسيط، من التصفح إلى الدفع، عبر إدخال صوتي أو نصي.
القيود والنقاط المضادة
(تم ترك هذا القسم فارغًا عن عمد)
ماذا تتابع لاحقاً
قاعدة الكود (https://github.com/lajosbencz/frontend-agent) مفتوحة المصدر، مما يدعو المجتمع لإضافة أدوات، أو توسيع الوصفات الاصطناعية، أو تجربة مناهج هجينة.
الخلاصة: إن الضبط الدقيق لنموذج لغوي كبير (LLM) متوسط الحجم ليصبح وكيلًا مستقلاً بذاته يجعل من الممكن دمج ذكاء اصطناعي وظيفي يحافظ على الخصوصية مباشرة في صفحة الويب — دون الحاجة لخوادم، ودون رسوم، ودون خروج أي بيانات من جهاز المستخدم.
