اپنے براؤزر میں LLM ایجنٹ چلانا

زیادہ تر AI اسسٹنٹ ڈیٹا سینٹرز میں موجود ہوتے ہیں۔ انہیں ایک API key، ایک سرور کی ضرورت ہوتی ہے، اور وہ ہر درخواست پر چارج کرتے ہیں۔

میں نے کچھ مختلف بنایا ہے۔

میں نے LiquidAI LFM2.5 ماڈلز (230M اور 350M) کو مکمل طور پر آپ کے براؤزر میں چلانے کے لیے fine-tune کیا ہے—نہ کوئی سرور، نہ کلاؤڈ کے اخراجات۔

مقصد ایک ایسا ماڈل بنانا تھا جو اتنا چھوٹا ہو کہ ویب پیج کے ساتھ ہی فراہم کیا جا سکے۔

ماڈل مخصوص مصنوعات کے بارے میں حقائق محفوظ نہیں کرتا؛ بلکہ یہ پیٹرنز (patterns) سیکھتا ہے۔ ایک چھوٹا سا ماڈل دوبارہ تربیت (retraining) کے بغیر کافی شاپ، گروسری اسٹور، یا کسی بھی دوسری دکان کو چلا سکتا ہے۔

ماڈل کیا کرتا ہے

  • کسی کام کے لیے صحیح ٹول کا انتخاب کرتا ہے
  • آرگومنٹس (arguments) اور آئٹم آئی ڈیز (item IDs) کو درست طریقے سے جوڑتا ہے
  • حوالہ جات جیسے کہ "دوسرا والا" یا "ایک درجن" کو سمجھتا ہے
  • سوالات کے جوابات دینے کے لیے حاصل کردہ متن (retrieved text) کا استعمال کرتا ہے
  • معلومات کی کمی کی صورت میں انکار کر دیتا ہے
  • جب بات چیت موضوع سے ہٹ جائے تو اسے واپس صحیح سمت میں لاتا ہے

میں نے اسے کیسے بنایا

  • آٹھ ٹولز کا ایک سیٹ (search, add_to_cart, checkout, وغیرہ) فریز (freeze) کیا
  • RAG کو ایک الگ پائپ لائن کے بجائے ایک ٹول کے طور پر استعمال کیا
  • درستگی کے لیے grammar-constrained decoding کا استعمال کیا
  • 18 انٹرایکشن ریسپیز (interaction recipes) سے ایک مصنوعی ڈیٹا سیٹ (synthetic dataset) تیار کیا
  • ایک سنگل 16 GB GPU کا استعمال کرتے ہوئے 30 ملین ٹوکنز پر fine-tune کیا

تربیت کا مرکز میں نے ماڈل کو بلاک لسٹوں کے بجائے رویوں پر تربیت دی۔ الفاظ پر پابندی لگانے کے بجائے، میں نے اسے شائستگی سے بات چیت کو درست سمت میں موڑنا سکھایا۔

یہ کیوں اہم ہے

  • پرائیویسی: آپ کا ڈیٹا کبھی بھی آپ کے ڈیوائس سے باہر نہیں جاتا
  • آف لائن استعمال: یہ انٹرنیٹ کنکشن کے بغیر کام کرتا ہے
  • لاگت: انفرنس (inference) کے کوئی بل نہیں
  • رسائی: یہ پیچیدہ UI کو آواز کے ذریعے استعمال کے قابل بناتا ہے

ماڈل چھوٹا ہے، لیکن یہ مفید ہے۔ یہ پوچھنا بند کریں کہ کیا بڑے ماڈلز کام کر سکتے ہیں۔ یہ پوچھیں کہ ایک ڈیوائس پر مددگار رہتے ہوئے ایک ماڈل کتنا چھوٹا ہو سکتا ہے۔

Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe


Lajos Bencz نے 350 ملین پیرامیٹر والا ایک لینگویج ماڈل مکمل طور پر ویب براؤزر میں چلانے کے لیے fine-tune کیا ہے، جس سے ایک اسٹیٹک پیج ایک خود مختار شاپنگ اسسٹنٹ میں بدل جاتا ہے جسے نہ کسی API key، نہ سرور اور نہ ہی کلاؤڈ پر مبنی انفرنس اخراجات کی ضرورت ہوتی ہے۔ اس کا نتیجہ ایک پرائیویسی فرسٹ، آف لائن قابل AI ہے جو ہر ڈومین کے لیے دوبارہ تربیت کے بغیر کافی شاپ، گروسری اسٹور یا کسی بھی ملتی جلتی کیٹلاگ کو سنبھال سکتا ہے۔

براؤزر میں LLM کیوں چلائیں

زیادہ تر AI اسسٹنٹ ڈیٹا سینٹرز میں رہتے ہیں۔ ہر سوال انٹرنیٹ کے ذریعے سفر کرتا ہے، ایک API تک پہنچتا ہے، اور ہر درخواست پر فیس لاگت میں اضافہ کرتا ہے۔ یہ سیٹ اپ صارف کا ڈیٹا لیک کرتا ہے، نیٹ ورک کی ضرورت رکھتا ہے، اور بل میں تیزی سے اضافہ کرتا ہے۔ ماڈل کو کلائنٹ پر منتقل کرنے سے یہ مسائل ختم ہو جاتے ہیں۔ ڈیٹا مقامی مشین پر رہتا ہے، نیٹ ورک کٹ جانے پر بھی اسسٹنٹ کام کرتا ہے، اور انفرنس اخراجات صفر ہو جاتے ہیں۔

ماڈل کیسے بنایا گیا

  • ماڈل کا انتخاب – LiquidAI LFM2.5، 230M اور 350M ورینٹس سے آغاز کیا۔ ان کا سائز ایک عام ویب پیج کو انہیں ڈاؤن لوڈ کرنے کی اجازت دیتا ہے۔
  • ٹول سیٹ – ایجنٹ میں آٹھ یوٹیلیٹیز (search, add_to_cart, checkout, وغیرہ) کو ہارڈ کوڈ (hard-code) کیا۔ ماڈل سیکھتا ہے کہ کون سا ٹول استعمال کرنا ہے اور آئٹم آئی ڈیز جیسے آرگومنٹس کیسے پاس کرنے ہیں۔
  • RAG بطور ٹول – Retrieval-Augmented Generation کو محض ایک اور کال ایبل (callable) ٹول کے طور پر استعمال کیا، جس سے آرکیٹیکچر سادہ ہو گیا۔
  • Grammar-constrained decoding – ڈیکوڈر کو درست ٹول کال سنٹیکس تک محدود کیا، جس سے غلط آؤٹ پٹ میں نمایاں کمی آئی۔
  • مصنوعی ڈیٹا – 18 انٹرایکشن ریسپیز (مثلاً "دو درجن ڈونٹس شامل کریں") کو 30 ملین ٹوکن کے ڈیٹا سیٹ میں تبدیل کیا جو ایک سنگل 16 GB GPU پر تیار کیا گیا۔
  • رویے پر مبنی تربیت – بلاک لسٹوں کے بجائے، fine-tuning نے بات چیت کو درست سمت دینے پر زور دیا: غیر متعلقہ

آگے کیا دیکھنا ہے

کوڈ بیس (https://github.com/lajosbencz/frontend-agent) اوپن ہے، جو کمیونٹی کو ٹولز شامل کرنے، مصنوعی ترکیبوں (synthetic recipes) کو وسعت دینے، یا ہائبرڈ طریقوں کو آزمانے کی دعوت دیتا ہے۔

اہم نکتہ: ایک معتدل سائز کے LLM کو خود مختار ایجنٹ کے طور پر فائن ٹیون کرنا، ایک ویب پیج میں براہ راست فعال اور پرائیویسی برقرار رکھنے والا AI شامل کرنا ممکن بناتا ہے—بغیر کسی سرور، بغیر کسی فیس، اور اس طرح کہ صارف کے ڈیوائس سے کوئی ڈیٹا باہر نہ جائے۔