ایک ڈویلپر نے 350 ملین پیرامیٹر والا ایک لینگویج ماڈل لیا، اسے fine-tune کیا، اور اسے ایک مکمل طور پر فعال AI اسسٹنٹ کے طور پر ڈیپلائے کیا جو کسی بھی جدید ویب براؤزر کے اندر چلتا ہے—بغیر کسی سرور کال، API کیز، یا کلاؤڈ بل کے۔

یہ پروجیکٹ ماڈل کے weights کو ایک static webpage کے ساتھ فراہم کرتا ہے، جس سے ایجنٹ کو ٹولز منتخب کرنے، arguments کو bind کرنے، "the second one" جیسے حوالوں (references) کو حل کرنے، اور معلومات کی کمی کی صورت میں جواب دینے سے انکار کرنے کی اجازت ملتی ہے—اور یہ سب کچھ اس طرح کہ آپ کا ڈیٹا آپ کے اپنے ڈیوائس پر ہی رہتا ہے۔

براؤزر پر مبنی ایجنٹ کیسے بنایا گیا

اس کا آغاز LiquidAI کے LFM2.5 فیملی سے ہوا، خاص طور پر 230M اور 350M پیرامیٹر والے ورژنز سے۔

ماڈل میں پروڈکٹ کیٹلاگ یا قیمتوں کے ٹیبلز بھرنے کے بجائے، ٹرینر نے اسے بات چیت کے پیٹرنز (patterns) سکھائے۔ ایجنٹ کو کبھی بھی کوئی مخصوص SKU معلوم نہیں ہوتا؛ بلکہ وہ یہ سیکھتا ہے کہ:

  • کسی دی گئی درخواست کے لیے مناسب ٹول کا انتخاب کرنا۔
  • اس ٹول کے لیے درست arguments اور identifiers کو bind کرنا۔
  • مبہم حوالوں (“a dozen,” “the second one”) کی تشریح کرنا۔
  • بیرونی متن (text) حاصل کرنا اور اسے سوالات کے جواب دینے کے لیے استعمال کرنا۔
  • مطلوبہ معلومات کی عدم موجودگی میں انکار کرنا۔
  • گفتگو کو موضوع پر رکھنا۔

ٹول سیٹ جان بوجھ کر static رکھا گیا ہے: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout, اور navigate۔ فہرست کو فریز کرنے سے ماڈل کو tool IDs یاد کرنے سے روکا جا سکتا ہے اور fine-tuning ڈیٹا کو چھوٹا رکھا جا سکتا ہے۔

تین انجینئرنگ انتخاب سسٹم کو ہلکا پھلکا (lightweight) رکھتے ہیں:

  1. Frozen tool roster – ماڈل ایکشنز کی ایک مقررہ فہرست دیکھتا ہے، اس لیے اسے ٹول کے ناموں کے لیے وسیع ذخیرہ الفاظ کی ضرورت نہیں ہوتی۔
  2. RAG as a tool – Retrieval-augmented generation (RAG) کسی بھی دوسرے فنکشن کی طرح کام کرتا ہے۔ ایجنٹ متن حاصل کرنے کے لیے search_knowledge کو کال کرتا ہے، پھر اس متن کو براہ راست اپنے جواب میں شامل کر دیتا ہے، جس سے ایک علیحدہ retrieval pipeline سے بچا جا سکتا ہے جو latency اور memory overhead میں اضافہ کرتی۔
  3. Grammar-constrained decoding – جنریشن کے دوران، ڈیکوڈر ایک سادہ گرامر پر عمل کرتا ہے جو آؤٹ پٹ کو ایک درست tool-call ساخت میں لانے پر مجبور کرتا ہے۔ یہ پابندی فضول tokens کو ختم کرتی ہے اور غلط کمانڈز کو کم کرتی ہے۔

ٹریننگ کے لیے synthetic data distillation کا استعمال کیا گیا۔ مصنف نے بات چیت کے 18 طریقے (recipes) متعارف کرائے، جن میں سے ہر ایک صارف اور اسسٹنٹ کے درمیان ہونے والی عام گفتگو کی وضاحت کرتا ہے۔ ایک بڑے "teacher" ماڈل نے قدرتی زبان (natural language) والا حصہ تیار کیا، جبکہ ایک deterministic اسکرپٹ نے درست tool-call فارمیٹ تیار کیا۔ Fine-tuning کے عمل میں تقریباً 30 ملین tokens استعمال ہوئے اور یہ 16 GB میموری والے ایک ہی GPU پر چل گیا۔

آن ڈیوائس (on-device) کیوں اہم ہے

  • Privacy – تمام صارف کے پرامپٹس (prompts) براؤزر کی میموری میں رہتے ہیں۔ ڈیوائس سے کوئی بھی telemetry باہر نہیں جاتی، جو حساس سوالات کے لیے اہم ہے۔
  • Offline capability – چونکہ ماڈل مقامی طور پر کیش (cache) ہوتا ہے، اس لیے اسسٹنٹ انٹرنیٹ کنکشن کے بغیر بھی کام کرتا ہے، جو فیلڈ ورک یا سفر کے دوران نئے امکانات پیدا کرتا ہے۔
  • Cost – static ماڈل فائلز فراہم کرنے سے بار بار GPU پر مبنی inference servers یا فی کال API فیسوں کی ضرورت ختم ہو جاتی ہے۔
  • Accessibility – پیچیدہ ویب انٹرفیس کی آواز کے ذریعے نیویگیشن کم صلاحیت والے (low-spec) ڈیوائسز پر بھی ممکن ہو جاتی ہے، جس سے ویب ایپلی کیشنز کی رسائی ان صارفین تک بڑھ جاتی ہے جو معاون ٹیکنالوجی (assistive technology) پر انحصار کرتے ہیں۔

یہ فوائد گفتگو کا رخ "کیا ایک بڑا ماڈل اس کا جواب دے سکتا ہے؟" سے بدل کر "ایک ماڈل کتنا چھوٹا ہو سکتا ہے جبکہ وہ پھر بھی مفید مدد فراہم کر سکے؟" کی طرف کر دیتے ہیں۔

ممکنہ حدود

اس سائز کا ماڈل انسائیکلوپیڈک حقائق کو یاد نہیں رکھ سکتا۔ جب کوئی صارف کسی مخصوص پروڈکٹ کی قیمت یا حالیہ خبر کے بارے میں پوچھتا ہے، تو اسسٹنٹ یا تو search_knowledge کے ذریعے معلومات حاصل کرتا ہے یا شائستگی سے انکار کر دیتا ہے۔ یہ ڈیزائن پرائیویسی کا تحفظ کرتا ہے لیکن سسٹم کو اس کے بیرونی علمی ذرائع (knowledge source) کے معیار اور تازگی سے بھی جوڑ دیتا ہے۔

آگے کیا دیکھیں

پبلک ڈیمو ایک سادہ GitHub Pages URL پر دستیاب ہے، اور اس کا سورس کوڈ بھی کھلے عام دستیاب ہے۔

Takeaway: ایک درمیانے سائز کے LLM کو سخت ٹول گرامر پر عمل کرنا سکھا کر اور retrieval کو محض ایک اور فنکشن کے طور پر استعمال کر کے، ڈویلپرز ایک مفید AI اسسٹنٹ فراہم کر سکتے ہیں جو مکمل طور پر براؤزر میں رہتا ہے—جو بنیادی بات چیت کی صلاحیتوں کو قربان کیے بغیر پرائیویسی، آف لائن استعمال، اور زیرو کلاؤڈ لاگت کی پیشکش کرتا ہے۔