एक डेवलपर ने 350-मिलियन-पैरामीटर वाले लैंग्वेज मॉडल को लिया, उसे फाइन-ट्यून किया, और एक पूरी तरह से कार्यात्मक AI असिस्टेंट के रूप में तैनात किया जो किसी भी आधुनिक वेब ब्राउज़र के भीतर चलता है—बिना किसी सर्वर कॉल, बिना किसी API की, और बिना किसी क्लाउड बिल के।
यह प्रोजेक्ट मॉडल के वेट्स (weights) को एक स्टैटिक वेबपेज के साथ भेजता है, जिससे एजेंट टूल्स चुन सकता है, आर्गुमेंट्स को बाइंड कर सकता है, "दूसरा वाला" (the second one) जैसे संदर्भों को हल कर सकता है, और जानकारी की कमी होने पर उत्तर देने से मना कर सकता है—और यह सब तब भी होता है जब आपका डेटा आपके अपने डिवाइस पर ही रहता है।
ब्राउज़र-आधारित एजेंट कैसे बनाया गया
इसकी शुरुआत LiquidAI के LFM2.5 परिवार से हुई, विशेष रूप से 230M और 350M पैरामीटर वेरिएंट्स से।
मॉडल में प्रोडक्ट कैटलॉग या प्राइस टेबल भरने के बजाय, ट्रेनर ने इसे इंटरैक्शन के पैटर्न सिखाए। एजेंट कभी भी किसी विशिष्ट SKU को नहीं जानता; यह सीखता है कि कैसे:
- किसी दिए गए अनुरोध के लिए उपयुक्त टूल चुनें।
- उस टूल के लिए सही आर्गुमेंट्स और आइडेंटिफायर बाइंड करें।
- अस्पष्ट संदर्भों (“एक दर्जन,” “दूसरा वाला”) की व्याख्या करें।
- बाहरी टेक्स्ट प्राप्त करें और प्रश्नों के उत्तर देने के लिए उसका उपयोग करें।
- आवश्यक जानकारी न होने पर मना कर दें।
- बातचीत को विषय पर बनाए रखें।
टूलसेट जानबूझकर स्टैटिक रखा गया है: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout, और navigate| रोस्टर को फ्रीज करने से मॉडल टूल ID को याद करने से बच जाता है और फाइन-ट्यूनिंग डेटा छोटा रहता है।
तीन इंजीनियरिंग विकल्प सिस्टम को हल्का रखते हैं:
- फ्रोज़न टूल रोस्टर – मॉडल कार्यों की एक निश्चित सूची देखता है, इसलिए इसे टूल नामों के बड़े शब्दकोश की आवश्यकता नहीं होती है।
- एक टूल के रूप में RAG – Retrieval-augmented generation (RAG) किसी अन्य फंक्शन की तरह काम करता है। एजेंट टेक्स्ट प्राप्त करने के लिए
search_knowledgeको कॉल करता है, फिर उस टेक्स्ट को सीधे अपने रिस्पॉन्स में डाल देता है, जिससे एक अलग रिट्रीवल पाइपलाइन से बचा जा सकता है जो लेटेंसी और मेमोरी ओवरहेड बढ़ा सकती थी। - ग्रामर-कंस्ट्रेंड डिकोडिंग – जनरेशन के दौरान डिकोडर एक सरल व्याकरण (grammar) का पालन करता है जो आउटपुट को एक वैध टूल-कॉल स्ट्रक्चर में मजबूर करता है। यह बाधा बेकार के टोकन को खत्म करती है और गलत कमांड्स को कम करती है।
ट्रेनिंग के लिए सिंथेटिक डेटा डिस्टिलेशन का उपयोग किया गया। लेखक ने 18 इंटरैक्शन रेसिपीज़ को परिभाषित किया, जिनमें से प्रत्येक एक विशिष्ट यूजर-असिस्टेंट एक्सचेंज का वर्णन करती है। एक बड़े "टीचर" मॉडल ने नेचुरल-लैंग्वेज पक्ष को जनरेट किया, जबकि एक डिटरमिनिस्टिक स्क्रिप्ट ने सटीक टूल-कॉल फॉर्मेट तैयार किया। फाइन-ट्यूनिंग रन में लगभग 30 मिलियन टोकन का उपयोग हुआ और यह 16 GB मेमोरी वाले सिंगल GPU पर फिट हो गया।
ऑन-डिवाइस क्यों महत्वपूर्ण है
- प्राइवेसी – सभी यूजर प्रॉम्प्ट ब्राउज़र की मेमोरी में रहते हैं। डिवाइस से कोई भी टेलीमेट्री बाहर नहीं जाती है, जो संवेदनशील प्रश्नों के लिए महत्वपूर्ण है।
- ऑफलाइन क्षमता – क्योंकि मॉडल स्थानीय रूप से कैश (cache) किया गया है, इसलिए असिस्टेंट बिना इंटरनेट कनेक्शन के काम करता है, जिससे फील्ड वर्क या यात्रा के लिए संभावनाएं खुल जाती हैं।
- लागत – स्टैटिक मॉडल फाइलों को भेजने से बार-बार GPU-संचालित इन्फरेंस सर्वर या प्रति-कॉल API फीस की आवश्यकता समाप्त हो जाती है।
- एक्सेसिबिलिटी – जटिल वेब इंटरफेस का वॉयस-ड्रिवन नेविगेशन कम-स्पेक वाले डिवाइस पर भी संभव हो जाता है, जिससे वेब एप्लिकेशन की पहुंच उन उपयोगकर्ताओं तक बढ़ जाती है जो सहायक तकनीक (assistive technology) पर निर्भर हैं।
ये लाभ बातचीत को "क्या एक विशाल मॉडल इसका उत्तर दे सकता है?" से बदलकर "एक मॉडल कितना छोटा हो सकता है जबकि वह अभी भी उपयोगी सहायता प्रदान कर सके?" पर ले आते हैं।
संभावित सीमाएं
इस आकार का मॉडल विश्वकोश जैसे तथ्यों (encyclopedic facts) को याद नहीं रख सकता। जब कोई यूजर किसी विशिष्ट उत्पाद की कीमत या हालिया समाचार की हेडलाइन पूछता है, तो असिस्टेंट या तो search_knowledge के माध्यम से जानकारी प्राप्त करता है या विनम्रता से मना कर देता है। यह डिज़ाइन प्राइवेसी की रक्षा करता है लेकिन सिस्टम को उसके बाहरी ज्ञान स्रोत की गुणवत्ता और नवीनता (freshness) से भी जोड़ देता है।
आगे क्या देखें
पब्लिक डेमो एक साधारण GitHub Pages URL पर उपलब्ध है, और सोर्स कोड खुले तौर पर उपलब्ध है।
निष्कर्ष (Takeaway): एक मध्यम आकार के LLM को सख्त टूल ग्रामर का पालन करना सिखाकर और रिट्रीवल को बस एक अन्य फंक्शन के रूप में मानकर, डेवलपर्स एक उपयोगी AI असिस्टेंट पेश कर सकते हैं जो पूरी तरह से ब्राउज़र में रहता है—जो मुख्य संवादात्मक क्षमताओं (conversational abilities) से समझौता किए बिना प्राइवेसी, ऑफलाइन उपयोग और शून्य क्लाउड लागत प्रदान करता है।
