एका डेव्हलपरने ३५०-मिलियन पॅरामीटरचे लँग्वेज मॉडेल घेतले, त्याचे फाईन-ट्यूनिंग केले आणि ते पूर्णपणे कार्यान्वित AI असिस्टंट म्हणून तैनात केले जे कोणत्याही आधुनिक वेब ब्राउझरमध्ये चालते—कोणतेही सर्व्हर कॉल्स नाहीत, कोणतेही API की नाहीत आणि क्लाउड बिलही नाही.

हा प्रकल्प मॉडेलचे वेट्स (weights) एका स्टॅटिक वेबपेजसोबत पाठवतो, ज्यामुळे एजंटला टूल्स निवडणे, आर्ग्युमेंट्स बाइंड करणे, “दुसरे वाला” (the second one) सारख्या संदर्भांचा अर्थ लावणे आणि माहिती नसल्यास उत्तर देण्यास नकार देणे शक्य होते—आणि हे सर्व करताना तुमचा डेटा तुमच्या स्वतःच्या डिव्हाइसवरच राहतो.

ब्राउझर-आधारित एजंट कसा तयार करण्यात आला

याची सुरुवात LiquidAI च्या LFM2.5 फॅमिलीपासून झाली, विशेषतः २३० M आणि ३५० M पॅरामीटर व्हेरिएंट्सपासून.

प्रॉडक्ट कॅटलॉग किंवा किंमतीचे तक्ते मॉडेलमध्ये भरण्याऐवजी, ट्रेनरने त्याला संवादाचे पॅटर्न (patterns) शिकवले. एजंटला कधीही विशिष्ट SKU माहित नसतो; तो खालील गोष्टी शिकतो:

  • दिलेल्या विनंतीसाठी योग्य टूल निवडणे.
  • त्या टूलला योग्य आर्ग्युमेंट्स आणि आयडेंटिफायर्स जोडणे.
  • संदिग्ध संदर्भ (“एक डझन,” “दुसरे वाला”) स्पष्ट करणे.
  • बाह्य मजकूर मिळवणे आणि प्रश्नांची उत्तरे देण्यासाठी त्याचा वापर करणे.
  • आवश्यक माहिती नसल्यास नकार देणे.
  • संभाषण विषयावर ठेवणे.

टूलसेट हेतुपुरस्सर स्टॅटिक ठेवला आहे: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout, आणि navigate. या यादीला स्थिर (freeze) ठेवल्यामुळे मॉडेल टूल आयडी (tool IDs) पाठ (memorize) करत नाही आणि फाईन-ट्यूनिंग डेटा देखील लहान राहतो.

तीन इंजिनिअरिंग निवडींमुळे ही प्रणाली हलकी (lightweight) राहते:

  1. Frozen tool roster – मॉडेलला कृतींची एक निश्चित यादी दिसते, त्यामुळे त्याला टूलच्या नावांची मोठी शब्दसंग्रह (vocabulary) लागत नाही.
  2. RAG as a tool – Retrieval-augmented generation (RAG) इतर कोणत्याही फंक्शनप्रमाणे काम करते. एजंट मजकूर मिळवण्यासाठी search_knowledge कॉल करतो आणि नंतर तो मजकूर थेट त्याच्या प्रतिसादात समाविष्ट करतो, ज्यामुळे वेग (latency) आणि मेमरी ओव्हरहेड वाढवणारी वेगळी रिट्रिव्हल पाइपलाइन टाळता येते.
  3. Grammar-constrained decoding – जनरेशन दरम्यान, डिकोडर एका साध्या व्याकरणाचे पालन करतो जे आउटपुटला वैध टूल-कॉल स्ट्रक्चरमध्ये आणते. ही मर्यादा वाया जाणारे टोकन्स (tokens) काढून टाकते आणि चुकीच्या कमांड्स कमी करते.

प्रशिक्षणासाठी सिंथेटिक डेटा डिस्टिलेशनचा (synthetic data distillation) वापर करण्यात आला. लेखकाने १८ इंटरॲक्शन रेसिपीज परिभाषित केल्या, ज्यामध्ये वापरकर्ता-असिस्टंटमधील सामान्य संवाद वर्णन केला आहे. एका मोठ्या “शिक्षक” (teacher) मॉडेलने नैसर्गिक भाषेचा भाग तयार केला, तर एका डिटरमिनिस्टिक स्क्रिप्टने अचूक टूल-कॉल फॉरमॅट तयार केला. फाईन-ट्यूनिंग प्रक्रियेत अंदाजे ३० दशलक्ष टोकन्स वापरले गेले आणि ते १६ GB मेमरी असलेल्या एका सिंगल GPU वर बसले.

ऑन-डिव्हाइस (on-device) का महत्त्वाचे आहे

  • Privacy – सर्व युजर प्रॉम्प्ट्स ब्राउझरच्या मेमरीमध्ये राहतात. डिव्हाइसवरून कोणताही टेलिमेट्री डेटा बाहेर जात नाही, जे संवेदनशील प्रश्नांसाठी महत्त्वाचे आहे.
  • Offline capability – मॉडेल स्थानिक पातळीवर कॅश (cache) केलेले असल्यामुळे, असिस्टंट इंटरनेट कनेक्शनशिवाय काम करतो, ज्यामुळे फील्ड वर्क किंवा प्रवासासाठी नवीन शक्यता निर्माण होतात.
  • Cost – स्टॅटिक मॉडेल फाइल्स पाठवल्यामुळे वारंवार लागणारे GPU-आधारित इन्फरन्स सर्व्हर्स किंवा प्रति-कॉल API फीची गरज उरत नाही.
  • Accessibility – कमी स्पेसिफिकेशन असलेल्या डिव्हाइसेसवरही जटिल वेब इंटरफेसचे व्हॉइस-ड्रिव्हन नेव्हिगेशन शक्य होते, ज्यामुळे असिस्टिव्ह टेक्नॉलॉजीवर अवलंबून असलेल्या वापरकर्त्यांपर्यंत वेब ॲप्लिकेशन्सची पोहोच वाढते.

हे फायदे चर्चा “एखादे अवाढव्य मॉडेल याचे उत्तर देऊ शकते का?” वरून “उपयुक्त मदत करताना मॉडेल किती लहान असू शकते?” याकडे वळवतात.

संभाव्य मर्यादा

या आकाराचे मॉडेल विश्वकोशातील तथ्ये (encyclopedic facts) लक्षात ठेवू शकत नाही. जेव्हा एखादा वापरकर्ता विशिष्ट उत्पादनाची किंमत किंवा अलीकडील बातमी विचारतो, तेव्हा असिस्टंट एकतर search_knowledge द्वारे माहिती मिळवतो किंवा नम्रपणे नकार देतो. हे डिझाइन गोपनीयता सुरक्षित करते परंतु सिस्टमला बाह्य ज्ञान स्त्रोताची गुणवत्ता आणि ताजेपणावर अवलंबून ठेवते.

पुढे काय पाहावे

पब्लिक डेमो एका साध्या GitHub Pages URL वर उपलब्ध आहे आणि सोर्स कोड उघडपणे उपलब्ध आहे.

निष्कर्ष: एका मध्यम आकाराच्या LLM ला कडक टूल व्याकरण पाळण्यास शिकवून आणि रिट्रिव्हलला (retrieval) केवळ आणखी एक फंक्शन मानून, डेव्हलपर्स ब्राउझरमध्ये पूर्णपणे राहणारा एक उपयुक्त AI असिस्टंट तयार करू शकतात—जो मूळ संवादात्मक क्षमतांचा बळी न देता गोपनीयता, ऑफलाइन वापर आणि शून्य क्लाउड खर्च प्रदान करतो.