உங்கள் உலாவியிலேயே (Browser) ஒரு LLM ஏஜென்ட்டை இயக்குதல்

பெரும்பாலான AI உதவியாளர்கள் ஒரு தரவு மையத்தில் (data center) அமர்ந்துள்ளன. அவற்றுக்கு ஒரு API key, ஒரு சர்வர் தேவை, மேலும் அவை ஒவ்வொரு கோரிக்கைக்கும் (request) கட்டணம் வசூலிக்கின்றன.

நான் வித்தியாசமான ஒன்றை உருவாக்கியுள்ளேன்.

உங்கள் உலாவியிலேயே முழுமையாக இயங்குவதற்காக நான் LiquidAI LFM2.5 மாடல்களை (230 M மற்றும் 350 M) ஃபைன்-டியூன் (fine-tuned) செய்துள்ளேன்—இதற்கு சர்வர் தேவையில்லை, கிளவுட் செலவுகளும் இல்லை.

ஒரு வலைப்பக்கத்துடன் (web page) சேர்த்து அனுப்பும் வகையில் மாடலை மிகச் சிறியதாக மாற்றுவதே இதன் இலக்காக இருந்தது.

இந்த மாடல் குறிப்பிட்ட தயாரிப்புகள் பற்றிய உண்மைகளைச் சேமிப்பதில்லை; மாறாக இது வடிவங்களைக் (patterns) கற்றுக்கொள்கிறது. ஒரு சிறிய மாடல், மீண்டும் பயிற்சி அளிக்காமலேயே ஒரு காபி ஷாப், மளிகைக் கடை அல்லது வேறு எந்தக் கடையையும் நிர்வகிக்க முடியும்.

மாடல் என்ன செய்கிறது

  • ஒரு பணிக்குத் தேவையான சரியான கருவியைத் (tool) தேர்ந்தெடுக்கிறது
  • ஆர்குமென்ட்களையும் (arguments) ஐட்டம் ஐடிகளையும் (item IDs) சரியாக இணைக்கிறது
  • “இரண்டாவது ஒன்று” அல்லது “ஒரு டஜன்” போன்ற குறிப்புகளைப் புரிந்துகொள்கிறது
  • கேள்விகளுக்குப் பதிலளிக்கத் தேடி எடுக்கப்பட்ட உரையைப் (retrieved text) பயன்படுத்துகிறது
  • தகவல் இல்லாதபோது பதிலளிக்க மறுக்கிறது
  • உரையாடல் தலைப்பிலிருந்து விலகும்போது அதை மீண்டும் சரியான பாதைக்குக் கொண்டு வருகிறது

நான் இதை எப்படி உருவாக்கினேன்

  • எட்டு கருவிகளின் தொகுப்பை (search, add_to_cart, checkout போன்றவை) நிலையானதாக (frozen) மாற்றினேன்
  • RAG-ஐ ஒரு தனிப் குழாயாக (pipeline) கருதாமல், ஒரு கருவியாகக் கருதினேன்
  • துல்லியத்திற்காக இலக்கணக் கட்டுப்பாட்டு டீகோடிங்கை (grammar-constrained decoding) பயன்படுத்தினேன்
  • 18 உரையாடல் முறைகளிலிருந்து (interaction recipes) ஒரு செயற்கைத் தரவுத்தொகுப்பை (synthetic dataset) உருவாக்கினேன்
  • ஒரு 16 GB GPU-வைப் பயன்படுத்தி 30 M டோக்கன்களில் ஃபைன்-டியூன் செய்தேன்

பயிற்சியின் முக்கிய நோக்கம் நான் மாடலுக்குத் தடைசெய்யப்பட்ட சொற்களைக் (blocklists) கற்பிக்காமல், நடத்தைகளைக் (behaviors) கற்பித்தேன். சொற்களைத் தடை செய்வதற்குப் பதிலாக, உரையாடல்களைத் கண்ணியமாக வழிநடத்தக் கற்றுக்கொடுத்தேன்.

இது ஏன் முக்கியமானது

  • தனியுரிமை: உங்கள் தரவு உங்கள் சாதனத்தை விட்டு வெளியேறுவதில்லை
  • ஆஃப்லைன் பயன்பாடு: இணைய இணைப்பு இல்லாமலேயே இது இயங்கும்
  • செலவு: இன்ஃபரன்ஸ் (inference) கட்டணங்கள் இல்லை
  • அணுகல்தன்மை: இது சிக்கலான UI-களைக் குரல் மூலம் இயக்கச் செய்கிறது

மாடல் சிறியது, ஆனால் பயனுள்ளது. பிரம்மாண்டமான மாடல்களால் பணிகளைச் செய்ய முடியுமா என்று கேட்பதை நிறுத்துங்கள். ஒரு சாதனத்தில் பயனுள்ளதாக இருக்கும் அதே வேளையில், ஒரு மாடல் எவ்வளவு சிறியதாக இருக்க முடியும் என்று கேளுங்கள்.

Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe


Lajos Bencz, 350 மில்லியன் அளவுருக்களைக் (parameters) கொண்ட ஒரு மொழி மாடலை முழுமையாக ஒரு வலை உலாவியில் இயங்கும் வகையில் ஃபைன்-டியூன் செய்துள்ளார். இது ஒரு நிலையான பக்கத்தை (static page), API key, சர்வர் அல்லது கிளவுட் அடிப்படையிலான இன்ஃபரன்ஸ் செலவுகள் தேவையில்லாத ஒரு தன்னாட்சி ஷாப்பிங் உதவியாளராக மாற்றுகிறது. இதன் விளைவாக, தனியுரிமைக்கு முன்னுரிமை அளிக்கும், ஆஃப்லைனில் இயங்கக்கூடிய ஒரு AI கிடைக்கிறது. இது ஒவ்வொரு துறைக்கும் மீண்டும் பயிற்சி அளிக்காமலேயே ஒரு காபி ஷாப், மளிகைக் கடை அல்லது அது போன்ற எந்தவொரு பட்டியலையும் நிர்வகிக்க முடியும்.

ஏன் உலாவியில் (browser) ஒரு LLM-ஐ இயக்க வேண்டும்

பெரும்பாலான AI உதவியாளர்கள் தரவு மையங்களில் உள்ளன. ஒவ்வொரு கேள்வியும் இணையம் வழியாகப் பயணித்து, ஒரு API-ஐச் சென்றடைந்து, ஒவ்வொரு கோரிக்கைக்கும் கட்டணம் வசூலிக்கப்படுகிறது. இந்த அமைப்பு பயனர் தரவை வெளியே கசியச் செய்கிறது, நெட்வொர்க் தேவைப்படுகிறது மற்றும் கட்டணத்தை விரைவாக உயர்த்துகிறது. மாடலை கிளையண்டிற்கு (client) மாற்றுவதன் மூலம் இந்தத் சிக்கல்களைத் தவிர்க்கலாம். தரவு உள்ளூர் இயந்திரத்திலேயே (local machine) இருக்கும், நெட்வொர்க் துண்டிக்கப்பட்டாலும் உதவியாளர் செயல்படுவார், மேலும் இன்ஃபரன்ஸ் செலவுகள் பூஜ்ஜியமாகிறது.

மாடல் எவ்வாறு உருவாக்கப்பட்டது

  • மாடல் தேர்வு – LiquidAI LFM2.5, 230 M மற்றும் 350 M வகைகளுடன் தொடங்கப்பட்டது. அவற்றின் அளவு ஒரு சாதாரண வலைப்பக்கம் அவற்றை டவுன்லோட் செய்ய அனுமதிக்கிறது.
  • கருவித் தொகுப்பு – எட்டு பயன்பாட்டுத் கருவிகளை (search, add_to_cart, checkout போன்றவை) ஏஜென்ட்டில் நேரடியாக இணைத்தேன் (hard-coded). எந்தக் கருவியைப் பயன்படுத்த வேண்டும் மற்றும் ஐட்டம் ஐடி போன்ற ஆர்குமென்ட்களை எவ்வாறு அனுப்புவது என்பதை மாடல் கற்றுக்கொள்கிறது.
  • கருவியாக RAG – Retrieval-Augmented Generation-ஐ மற்றொரு அழைக்கக்கூடிய கருவியாகக் கருதியதன் மூலம் கட்டமைப்பை எளிமைப்படுத்தினேன்.
  • இலக்கணக் கட்டுப்பாட்டு டீகோடிங் – தவறான வெளியீடுகளைக் குறைக்க, டீகோடரைச் சரியான டூல்-கால் (tool-call) தொடரியலுக்குள் (syntax) கட்டுப்படுத்தினேன்.
  • செயற்கைத் தரவு – 18 உரையாடல் முறைகளை (உதாரணமாக, “two dozen donuts-ஐச் சேர்”) ஒரு 16 GB GPU-வில் உருவாக்கப்பட்ட 30 M-டோக்கன் தரவுத்தொகுப்பாக மாற்றினேன்.
  • நடத்தை சார்ந்த பயிற்சி – தடைசெய்யப்பட்ட பட்டியல்களுக்குப் பதிலாக, உரையாடலை வழிநடத்துவதில் ஃபைன்-டியூனிங் கவனம் செலுத்தியது: தலைப்பிலிருந்து விலகிய உரையாடல்களைக் கண்ணியமாகத் திசைதிருப்புதல், தகவல் இல்லாதபோது மறுத்தல் மற்றும் “இரண்டாவது ஒன்று” போன்ற தெளிவற்ற குறிப்புகளை உறுதிப்படுத்துதல்.

இந்த ஃபைன்-டியூனிங் ஒரு 16 GB GPU-வில் நடைபெற்றது.

ஏஜென்ட் என்ன செய்ய முடியும்

  • கருவித் தேர்வு – ஒரு கேள்விக்குத் தேடல் (search) தேவையா, கார்ட் அப்டேட் தேவையா அல்லது வேறு ஏதேனும் செயல்பாடு தேவையா என்பதைத் தீர்மானிக்கிறது.
  • ஆர்குமென்ட் கையாளுதல் – ஐட்டம் அடையாளங்காட்டிகள், அளவுகள் மற்றும் தகுதிகளை (உதாரணமாக, “ஒரு டஜன்”) பகுப்பாய்வு செய்து அவற்றைச் சரியாக அனுப்புகிறது.
  • குறிப்புத் தீர்வு (Reference resolution) – “இரண்டாவது ஒன்று” போன்ற சொற்றொடர்களைத் தேடி எடுக்கப்பட்ட பட்டியலில் உள்ள சரியான ஐட்டத்துடன் இணைக்கிறது.
  • RAG மூலம் பதிலளித்தல் – தொடர்புடைய உரையைத் தேடி எடுத்து அதை பதில்களில் இணைக்கிறது.
  • கண்ணியமான மறுப்பு – தவறான தகவல்களைத் (hallucinating) தருவதற்குப் பதிலாக, தேவையான தகவல் இல்லாதபோது மறுக்கிறது.
  • உரையாடல் வழிநடத்துதல் – உரையாடலின் ஓட்டத்தைச் சிதைக்காமல், தலைப்பிலிருந்து விலகிய கருத்துக்களை மீண்டும் பணிக்குத் திருப்புகிறது.

ஒரு நேரடி டெமோ (https://lajosbencz.github.io/frontend-agent/) குரல் அல்லது உரை உள்ளீட்டின் மூலம், தேடல் முதல் செக்அவுட் வரை ஒரு எளிய இ-காமர்ஸ் ஓட்டத்தை ஏஜென்ட் எவ்வாறு கையாள்கிறது என்பதைக் காட்டுகிறது.

வரம்புகள் மற்றும் எதிர் கருத்துக்கள்

(பிரிவு வேண்டுமென்றே காலியாக விடப்பட்டுள்ளது)

அடுத்து கவனிக்க வேண்டியவை

இந்த codebase (https://github.com/lajosbencz/frontend-agent) திறந்த நிலையில் உள்ளது, இது கருவிகளைச் சேர்க்கவும், synthetic recipes-களை விரிவுபடுத்தவும் அல்லது hybrid approaches-களை முயற்சிக்கவும் சமூகத்தினரை அழைக்கிறது.

முக்கியக் கருத்து: ஒரு மிதமான அளவுள்ள LLM-ஐ ஒரு சுயாதீன ஏஜென்ட்டாக (self-contained agent) fine-tuning செய்வதன் மூலம், செயல்பாட்டுத் திறன் கொண்ட, தனியுரிமையைப் பாதுகாக்கும் AI-ஐ ஒரு வலைப்பக்கத்தில் நேரடியாக இணைக்க முடியும்—இதற்கு சர்வர்கள் தேவையில்லை, கட்டணங்கள் இல்லை, மேலும் பயனரின் சாதனத்திலிருந்து தரவுகள் வெளியேறவும் செய்யாது.