ஒரு RTX 5090-இல் உள்ளூர் முறையில் இயக்கப்பட்ட ஐந்து LLM ஏஜென்ட்களின் (agents) ஒப்பீடு, 35-பில்லியன் அளவுருக்களைக் கொண்ட ஒரு mixture-of-experts (MoE) மாடல், ஒரு நிஜ உலக கோடிங் பணியில் மற்றவற்றை விடச் சிறப்பாகச் செயல்பட்டதைக் காட்டுகிறது. எந்தவொரு கிளவுட் API-களும் இன்றி, ஏற்கனவே உள்ள ஒரு அட்மின் பேனலில் (admin panel) ஒரு Tag Manager-ஐச் சேர்த்த இந்தச் சோதனை, Qwen 3.6 35B-A3B மாடலைத் தெளிவான வெற்றியாளராக அறிவித்தது.

இந்தச் சோதனை ஏன் முக்கியமானது

தனிப்பட்ட வன்பொருள்களில் (personal hardware) பெரிய மொழி மாதிரிகளை (large language models) இயக்குவது, டெவலப்பர்கள் API கட்டணங்கள் மற்றும் தரவுத் தனியுரிமை (data-privacy) கவலைகளைத் தவிர்க்க அனுமதிக்கிறது. இருப்பினும், "local agents" என்பது இன்னும் ஒரு சொல்லாடலாகவே (buzzword) உள்ளது: மனித உதவியின்றி அவைகளால் உண்மையில் கோப்புகளைத் திருத்தவும், command-line கருவிகளை அழைக்கவும் மற்றும் பயன்பாட்டிற்குத் தயாரான (production-ready) குறியீட்டை வழங்கவும் முடியுமா? கிளவுட் சேவைகளைத் தவிர்த்து நடத்தப்பட்ட இந்த நேரடி ஒப்பீடு, இந்தத் தொழில்நுட்பம் தற்போது எந்த நிலையில் உள்ளது என்பதைப் பற்றிய ஒரு தெளிவான புரிதலை டெவலப்பர்களுக்கு வழங்குகிறது.

வன்பொருள் மற்றும் பணி

ஐந்து மாடல்களும் ஒரே பணிநிலையத்தில் (workstation) இயக்கப்பட்டன: ஒரு RTX 5090 GPU, இது ஒரு பொதுவான உயர்நிலை நுகர்வோர் கார்டு (high-end consumer card), மற்றும் எந்த வெளிப்புறச் சேவைகளும் இல்லை. இந்தத் பணி வேண்டுமென்றே எளிமையாகவும் அதே சமயம் பிரதிநிதித்துவமாகவும் இருந்தது - ஏற்கனவே உருவாக்கப்பட்ட ஒரு அட்மின் பிரிவில் Tag Manager கூறுகளைச் சேர்த்தல். இதில் வெற்றிபெற, மாடல் சரியான மூலக் கோப்புகளைக் (source files) கண்டறிய வேண்டும், அவற்றை எடிட் செய்ய வேண்டும் மற்றும் புதிய அம்சம் ஏற்கனவே உள்ள செயல்பாடுகளைப் பாதிக்காமல் ஒருங்கிணைக்கப்படுவதை உறுதி செய்ய வேண்டும்.

மாடல் செயல்திறன்

  • Qwen 3.6 35B-A3B (MoE) – பணியை தானாகவே முடித்தது, கேட்கப்படாத அறிவுபூர்வமான மேம்பாடுகளைச் சேர்த்தது மற்றும் இயங்கிய பிறகு எந்தத் திருத்தங்களும் (patches) தேவைப்படவில்லை.
  • Qwen 3.6 27B (dense) – பணியை முடித்தது, ஆனால் ஏறக்குறைய இரண்டு மடங்கு அதிகத் தொடர்புகளைக் (interaction steps) கொண்டது மற்றும் அவ்வப்போது வழிமுறைகளைத் தவறாகப் புரிந்துகொண்டது.
  • GLM-4.7-Flash (dense) – செயல்படக்கூடிய ஒரு கட்டமைப்பை உருவாக்கியது, ஆனால் தவறான கோப்பு-பொருத்த முறைகளைப் (file-matching patterns) பயன்படுத்தியது மற்றும் பாதுகாப்புச் சோதனைகளைத் தவிர்த்தது, இதனால் குறியீடு பாதிப்புக்குள்ளாகக்கூடிய நிலையில் இருந்தது.
  • Qwythos-9B – எந்தவொரு உண்மையான கருவிகளையும் செயல்படுத்தவில்லை; இந்தத் தோல்வி மாடலிலிருந்தோ அல்லது உள்ளூர் அமைப்பிலிருந்தோ (local setup) ஏற்பட்டிருக்கலாம், ஆனால் சோதனையினால் அதன் காரணத்தைத் தனிமைப்படுத்த முடியவில்லை.
  • Nemotron-3-Nano (hybrid) – ஒரு சுழற்சியில் (loop) சிக்கிக்கொண்டது, ஏற்கனவே கண்டறிந்த ஒரு கோப்புறையைத் (folder) தேடுவதிலேயே 40 முறைகளைச் செலவிட்டது, மேலும் அந்தப் புள்ளியைக் கடந்து முன்னேறவில்லை.

முடிவுகள் எதைக் காட்டுகின்றன

கட்டமைப்பு (Architecture) ஒரு நம்பகமான முன்னறிவிப்பாளர் அல்ல

தனது அளவுருக்களைப் பல நிபுணர் துணை-வலைப்பின்னல்களாகப் (expert sub-networks) பிரிக்கும் MoE மாடல் முழுமையான வெற்றியைப் பெற்றது, அதே சமயம் dense மற்றும் hybrid மாடல்கள் வெற்றி மற்றும் தோல்வி எனப் பிரிந்தன. இது வெறும் கட்டமைப்புத் தெரிவுகள் (architectural choices) கருவிகளைப் பயன்படுத்தும் திறனை உறுதி செய்வதில்லை என்பதைக் காட்டுகிறது.

கருவிப் பயன்பாடு ஒரு பெரிய தடையாகவே உள்ளது

சோதனையின் போது வழங்கப்பட்ட பிரத்யேக ஸ்கிரீன்ஷாட் கருவியைப் (screenshot tool) ஐந்து ஏஜென்ட்களில் எவருமே பயன்படுத்தவில்லை. அனைவரும் கோப்புப் பெயர்களைக் கணிப்பதன் மூலமோ அல்லது மறைமுகமான மாற்று வழிகளை முயல்வதன் மூலமோ தன்னிச்சையாகச் செயல்பட முயன்றனர். "குறியீட்டை உருவாக்க முடியும்" என்பதற்கும் "வெளிப்புறக் கருவிகளை ஒருங்கிணைக்க முடியும்" என்பதற்கும் இடையிலான இடைவெளி இன்னும் அதிகமாகவே உள்ளது.

உள்ளூர் முறையில் இயக்குவது என்பது மாடலை மட்டுமல்ல, முழுத் தொகுப்பையும் (stack) பிழைத்திருத்தம் செய்வதாகும்

சோதனை தொடங்குவதற்கு முன்பே இரண்டு மாடல்களின் prompt templates-களில் உடனடித் திருத்தங்கள் தேவைப்பட்டன. மாடல் சார்ந்த பிழைகளைச் சரிசெய்வதற்கே செலவிடப்பட்ட நேரம், உண்மையான Tag Manager குறியீட்டை எழுதுவதற்குச் செலவிடப்பட்ட நேரத்தை விட அதிகமாக இருந்தது, இது தற்போதைய உள்ளூர் பயன்பாடுகள் (local deployments) எவ்வளவு பலவீனமானவை என்பதைச் சுட்டிக்காட்டுகிறது.

ஒரு எச்சரிக்கை குறிப்பு

இந்த ஒப்பீடு ஒரு ஒற்றை வன்பொருள் கட்டமைப்பு, ஒரு கோடிங் சூழல் மற்றும் ஒரு சிறிய அளவிலான மாடல்களை மட்டுமே பிரதிபலிக்கிறது. Qwen 3.6 35B-A3B இதற்கு முன்னதாக ஒரு சுற்றில் தோல்வியடைந்தது; அதன் முந்தைய தோல்வி ஒரு தற்செயலான நிகழ்வு (fluke). எனவே, இந்த முடிவுகள் ஒரு அறிகுறியே தவிர, இறுதியானவை அல்ல.

அடுத்து கவனிக்க வேண்டியவை

எதிர்காலச் சுற்றுகள் பணிகளின் தொகுப்பை விரிவுபடுத்த வேண்டும், அதிகப்படியான பல்வேறு கருவிச் சங்கிலிகளை (toolchains) சேர்க்க வேண்டும் மற்றும் பரந்த அளவிலான வன்பொருள்களில் சோதிக்க வேண்டும். MoE மாடல்கள் தொடர்ந்து dense மற்றும் hybrid வடிவமைப்புகளை விடச் சிறப்பாகச் செயல்படுகின்றனவா என்பதையும், டெவலப்பர்கள் கைமுறைப் பிழைத்திருத்தத் தேவையைத் தவிர்க்கக்கூடிய நம்பகமான wrappers-களை உருவாக்க முடியுமா என்பதையும் ஆய்வாளர்கள் கண்காணிக்க வேண்டும்.

சுருக்கம்: ஒரு 35B MoE மாடல் ஏற்கனவே ஒரு திறமையான உள்ளூர் கோடிங் உதவியாளராகச் செயல்பட முடியும், ஆனால் கருவி ஒருங்கிணைப்பு (tool integration), prompt engineering மற்றும் நிலையான runtime-கள் போன்ற பரந்த சுற்றுச்சூழல் அமைப்பு இன்னும் பின்தங்கியே உள்ளது. இந்தத் துண்டுகள் ஒன்றிணையும் வரை, "plug-and-play" உள்ளூர் ஏஜென்ட்கள் குறித்த எதிர்பார்ப்புகளை டெவலப்பர்கள் நிதானமாக வைத்திருக்க வேண்டும்.