Alibaba நிறுவனம் Qwen3.8-Max ஐ அறிமுகப்படுத்தியுள்ளது. இது 2.4 டிரில்லியன் அளவுருக்களைக் (parameters) கொண்ட ஒரு Mixture-of-Experts (MoE) மாதிரியாகும். இது OSWorld-Verified பெஞ்ச்மார்க்கில் 86.1% வெற்றி விகிதத்தைப் பதிவு செய்துள்ளது—இந்த மதிப்பெண் GPT-5.6, Sol Max மற்றும் Fable 5 ஆகியவற்றை விட சிறந்தது என்று Alibaba கூறுகிறது. ஒரு இயங்குதளத்துடன் (operating system) தொடர்பு கொள்ளுதல், மென்பொருளை நிறுவுதல் மற்றும் குறியீடுகளைத் திருத்துதல் (debug code) போன்ற ஒரு AI-இன் திறன்களை இந்த பெஞ்ச்மார்க் அளவிடுகிறது; இந்தத் திறன்களே தன்னாட்சி மென்பொருள் பொறியியல் முகவர்களின் (autonomous software-engineering agents) அடிப்படையாகும்.

தன்னாட்சி முகவர்களுக்கானப் போட்டி

பெரிய மொழி மாதிரிகள் (Large language models) உரையாடல் பாணி உதவியாளர்களிலிருந்து, குறியீடுகளை எழுதவும், சோதிக்கவும் மற்றும் பயன்படுத்தவும் (deploy) கூடிய கருவிகளாக மாறியுள்ளன. வழக்கமான பொறியியல் பணிகளை நம்பகமான முறையில் ஒரு AI-இடம் ஒப்படைக்கக்கூடிய நிறுவனங்கள், பணியாளர் செலவைக் குறைக்கவும் மற்றும் தயாரிப்பு சுழற்சியை (product cycles) வேகப்படுத்தவும் முடியும். OSWorld-Verified பெஞ்ச்மார்க் "ஏஜென்டிக்" (agentic) திறனுக்கான ஒரு நடைமுறை அளவுகோலாக மாறியுள்ளது, ஏனெனில் இது வெறும் நிலையான உரை உருவாக்கத்தை விட மேலானது; இது ஒரு அமைதியுடன் (system) நிஜ உலகத் தொடர்பைக் கோருகிறது.

Qwen3.8-Max கொண்டு வரும் அம்சங்கள்

  • 2.4 T அளவுருக்களுடன் கூடிய MoE கட்டமைப்பு – ஒவ்வொரு டோக்கனுக்கும் (token) 64 நிபுணர் துணை-வலைப்பின்னல்கள் (expert sub-networks) வரை பயன்படுத்தப்படலாம்; இந்த வடிவமைப்பு கணக்கீட்டுச் செலவை (compute expense) தோராயமாக 40% குறைப்பதாக Alibaba கூறுகிறது.
  • Multimodal ப்ராம்ப்ட் கையாளுதல் – இந்த மாதிரி உரை, படங்கள் மற்றும் கட்டமைக்கப்பட்ட தரவுகளை (structured data) ஒன்றாக ஏற்றுக்கொள்கிறது, இதன் மூலம் ஒரு ஒற்றை கோரிக்கையிலேயே ஒரு UI-ஐ விவரிக்கவும், ஸ்கிரீன்ஷாட்டை காட்டவும் மற்றும் உள்ளமைவு கோப்புகளை (configuration files) வழங்கவும் முடியும்.
  • 64 k டோக்கன் கான்டெக்ஸ்ட் விண்டோ (context window) – முழுமையான குறியீட்டுத் தொகுப்புகள் (codebases), லாக் கோப்புகள் (log files) அல்லது நீண்ட தொழில்நுட்ப அறிக்கைகளைத் துண்டுகளாகப் பிரிக்காமல் கையாள போதுமான இடவசதி கொண்டது.

இந்த அம்சங்கள் மென்பொருள் குழுக்கள் பல மணிநேரம் செலவிடும் "முழுமையான" (end-to-end) பணிப்பாய்வுகளைக் குறிவைக்கின்றன: சார்புகளைப் பெறுதல் (pulling dependencies), லாக் கோப்புகளை ஸ்கேன் செய்தல், பிழைகளைச் சரிசெய்தல் (patching bugs) மற்றும் ஆவணங்களை உருவாக்குதல்.

நுணுக்கமான ஆய்வில் எண்கள்

பணி (Task) அறிக்கையிடப்பட்ட அளவீடு (Reported metric)
OSWorld-Verified (ஏஜென்டிக் OS தொடர்பு) 86.1 % வெற்றி
Code generation (HumanEval-Plus) 78.4 % தேர்ச்சி
Multimodal reasoning (MM-Bench) 84.3 %
Long-context summarization (50 k-token சோதனை) 90.2 %

அனைத்துப் புள்ளிவிவரங்களும் Alibaba-வின் உள் சோதனை முறையிலிருந்து பெறப்பட்டவை. இவை நிலைத்திருந்தால், இந்த மாதிரி நிறுவனங்களுக்கு குறியீடு, படங்கள் மற்றும் பெரிய ஆவணங்களைக் கையாளக்கூடிய ஒரு ஒற்றை API-ஐ வழங்கும், அதே நேரத்தில் பல டென்ஸ்-மாடல் (dense-model) போட்டியாளர்களை விட இன்ஃபரன்ஸ் (inference) செலவைக் குறைவாக வைத்திருக்கும்.

அபாயங்கள் மற்றும் சுயாதீன சரிபார்ப்பின் அவசியம்

மூன்றாம் தரப்பு சரிபார்ப்பு இல்லாததே உடனடி எச்சரிக்கையாகும். பெஞ்ச்மார்க்குகள் மாற்றியமைக்கப்படலாம், ப்ராம்ப்ட்கள் மேம்படுத்தப்படலாம் அல்லது ஒரு குறிப்பிட்ட கட்டமைப்பிற்கு சாதகமாக சோதனைத் தொகுப்புகள் வடிகட்டப்படலாம். வெளிப்புற மறுஉருவாக்கம் (external replication) இல்லாமல், Qwen3.8-Max, GPT-5.6-ஐ "தோற்கடிக்கிறது" என்ற கூற்று தற்காலிகமானதுதான். மேலும், MoE மாதிரிகள் சீரற்ற செயல்திறனைக் காட்டலாம்: சில டோக்கன்கள் போதிய பயிற்சி பெறாத நிபுணர்களுக்கு (under-trained experts) அனுப்பப்படலாம், இது அவ்வப்போது மாயத்தோற்றங்கள் (hallucinations) அல்லது நிலையற்ற வெளியீடுகளுக்கு வழிவகுக்கும்—ஒரு AI உற்பத்தி அமைப்புகளை (production systems) மாற்றியமைக்கும் என்று எதிர்பார்க்கப்படும்போது இத்தகைய சிக்கல்கள் முக்கியமானவை.

அடுத்து கவனிக்க வேண்டியவை

  • சுயாதீன மறுஉருவாக்கம் – ஆராய்ச்சியாளர்கள் மற்றும் கிளவுட் வாடிக்கையாளர்கள் பொதுவில் கிடைக்கும் வன்பொருளில் (hardware) அதே OSWorld-Verified தொகுப்பு மற்றும் HumanEval-Plus சோதனைகளை likely செய்வார்கள்.
  • விலை மற்றும் தாமதம் (latency) – Alibaba Cloud-இன் API விலை நிர்ணயம், 40% கணக்கீட்டுச் சேமிப்பு டெவலப்பர்களுக்கு ஒரு குறிப்பிடத்தக்க செலவு நன்மையாக மாறுமா என்பதை வெளிப்படுத்தும்.
  • பாதுகாப்பிற்கான கருவிகள் – தன்னாட்சி முகவர்கள் உள்கட்டமைப்பின் (infrastructure) மீது அதிக கட்டுப்பாட்டைப் பெறும்போது, கண்காணிப்பு, ரோல்பேக் (rollback) மற்றும் தணிக்கை வழிமுறைகள் தேவைப்படும்; இவை இன்னும் ஆரம்ப நிலையில் உள்ளன.

Qwen3.8-Max அதன் முக்கிய எண்களைச் சரியாகச் செயல்படுத்தினால், ஒரு உரையாடல் உதவியாளருக்கும் ஒரு சுயசார்பு பொறியியல் பாட்டிற்கும் (engineering bot) இடையிலான இடைவெளி வியத்தகு முறையில் குறையும். மாதிரியின் செயல்திறன் ஆய்வுக்குத் தாங்குமா மற்றும் நிறுவனங்கள் இதைத் தங்களின் தானியங்கி மேம்பாட்டுப் பாதைகளின் (automated development pipelines) முதுகெலும்பாக ஏற்றுக்கொள்வார்களா என்பதை அடுத்த சில மாதங்கள் காட்டும்.