Alibaba Qwen3.8-Max-ஐ அறிமுகப்படுத்துகிறது: AI ஏஜெண்டுகளுக்கான 2.4 டிரில்லியன் அளவுருக்களைக் கொண்ட ஒரு மாபெரும் மாதிரி

Alibaba-வின் Qwen குழு, Qwen3.8-Max-ஐ அறிவித்துள்ளது. இது வெறும் உரையாடல் தூண்டுதல்களைத் (chat prompts) தாண்டி, நீண்ட காலத் தன்னாட்சித் திறனுடன் (long-horizon autonomous reasoning) செயல்படும் வகையில் வடிவமைக்கப்பட்ட 2.4 டிரில்லியன் அளவுருக்களைக் கொண்ட ஒரு பிரம்மாண்டமான முதன்மை மாதிரியாகும் (flagship model). பல நாட்கள் நீடிக்கும் பணிப்பாய்வுகள் (workflows) மற்றும் சிக்கலான பணிகளைச் செயல்படுத்துவதில் கவனம் செலுத்துவதன் மூலம், இந்த மாதிரி எதிர்வினை ஆற்றும் LLM-களிலிருந்து (reactive LLMs) முன்முயற்சி எடுக்கும் AI ஏஜெண்டுகளாக (proactive AI agents) மாறுவதற்கான ஒரு குறிப்பிடத்தக்க மாற்றத்தைக் குறிக்கிறது.

தன்னாட்சி நுண்ணறிவிற்கான அளவுருக்களை அதிகரித்தல் (Scaling Parameters for Autonomous Intelligence)

Qwen3.8-Max ஒரு தொழில்நுட்ப வலிமைமிக்க மாதிரியாகும், இது மொத்தம் 2.4 டிரில்லியன் அளவுருக்களைப் பயன்படுத்துகிறது, மேலும் ஒவ்வொரு வினவலுக்கும் (query) 95 பில்லியன் செயல்பாட்டு அளவுருக்களைக் (active parameters) கொண்டுள்ளது. Qwen3.5 கட்டமைப்பின் அடிப்படையில் உருவாக்கப்பட்ட இந்த மாதிரி, "long-horizon" பணிகளுக்காக—அதாவது AI பல நாட்கள் அல்லது வாரங்கள் வரை சுதந்திரமாகச் செயல்பட வேண்டிய சிக்கலான இலக்குகளுக்காக—குறிப்பாக மேம்படுத்தப்பட்டுள்ளது.

திறந்த மூல சமூகத்திற்கு (open-source community) ஒரு முக்கியமான நடவடிக்கையாக, Qwen-Max வகுப்பிற்கான எடைகள் (weights) அடுத்த வாரம் பொதுப்பயன்பாட்டிற்குத் தரப்படும் என்று Alibaba உறுதிப்படுத்தியுள்ளது. இது GPT மற்றும் Claude போன்ற முன்னணி மாதிரிகளின் (frontier models) மூடிய நிலை ஆதிக்கத்திற்கு சவாலாக அமையும்.

கோடிங் மற்றும் ஆராய்ச்சி மூலம் தன்னாட்சியை நிரூபித்தல்

அதன் ஏஜென்டிக் திறன்களை (agentic capabilities) நிரூபிப்பதற்காக, மனிதத் தலையீடு இன்றி இந்த மாதிரி செயல்பட்ட பல முக்கியமான ஆய்வுத் தரவுகளை (case studies) Alibaba முன்வைத்தது:

  • Software Engineering: 16 நாட்கள் காலப்பகுதியில், Qwen3.8-Max oh-my-cli என்ற கமாண்ட்-லைன் கருவியை (command-line tool) தன்னாட்சியுடன் உருவாக்கியது. இது தனது சொந்த GitHub சிக்கல்களை (issues) நிர்வகித்தது, குறியீடுகளை (code) எழுதியது, சோதனைகளை (tests) நடத்தியது, மற்றும் 265 கமிட்கள் (commits) மற்றும் 127 புல் ரிக்வெஸ்ட்களை (pull requests) நிறைவேற்றியது.
  • Scientific Reproduction: "Unified Data Selection for LLM Reasoning" ஆய்வறிக்கையின் முடிவுகளை மீண்டும் உருவாக்குமாறு (reproducing) பணிக்கப்பட்ட இந்த மாதிரி, 7,600 வரிகள் கொண்ட குறியீடுகளை எழுத 125 மணிநேர கணினி நேரத்தைச் (compute time) செலவிட்டது. இது அசல் ஆராய்ச்சியைப் பிரதிபலித்தது மட்டுமல்லாமல், AIME24 கணித பெஞ்ச்மார்க் மதிப்பெண்ணை 2.7 புள்ளிகள் உயர்த்தியது.
  • Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition சவாலில், இந்த மாதிரி 526 மனிதக் குழுக்களில் 458 குழுக்களை விடச் சிறப்பாகச் செயல்பட்டது, மேலும் 24 மணி நேரத்திற்குள் அதன் துல்லியத்தை (accuracy) 0.60 இலிருந்து 0.853 ஆக உயர்த்தியது.

மென்பொருளுக்கு அப்பால்: சிப் வடிவமைப்பு மற்றும் நிதி உருவகப்படுத்துதல் (Fiscal Simulation)

Qwen3.8-Max-இன் பகுத்தறிவுத் திறன் வன்பொருள் (hardware) மற்றும் பொருளாதாரம் வரை நீள்கிறது. ஒரு கிரிப்டோகிராஃபிக் சர்க்யூட் வடிவமைப்பு பணியில், இந்த மாதிரி ஒரு "வீக்கமடைந்த" (bloated) வடிவமைப்பை 8,298 லாஜிக் கேட்ட்களில் (logic gates) இருந்து வெறும் 678 கேட்டுகளாகத் படிப்படியாகக் குறைத்தது. OpenROAD கருவியைப் பயன்படுத்தியதன் மூலம், இது இயற்பியல் சிப் பரப்பளவில் (physical chip area) 81% குறைவை ஏற்படுத்தியது.

E-Commerce-Bench எனப்படும் சிக்கலான சில்லறை விற்பனை உருவகப்படுத்துதலில் (retail simulation), இந்த மாதிரி ஒரு உருவகப்படுத்தப்பட்ட நிதியாண்டின் போது பல ஆன்லைன் ஸ்டோர்களை நிர்வகித்தது. 100,000 யுவானுடன் தொடங்கி, இது விநியோகஸ்தர் பேச்சுவார்த்தைகளை நடத்தியது, 152 மோசடி நபர்களைக் கண்டறிந்தது மற்றும் விநியோகச் சங்கிலித் தடைகளை (supply chain disruptions) நிர்வகித்தது. இறுதியில் 416,252 யுவானுடன் முடித்தது—இது அதன் ஆரம்ப மூலதனத்தை நான்கு மடங்கு அதிகரித்தது மற்றும் இரண்டாம் இடத்தைப் பிடித்த GLM 5.2 ஐ விடச் சிறப்பாகச் செயல்பட்டது.

மல்டிமோடல் எல்லைகள் மற்றும் பெஞ்ச்மார்க் ஆதிக்கம்

இந்த மாதிரி மல்டிமோடல் செயலாக்கத்தின் (multimodal processing) எல்லைகளைத் தள்ளுகிறது, மேலும் 200 பக்க ஆவணங்கள் மற்றும் 100 மணிநேரத்திற்கு மேலான வீடியோக்களைக் கையாளும் திறன் கொண்டது. Alibaba RecreationBench என்பதையும் அறிமுகப்படுத்துகிறது; இது ஒரு ஏஜென்ட், மூலக் குறியீட்டுக்கு (source code) அணுகல் இல்லாமலேயே, காட்சி மற்றும் விசைப்பலகை தொடர்புகள் (visual and keyboard interaction) மூலம் இயங்கிக் கொண்டிருக்கும் பயன்பாடுகளை (Windows, macOS, Android போன்றவை) மீண்டும் கட்டமைக்கும் திறனைச் சோதிக்கும் ஒரு பெஞ்ச்மார்க் ஆகும்.

உள் பெஞ்ச்மார்க்குகளின்படி, Qwen3.8-Max உயர்தர மாதிரிகளுடன் நேரடியாகப் போட்டியிடுகிறது. PaperBench இல் 93 என்ற முன்னணியில் உள்ள மதிப்பெண்ணுடன் சேர்த்து, பல பிரிவுகளில் Claude Opus 4.8 மற்றும் GPT-5.6 Sol ஆகியவற்றிற்கு அருகிலோ அல்லது அவற்றிற்கு மேலோ உள்ளது.

முக்கியக் குறிப்புகள்

  • Massive Scale: Qwen3.8-Max மொத்தம் 2.4 டிரில்லியன் அளவுருக்கள் மற்றும் 95 பில்லியன் செயல்பாட்டு அளவுருக்களைக் கொண்டுள்ளது, இது பல நாட்கள் நீடிக்கும் தன்னாட்சி பணிப்பாய்வுகளுக்காக (autonomous workflows) மேம்படுத்தப்பட்டுள்ளது.
  • Agentic Mastery: சிக்கலான மென்பொருள் பொறியியல், சிப் வடிவமைப்பு மேம்படுத்தல் மற்றும் முழு அளவிலான நிதி மேலாண்மை ஆகியவற்றைத் தன்னாட்சியுடன் கையாளும் திறனை இந்த மாதிரி நிரூபித்துள்ளது.
  • Open-Weight Impact: பல முன்னணி மாதிரிகளைப் போலல்லாமல், Alibaba நிறுவனம் Qwen-Max வகுப்பிற்கான எடைகளை (weights) வெளியிடத் திட்டமிட்டுள்ளது, இது டெவலப்பர்களுக்கு உயர்மட்ட ஏஜென்டிக் நுண்ணறிவை (agentic intelligence) முன்னெப்போதும் இல்லாத வகையில் அணுக வழிவகை செய்கிறது.