Moonshot AI-ன் புதிய Kimi K3, AA-Briefcase பெஞ்ச்மார்க்கில் GPT-5.6-ஐ விட அதிக மதிப்பெண்களைப் பெற்று முதலிடம் பிடித்துள்ளது; இது 1,527 மதிப்பெண்களைப் பெற்றுள்ளது, அதேசமயம் GPT-5.6 1,495 மதிப்பெண்களைப் பெற்றுள்ளது. இந்த வெற்றிக்குக் காரணம், இதன் விலை நிர்ணய முறைதான். இது 2.8 டிரில்லியன் அளவுருக்களைக் (parameters) கொண்ட ஒரு open-weight மாடலாக இருந்தாலும், நீண்ட கால குறியீட்டுப் பணிகளுக்கு (long-form coding tasks) வியக்கத்தக்க வகையில் மலிவான தேர்வாக அமைகிறது.
இந்த பெஞ்ச்மார்க் ஏன் முக்கியமானது
AA-Briefcase என்பது தனித்தனி பொது அறிவு வினாக்களை விட, தொடர்ச்சியான, நிஜ உலகப் பணிகளின் (real-world workloads) செயல்திறனை அளவிடுகிறது. அதிக மதிப்பெண் என்பது ஒரு மாடல் சூழலை (context) அப்படியே தக்கவைத்துக் கொள்ளவும், முன்கூட்டியே திட்டமிடவும் மற்றும் ஆயிரக்கணக்கான டோக்கன்களுக்கு அப்பாலும் தனது பணியைத் தொடரவும் முடியும் என்பதைக் குறிக்கிறது – உதவியாளர்கள் (assistants), குறியீடு உருவாக்குநர்கள் (code generators) அல்லது ஆராய்ச்சி உதவியாளர்களை உருவாக்கும்போது டெவலப்பர்கள் எதிர்கொள்ளும் சூழலே இதுவாகும். GPT-5.6-ஐ விட Kimi K3 கொண்டுள்ள இந்தத் திறன், மூடிய மாடல்கள் (closed models) பாரம்பரியமாக ஆதிக்கம் செலுத்தி வந்த இடத்திலும், ஒரு திறந்த மாடல் (open model) இப்போது போட்டியிட முடியும் என்பதைக் காட்டுகிறது.
தொழில்நுட்பத் தோற்றம்
- அளவு – 2.8 டிரில்லியன் அளவுருக்கள் (parameters), இன்றுவரை வெளியிடப்பட்ட மிகப்பெரிய open-weight மாடல்.
- கட்டமைப்பு (Architecture) – 896 நிபுணர்களைக் (experts) கொண்ட Stable LatentMoE (Mixture-of-Experts), இதில் எந்த நேரத்திலும் 16 நிபுணர்கள் மட்டுமே செயல்பாட்டில் இருப்பார்கள்.
- சூழல் சாளரம் (Context window) – 1 மில்லியனுக்கும் அதிகமான டோக்கன்கள், இது முழு புத்தகங்களையோ அல்லது நீண்ட குறியீட்டுத் தொகுப்புகளையோ (codebases) சேமிக்க போதுமானது.
- கவனம் (Attention) – Kimi Delta Attention, இது அளவிடுதல் திறனை (scaling efficiency) மேம்படுத்த உருவாக்கப்பட்ட ஒரு தனிப்பயனாக்கப்பட்ட மாற்றம் (custom tweak) எனக் கூறப்படுகிறது.
இந்தத் தெரிவுகள் மாடலுக்கு "நீண்ட காலத் திட்டமிடல்" (long-horizon) பணிகளைக் கையாளும் திறனை வழங்குகின்றன, ஆனால் அவை கணினித் தேவைகளையும் (compute requirements) அதிகரிக்கின்றன, இது வேகம் மற்றும் செலவுத் தரவுகளில் பிரதிபலிக்கிறது.
கவனத்தை ஈர்க்கும் விலை நிர்ணயம்
Moonshot டோக்கன் விலையை மூன்று வகைகளாகப் பிரிக்கிறது:
| பயன்பாட்டு வகை | 1 மில்லியன் டோக்கன்களுக்கான செலவு |
|---|---|
| Input – cache miss | $3.00 |
| Input – cache hit | $0.30 |
| Output | $15.00 |
குறியீட்டுப் பணிகளில் (coding workloads) 90% cache-hit விகிதம் இருப்பதாக நிறுவனம் கூறுகிறது. இது உண்மையென்றால், குறியீட்டு ஏஜெண்டுகளுக்கு (coding agents) இது மிகவும் மலிவான தேர்வாகும்.
நீங்கள் உணரக்கூடிய சவால்கள் (Trade-offs)
- வேகம் – இந்த மாடல் ஒரு வினாடிக்கு சுமார் 62 டோக்கன்களை மட்டுமே செயலாக்குகிறது, இது சராசரியை விடக் குறைவு. ஒரு நீண்ட ப்ராம்ப்ட் (prompt) பல நிமிடங்கள் எடுக்கலாம், இது நேரடித் தொடர்பாடலுக்கு (interactive use) முக்கியமானது.
- சிந்தனைச் செலவு (Reasoning cost) – Kimi K3 இயல்பாகவே "அதிகபட்ச சிந்தனை முயற்சி" (max reasoning effort) முறையில் இயங்குகிறது மற்றும் அதைத் தணிக்க எந்த வசதியும் இல்லை. எனவே, எளிய வினாக்களுக்கும் சிக்கலான வினாக்களுக்கும் ஒரே அளவு டோக்கன்கள் செலவாகின்றன, இது அன்றாடப் பணிகளுக்கான செலவை அதிகரிக்கிறது.
- மறைக்கப்பட்ட டோக்கன் பயன்பாடு – மாடல் தானாகவே சேர்க்கும் ஒரு பெரிய சிஸ்டம் ப்ராம்ப்ட் (system prompt) இருப்பதாகச் சில பயனர்கள் தெரிவிக்கின்றனர்; இது பயனரின் கோரிக்கையில்த் தெரியாவிட்டாலும், அதற்கான டோக்கன்கள் கட்டணமாக வசூலிக்கப்படுகின்றன.
இந்த காரணிகளால், விளம்பரப்படுத்தப்படும் குறைந்த விலை, நடைமுறையில் மெதுவான வேகம் மற்றும் அதிக டோக்கன் பயன்பாட்டினால் ஈடுகட்டப்படலாம் (offset).
கிடைப்புத்தன்மை மற்றும் எதிர்காலப் பாதை
API இன்று பயன்பாட்டிற்கு வந்துவிட்டது, இது டெவலப்பர்கள் உடனடியாகச் சோதனைகளை மேற்கொள்ள அனுமதிக்கிறது. மாடல் வெயிட்டுகள் (model weights) ஜூலை 27 அன்று வெளியிடப்படும், அதன் பிறகு சுய-ஹோஸ்டிங் (self-hosting) சாத்தியமாகும். அதுவரை, பயனர்கள் Moonshot-ன் ஹோஸ்டட் சேவையைச் சார்ந்திருக்க வேண்டும் மற்றும் அதனுடன் தொடர்புடைய தாமதம் (latency) மற்றும் விலை அமைப்பை ஏற்க வேண்டும்.
மூடிய மாடல் தரப்பிலிருந்து ஒரு எதிர் கருத்து
வெளிப்படும் முக்கியக் கருத்து
மூடிய மாடல்களுக்கும் திறந்த மாடல்களுக்கும் இடையிலான இடைவெளி குறைந்து வருவதே இதன் முக்கியக் கருத்தாகும். திறந்த மாடல்களும் சிக்கலான, நீண்ட காலத் திட்டமிடல் பணிகளைக் கையாள முடியும் என்பதை Kimi K3 நிரூபிக்கிறது.
