Moonshot AI యొక్క కొత్త Kimi K3, AA-Briefcase బెంచ్మార్క్లో GPT-5.6 కంటే మెరుగైన ప్రతిభ కనబరిచింది; ఇది 1,527 స్కోరు సాధించగా, GPT-5.6 1,495 స్కోరు సాధించింది. ఈ విజయం ఒక ప్రత్యేకమైన ధరల విధానంతో (pricing model) వస్తోంది, ఇది 2.8 ట్రిలియన్ పారామీటర్ల కలిగిన ఈ open-weight మోడల్ను సుదీర్ఘ కోడింగ్ పనుల కోసం ఆశ్చర్యకరంగా తక్కువ ధర కలిగిన ఎంపికగా మారుస్తుంది.
ఈ బెంచ్మార్క్ ఎందుకు ముఖ్యం
AA-Briefcase కేవలం విడివిడి ప్రశ్నలకు సమాధానాలు చెప్పడం కంటే, నిరంతరమైన, వాస్తవ ప్రపంచ పనిభారాలపై (real-world workloads) పనితీరును కొలుస్తుంది. ఎక్కువ స్కోరు అంటే, ఒక మోడల్ వేల సంఖ్యలో టోకెన్ల వరకు సందర్భాన్ని (context) గుర్తుంచుకోగలదని, ముందుగా ప్రణాళిక చేయగలదని మరియు పనిపై దృష్టి పెట్టగలదని అర్థం – అసిస్టెంట్లు, కోడ్ జనరేటర్లు లేదా రీసెర్చ్ ఎయిడ్స్ నిర్మించేటప్పుడు డెవలపర్లు ఎదుర్కొనే పరిస్థితులు ఇవే. GPT-5.6 కంటే Kimi K3 సాధించిన ఈ ఆధిక్యం, గతంలో క్లోజ్డ్ మోడల్స్ (closed rivals) మాత్రమే రాజ్యమేల었던 రంగంలో ఇప్పుడు ఓపెన్ మోడల్ కూడా పోటీ పడగలదని చూపుతోంది.
సాంకేతిక అంశాలు
- Size – 2.8 ట్రిలియన్ పారామీటర్లు, ఇప్పటివరకు విడుదలైన అతిపెద్ద open-weight మోడల్.
- Architecture – 896 నిపుణులతో (experts) కూడిన Stable LatentMoE (Mixture-of-Experts), ఇందులో ఏ సమయంలోనైనా 16 మంది మాత్రమే యాక్టివ్గా ఉంటారు.
- Context window – 1 మిలియన్ టోకెన్ల కంటే ఎక్కువ, ఇది పూర్తి పుస్తకాలను లేదా సుదీర్ఘమైన కోడ్బేస్లను నిల్వ చేయడానికి సరిపోతుంది.
- Attention – Kimi Delta Attention, ఇది స్కేలింగ్ సామర్థ్యాన్ని మెరుగుపరచడానికి చేసిన ఒక ప్రత్యేక మార్పు (custom tweak).
ఈ ఎంపికలు మోడల్కు “long-horizon” పనులను నిర్వహించే సామర్థ్యాన్ని ఇస్తాయి, కానీ ఇవి కంప్యూట్ అవసరాలను (compute requirements) కూడా పెంచుతాయి, ఇది వేగం మరియు ఖర్చు గణాంకాల్లో కనిపిస్తుంది.
ఆకర్షణీయమైన ధరలు
Moonshot టోకెన్ ధరలను మూడు రకాలుగా విభజించింది:
| వినియోగ రకం (Usage type) | 1 మిలియన్ టోకెన్లకు అయ్యే ఖర్చు |
|---|---|
| Input – cache miss | $3.00 |
| Input – cache hit | $0.30 |
| Output | $15.00 |
కోడింగ్ వర్క్లోడ్స్లో 90% cache-hit రేటు ఉంటుందని కంపెనీ చెబుతోంది. ఇది నిజమైతే, కోడింగ్ ఏజెంట్ల కోసం ఇది చాలా తక్కువ ధర కలిగిన ఎంపిక అవుతుంది.
మీరు ఎదుర్కొనే లోపాలు (Trade-offs)
- Speed – ఈ మోడల్ సెకనుకు సుమారు 62 టోకెన్లను ప్రాసెస్ చేస్తుంది, ఇది సగటు కంటే తక్కువ. సుదీర్ఘమైన ప్రాంప్ట్ (prompt) కోసం నిమిషాల సమయం పట్టవచ్చు, ఇది ఇంటరాక్టివ్ వినియోగానికి ఇబ్బందిగా మారవచ్చు.
- Reasoning cost – Kimi K3 డిఫాల్ట్గా “max reasoning effort”తో నడుస్తుంది మరియు దానిని తగ్గించడానికి ఎటువంటి ఆప్షన్ ఇవ్వదు. అందువల్ల, సాధారణ ప్రశ్నలకు కూడా సంక్లిష్టమైన ప్రశ్నల మాదిరిగానే టోకెన్ బడ్జెట్ ఖర్చవుతుంది, దీనివల్ల రోజువారీ పనుల ఖర్చు పెరుగుతుంది.
- Hidden token usage – మోడల్ స్వయంచాలకంగా జోడించే పెద్ద సిస్టమ్ ప్రాంప్ట్ (system prompt) వల్ల కొన్ని టోకెన్లు అదనంగా ఖర్చవుతున్నాయని వినియోగదారులు చెబుతున్నారు; ఇవి బిల్లులో కనిపిస్తాయి కానీ వినియోగదారు పంపిన రిక్వెస్ట్లో కనిపించవు.
ఈ అంశాల వల్ల, ప్రకటనల్లో కనిపించే తక్కువ ధర, వాస్తవంగా నెమ్మదైన పనితీరు మరియు అధిక టోకెన్ వినియోగం వల్ల పెరిగిపోయే అవకాశం ఉంది.
లభ్యత మరియు భవిష్యత్తు ప్రణాళిక
API ఈరోజే అందుబాటులోకి వచ్చింది, దీనివల్ల డెవలపర్లు వెంటనే ప్రయోగాలు చేయవచ్చు. మోడల్ వెయిట్స్ (model weights) జూలై 27న విడుదల చేయబడతాయి, ఆ తర్వాత సెల్ఫ్-హోస్టింగ్ (self-hosting) సాధ్యమవుతుంది. అప్పటి వరకు, వినియోగదారులు Moonshot యొక్క హోస్టెడ్ సర్వీస్పైనే ఆధారపడాల్సి ఉంటుంది మరియు దాని వల్ల కలిగే లాటెన్సీ (latency) మరియు ధరల నిర్మాణాన్ని అంగీకరించాల్సి ఉంటుంది.
క్లోజ్డ్-మోడల్ వర్గం నుండి ప్రతివాదన
ముగింపు (The emerging takeaway)
క్లోజ్డ్ మోడల్స్ మరియు ఓపెన్ మోడల్స్ మధ్య ఉన్న వ్యత్యాసం తగ్గుతోందనేదే ప్రధాన అంశం. ఓపెన్-వెయిట్ మోడల్స్ కూడా సంక్లిష్టమైన, సుదీర్ఘమైన పనులను చేయగలవని Kimi K3 నిరూపించింది.
