Kimi K3 ની API કાગળ પર સસ્તી લાગે છે, પરંતુ છુપા ચાર્જ અને ટેકનિકલ વિગતોના અભાવને કારણે તે હેડલાઇન આંકડાઓ સૂચવે છે તેના કરતા ઘણી વધારે મોંઘી હોઈ શકે છે.

જાહેરાતોમાં જે બાબતો છુપાવવામાં આવે છે

Moonshot AI ની લોન્ચિંગ સામગ્રી 2.8 ટ્રિલિયન-પેરામીટર ધરાવતા મોડેલનો દાવો કરે છે જે "સસ્તું" અને "ઓપન" છે. પ્રેસ રિલીઝમાં ટૂંક સમયમાં ડાઉનલોડ કરી શકાય તેવા weights આપવાનું વચન પણ આપવામાં આવ્યું છે. પરંતુ આમાંથી એક પણ દાવો સાચો સાબિત થતો નથી.

  • Weights ઉપલબ્ધ નથી – Moonshot એ પબ્લિક ચેકપોઈન્ટ માટે 27 જુલાઈ 2026 ની સમયમર્યાદા નક્કી કરી છે. ત્યાં સુધી વપરાશકર્તાઓએ હોસ્ટેડ API નો જ ઉપયોગ કરવો પડશે, તેથી "ઓપન-સોર્સ" નું વચન કંઈ કામનું કંઈ જ આપતું નથી.
  • 2.8 T પેરામીટર્સ બધા જ સક્રિય નથી – આ આંકડો આર્કિટેક્ચરની કુલ ક્ષમતા દર્શાવે છે. K3 ની Mixture-of-Experts ડિઝાઇન દરેક ટોકનને 896 એક્સપર્ટ સબ-નેટવર્ક્સમાંથી 16 દ્વારા રૂટ કરે છે. Moonshot એ જણાવ્યું નથી કે એક રિક્વેસ્ટ માટે કેટલા પેરામીટર્સ ચાલે છે, જેના કારણે મેમરી અને કમ્પ્યુટનો અંદાજ લગાવવો અશક્ય બની જાય છે.

કિંમત જે સારી લાગે છે – જ્યાં સુધી તમે શબ્દોની ગણતરી ન કરો ત્યાં સુધી

પ્રકાશિત દરો:

  • Cache-hit ઇનપુટ: $0.30 પ્રતિ 1 મિલિયન ટોકન્સ
  • Uncached ઇનપુટ: $3.00 પ્રતિ 1 મિલિયન ટોકન્સ
  • આઉટપુટ: $15.00 પ્રતિ 1 મિલિયન ટોકન્સ

આ દરો સામાન્ય લાગે છે, પરંતુ તેઓ ટોકન વોલ્યુમને અવગણે છે.

તાજેતરના એક ટેસ્ટમાં K3 નું આઉટપુટ 130 મિલિયન ટોકન્સ નોંધાયું હતું, જે સમાન કાર્યો પર અન્ય અગ્રણી મોડેલો દ્વારા ઉત્પાદિત 63 મિલિયન કરતા બમણાથી પણ વધુ છે. મોડેલની વધુ પડતી વિગતવાર માહિતી (verbosity) સીધી રીતે આઉટપુટ બિલમાં વધારો કરે છે—બમણા શબ્દો એટલે બમણો ખર્ચ. કોડ જનરેશન, નિબંધો અથવા ચેટ એજન્ટ્સ માટે, $15 પ્રતિ મિલિયન-ટોકનનો દર ખર્ચમાં મોટો હિસ્સો લઈ શકે છે.

વિવિધ વપરાશકર્તાઓ માટે આનો અર્થ શું છે

ડેવલપર્સ અને સંશોધકો

જો તમે કોડિંગ સહાય અથવા ડેટા-આધારિત સંશોધન માટે K3 નું પરીક્ષણ કરો છો, તો ટોકન આઉટપુટ પર કડક મર્યાદા (hard caps) લાદો. K3 ની સરખામણી સમાન આઉટપુટ મર્યાદા ધરાવતા બેઝલાઇન મોડેલ સાથે કરતા કરવામાં આવતું A/B ટેસ્ટ એ બતાવશે કે વધુ ટોકન વપરાશ મોડેલને કારણે છે કે પ્રોમ્પ્ટ ડિઝાઇનને કારણે.

બજેટ પ્રત્યે સજાગ ટીમો

Cache-hit ડિસ્કાઉન્ટ ત્યારે જ લાગુ પડે છે જ્યારે સમાન ઇનપુટનું પુનરાવર્તન થાય. વધુ રિક્વેસ્ટ્સને $0.30 ના સ્તર (tier) માં લાવવા માટે સ્થિર પ્રોમ્પ્ટ પ્રીફિક્સ બનાવો જે સમાન ઇનપુટ સ્ટ્રિંગ્સ બનાવે; આ ફક્ત અત્યંત પુનરાવર્તિત વર્કલોડ્સ (દા.ત., ટેમ્પલેટેડ ક્વેરીઝ) માટે જ કામ કરે છે. મોટાભાગના વિવિધ ઇનપુટ્સ $3.00 ના uncached દરે જ રહેશે.

સેલ્ફ-હોસ્ટિંગનો વિચાર કરતી કંપનીઓ

ચેકપોઈન્ટ રિલીઝની રાહ જોવી સમજદારી છે. મોડેલને હોસ્ટ કરવાથી પ્રતિ-ટોકન ફી દૂર થાય છે પરંતુ અપ્રગટ લાયસન્સિંગ અને ઇન્ફ્રાસ્ટ્રક્ચર ખર્ચ ઉમેરાય છે. જ્યાં સુધી weights જાહેર ન થાય ત્યાં સુધી, હોસ્ટેડ API એ જ એક વાસ્તવિક વિકલ્પ છે.

પ્રોડક્શન એન્વાયરમેન્ટ્સ

માત્ર હેડલાઇન કિંમત હરીફો કરતા ઓછી લાગે છે એટલે જ બદલાવ ન કરો. પ્રતિ ટોકન ખર્ચને બદલે, લાંબા જવાબોથી થતા છુપા વધારાના ખર્ચ સહિત પૂર્ણ થયેલ કાર્ય દીઠ ખર્ચ (cost per completed task) માપે તેવો પાયલોટ પ્રોજેક્ટ ચલાવો. તો જ તમે નક્કી કરી શકશો કે K3 ખર્ચ બચાવે છે કે નહીં.

આગળ શું જોવું

  • 27 જુલાઈ 2026 ચેકપોઈન્ટ રિલીઝ – તે તારીખે weights રિલીઝ થવાની શક્યતા છે.
  • એક્ટિવ-પેરામીટર ડિસ્ક્લોઝર – પ્રતિ ટોકન કેટલા 2.8 T પેરામીટર્સ ચાલે છે તે જાણવાથી વપરાશકર્તાઓ હાર્ડવેરનું સચોટ માપ નક્કી કરી શકશે.

નિષ્કર્ષ

K3 ની જાહેરાત કરેલી $15 પ્રતિ મિલિયન-ટોકન આઉટપુટ કિંમત માત્ર અડધી વાસ્તવિકતા જણાવે છે. અન્ય મોડેલો કરતા બમણા ટોકન્સ જનરેટ કરવાની તેની વૃત્તિ કોઈપણ હેડલાઇન બચતને ખતમ કરી શકે છે, ખાસ કરીને લાંબા જવાબોવાળા કાર્યો માટે. જ્યાં સુધી weights ઉપલબ્ધ ન થાય અને એક્ટિવ-પેરામીટરની સંખ્યા સ્પષ્ટ ન થાય, ત્યાં સુધી K3 ને સસ્તા વિકલ્પને બદલે પ્રીમિયમ અને સંભવિત રીતે વધુ વિગતવાર (verbose) સેવા તરીકે ગણો. ટોકન-બજેટ ટેસ્ટ કરો, આઉટપુટ મર્યાદાઓ લાગુ કરો, અને કાર્ય પૂર્ણ થયા પછીના સાચા ખર્ચને માપ્યા પછી જ બદલાવ કરો.