L'API di Kimi K3 sembra economica sulla carta, ma costi nascosti e dettagli tecnici mancanti possono renderla molto più costosa di quanto suggeriscano i numeri principali.
Cosa omette l'hype
Il materiale di lancio di Moonshot AI vanta un modello da 2,8 trilioni di parametri che è "economico" e "aperto". Il comunicato stampa promette anche che i pesi saranno scaricabili a breve. Nessuna delle due affermazioni regge.
- I pesi non sono disponibili – Moonshot ha fissato il 27 luglio 2026 come scadenza per un checkpoint pubblico. Fino ad allora, gli utenti dovranno utilizzare l'API ospitata, quindi la promessa "open-source" non offre nulla di utilizzabile.
- I 2,8 T di parametri non sono tutti attivi – Il numero descrive la capacità totale dell'architettura. Il design Mixture-of-Experts di K3 instrada ogni token attraverso 16 delle 896 sottoreti di esperti. Moonshot non ha dichiarato quanti parametri vengano eseguiti per una richiesta, rendendo impossibili le stime di memoria e calcolo.
Un prezzo che sembra buono – finché non si contano le parole
Tariffe pubblicate:
- Input con cache-hit: $0,30 per 1 milione di token
- Input senza cache: $3,00 per 1 milione di token
- Output: $15,00 per 1 milione di token
Queste tariffe sembrano modeste, ma ignorano il volume di token.
Un test recente ha misurato l'output di K3 a 130 milioni di token, più del doppio dei 63 milioni prodotti da altri modelli leader negli stessi compiti. La verbosità del modello gonfia direttamente la fattura dell'output: il doppio delle parole significa il doppio del costo. Per la generazione di codice, saggi o agenti di chat, la tariffa di $15 per milione di token può dominare la spesa.
Cosa significa per i diversi utenti
Sviluppatori e ricercatori
Se testate K3 per l'assistenza alla programmazione o per la ricerca basata sui dati, imponete dei limiti rigidi (hard caps) all'output dei token. Un test A/B che metta K3 a confronto con un modello di base con limiti di output identici mostrerà se l'elevato utilizzo di token derivi dal modello o dal design del prompt.
Team attenti al budget
Lo sconto per cache-hit si applica solo quando l'input si ripete. Create prefissi di prompt stabili che producano stringhe di input identiche per spingere più richieste nella fascia da $0,30; questo funziona solo per carichi di lavoro altamente ripetitivi (ad es. query basate su template). La maggior parte degli input variabili tornerà alla tariffa senza cache di $3,00.
Aziende che considerano l'auto-hosting
Aspettare il rilascio del checkpoint è saggio. Ospitare il modello elimina le tariffe per token ma aggiunge costi di licenza e infrastruttura non dichiarati. Finché i pesi non saranno pubblici, l'API ospitata rimarrà l'unica opzione realistica.
Ambienti di produzione
Non passate a questo modello solo perché il prezzo pubblicizzato sembra inferiore a quello dei concorrenti. Avviate un progetto pilota che misuri il costo per task completato, inclusi i costi indiretti derivanti da risposte più lunghe, invece del costo per token. Solo allora potrete decidere se K3 permette di risparmiare.
Cosa monitorare in seguito
- Rilascio del checkpoint il 27 luglio 2026 – i pesi sono previsti per quella data.
- Divulgazione dei parametri attivi – sapere quanti dei 2,8 T di parametri vengono eseguiti per token permetterebbe agli utenti di dimensionare l'hardware con precisione.
In sintesi
Il prezzo pubblicizzato di $15 per milione di token in output di K3 racconta solo metà della storia. La sua tendenza a generare il doppio dei token rispetto ai concorrenti può annullare qualsiasi risparmio dichiarato, specialmente per i compiti che richiedono risposte lunghe. Finché i pesi non saranno disponibili e il numero di parametri attivi non sarà chiaro, trattate K3 come un servizio premium, potenzialmente verboso, piuttosto che come un'alternativa economica. Effettuate test sul budget di token, imponete limiti di output e passate al modello solo dopo aver misurato il costo reale per ogni lavoro completato.
