Una nuova analisi dei costi mostra che l'auto-hosting di un modello linguistico di grandi dimensioni (LLM) conviene rispetto alle API commerciali solo quando un'azienda elabora circa 5-10 milioni di token di input ogni mese. Per chiunque debba pianificare il budget per i servizi di IA, il punto di pareggio determina se l'attrattiva dei pesi aperti "gratuiti" si trasformi in un risparmio reale.
Il modello API
I fornitori di API fanno pagare per token e gestiscono tutta l'hardware, l'energia e il raffreddamento. Le attuali tariffe pubbliche sono:
- Claude Sonnet 5 – $2 per milione di token di input
- GPT-5.6 – circa $1 per milione di token di input
- Meta Muse Spark – $1,25 per milione di token di input in entrata, $4,25 per milione in uscita
Il modello è pay-as-you-go. Quando il traffico scende a zero, anche la fattura scende a zero. Gli utenti evitano inoltre il mal di testa causato dai guasti alle GPU, dagli aggiornamenti del firmware e dalla pianificazione della capacità.
Il modello di self-hosting
Eseguire un modello a pesi aperti (open-weight) sull'hardware proprietario significa che il costo computazionale è a carico proprio, indipendentemente dall'utilizzo. Una singola NVIDIA H100 — una scelta comune per l'inferenza degli LLM — costa:
- $2 – $3 all'ora sui servizi cloud GPU generici
- $7 – $12 all'ora sulle principali piattaforme cloud (AWS, Azure)
Ciò si traduce in circa $1.800 – $2.000 al mese per il funzionamento continuo di una H100. Il prezzo dell'hardware è solo la parte visibile della fattura.
Dove i numeri si incontrano
L'analisi rivela che il self-hosting diventa più economico delle API premium una volta che il volume mensile di token di input raggiunge la fascia tra 5 e 10 milioni. Al di sotto di questa soglia, vincono le tariffe API per token. Con volumi di 100 milioni di token al mese o superiori, la linea dei costi relativi solo all'hardware scende sotto quella delle API, rendendo il self-hosting attraente sulla carta.
