Un modello Mixture-of-Experts da 150 miliardi di parametri può generare testo su un normale laptop da sviluppatore. L'esperimento dimostra che il vero limite delle prestazioni è la RAM, non la velocità dell'SSD. Questo è importante perché dimostra che i modelli di frontiera sono testabili localmente senza dover spendere per il calcolo in cloud.
Il Test
Abbiamo eseguito il modello DeepSeek V4 Flash — un MoE da 150 miliardi di parametri sottoposto a pruning REAP — tramite il motore di inferenza open-source Colibrì. L'hardware utilizzato era un laptop AMD Ryzen AI 9 365 con 61 GB di RAM e un SSD NVMe da 1 TB. Abbiamo cronometrato un ciclo di generazione di tre minuti e registrato ogni accesso al disco.
Cosa rivelano i numeri
- L'attività del disco è stata minima. L'SSD ha effettuato meno di 11 secondi di lettura durante la generazione di tre minuti. Anche se l'unità fosse in grado di leggere i dati istantaneamente, il throughput totale migliorerebbe solo di circa il 6 percento.
- La dimensione della RAM ha influenzato direttamente la velocità. Dimezzare la cache della RAM ha ridotto il throughput di circa il 15 percento. La CPU ha trascorso quasi tanto tempo a gestire i cache miss — de-quantizzazione, copia e gestione dei dati — quanto ad attendere il disco.
Questi dati ribaltano la convinzione comune secondo cui la larghezza di banda dell'archiviazione sia il principale collo di bottiglia per l'inferenza di modelli di grandi dimensioni su un laptop.
Perché la RAM batte l'SSD
Quando un parametro del modello non è già residente nella RAM, il sistema deve:
- Estrarre i dati dall'SSD.
- Decodificarli e spostarli nei registri della CPU per il calcolo.
Entrambi i passaggi consumano cicli. Il primo passaggio è limitato dalla larghezza di banda dell'SSD; il secondo aggiunge all'incirca lo stesso ritardo perché la CPU deve de-quantizzare i dati indipendentemente dalla velocità con cui arrivano. Un SSD più veloce offre quindi rendimenti decrescenti, mentre una maggiore quantità di RAM permette a una parte più ampia del modello di rimanere residente, eliminando l'oneroso viaggio di andata e ritorno.
Implicazioni per gli sviluppatori
- Investire nella memoria, non nell'archiviazione.
- Il testing locale diventa fattibile. Gli sviluppatori possono eseguire modelli MoE open-weight su macchine esistenti, verificando lo stile, il comportamento del tool-calling e la qualità dell'output senza pagare crediti cloud.
- La valutazione batch è realistica. La chat in tempo reale potrebbe sembrare ancora lenta, ma i lavori in coda — come la generazione di decine di prompt per la ricerca — girano agevolmente su un laptop.
Possibile controargomentazione
Alcuni potrebbero sostenere che la latenza dell'SSD conti ancora per i carichi di lavoro che caricano ripetutamente nuovi pesi degli esperti.
Cosa osservare in futuro
- Varianti di modelli efficienti dal punto di vista della memoria.
- Hardware con cache on-chip più grandi.
- Strategie di caching a livello software.
La conclusione è chiara: gli sviluppatori che vogliono sperimentare con modelli MoE massicci su un laptop dovrebbero acquistare più RAM. L'aggiornamento dell'SSD riduce i tempi solo di pochi punti percentuali, mentre la memoria extra può tagliare i tempi di inferenza con percentuali a doppia cifra. Ciò sposta il calcolo dei costi per la prototipazione di IA e apre la porta al testing locale e gratuito di modelli che prima si pensava richiedessero cluster cloud dedicati.
