L'LLM da 180 milioni di parametri su un chip da 10 dollari

Un nuovo progetto chiamato p-for-llm sta facendo qualcosa di impressionante. Esegue un modello da 180,9 milioni di parametri su un microcontrollore ESP32-P4. Questo chip costa tra i sei e i dieci dollari.

La maggior parte dei progetti AI virali su chip piccoli si concentra su compiti semplici. Mostrano un modello che scrive brevi storie. Spesso questi modelli hanno pochissimi parametri e nessuna utilità reale.

p-for-llm è diverso. Mira all'utilità.

Ecco come funziona:

  • Utilizza un'architettura Mixture-of-Experts (MoE).
  • Per ogni token, il router sceglie un esperto su 29.
  • Gli altri 28 esperti rimangono inattivi.
  • Questo risparmia potenza di calcolo mantenendo un'elevata conoscenza.
  • Utilizza pesi ternari per far rientrare il modello in una memoria ridotta.
  • Il modello genera circa 9 token al secondo.

Anche il processo di addestramento è degno di nota. Lo sviluppatore ha utilizzato una singola scheda grafica consumer RTX 5060 Ti. Non c'è un laboratorio massiccio o un budget enorme. Solo una persona con una GPU di fascia media e molta pazienza.

C'è un dettaglio da tenere a mente. Il modello non è ancora completamente autonomo. È necessario caricare i pesi sulla scheda tramite USB all'avvio. Non è ancora un dispositivo standalone che carica i dati da una scheda SD.

Non si tratta ancora di una demo in cloud. I calcoli avvengono localmente sul chip. Questo è un passo avanti enorme rispetto ai progetti che si limitano a trasmettere dati a un server.

Perché tutto questo è importante?

I modelli piccoli di solito si scontrano con un limite invalicabile. Possono essere affascinanti, ma non sanno seguire le istruzioni. p-for-llm tenta di superare questo ostacolo. Supporta i prompt ChatML e mostra i primi segni di tool calling.

Questo progetto dimostra che il vero progresso spesso avviene in silenzio. Mentre i progetti virali cercano i titoli dei giornali, i costruttori seri pubblicano i propri limiti e le proprie note a piè di pagina.

Testerò personalmente questo hardware per verificare questi numeri.

Fonte: https://dev.to/aiexplore369zoho/the-180m-parameter-llm-running-on-a-10-microcontroller-and-almost-nobody-noticed-4d3n

Community di apprendimento opzionale: https://t.me/GyaanSetuAi