Model LLM o 180 mln parametrów na chipie za 10 dolarów

Nowy projekt o nazwie p-for-llm robi coś imponującego. Uruchamia model o 180,9 miliona parametrów na mikrokontrolerze ESP32-P4. Chip ten kosztuje od sześciu do dziesięciu dolarów.

Większość wiralowych projektów AI na małych chipach skupia się na prostych zadaniach. Chwalą się modelem, który pisze krótkie opowiadania. Modele te często mają bardzo mało parametrów i nie mają realnej użyteczności.

p-for-llm jest inny. Jego celem jest użyteczność.

Oto jak to działa:

  • Wykorzystuje architekturę Mixture-of-Experts (MoE).
  • Dla każdego tokenu router wybiera jednego eksperta spośród 29.
  • Pozostałych 28 ekspertów pozostaje nieaktywnych.
  • Pozwala to oszczędzać moc obliczeniową przy zachowaniu wysokiego poziomu wiedzy.
  • Wykorzystuje wagi trójstanowe (ternary weights), aby zmieścić model w małej pamięci.
  • Model generuje około 9 tokenów na sekundę.

Proces trenowania również zasługuje na uwagę. Deweloper użył pojedynczej konsumenckiej karty graficznej RTX 5060 Ti. Nie ma tu ogromnego laboratorium ani wielkiego budżetu. Tylko jedna osoba ze średniej klasy GPU i cierpliwością.

Jest jeden haczyk, o którym powinieneś wiedzieć. Model nie jest jeszcze w pełni autonomiczny. Przy uruchamianiu należy przesłać wagi na płytkę przez USB. Nie jest to jeszcze samodzielne urządzenie, które ładuje dane z karty SD.

To wciąż nie jest demo chmurowe. Obliczenia odbywają się lokalnie na chipie. To ogromny krok naprzód w porównaniu do projektów, które jedynie przesyłają dane do serwera.

Dlaczego to ma znaczenie?

Małe modele zazwyczaj uderzają w ścianę. Mogą być urocze, ale nie potrafią wykonywać instrukcji. p-for-llm próbuje pokonać tę barierę. Obsługuje prompty ChatML i wykazuje wczesne oznaki korzystania z narzędzi (tool calling).

Ten projekt pokazuje, że prawdziwy postęp często dokonuje się po cichu. Podczas gdy wiralowe projekty gonią za nagłówkami, poważni twórcy publikują swoje ograniczenia i przypisy.

Osobiście przetestuję ten sprzęt, aby zweryfikować te liczby.

Source: https://dev.to/aiexplore369zoho/the-180m-parameter-llm-running-on-a-10-microcontroller-and-almost-nobody-noticed-4d3n

Opcjonalna społeczność edukacyjna: https://t.me/GyaanSetuAi