10달러짜리 칩에서 구동되는 1억 8천만 파라미터 LLM

p-for-llm이라는 새로운 프로젝트가 인상적인 성과를 내고 있습니다. 이 프로젝트는 6~10달러 사이의 ESP32-P4 마이크로컨트롤러에서 1억 8,090만 파라미터 모델을 구동합니다.

소형 칩을 활용한 대부분의 화제성 AI 프로젝트들은 단순한 작업에 집중합니다. 짧은 이야기를 쓰는 모델을 선보이곤 하죠. 하지만 그런 모델들은 파라미터 수가 매우 적고 실질적인 유용성이 없는 경우가 많습니다.

p-for-llm은 다릅니다. 이 프로젝트는 실용성을 목표로 합니다.

작동 방식은 다음과 같습니다:

  • Mixture-of-Experts (MoE) 아키텍처를 사용합니다.
  • 토큰마다 라우터가 29개의 전문가 중 하나를 선택합니다.
  • 나머지 28개의 전문가는 비활성화된 상태로 유지됩니다.
  • 이를 통해 높은 지식 수준을 유지하면서도 연산 능력을 절약합니다.
  • 모델을 작은 메모리에 맞추기 위해 ternary weights를 사용합니다.
  • 모델은 초당 약 9개의 토큰을 생성합니다.

학습 과정 또한 주목할 만합니다. 개발자는 단 한 장의 RTX 5060 Ti 소비자용 그래픽 카드를 사용했습니다. 거대한 연구소나 막대한 예산도 없습니다. 그저 중급 GPU와 인내심을 가진 한 명의 개발자뿐입니다.

한 가지 알아두어야 할 점이 있습니다. 모델이 아직 완전히 자율적이지는 않다는 것입니다. 시작할 때 USB를 통해 보드에 가중치를 전송해야 합니다. 아직 SD 카드에서 직접 로드하는 독립형 장치는 아닙니다.

클라우드 데모도 아닙니다. 모든 연산은 칩에서 로컬로 이루어집니다. 이는 단순히 데이터를 서버로 스트리밍하는 프로젝트들과 비교했을 때 엄청난 진전입니다.

이것이 왜 중요할까요?

소형 모델들은 보통 한계에 부딪힙니다. 매력적일 수는 있지만 지시 사항을 따르지는 못하죠. p-for-llm은 그 한계를 넘어서려 시도합니다. ChatML 프롬프트를 지원하며, tool calling의 초기 징후도 보여주고 있습니다.

이 프로젝트는 진정한 진보가 종종 조용히 일어난다는 것을 보여줍니다. 화제성 프로젝트들이 헤드라인을 쫓을 때, 진지한 빌더들은 자신들의 한계와 세부 사항을 기록합니다.

저는 이 수치들을 검증하기 위해 직접 이 하드웨어를 테스트해 볼 예정입니다.

Source: https://dev.to/aiexplore369zoho/the-180m-parameter-llm-running-on-a-10-microcontroller-and-almost-nobody-noticed-4d3n

Optional learning community: https://t.me/GyaanSetuAi