Prism ML은 모바일 기기에서 구동 가능한 Qwen 3.6 대규모 언어 모델(LLM) 버전인 Bonsai 27B를 출시했습니다. 1비트 양자화(quantization)를 통해 기존 54GB 모델을 4GB 미만으로 압축함으로써, 회사는 14배의 크기 감소를 실현했으며 사용자가 클라우드 API 호출 없이 모델을 로컬에서 실행할 수 있도록 했습니다.
압축이 중요한 이유
LLM은 가중치(weights)가 수십 기가바이트를 차지하기 때문에 보통 데스크톱급 GPU나 유료 API가 필요합니다. 가중치당 비트 수를 줄이는 양자화는 모델의 크기를 줄여주지만, 지식을 손실시킬 수도 있습니다. Bonsai는 두 가지 극단적인 옵션을 제공합니다. 하나는 ternary 변형(세 가지 가능한 가중치 값, 약 7.2GB)이고, 다른 하나는 공격적인 1비트 변형(약 3.9GB)입니다. 이번 테스트는 크기와 성능 사이의 절충(trade-off)을 확인하는 데 중점을 두었습니다.
사실 관계 회상(factual recall) 성능
테스트 세트에서 기존 Qwen 3.6은 모든 역사적 날짜 관련 질문에 정확히 답변했습니다. 반면 ternary Bonsai는 6개 중 5개를 놓쳤고, 1비트 버전은 모든 날짜 관련 질의에 실패했습니다. 예상대로, 공격적인 압축은 희귀하고 구체적인 사실을 가장 먼저 버리고, 유창성을 결정짓는 광범위한 언어 패턴만을 보존합니다.
코딩 성능은 다른 양상을 보입니다
프롬프트가 코딩 작업으로 전환되자 결과는 뒤집혔습니다. 세 모델 모두 고전적인 동시성 버그(concurrency bugs)를 오류 없이 해결했습니다. 까다로운 React 애니메이션 챌린지에서 1비트 Bonsai는 두 번의 시도 만에 완료한 반면, 기존 모델은 코드 파싱에 추가 시간이 소요되어 네 번의 시도가 필요했습니다. ternary 버전은 10번의 시도가 필요했으며 결국 테스트 서버를 다운시켰습니다.
실질적인 장애물
Bonsai는 대중적인 Ollama 런타임에서 실행되지 않습니다. 1비트 모델은 Prism ML에서 제공하는 커스텀 실행 레이어가 필요하므로, 사용자가 이를 작동시키려면 비표준 소프트웨어를 설치해야 합니다. 이러한 의존성 때문에 환경 설정을 직접 조정하는 데 익숙한 사용자들에게만 매력이 제한됩니다.
Bonsai를 고려해야 할 대상과 피해야 할 대상
- 범용 채팅 – 사실 관계의 세부 정보가 급격히 손실되기 때문에 Bonsai는 지식 베이스 어시스턴트로 사용하기에 부적합합니다. 역사, 과학 또는 시사 문제에 대한 정확한 답변을 원한다면 기존 모델이나 클라우드 API를 사용하십시오.
- 로컬 코딩 보조 도구 – 코드를 제안하고 버그를 잡아내며, 휴대폰이나 저사양 노트북에서 실행되는 오프라인 도구를 원하는 개발자라면 1비트 버전이 제공하는 속도와 낮은 저장 공간 비용에 만족할 것입니다. 자율적인 에이전트는 아니지만, 로직과 구문을 효율적으로 처리합니다.
결론
Bonsai 27B는 54GB의 LLM을 휴대폰에 적합한 3.9GB로 압축하면서도 놀라울 정도로 빠르고 유능한 코드 제안을 받을 수 있음을 보여줍니다. 그 대가는 구체적인 사실 관계 회상 능력의 거의 완전한 상실입니다. 따라서 이 모델은 백과사전식 지식보다 오프라인 속도를 중시하는 개발자들의 도구 상자에 적합합니다.
