Apple이 Khosla Ventures의 지원을 받는 스타트업 PrismML과 자사 생태계에 고급 모델 압축 기술을 통합하기 위해 예비 논의를 진행 중인 것으로 알려졌습니다. 이 움직임은 정교한 인공지능을 iPhone으로 직접 가져와, 모바일 하드웨어의 한계와 현대 대규모 언어 모델(LLM)의 막대한 계산 요구 사항 사이의 간극을 메우는 것을 목표로 합니다.

온디바이스 AI의 제약 해결

Apple이 iOS 18과 재설계된 Siri를 출시함에 따라, 회사는 중대한 기술적 난관에 직면해 있습니다. 고성능 AI 모델은 일반적으로 표준 스마트폰의 용량을 초과하는 막대한 양의 메모리와 처리 능력을 필요로 하기 때문입니다. Apple은 PrismML의 기술을 통합함으로써 프로세싱을 클라우드에서 기기 자체로 옮기고자 합니다.

이러한 변화는 Apple의 전략적 포지셔닝에 매우 중요합니다. 온디바이스 AI는 지연 시간을 줄이고, 비용이 많이 드는 클라우드 컴퓨팅 비용을 낮추며, 민감한 사용자 데이터가 기기에 머물도록 보장함으로써 Apple의 핵심 가치인 개인정보 보호를 강화합니다. 또한, 인터넷 연결이 없는 상태에서도 주요 AI 기능이 작동할 수 있게 해줍니다.

PrismML이 거대 AI 모델을 축소하는 방법

캘리포니아 공과대학교(Caltech)의 연구에서 시작된 PrismML은 모델의 내부 값이 저장되는 방식을 단순화하는 정교한 방법을 사용합니다. 기존 방식이 수치를 16비트에서 4비트로 줄이는 수준이라면, PrismML은 여기서 한 단계 더 나아가 각 수치를 단 1개 또는 3개의 가능한 값으로 줄입니다.

효율성 향상은 상당합니다. PrismML은 최근 Alibaba의 오픈 소스 Qwen 모델을 54GB의 거대한 크기에서 4GB 미만으로 압축하여 이를 입증했습니다. 이 압축 기술을 통해 모델의 270억 개 파라미터 전체가 iPhone 15 또는 그 이상의 모델에서 작동할 수 있습니다. CEO Babak Hassibi에 따르면, 이러한 압축 모델은 다음과 같은 여러 성능상의 이점을 제공합니다:

  • 메모리 효율성: 메모리 사용량을 최대 15배 절감.
  • 속도: 6~8배 더 빠르게 실행.
  • 전력 소비: 에너지 소비를 최대 6배 절감.

Hassibi는 사실 관계 회상(factual recall) 측면에서 다소 성능 저하가 있음을 언급했지만, 모델은 추론 및 코딩 능력에서 높은 숙련도를 유지합니다.

반도체 및 하드웨어 시장에 미치는 영향

Apple과 같은 거대 기업이 이러한 압축 기술을 채택할 가능성은 하드웨어 제조업체의 지형을 바꿀 수 있습니다. 현재 Morgan Stanley와 같은 분석가들은 Apple이 AI를 지원하기 위해 2027 회계연도까지 메모리 비용이 급격히 상승할 수 있다고 예측하며, 이는 iPhone 가격 상승으로 이어질 수 있다고 보고 있습니다.

하지만 PrismML의 기술이 표준이 된다면, 고속의 효율적인 로컬 프로세싱에 대한 필요성은 증가하더라도 스마트폰의 대용량 메모리 모듈에 대한 수요는 완화될 수 있습니다. PrismML이 Google의 Gemma와 같은 다른 주요 모델의 압축으로 나아감에 따라, 목표는 명확합니다. 고수준의 지능을 소비자용 하드웨어에서 로컬로, 빠르게, 그리고 접근 가능하게 만드는 것입니다.

핵심 요약

  • 대규모 압축: PrismML은 54GB의 AI 모델을 4GB 미만으로 축소하여 iPhone 15와 같은 고사양 스마트폰에서 실행 가능하게 만듭니다.
  • 효율성 향상: 이 기술은 메모리 사용량을 최대 15배, 에너지 소비를 6배까지 줄여줄 것을 약속하며, 이는 AI 작업 중 배터리 수명을 유지하는 데 필수적입니다.
  • 개인정보 보호 및 속도: AI를 클라우드에서 기기로 이동시키면 지연 시간이 줄어들고 사용자 개인정보 보호가 강화되며, 이는 Apple 제품 철학의 초석입니다.

리스크 및 미결 과제

PrismML의 결과는 유망하지만 아직 초기 단계입니다.

향후 주목할 점

  • 공식 확인: Apple은 아직 파트너십을 발표하지 않았으므로, 온디바이스 LLM에 관한 보도 자료나 iOS 18 베타 노트가 중요한 신호가 될 것입니다.

결론: PrismML의 압축 기술은 iPhone이 메모리 폭증이나 배터리 소모 없이도 진정으로 거대한 언어 모델을 구동할 수 있게 하여, 더 빠르고 프라이빗한 AI 경험을 제공할 수 있습니다.