트랜스포머를 넘어: LLM의 차세대 시대를 재정의하는 스타트업들

대규모 언어 모델(LLM)의 연산 요구량이 한계점에 도달함에 따라, 트랜스포머의 시대가 근본적인 병목 현상에 직면해 있습니다. 2017년 "Attention Is All You Need" 논문이 현재의 AI 붐을 위한 토대를 마련했지만, 이제 새로운 세대의 스타트업들이 진정한 효율성을 달성하기 위해 핵심 아키텍처를 교체하거나 재발명하려는 경쟁을 벌이고 있습니다.

트랜스포머의 병목 현상: 왜 밀집 어텐션(Dense Attention)이 한계에 부딪혔는가

지난 10년 가까이 트랜스포머는 "밀집 어텐션(dense attention)"이라 불리는 메커니즘을 통해 AI 산업의 엔진 역할을 해왔습니다. 이 프로세스는 텍스트 블록 내의 모든 토큰을 대규모 곱셈을 통해 다른 모든 토큰과 비교합니다. 의미론적 의미를 포착하는 데는 매우 정확하지만, 수학적 복잡성이 효율적으로 확장되지 않는다는 단점이 있습니다.

예를 들어, 10,000단어 분량의 문서를 처리하려면 트랜스포머는 약 5,000만 번의 곱셈을 수행해야 할 수도 있습니다. 이러한 연산량의 이차적(quadratic) 증가는 급증하는 에너지 소비와 제한된 컨텍스트 창(context window)이라는 두 가지 거대한 과제를 야기합니다. OpenAI가 올해 컴퓨팅에 500억 달러를 지출할 예정이며, 2030년까지 데이터 센터의 전력 수요가 두 배로 증가할 것으로 예상됨에 따라, 업계는 비용과 물리적 한계라는 벽에 부딪히고 있습니다.

어텐션의 재고: 희소 메커니즘(Sparse Mechanisms)의 부상

효율성 위기를 해결하기 위해 여러 스타트업이 밀집 어텐션에서 벗어나 "희소 어텐션(sparse attention)"으로 전환을 시도하고 있습니다. 희소 어텐션은 가능한 모든 단어 쌍을 계산하는 대신 가장 관련성이 높은 연결에만 집중하여 연산 부하를 크게 줄입니다.

마이애미에 본사를 둔 스타트업 SubquadraticSubQ 모델을 통해 이 분야를 선도하고 있습니다. 정확도 유지에 어려움을 겪었던 이전의 희소 메커니즘과 달리, Subquadratic는 자사의 기술이 코딩 및 검색과 같은 전문 작업에서 주류 LLM과 대등한 성능을 보인다고 주장합니다. 이들의 접근 방식은 무관한 토큰에 연산 자원을 낭비하는 대신, 주어진 텍스트에서 실제로 중요한 단어가 무엇인지 실시간으로 식별하는 동적 시스템을 포함합니다.

파워 리텐션(Power Retention): 롤링 서머리(Rolling Summaries)를 향한 움직임

또 다른 접근 방식은 어텐션 메커니즘에서 완전히 벗어나는 것입니다. 샌프란시스코 기반의 Manifest AI는 "파워 리텐션(power retention)"이라 불리는 기술을 개척하고 있습니다. SubQ와 같은 희소 어텐션 모델이 전체 컨텍스트 창의 대략적인 모습을 유지하려고 노력하는 반면, 파워 리텐션은 모델에 메모리의 롤링 서머리(rolling summary)를 제공하는 방식으로 작동합니다.

새로운 정보가 컨텍스트 창에 들어오면 모델은 관련성이 낮은 데이터를 식별하여 삭제함으로써, 입력 크기에 관계없이 연산 부하를 관리 가능한 수준으로 유지합니다. Manifest AI는 이미 다음과 같은 방식으로 이 접근 방식의 생존 가능성을 입증했습니다:

  • 파워 리텐션을 사용하여 오픈 소스 StarCoder 모델을 PowerCoder로 변환.
  • Alibaba의 인기 있는 Qwen 오픈 소스 모델과 대등하다고 주장하는 모델인 Brumby 출시.

최소한의 재학습만으로 기존 트랜스포머 모델을 파워 리텐션 모델로 적응시킬 수 있는 능력은, 차세대 모델인 "LLMs+"로의 전환이 예상보다 훨씬 빠르게 일어날 수 있음을 시사합니다.

핵심 요약

  • 트랜스포머의 한계: 밀집 어텐션의 이차적 스케일링은 현재의 LLM을 실행하는 데 엄청난 비용을 들게 하며, 대규모 데이터셋이나 장문 추론을 위해 확장하기 어렵게 만듭니다.
  • 희소성 vs. 리텐션: 스타트업들은 두 가지 측면에서 이 문제에 접근하고 있습니다. Subquadratic는 희소 계산(SubQ)을 통해 어텐션을 최적화하고 있으며, Manifest AI는 이를 롤링 서머리(Power Retention)로 대체하고 있습니다.
  • 경제적 필연성: AI 연산 비용이 수백억 달러에 달함에 따라, 차세대 AI 시대의 승자는 단순히 규모를 키우는 것이 아니라 효율성 문제를 해결하는 기업이 될 가능성이 높습니다.