사티아 나델라가 자사가 구축을 도운 바로 그 연구소들과 공개적인 싸움을 시작했습니다. Microsoft의 CEO는 거대 AI 기업들이 데이터 소유권의 규칙을 어떻게 재정의하고 있는지에 대해 직설적인 경고를 던졌으며, 이 메시지는 이례적일 만큼 강력한 파급력을 미쳤습니다. 최근 블로그 게시물에서 나델라는 OpenAI와 Anthropic을 포함한 프런티어 연구소들이 조작된 시장을 구축하고 있다고 비난했습니다. 이들은 방대한 모델을 학습시키기 위해 공개 데이터를 수집한 뒤, 해당 모델이 생성한 결과물로부터 그 누구도 학습할 수 없도록 서비스 약관을 활용해 차단하고 있습니다. 그는 그 결과, 기업들이 비용은 지불하면서 자신들의 독점적 지식은 내어주는 일방적인 가치 이전이 발생하고 있다고 주장합니다.
증류의 이중 잣대
이 불만에 대해 이해하려면, 이 연구소들이 그토록 차단하려 애쓰는 기술을 살펴볼 필요가 있습니다. 증류(Distillation)는 소규모의 특화된 모델이 처음부터 인터넷의 가공되지 않은 텍스트를 흡수하는 대신, 대규모 모델의 결과물로부터 학습하는 일반적인 학습 방법입니다. 스타트업이나 연구 팀은 프런티어 모델에 수백만 개의 프롬프트를 입력하여 응답을 캡처한 뒤, 그 풍부한 신호를 사용하여 로컬에서 실행되거나 특정 니즈를 충족하는 소형 모델을 학습시킬 수 있습니다. 이는 기초 모델(foundation model)을 처음부터 구축하는 것보다 비용이 저렴하고 에너지 소모도 훨씬 적습니다.
OpenAI와 Anthropic 모두 서비스 약관을 통해 이러한 관행을 금지하고 있습니다. 이들이 체계적인 증류를 감지하면 이를 약관 위반으로 간주합니다. 이러한 집행은 주로 경쟁사, 특히 막대한 초기 학습 비용을 들이지 않고도 기술 격차를 줄이기 위해 이 방법을 사용하는 것으로 의심받는 중국 기반 AI 기업들을 겨냥합니다.
나델라는 이 정책의 중심에 있는 긴장 상태를 강조했습니다. 이 연구소들은 공개된 웹을 크롤링하고, 도서, 포럼, 코드 저장소, 기사 등을 긁어모아 자사의 플래그십 모델을 구축했습니다. 이 과정에서 공개적으로 접근 가능한 데이터로 학습하는 것은 '공정 이용(fair use)'에 해당한다는 법적 논리를 내세웠습니다. 즉, 그들은 공유 자원(commons)을 채굴했습니다. 하지만 이제는 그 대가로 모델의 결과물을 공공 교육 자료로 활용하려는 시도를 막기 위해 법적 울타리를 치고 있습니다. 그들은 "세상의 공개된 지식으로부터는 배울 수 있지만, 우리로부터는 아무도 배울 수 없다"라고 말하는 듯합니다.
이러한 비대칭성은 학술적 논쟁 이상의 의미를 갖습니다. 이는 소수의 인프라 제공업체가 누가 무엇을 알 수 있는지를 통제하는 계층 구조를 형성합니다. 만약 공정 이용이 인류가 발표한 지능을 흡수하는 것을 정당화한다면, 해당 모델의 결과물은 사유화된 공유 자원처럼 보이기 시작합니다. 경쟁사와 고객 모두 그 신호를 새로운 도구로 재활용하는 것이 차단됩니다. 결국 모든 길은 거대 연구소로만 향하게 됩니다.
자신의 지능에 대해 두 번 비용을 지불하는 것
나델라는 형성되고 있는 경제적 함정을 설명하기 위해 "역정보의 역설(reverse information paradox)"이라는 용어를 만들었습니다. 그의 관점에서 기업들은 현재 인공지능에 대해 두 번 비용을 지불하고 있으며, 그중 한 번의 결제만이 청구서에 나타납니다.
첫 번째 비용은 명백합니다. 기업들은 API 크레딧을 구매하거나, Copilot을 구독하거나, 챗봇 서비스를 라이선스합니다. 두 번째 비용은 숨겨져 있습니다. 직원이 환각(hallucination) 현상이 나타난 사실을 바로잡거나, 응답에 도움을 받았다고 평가하거나, 생성된 보고서를 다듬을 때마다, 그 행동은 나델라가 "데이터 부산물(exhaust)"이라고 부르는 것을 생성합니다. 이는 실제 업무 중에 발생하는 수정 사항, 선호도 데이터, 상호작용 로그의 흔적입니다.
이 부산물은 단순한 디지털 쓰레기가 아닙니다. 여기에는 어렵게 얻은 비즈니스 로직이 포함되어 있는 경우가 많습니다. 물류 팀은 기업이 수년간 개발해 온 내부 제약 조건을 사용하여 배송 경로를 최적화하도록 모델에 프롬프트를 입력할 수 있습니다. 법무 부서는 출력물이 사내 스타일에 맞을 때까지 계약서 문구를 반복적으로 수정할 수 있습니다. 제약 연구 그룹은 전략적 우선순위를 드러내는 방식으로 임상 데이터를 질의할 수 있습니다. 이러한 상호작용이 제3자 API를 통해 흐를 때, 제공업체는 전체 교환 내용을 보게 됩니다. 모델은 해당 특정 도메인에서 좋은 답변이 무엇인지 학습하게 됩니다.
시간이 흐름에 따라, 이러한 피드백은 제공업체의 범용 모델을 고객이 고용한 바로 그 작업에 더 정교하게 만듭니다. 그러면 제공업체는 개선된 능력을 고객의 경쟁사에 판매하거나, 특화된 워크플로우를 모방한 인접 제품을 출시할 수 있습니다. 원래의 기업은 구독료를 지불하고, 독점적 전문 지식을 기부했으며, 결과적으로 자신의 경쟁자를 학습시킨 셈이 됩니다.
왜 소버린 AI가 유행어를 넘어 전략으로 이동하고 있는가
이러한 유출에 대한 논리적인 대응은 학습 루프에 대한 통제권을 되찾는 것입니다. 나델라의 주장은 Microsoft를 색다른 형태의 임대인으로 포지셔닝하기 위해 설계되었습니다. 고객에게 지능을 중앙 집중식 블랙박스에 주입하라고 강요하는 대신, 그는 고객이 직접 열쇠를 쥐는 환경의 필요성을 역설하고 있습니다.
바로 이 지점에서 소버린 AI(sovereign AI)에 관한 논의가 실질적인 무게를 얻게 됩니다. 프라이빗 클라우드, 온프레미스 데이터 센터 또는 엄격하게 제어되는 가상 네트워크 내에서 모델을 실행한다는 것은 상호작용 데이터가 조직의 경계를 절대 벗어나지 않음을 의미합니다. 기업은 여전히 현대적인 파운데이션 모델의 혜택을 누리면서도, 가중치, 프롬프트, 선호도 데이터는 회사가 관리하는 경계 내에 유지할 수 있습니다.
Microsoft는 바로 이러한 프라이빗 배포와 지역 데이터 레지던시(data residency)라는 약속을 중심으로 Azure 클라우드 비즈니스를 구축해 왔습니다. 나델라는 자신의 글을 통해, 기업이 자신들의 지적 재산을 멀리 떨어진 모델 제공업체로 의도치 않게 전송하지 않고도 자체적인 학습과 추론을 수행할 수 있는 플랫폼이 되고 싶다는 신호를 보냈습니다. 그 제안은 명확합니다. 강력한 AI를 사용하되, 그 과정에서 발생하는 데이터 부산물(exhaust)은 직접 보유하라는 것입니다.
다른 벤더들도 비슷한 목소리를 내고 있지만, 나델라의 발언은 Microsoft와 OpenAI 간의 긴밀한 파트너십 덕분에 더욱 큰 무게감을 갖습니다. ~의 CEO로서
