IBM은 30억, 80억, 300억 개의 파라미터를 가진 변체를 제공하는 Granite 4.2 대규모 언어 모델 제품군을 출시했습니다. 이 모델들은 최대 512k 토큰의 컨텍스트 윈도우와 내장된 에이전트 방식의 도구 활용 기능을 갖추고 있으며, 모두 Apache 2.0 라이선스로 제공됩니다. 이번 행보를 통해 개발자들은 독점 API에 의존하지 않고도 방대한 문서를 추론하고 자율적으로 행동할 수 있는, 보기 드문 오픈 웨이트(open-weight) 방식의 엔터프라이즈급 AI를 사용할 수 있게 되었습니다.
IBM의 오픈 웨이트 추진이 지금 중요한 이유
허용적인 라이선스 덕분에 기업들은 라이선스 비용 없이 온프레미스, 프라이빗 클라우드 또는 에지 디바이스에 모델을 실행하거나 내장할 수 있습니다. 이는 데이터를 외부 서비스에 노출할 수 없는 규제 산업 분야에 명확한 이점을 제공합니다.
기술적 도약
- 규모 및 학습 데이터 – IBM은 가장 큰 상용 파운데이션 모델과 맞먹는 규모인 약 15조 개의 토큰 데이터셋을 사용하여 모델을 처음부터 학습시켰습니다.
- 컨텍스트 윈도우 – 512k 토큰 윈도우를 통해 단 한 번의 패스로 전체 코드베이스, 긴 정책 문서 또는 여러 장으로 구성된 책을 처리할 수 있어, 데이터를 조각내어 다시 조립할 필요가 없습니다.
- 듀얼 모드 컴퓨팅 – "사고(thinking)" 모드는 더 깊은 추론 레이어를 활용하고, "비사고(non-thinking)" 모드는 낮은 GPU 수요로 간단한 조회 작업을 처리합니다. 이 토글 기능을 통해 사용자는 지연 시간과 요청당 비용 사이의 균형을 맞출 수 있습니다.
- 에이전트 강화 학습 – 8B 및 30B 모델은 외부 도구를 호출하고, 샌드박스 환경에서 코드를 실행하며, 웹 검색을 수행하도록 학습시키는 특화된 RL(강화 학습) 단계를 거쳤습니다. 이 모델들은 OpenAI 스타일의 도구 호출(tool-calling) 엔드포인트를 제공하므로, 기존의 오케스트레이션 파이프라인을 재작성 없이 그대로 재사용할 수 있습니다.
- 추론 편의성 – vLLM 및 SGLang과의 호환성을 통해 범용 하드웨어에서도 높은 처리량으로 모델을 실행할 수 있으며, 이는 수십 개의 에이전트를 동시에 운영하려는 기업에 실질적인 이점을 제공합니다.
음성 기술 관련 소식: Granite Speech 5.0 Turbo CTC
LLM 라인업과 함께 IBM은 Granite Speech 5.0 Turbo CTC라고 불리는 4억 7천만 파라미터 규모의 음성-텍스트 변환(STT) 모델을 출시했습니다. IBM에 따르면 이 모델은 3시간 분량의 오디오를 1초 만에 전사하며, 이는 Open ASR 리더보드의 기존 선두 주자들보다 두 배 빠른 속도입니다. 작은 크기와 극도로 높은 처리량 덕분에 실시간 자막 생성, 콜센터 분석 및 대규모 오디오 수집 파이프라인의 유력한 후보로 꼽힙니다.
AI 생태계의 이해관계
승자:
- 기업은 값비싼 API 사용을 대체할 수 있는 비용 효율적인 셀프 호스팅 대안을 얻게 됩니다.
- 개발자는 상업적 라이선스 협상 없이 맞춤 설정할 수 있는 즉시 사용 가능한 에이전트 스택을 확보하게 됩니다.
- IBM은 자사의 연구 역량을 보여주는 플래그십 오픈 소스 제품을 공급함으로써 AI 경쟁에서 자신의 입지를 재확인합니다.
위협받는 대상:
- 독점 모델을 통한 락인(lock-in) 효과에 의존하는 폐쇄형 소스 제공업체들은 고객이 로컬에서 호스팅되는 Granite 에이전트로 이동할 경우 기업 지출 감소를 겪을 수 있습니다.
- 소규모 오픈 소스 프로젝트
