Cerebras가 맞춤형 AI 칩을 제작하는 동안, 프랑스 스타트업 Kog는 기업이 이미 보유하고 있는 GPU에서 성능을 최대한 끌어냅니다. 기존 데이터센터 하드웨어를 위한 저수준(low-level) 소프트웨어를 재작성함으로써, Kog는 AI 워크플로우를 늦추는 지연 시간(latency) 병목 현상을 제거합니다.

맞춤형 AI 실리콘의 필요성에 대한 도전

AI 산업은 추론을 위한 목적 기반 칩으로 중심축을 옮겼습니다. Kog의 CEO인 Gaël Delalleau는 표준 GPU가 디코딩을 처리할 수 없다는 믿음은 잘못되었다고 말합니다. Nvidia H200, AMD MI300X와 같은 최신 GPU는 현재의 소프트웨어가 유휴 상태로 방치하고 있는 메모리 대역폭을 제공합니다.

Kog의 Kog Inference Engine (KIE)은 실시간 앱에 필수적인 "매우 빠른 단일 요청 디코딩"을 목표로 합니다. 최근 데모에서 이 회사는 자사의 스택에 맞춰 튜닝된 오픈 소스 20억 파라미터 모델인 Laneformer 2B를 사용하여 초당 3,000개 토큰(TPS)을 달성했습니다. 이 데모는 소규모 모델을 사용했지만, Kog는 이러한 이점을 훨씬 더 큰 LLM으로 확장할 계획입니다.

GPU 엔지니어링에 대한 "해커"식 접근 방식

ZML과 같이 하드웨어에 구애받지 않는 제공업체와 달리, Kog는 깊게 파고듭니다. 팀은 GPU를 어셈블리 및 바이너리 수준에서 역공학(reverse-engineer)하며, 실리콘을 정복해야 할 물리 법칙의 집합으로 취급합니다.

이러한 저수준 중심의 접근 방식은 효율성을 극한까지 끌어내지만, 그만큼 시간이 소요됩니다. 11명의 엔지니어로 구성된 소규모 팀인 Kog는 새로운 GPU 아키텍처를 지원하기 전에 이를 분석하는 데 몇 주 또는 몇 달을 소비합니다. 이 방식은 최상위 성능을 제공하지만, Kog가 새로운 하드웨어를 얼마나 빠르게 지원할 수 있는지에는 한계가 있습니다.

고부가가치 AI 유스케이스 타겟팅

Kog는 지연 시간이 곧 매출 손실로 이어지는 분야에 집중합니다:

  • 소프트웨어 엔지니어링: Claude Code와 같은 도구는 몇 분씩 멈추기도 합니다. Kog는 "몇 시간의 대기"를 거의 즉각적인 결과로 바꾸는 것을 목표로 합니다.
  • 생성형 앱/게임 디자인: 프롬프트 투 앱(Prompt-to-app) 파이프라인은 사용자의 참여를 유지하고 수익을 창출하기 위해 빠른 반복(iteration)이 필요합니다.

이 회사의 다음 이정표는 첫 번째 주요 대규모 모델에서 10배의 속도 향상을 달성하는 것입니다. Scaleway, Bpifrance 및 French Tech 2030 프로그램의 지원을 받는 Kog는 유럽의 AI 주권 확보 추진력의 핵심 플레이어로 자리매김하고 있습니다.

핵심 요약

  • 하드웨어보다 최적화: Kog는 극한의 저수준 소프트웨어 엔지니어링을 통해 Nvidia H200 및 AMD MI300X GPU의 메모리 대역폭을 한계까지 밀어붙입니다.
  • 지연 시간 장벽 타파: 이 스타트업은 자동 코딩 및 생성형 디자인과 같은 실시간 전문 워크플로우를 위해 LLM 추론 속도를 30배 향상시키는 것을 목표로 합니다.
  • 심층 엔지니어링: "해커" 정신을 채택함으로써, Kog는 표준 스택이 도달할 수 없는 성능을 달성하기 위해 GPU 어셈블리 및 바이너리 코드를 역공학합니다.

프랑스 스타트업인 Kog는 자사의 Kog Inference Engine이 데이터 센터 운영자가 이미 보유하고 있는 Nvidia H200 또는 AMD MI300X GPU에서 대규모 언어 모델(LLM) 디코딩을 최대 30배 더 빠르게 실행하는 것을 목표로 한다고 밝혔습니다.

왜 지금 속도 향상이 중요한가

LLM 추론은 현재 코드 완성 어시스턴트, 실시간 콘텐츠 생성기, 대화형 게임 디자인 도구와 같은 제품의 성능을 제한하고 있습니다. 이러한 환경에서 사용자의 프롬프트와 모델의 응답 사이의 간격은 생산성과 매출에 직접적인 영향을 미칩니다. CUDA와 같은 고수준 API는 특히 실시간 유스케이스를 지배하는 토큰 단위 디코딩 중에 GPU 메모리 대역폭의 상당 부분을 유휴 상태로 남겨둡니다.

Kog의 저수준 해법

Kog는 기존의 소프트웨어 계층을 건너뛰고 실리콘과 직접 통신합니다. 엔지니어들은 GPU를 추상화해야 할 블랙박스가 아니라 준수해야 할 제약 조건의 집합으로 취급하며 어셈블리 수준에서 GPU를 역공학합니다. 그 결과, GPU의 메모리 파이프를 통해 데이터를 거의 최대 용량으로 계속 흐르게 하는 맞춤형 실행 경로를 만들어냅니다.

최근 데모에서 이 회사는 자사의 스택에 맞춰 튜닝된 20억 파라미터 오픈 소스 모델인 Laneformer 2B를 실행하여 높은 토큰 처리량을 기록했습니다. 이 모델은 더 큰 상용 시스템에 비하면 소규모이지만, 이 속도 향상은 맞춤형 소프트웨어 스택이 동일한 하드웨어에서 무엇을 끌어낼 수 있는지를 보여줍니다.

엔지니어링 트레이드오프

이러한 장점에는 가파른 비용 곡선이 따릅니다. 11명의 엔지니어로 구성된 Kog 팀은 새로운 GPU 아키텍처를 지원하기 전에 이를 분석하는 데 몇 주 또는 몇 달을 소비합니다. 이러한 깊이 있는 접근은 대상 카드의 높은 성능을 보장하지만, Kog가 시장에 출시되는 모든 새로운 GPU를 즉시 지원할 수는 없음을 의미하기도 합니다. 고객은 Kog가 이미 최적화한 Nvidia H200 또는 AMD MI300X GPU를 보유한 경우에만 혜택을 볼 수 있습니다.

누가 이득을 보는가

  • Software-engineering tools – Products that generate code, such as Claude Code, often stall for minutes while the model processes a request. Cutting that wait to a few seconds would make interactive development far more fluid.
  • Generative design pipelines – Studios turning textual prompts into app prototypes or game assets need rapid iteration to keep creators engaged. Faster decoding shortens design loops and boosts conversion rates.

Both sectors translate latency directly into lost billable hours or churn, so a 30× speed boost could be a decisive competitive edge.

The broader picture

Kog’s strategy runs counter to the industry trend of building custom AI silicon. Companies like Cerebras pour billions into chips that promise higher throughput per watt. Kog argues that today’s GPUs already have enough memory bandwidth for decoding; the missing piece is software that can actually use it. If the claim holds at scale, developers could defer costly hardware upgrades and rely on a software upgrade to achieve near-real-time inference.

Potential headwinds

  • Maintenance burden – Every new GPU generation will require fresh reverse-engineering. As the market diversifies, the small team could be stretched thin.
  • Scalability to larger models – The demo used a 2 B-parameter model. Scaling the same techniques to much larger systems may hit memory-capacity limits or demand additional engineering tricks not yet disclosed.
  • Alternative paths – Cloud providers already offer inference-optimized instances that bundle specialized chips and software. For some workloads, the marginal gain from Kog’s stack may not outweigh the convenience of a managed service.

What to watch

  • First large-model rollout – Kog says its next milestone is a 10× speedup on a “major large-scale model.” The gap between the 2 B demo and an enterprise-grade model will be the clearest test of the approach.
  • Hardware support expansion – Adding support for newer GPUs or other accelerators will signal whether the low-level model can keep pace with rapid hardware cadence.

Takeaway

Kog shows that squeezing more work from existing GPUs is possible when you rewrite the software stack from the ground up. The promise of 30× faster LLM decoding could reshape how developers price and architect AI services—provided the company can sustain the intense engineering effort needed for each new piece of silicon.