Cerebras ಕಸ್ಟಮ್ AI ಚಿಪ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿದ್ದರೆ, ಫ್ರೆಂಚ್ ಸ್ಟಾರ್ಟ್‌ಅಪ್ Kog ಕಂಪನಿಯು ಉದ್ಯಮಗಳು ಈಗಾಗಲೇ ಹೊಂದಿರುವ GPUಗಳಿಂದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಡೇಟಾ ಸೆಂಟರ್ ಹಾರ್ಡ್‌ವೇರ್‌ನ ಲೊ-ಲೆವೆಲ್ ಸಾಫ್ಟ್‌ವೇರ್ ಅನ್ನು ಮರುಬರೆಯುವ ಮೂಲಕ, Kog AI ವರ್ಕ್‌ಫ್ಲೋಗಳನ್ನು ನಿಧಾನಗೊಳಿಸುವ ಲೇಟೆನ್ಸಿ ಬಾಟಲ್‌ನೆಕ್‌ಗಳನ್ನು (latency bottlenecks) ನಿವಾರಿಸುತ್ತದೆ.

ಕಸ್ಟಮ್ AI ಸಿಲಿಕಾನ್‌ನ ಅಗತ್ಯತೆಯನ್ನು ಪ್ರಶ್ನಿಸುವುದು

AI ಉದ್ಯಮವು ಇನ್ಫರೆನ್ಸ್ (inference) ಗಾಗಿ ಉದ್ದೇಶಿತ ಚಿಪ್‌ಗಳತ್ತ ತಿರುಗಿದೆ. Kog ನ CEO, Gaël Delalleau, ಸ್ಟ್ಯಾಂಡರ್ಡ್ GPUಗಳು ಡಿಕೋಡಿಂಗ್ ಅನ್ನು ನಿಭಾಯಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ ಎಂಬ ನಂಬಿಕೆಯು ತಪ್ಪಾಗಿದೆ ಎಂದು ಹೇಳುತ್ತಾರೆ. ಆಧುನಿಕ GPUಗಳು—Nvidia H200, AMD MI300X—ಪ್ರಸ್ತುತ ಸಾಫ್ಟ್‌ವೇರ್ ಬಳಸದ ಮೆಮೊರಿ ಬ್ಯಾಂಡ್‌ವಿಡ್ತ್ ಅನ್ನು ಒದಗಿಸುತ್ತವೆ.

Kog ನ Kog Inference Engine (KIE) "ಅತ್ಯಂತ ವೇಗದ ಸಿಂಗಲ್-ರಿಕ್ವೆಸ್ಟ್ ಡಿಕೋಡಿಂಗ್" ಅನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿದೆ, ಇದು ರಿಯಲ್-ಟೈಮ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗೆ ಅತ್ಯಗತ್ಯವಾಗಿದೆ. ಇತ್ತೀಚಿನ ಡೆಮೊದಲ್ಲಿ, ಕಂಪನಿಯು Laneformer 2B (ಅವರ ಸ್ಟ್ಯಾಕ್ ಗಾಗಿ ಟ್ಯೂನ್ ಮಾಡಲಾದ ಓಪನ್-ಸೋರ್ಸ್ 2-ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್) ಬಳಸಿ ಸೆಕೆಂಡಿಗೆ 3,000 ಟೋಕನ್‌ಗಳ (TPS) ವೇಗವನ್ನು ತಲುಪಿದೆ. ಈ ಡೆಮೊವು ಸಣ್ಣ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸುತ್ತದೆ, ಆದರೆ Kog ಆ ಲಾಭವನ್ನು ದೊಡ್ಡ LLMಗಳಿಗೆ ವಿಸ್ತರಿಸಲು ಯೋಜಿಸುತ್ತಿದೆ.

GPU ಎಂಜಿನಿಯರಿಂಗ್‌ನಲ್ಲಿ "ಹ್ಯಾಕರ್" ವಿಧಾನ

ZML ನಂತಹ ಹಾರ್ಡ್‌ವೇರ್-ಅಗ್ನಾಸ್ಟಿಕ್ (hardware-agnostic) ಪೂರೈಕೆದಾರರಂತೆ ಅಲ್ಲದೆ, Kog ಆಳವಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ. ತಂಡವು GPUಗಳನ್ನು ಅಸೆಂಬ್ಲಿ ಮತ್ತು ಬೈನರಿ ಮಟ್ಟದಲ್ಲಿ ರಿವರ್ಸ್-ಎಂಜಿನಿಯರ್ ಮಾಡುತ್ತದೆ, ಸಿಲಿಕಾನ್ ಅನ್ನು ಕರಗತ ಮಾಡಿಕೊಳ್ಳಬೇಕಾದ ಭೌತಿಕ ನಿಯಮಗಳ ಗುಂಪಿನಂತೆ ಪರಿಗಣಿಸುತ್ತದೆ.

ಆ ಲೊ-ಲೆವೆಲ್ ಗಮನವು ಪ್ರತಿಯೊಂದು ದಕ್ಷತೆಯನ್ನು ಹೊರತೆಗೆಯುತ್ತದೆ, ಆದರೆ ಅದಕ್ಕೆ ಸಮಯ ಬೇಕಾಗುತ್ತದೆ. 11 ಎಂಜಿನಿಯರ್‌ಗಳ ಸಣ್ಣ ತಂಡದೊಂದಿಗೆ, Kog ಹೊಸ GPU ಆರ್ಕಿಟೆಕ್ಚರ್ ಅನ್ನು ಬೆಂಬಲಿಸುವ ಮೊದಲು ಅದನ್ನು ವಿಶ್ಲೇಷಿಸಲು ವಾರಗಟ್ಟಲೆ ಅಥವಾ ತಿಂಗಳುಗಟ್ಟಲೆ ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಈ ವಿಧಾನವು ಉನ್ನತ ಮಟ್ಟದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತದೆ ಆದರೆ Kog ಎಷ್ಟು ವೇಗವಾಗಿ ಹೊಸ ಹಾರ್ಡ್‌ವೇರ್ ಅನ್ನು ಒಳಗೊಳ್ಳಬಹುದು ಎಂಬುದರ ಮೇಲೆ ಮಿತಿ ಹೇರುತ್ತದೆ.

ಹೆಚ್ಚಿನ ಮೌಲ್ಯದ AI ಬಳಕೆಗಳ ಗುರಿ

Kog ವಿಳಂಬವು (latency) ಆದಾಯದ ನಷ್ಟಕ್ಕೆ ಕಾರಣವಾಗುವ ವಲಯಗಳ ಮೇಲೆ ಗಮನ ಹರಿಸುತ್ತದೆ:

  • Software engineering: Claude Code ನಂತಹ ಪರಿಕರಗಳು ನಿಮಿಷಗಟ್ಟಲೆ ವಿಳಂಬವಾಗುತ್ತವೆ. Kog "ಗಂಟೆಗಟ್ಟಲೆ ಕಾಯುವುದನ್ನು" ತಕ್ಷಣದ ಫಲಿತಾಂಶಗಳಾಗಿ ಪರಿವರ್ತಿಸುವ ಗುರಿಯನ್ನು ಹೊಂದಿದೆ.
  • Generative app/game design: ಬಳಕೆದಾರರನ್ನು ತೊಡಗಿಸಿಕೊಳ್ಳಲು ಮತ್ತು ಆದಾಯವನ್ನು ಹೆಚ್ಚಿಸಲು ಜನರೇಟಿವ್ ಅಪ್ಲಿಕೇಶನ್/ಗೇಮ್ ಡಿಸೈನ್ ಪೈಪ್‌ಲೈನ್‌ಗಳಿಗೆ ತ್ವರಿತ ಇಟರೇಶನ್ ಅಗತ್ಯವಿದೆ.

ಕಂಪನಿಯ ಮುಂದಿನ ಮೈಲಿಗಲ್ಲು ಅದರ ಮೊದಲ ಪ್ರಮುಖ ದೊಡ್ಡ ಪ್ರಮಾಣದ ಮಾಡೆಲ್‌ನಲ್ಲಿ 10× ವೇಗವನ್ನು ಸಾಧಿಸುವುದಾಗಿದೆ. Scaleway, Bpifrance ಮತ್ತು French Tech 2030 ಕಾರ್ಯಕ್ರಮದಿಂದ ಬೆಂಬಲಿತವಾಗಿರುವ Kog, ಯುರೋಪಿನ AI ಸಾರ್ವಭೌಮತ್ವದ ಚಾಲನೆಯಲ್ಲಿ ಪ್ರಮುಖ ಪಾತ್ರ ವಹಿಸಲು ತನ್ನನ್ನು ತಾನು ಸಜ್ಜುಗೊಳಿಸಿಕೊಳ್ಳುತ್ತಿದೆ.

ಪ್ರಮುಖ ಅಂಶಗಳು

  • Optimization over hardware: Kog ಅತ್ಯಂತ ಲೊ-ಲೆವೆಲ್ ಸಾಫ್ಟ್‌ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಮೂಲಕ Nvidia H200 ಮತ್ತು AMD MI300X GPUಗಳ ಮೆಮೊರಿ ಬ್ಯಾಂಡ್‌ವಿಡ್ತ್ ಅನ್ನು ಗರಿಷ್ಠ ಮಟ್ಟಕ್ಕೆ ತಳ್ಳುತ್ತದೆ.
  • Breaking the latency barrier: ಈ ಸ್ಟಾರ್ಟ್‌ಅಪ್ ಆಟೋಮೇಟೆಡ್ ಕೋಡಿಂಗ್ ಮತ್ತು ಜನರೇಟಿವ್ ಡಿಸೈನ್‌ನಂತಹ ರಿಯಲ್-ಟೈಮ್ ವೃತ್ತಿಪರ ವರ್ಕ್‌ಫ್ಲೋಗಳಿಗಾಗಿ LLM ಇನ್ಫರೆನ್ಸ್ ವೇಗದಲ್ಲಿ 30× ಹೆಚ್ಚಳವನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿದೆ.
  • Deep-level engineering: "ಹ್ಯಾಕರ್" ಮನೋಭಾವವನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುವ ಮೂಲಕ, Kog ಸ್ಟ್ಯಾಂಡರ್ಡ್ ಸ್ಟ್ಯಾಕ್‌ಗಳು ತಲುಪಲು ಸಾಧ್ಯವಾಗದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸಲು GPU ಅಸೆಂಬ್ಲಿ ಮತ್ತು ಬೈನರಿ ಕೋಡ್ ಅನ್ನು ರಿವರ್ಸ್-ಎಂಜಿನಿಯರ್ ಮಾಡುತ್ತದೆ.

Kog ಎಂಬ ಫ್ರೆಂಚ್ ಸ್ಟಾರ್ಟ್‌ಅಪ್, ತನ್ನ Kog Inference Engine ಮೂಲಕ ಡೇಟಾ ಸೆಂಟರ್ ಆಪರೇಟರ್‌ಗಳು ಈಗಾಗಲೇ ಹೊಂದಿರುವ Nvidia H200 ಅಥವಾ AMD MI300X GPUಗಳ ಮೇಲೆ ಲಾರ್ಜ್-ಲ್ಯಾಂಗ್ವೇಜ್-ಮಾಡಲ್ (LLM) ಡಿಕೋಡಿಂಗ್ ಅನ್ನು 30 ಪಟ್ಟು ಹೆಚ್ಚು ವೇಗವಾಗಿ ನಡೆಸುವ ಗುರಿಯನ್ನು ಹೊಂದಿದೆ ಎಂದು ಹೇಳಿದೆ.

ಈಗ ವೇಗದ ಅಗತ್ಯ ಏಕೆ ಇದೆ

LLM ಇನ್ಫರೆನ್ಸ್ ಈಗ ಕೋಡ್-ಕಂಪ್ಲೀಷನ್ ಅಸಿಸ್ಟೆಂಟ್ಸ್, ಕಂಟೆಂಟ್ ಜನರೇಟರ್‌ಗಳು ಮತ್ತು ಇಂಟರಾಕ್ಟಿವ್ ಗೇಮ್-ಡಿಸೈನ್ ಟೂಲ್‌ಗಳಂತಹ ಉತ್ಪನ್ನಗಳ ವೇಗವನ್ನು ಮಂದಗತಿಗೊಳಿಸುತ್ತಿದೆ. ಅಂತಹ ಸಂದರ್ಭಗಳಲ್ಲಿ, ಬಳಕೆದಾರರ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು ಮಾಡೆಲ್‌ನ ಪ್ರತಿಕ್ರಿಯೆಯ ನಡುವಿನ ಅಂತರವು ನೇರವಾಗಿ ಉತ್ಪಾದಕತೆ ಮತ್ತು ಆದಾಯದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. CUDA ನಂತಹ ಹೈ-ಲೆವೆಲ್ APIಗಳು, ವಿಶೇಷವಾಗಿ ರಿಯಲ್-ಟೈಮ್ ಬಳಕೆಗಳಲ್ಲಿ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿರುವ ಟೋಕನ್-ಬೈ-ಟೋಕನ್ ಡಿಕೋಡಿಂಗ್ ಸಮಯದಲ್ಲಿ, GPU ಮೆಮೊರಿ ಬ್ಯಾಂಡ್‌ವಿಡ್ತ್‌ನ ದೊಡ್ಡ ಭಾಗವನ್ನು ಬಳಕೆಯಾಗದಂತೆ ಬಿಡುತ್ತವೆ.

Kog ನ ಲೊ-ಲೆವೆಲ್ ಉತ್ತರ

Kog ಸಾಂಪ್ರದಾಯಿಕ ಸಾಫ್ಟ್‌ವೇರ್ ಪದರಗಳನ್ನು ಬಿಟ್ಟು ನೇರವಾಗಿ ಸಿಲಿಕಾನ್ ಜೊತೆ ಸಂವಹನ ನಡೆಸುತ್ತದೆ. ಅದರ ಎಂಜಿನಿಯರ್‌ಗಳು GPU ಅನ್ನು ಅಸೆಂಬ್ಲಿ ಮಟ್ಟದಲ್ಲಿ ರಿವರ್ಸ್-ಎಂಜಿನಿಯರ್ ಮಾಡುತ್ತಾರೆ, ಹಾರ್ಡ್‌ವೇರ್ ಅನ್ನು ಕೇವಲ ಒಂದು ಕಪ್ಪು ಪೆಟ್ಟಿಗೆಯಂತೆ (black box) ನೋಡುವ ಬದಲು, ಪಾಲಿಸಬೇಕಾದ ಮಿತಿಗಳ ಗುಂಪಿನಂತೆ ಪರಿಗಣಿಸುತ್ತಾರೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ, GPU ನ ಮೆಮೊರಿ ಪೈಪ್‌ಗಳ ಮೂಲಕ ಡೇಟಾವನ್ನು ಪೂರ್ಣ ಸಾಮರ್ಥ್ಯದೊಂದಿಗೆ ಹರಿಸುವ ಕಸ್ಟಮ್ ಎಕ್ಸಿಕ್ಯೂಷನ್ ಪಾತ್ (execution path) ಸಿದ್ಧವಾಗುತ್ತದೆ.

ಇತ್ತೀಚಿನ ಡೆಮೊದಲ್ಲಿ ಕಂಪನಿಯು Laneformer 2B ಅನ್ನು ಚಲಾಯಿಸಿತು—ಇದು ಅದರ ಸ್ಟ್ಯಾಕ್ ಗಾಗಿ ಟ್ಯೂನ್ ಮಾಡಲಾದ 2-ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಓಪನ್-ಸೋರ್ಸ್ ಮಾಡೆಲ್—ಮತ್ತು ಹೆಚ್ಚಿನ ಟೋಕನ್ ಥ್ರೂಪುಟ್ ಅನ್ನು ವರದಿ ಮಾಡಿದೆ. ದೊಡ್ಡ ವಾಣಿಜ್ಯ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಹೋಲಿಸಿದರೆ ಈ ಮಾಡೆಲ್ ಸಾಧಾರಣವಾಗಿದ್ದರೂ, ಈ ವೇಗದ ಹೆಚ್ಚಳವು ಉದ್ದೇಶಿತ ಸಾಫ್ಟ್‌ವೇರ್ ಸ್ಟ್ಯಾಕ್ ಒಂದೇ ಹಾರ್ಡ್‌ವೇರ್‌ನಿಂದ ಏನನ್ನು ಹೊರತೆಗೆಯಬಲ್ಲದು ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ.

ಎಂಜಿನಿಯರಿಂಗ್ ಟ್ರೇಡ್-ಆಫ್ (trade-off)

ಇದರ ಲಾಭವು ಹೆಚ್ಚಿನ ವೆಚ್ಚದೊಂದಿಗೆ ಬರುತ್ತದೆ. Kog ನ 11 ಎಂಜಿನಿಯರ್‌ಗಳ ತಂಡವು ಪ್ರತಿಯೊಂದು ಹೊಸ GPU ಆರ್ಕಿಟೆಕ್ಚರ್ ಅನ್ನು ಬೆಂಬಲಿಸುವ ಮೊದಲು ಅದನ್ನು ವಿಶ್ಲೇಷಿಸಲು ವಾರಗಟ್ಟಲೆ ಅಥವಾ ತಿಂಗಳುಗಟ್ಟಲೆ ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಈ ಆಳವಾದ ವಿಶ್ಲೇಷಣೆಯು ಗುರಿಯಾಗಿಸಿಕೊಂಡ ಕಾರ್ಡ್‌ಗಳ ಮೇಲೆ ಹೆಚ್ಚಿನ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತದೆ

  • Software-engineering tools – Products that generate code, such as Claude Code, often stall for minutes while the model processes a request. Cutting that wait to a few seconds would make interactive development far more fluid.
  • Generative design pipelines – Studios turning textual prompts into app prototypes or game assets need rapid iteration to keep creators engaged. Faster decoding shortens design loops and boosts conversion rates.

Both sectors translate latency directly into lost billable hours or churn, so a 30× speed boost could be a decisive competitive edge.

The broader picture

Kog’s strategy runs counter to the industry trend of building custom AI silicon. Companies like Cerebras pour billions into chips that promise higher throughput per watt. Kog argues that today’s GPUs already have enough memory bandwidth for decoding; the missing piece is software that can actually use it. If the claim holds at scale, developers could defer costly hardware upgrades and rely on a software upgrade to achieve near-real-time inference.

Potential headwinds

  • Maintenance burden – Every new GPU generation will require fresh reverse-engineering. As the market diversifies, the small team could be stretched thin.
  • Scalability to larger models – The demo used a 2 B-parameter model. Scaling the same techniques to much larger systems may hit memory-capacity limits or demand additional engineering tricks not yet disclosed.
  • Alternative paths – Cloud providers already offer inference-optimized instances that bundle specialized chips and software. For some workloads, the marginal gain from Kog’s stack may not outweigh the convenience of a managed service.

What to watch

  • First large-model rollout – Kog says its next milestone is a 10× speedup on a “major large-scale model.” The gap between the 2 B demo and an enterprise-grade model will be the clearest test of the approach.
  • Hardware support expansion – Adding support for newer GPUs or other accelerators will signal whether the low-level model can keep pace with rapid hardware cadence.

Takeaway

Kog shows that squeezing more work from existing GPUs is possible when you rewrite the software stack from the ground up. The promise of 30× faster LLM decoding could reshape how developers price and architect AI services—provided the company can sustain the intense engineering effort needed for each new piece of silicon.