Поки Cerebras створює спеціалізовані ШІ-чіпи, французький стартап Kog витискає максимум продуктивності з GPU, якими підприємства вже володіють. Переписуючи низькорівневе програмне забезпечення для існуючого обладнання дата-центрів, Kog усуває вузькі місця затримки, що сповільнюють робочі процеси ШІ.

Підрив необхідності спеціалізованих ШІ-чіпів

Індустрія ШІ переорієнтувалася на спеціально розроблені чіпи для інференсу. Генеральний директор Kog, Gaël Delalleau, стверджує, що переконання, ніби стандартні GPU не можуть впоратися з декодуванням, є помилковим. Сучасні GPU — Nvidia H200, AMD MI300X — пропонують таку пропускну здатність пам'яті, яку сучасне програмне забезпечення залишає невикористаною.

Kog Inference Engine (KIE) від Kog орієнтований на «надзвичайно швидке декодування поодиноких запитів», що є необхідним для додатків реального часу. Під час нещодавньої демонстрації компанія досягла показника 3000 токенів на секунду (TPS) з Laneformer 2B — open-source моделі з 2 мільярдами параметрів, налаштованої під їхній стек. У демо використовується невелика модель, але Kog планує поширити ці досягнення на набагато більші LLM.

«Хакерський» підхід до проектування GPU

На відміну від апаратне-незалежних провайдерів, таких як ZML, Kog занурюється глибоко. Команда проводить реверс-інжиніринг GPU на рівнях асемблера та бінарного коду, розглядаючи кремній як набір фізичних законів, які потрібно опанувати.

Такий фокус на низькому рівні дозволяє витиснути кожну краплю ефективності, але це коштує часу. Маючи невелику команду з 11 інженерів, Kog витрачає тижні або місяці на дослідження кожної нової архітектури GPU перед додаванням підтримки. Цей метод забезпечує топову продуктивність, але обмежує швидкість, з якою Kog може охопити нове обладнання.

Орієнтація на високовартісні сценарії використання ШІ

Kog зосереджується на секторах, де затримка означає втрату прибутку:

  • Розробка програмного забезпечення: Такі інструменти, як Claude Code, можуть зависати на хвилини. Kog прагне перетворити «години очікування» на майже миттєві результати.
  • Генеративний дизайн додатків/ігор: Конвеєри «від промпту до додатка» потребують швидких ітерацій, щоб утримувати користувачів та забезпечувати прибуток.

Наступною віхою компанії є 10-кратне прискорення на її першій великій масштабній моделі. За підтримки Scaleway, Bpifrance та програми French Tech 2030, Kog позиціонує себе як ключового гравця у русі Європи за суверенітет у сфері ШІ.

Основні висновки

  • Оптимізація замість обладнання: Kog витискає межі пропускної здатності пам'яті GPU Nvidia H200 та AMD MI300X за допомогою надскладного низькорівневого проектування ПЗ.
  • Подолання бар'єру затримки: Стартап прагне 30-кратного збільшення швидкості інференсу LLM для професійних робочих процесів у реальному часі, таких як автоматизоване програмування та генеративний дизайн.
  • Глибоке проектування: Завдяки «хакерському» мисленню, Kog проводить реверс-інжиніринг асемблерного та бінарного коду GPU, щоб досягти продуктивності, недоступної для стандартних стеків.

Kog, французький стартап, заявляє, що його Kog Inference Engine має на меті забезпечити декодування великих мовних моделей (LLM) до 30 разів швидше на тих самих GPU Nvidia H200 або AMD MI300X, якими вже володіють оператори дата-центрів.

Чому гонитва за швидкістю важлива саме зараз

Інференс LLM зараз гальмує такі продукти, як асистенти автодоповнення коду, генератори контенту «на льоту» та інтерактивні інструменти для дизайну ігор. У таких умовах розрив між запитом користувача та відповіддю моделі безпосередньо впливає на продуктивність і прибуток. Високорівневі API, такі як CUDA, залишають значну частину пропускної здатності пам'яті GPU невикористаною, особливо під час потокенного декодування, яке домінує у сценаріях реального часу.

Низькорівневе рішення від Kog

Kog пропускає традиційні програмні рівні та звертається безпосередньо до кремнію. Його інженери проводять реверс-інжиніринг GPU на рівні асемблера, розглядаючи апаратне забезпечення як набір обмежень, яких слід дотримуватися, а не як «чорну скриньку», яку потрібно абстрагувати. Результатом є кастомний шлях виконання, який забезпечує потік даних через канали пам'яті GPU майже на повну потужність.

Під час нещодавньої демонстрації компанія запустила Laneformer 2B — open-source модель з 2 мільярдами параметрів, налаштовану під її стек, — і повідомила про високу пропускну здатність токенів. Модель є скромною порівняно з більшими комерційними системами, але приріст швидкості демонструє, що спеціалізований програмний стек може витягнути з того самого обладнання.

Інженерний компроміс

Переваги супроводжуються стрімким зростанням витрат. Команда Kog з 11 інженерів витрачає тижні або місяці на дослідження кожної нової архітектури GPU перед тим, як вона зможе отримати підтримку. Така глибина забезпечує високу продуктивність на цільових картах, але це також означає, що Kog не може миттєво додати підтримку кожного нового GPU, що з'являється на ринку. Клієнти отримують вигоду лише в тому випадку, якщо їхній парк обладнання включає GPU Nvidia H200 або AMD MI300X, які Kog вже оптимізувала.

Хто отримає вигоду

  • Інструменти програмної інженерії – Продукти, що генерують код, такі як Claude Code, часто зависають на кілька хвилин, поки модель обробляє запит. Скорочення цього очікування до кількох секунд зробило б інтерактивну розробку набагато плавнішою.
  • Конвеєри генеративного дизайну – Студіям, які перетворюють текстові промпти на прототипи застосунків або ігрові асети, потрібна швидка ітерація, щоб підтримувати залученість творців. Швидше декодування скорочує цикли проєктування та підвищує рівень конверсії.

Обидва сектори безпосередньо перетворюють затримку на втрачені оплачувані години або відтік клієнтів, тому 30-кратне прискорення може стати вирішальною конкурентною перевагою.

Ширша картина

Стратегія Kog суперечить галузевому тренду на створення спеціалізованих ШІ-чипів. Такі компанії, як Cerebras, вкладають мільярди в чипи, що обіцяють вищу пропускну здатність на ват. Kog стверджує, що сучасні GPU вже мають достатню пропускну здатність пам'яті для декодування; бракує лише програмного забезпечення, яке могло б її реально використовувати. Якщо це твердження підтвердиться у масштабах ринку, розробники зможуть відкласти дорогі оновлення обладнання та покластися на оновлення програмного забезпечення для досягнення інференсу майже в реальному часі.

Потенційні перешкоди

  • Навантаження на підтримку – Кожне нове покоління GPU потребуватиме нового зворотного проектування. У міру диверсифікації ринку невелика команда може бути перевантажена.
  • Масштабованість на більші моделі – У демо-версії використовувалася модель із 2 млрд параметрів. Масштабування тих самих методів на набагато більші системи може впертися в ліміти ємності пам'яті або вимагати додаткових інженерних хитрощів, які ще не розголошені.
  • Альтернативні шляхи – Хмарні провайдери вже пропонують інстанси, оптимізовані для інференсу, які поєднують спеціалізовані чипи та програмне забезпечення. Для деяких робочих навантажень маржинальний приріст від стека Kog може не переважити зручність керованого сервісу.

На що звернути увагу

  • Перше розгортання великої моделі – Kog заявляє, що наступним етапом стане 10-кратне прискорення на «важливій великомасштабній моделі». Розрив між демо-версією на 2 млрд параметрів та моделлю корпоративного рівня стане найчіткішим тестом цього підходу.
  • Розширення підтримки обладнання – Додавання підтримки новіших GPU або інших акселераторів покаже, чи зможе низькорівнева модель встигати за швидким темпом оновлення апаратного забезпечення.

Висновок

Kog демонструє, що витиснути більше продуктивності з існуючих GPU можливо, якщо переписати програмний стек з нуля. Обіцянка 30-кратного прискорення декодування LLM може змінити те, як розробники цінують та проєктують архітектуру ШІ-сервісів — за умови, що компанія зможе підтримувати інтенсивні інженерні зусилля, необхідні для кожного нового типу кремнію.