Cerebras కస్టమ్ AI చిప్‌లను తయారు చేస్తుంటే, ఫ్రెంచ్ స్టార్టప్ Kog సంస్థలు ఇప్పటికే కలిగి ఉన్న GPUs నుండి గరిష్ట పనితీరును వెలికితీస్తుంది. ఇప్పటికే ఉన్న డేటాసెంటర్ హార్డ్‌వేర్ కోసం లో-లెవల్ సాఫ్ట్‌వేర్‌ను తిరిగి వ్రాయడం ద్వారా, Kog AI వర్క్‌ఫ్లోలను నెమ్మదింపజేసే లేటెన్సీ (latency) అడ్డంకులను తొలగిస్తుంది.

కస్టమ్ AI సిలికాన్ అవసరాన్ని సవాలు చేయడం

AI పరిశ్రమ ఇన్‌ఫరెన్స్ (inference) కోసం ప్రత్యేకంగా తయారు చేసిన చిప్‌ల వైపు మళ్లింది. సాధారణ GPUs డీకోడింగ్‌ను నిర్వహించలేవనే నమ్మకం తప్పని Kog CEO, Gaël Delalleau అంటున్నారు. ఆధునిక GPUs—Nvidia H200, AMD MI300X—ప్రస్తుత సాఫ్ట్‌వేర్ వాడుకోకుండా వదిలేసిన మెమరీ బ్యాండ్‌విడ్త్‌ను అందిస్తాయి.

Kog యొక్క Kog Inference Engine (KIE) "అత్యంత వేగవంతమైన సింగిల్-రిక్వెస్ట్ డీకోడింగ్"ను లక్ష్యంగా చేసుకుంటుంది, ఇది రియల్-టైమ్ యాప్‌లకు అత్యవసరం. ఇటీవలి డెమోలో, కంపెనీ వారి స్టాక్ కోసం ట్యూన్ చేయబడిన ఓపెన్-సోర్స్ 2-బిలియన్ పారామీటర్ మోడల్ అయిన Laneformer 2B తో సెకనుకు 3,000 టోకెన్ల (TPS) వేగాన్ని సాధించింది. ఈ డెమోలో చిన్న మోడల్‌ను ఉపయోగించినప్పటికీ, ఆ ప్రయోజనాలను మరింత పెద్ద LLMలకు విస్తరించాలని Kog యోచిస్తోంది.

GPU ఇంజనీరింగ్‌కు ఒక "హ్యాకర్" విధానం

ZML వంటి హార్డ్‌వేర్-అజ్ఞాత (hardware-agnostic) ప్రొవైడర్లలా కాకుండా, Kog లోతుగా పరిశోధిస్తుంది. ఈ బృందం GPUsను అసెంబ్లీ మరియు బైనరీ స్థాయిలలో రివర్స్-ఇంజనీర్ చేస్తుంది, సిలికాన్‌ను అధిగమించాల్సిన భౌతిక నియమాల సమితిగా పరిగణిస్తుంది.

ఈ లో-లెవల్ ఫోకస్ ప్రతి అణువు నుండి సామర్థ్యాన్ని వెలికితీస్తుంది, కానీ దీనికి సమయం పడుతుంది. కేవలం 11 మంది ఇంజనీర్లతో ఉన్న Kog బృందం, కొత్త GPU ఆర్కిటెక్చర్‌కు మద్దతు ఇవ్వడానికి ముందు దానిని విశ్లేషించడానికి వారాలు లేదా నెలల సమయం తీసుకుంటుంది. ఈ పద్ధతి అత్యుత్తమ పనితీరును అందిస్తుంది కానీ, కొత్త హార్డ్‌వేర్‌ను ఎంత వేగంగా కవర్ చేయగలరు అనే దానిపై పరిమితులను కలిగిస్తుంది.

అధిక విలువ కలిగిన AI వినియోగ సందర్భాలను లక్ష్యంగా చేసుకోవడం

Kog ఈ క్రింది రంగాలపై దృష్టి పెడుతుంది, ఇక్కడ లేటెన్సీ అంటే ఆదాయ నష్టం:

  • సాఫ్ట్‌వేర్ ఇంజనీరింగ్: Claude Code వంటి సాధనాలు నిమిషాల పాటు ఆగిపోతాయి. "గంటల తరబడి వేచి ఉండటం"ను దాదాపు తక్షణ ఫలితాలుగా మార్చడమే Kog లక్ష్యం.
  • జనరేటివ్ యాప్/గేమ్ డిజైన్: వినియోగదారులను ఆకట్టుకోవడానికి మరియు ఆదాయం పెరగడానికి Prompt-to-app పైప్‌లైన్‌లకు వేగవంతమైన పునరావృతం (iteration) అవసరం.

కంపెనీ యొక్క తదుపరి మైలురాయి దాని మొదటి ప్రధాన భారీ స్థాయి మోడల్‌పై 10× వేగవంతం చేయడం. Scaleway, Bpifrance మరియు French Tech 2030 ప్రోగ్రామ్ మద్దతుతో, Kog యూరప్ యొక్క AI సార్వభౌమాధికార డ్రైవ్‌లో ఒక కీలక పాత్ర పోషిస్తోంది.

ముఖ్య అంశాలు

  • హార్డ్‌వేర్ కంటే ఆప్టిమైజేషన్ ముఖ్యం: Kog అత్యంత లో-లెవల్ సాఫ్ట్‌వేర్ ఇంజనీరింగ్‌తో Nvidia H200 మరియు AMD MI300X GPUs యొక్క మెమరీ బ్యాండ్‌విడ్త్‌ను గరిష్ట స్థాయికి తీసుకెళ్తుంది.
  • లేటెన్సీ అడ్డంకిని అధిగమించడం: ఆటోమేటెడ్ కోడింగ్ మరియు జనరేటివ్ డిజైన్ వంటి రియల్-టైమ్ ప్రొఫెషనల్ వర్క్‌ఫ్లోల కోసం LLM ఇన్‌ఫరెన్స్ వేగంలో 30× పెరుగుదలను ఈ స్టార్టప్ లక్ష్యంగా పెట్టుకుంది.
  • డీప్-లెవల్ ఇంజనీరింగ్: "హ్యాకర్" మైండ్‌సెట్‌ను అవలంబించడం ద్వారా, Kog సాధారణ స్టాక్‌లు చేరుకోలేని పనితీరును సాధించడానికి GPU అసెంబ్లీ మరియు బైనరీ కోడ్‌ను రివర్స్-ఇంజనీర్ చేస్తుంది.

ఫ్రెంచ్ స్టార్టప్ అయిన Kog, తన Kog Inference Engine ద్వారా డేటా-సెంటర్ ఆపరేటర్లు ఇప్పటికే కలిగి ఉన్న Nvidia H200 లేదా AMD MI300X GPUs పైనే లార్జ్-లాంగ్వేజ్-మోడల్ (LLM) డీకోడింగ్‌ను 30 రెట్లు వేగంగా నడపాలని లక్ష్యంగా పెట్టుకుంది.

ఇప్పుడు వేగం కోసం ప్రయత్నించడం ఎందుకు ముఖ్యం

LLM ఇన్‌ఫరెన్స్ ఇప్పుడు కోడ్-కంప్లీషన్ అసిస్టెంట్లు, ఆన్-ది-ఫ్లై కంటెంట్ జనరేటర్లు మరియు ఇంటరాక్టివ్ గేమ్-డిజైన్ టూల్స్ వంటి ఉత్పత్తుల వేగాన్ని తగ్గిస్తోంది. అటువంటి సందర్భాలలో, వినియోగదారుని ప్రాంప్ట్ మరియు మోడల్ సమాధానం మధ్య ఉన్న వ్యత్యాసం నేరుగా ఉత్పాదకత మరియు ఆదాయంపై ప్రభావం చూపుతుంది. CUDA వంటి హై-లెవల్ APIs, ముఖ్యంగా రియల్-టైమ్ వినియోగ సందర్భాలలో ఎక్కువగా ఉండే టోకెన్-బై-టోకెన్ డీకోడింగ్ సమయంలో, GPU మెమరీ బ్యాండ్‌విడ్త్‌లో పెద్ద భాగాన్ని వాడుకోకుండా వదిలేస్తాయి.

Kog యొక్క లో-లెవల్ పరిష్కారం

Kog సంప్రదాయ సాఫ్ట్‌వేర్ లేయర్లను దాటవేసి నేరుగా సిలికాన్‌తో మాట్లాడుతుంది. దీని ఇంజనీర్లు GPUను అసెంబ్లీ స్థాయిలో రివర్స్-ఇంజనీర్ చేస్తారు, హార్డ్‌వేర్‌ను ఒక బ్లాక్ బాక్స్‌గా కాకుండా, పాటించాల్సిన పరిమితుల సమితిగా పరిగణిస్తారు. దీని ఫలితంగా, GPU యొక్క మెమరీ పైపుల ద్వారా డేటా దాదాపు పూర్తి సామర్థ్యంతో ప్రవహించేలా చేసే ఒక కస్టమ్ ఎగ్జిక్యూషన్ పాత్ (execution path) ఏర్పడుతుంది.

ఇటీవలి డెమోలో, కంపెనీ తన స్టాక్ కోసం ట్యూన్ చేయబడిన 2-బిలియన్ పారామీటర్ ఓపెన్-సోర్స్ మోడల్ అయిన Laneformer 2B ను నడిపి, అధిక టోకెన్ త్రూపుట్‌ను (throughput) నమోదు చేసింది. పెద్ద వాణిజ్య వ్యవస్థలతో పోలిస్తే ఈ మోడల్ చిన్నదే అయినప్పటికీ, ఒక ప్రత్యేకంగా తయారు చేసిన సాఫ్ట్‌వేర్ స్టాక్ అదే హార్డ్‌వేర్ నుండి ఎంత వేగాన్ని వెలికితీయగలదో ఇది చూపుతుంది.

ఇంజనీరింగ్ ట్రేడ్-ఆఫ్ (Trade-off)

దీని ప్రయోజనంతో పాటు ఒక సవాలు కూడా ఉంది. Kog యొక్క 11 మంది ఇంజనీర్ల బృందం, ప్రతి కొత్త GPU ఆర్కిటెక్చర్‌కు మద్దతు ఇవ్వడానికి ముందు దానిని విశ్లేషించడానికి వారాలు లేదా నెలల సమయం తీసుకుంటుంది. ఈ లోతైన పరిశోధన లక్ష్యిత కార్డ్‌లపై అధిక పనితీరును ఇస్తుంది, కానీ మార్కెట్లోకి వచ్చే ప్రతి కొత్త GPUకు Kog తక్షణమే మద్దతు ఇవ్వలేదని కూడా అర్థం. వినియోగదారులు Kog ఇప్పటికే ఆప్టిమైజ్ చేసిన Nvidia H200 లేదా AMD MI300X GPUsలను కలిగి ఉంటేనే దీని వల్ల ప్రయోజనం పొందుతారు.

ఎవరికి ప్రయోజనం ఉంటుంది

  • సాఫ్ట్‌వేర్-ఇంజనీరింగ్ సాధనాలు – Claude Code వంటి కోడ్‌ను రూపొందించే ఉత్పత్తులు, మోడల్ ఒక రిక్వెస్ట్‌ను ప్రాసెస్ చేస్తున్నప్పుడు తరచుగా నిమిషాల తరబడి ఆగిపోతుంటాయి. ఆ వేచి ఉండే సమయాన్ని కొన్ని సెకన్లకు తగ్గించడం వల్ల ఇంటరాక్టివ్ డెవలప్‌మెంట్ మరింత సులభతరం అవుతుంది.
  • జనరేటివ్ డిజైన్ పైప్‌లైన్స్ – టెక్స్ట్‌ual ప్రాంప్ట్‌లను యాప్ ప్రోటోటైప్‌లుగా లేదా గేమ్ అసెట్‌లుగా మార్చే స్టూడియోలకు సృష్టికర్తలను నిమగ్నం చేయడానికి వేగవంతమైన పునరావృతం (iteration) అవసరం. వేగవంతమైన డీకోడింగ్ డిజైన్ లూప్‌లను తగ్గిస్తుంది మరియు కన్వర్షన్ రేట్లను పెంచుతుంది.

ఈ రెండు రంగాలలోనూ లేటెన్సీ (latency) నేరుగా కోల్పోయిన బిల్లింగ్ గంటలు లేదా వినియోగదారుల తగ్గింపుకు (churn) దారితీస్తుంది, కాబట్టి 30× వేగవంతమైన పెరుగుదల ఒక నిర్ణయాత్మక పోటీ ప్రయోజనం కావచ్చు.

విస్తృత దృక్పథం

కస్టమ్ AI సిలికాన్‌ను నిర్మించే పరిశ్రమ ధోరణికి విరుద్ధంగా Kog వ్యూహం ఉంది. Cerebras వంటి కంపెనీలు వాట్ (watt) కి అధిక త్రూపుట్ (throughput) వాగ్దానం చేసే చిప్‌ల కోసం బిలియన్ల కొద్దీ ఖర్చు చేస్తున్నాయి. డీకోడింగ్ కోసం నేటి GPUలకు ఇప్పటికే తగినంత మెమరీ బ్యాండ్‌విడ్త్ ఉందని, కానీ దాన్ని వాడగలిగే సాఫ్ట్‌వేర్ లేకపోవడమే లోటు అని Kog వాదిస్తోంది. ఈ వాదన పెద్ద ఎత్తున నిజమైతే, డెవలపర్లు ఖరీదైన హార్డ్‌వేర్ అప్‌గ్రేడ్‌లను వాయిదా వేసి, నయానంతర (near-real-time) ఇన్ఫరెన్స్ సాధించడానికి సాఫ్ట్‌వేర్ అప్‌గ్రేడ్‌పై ఆధారపడవచ్చు.

ఎదురయ్యే సవాళ్లు

  • మెయింటెనెన్స్ భారం – ప్రతి కొత్త GPU జనరేషన్‌కు కొత్త రివర్స్-ఇంజనీరింగ్ అవసరమవుతుంది. మార్కెట్ వైవిధ్యం పెరిగే కొద్దీ, చిన్న బృందంపై ఒత్తిడి పెరగవచ్చు.
  • పెద్ద మోడళ్లకు స్కేలబిలిటీ – డెమోలో 2B-పారామీటర్ మోడల్‌ను ఉపయోగించారు. అదే పద్ధతులను చాలా పెద్ద వ్యవస్థలకు విస్తరించడం వల్ల మెమరీ సామర్థ్య పరిమితులు ఎదురుకావచ్చు లేదా ఇంకా వెల్లడించని అదనపు ఇంజనీరింగ్ ట్రిక్స్ అవసరం కావచ్చు.
  • ప్రత్యామ్నాయ మార్గాలు – క్లౌడ్ ప్రొవైడర్లు ఇప్పటికే ప్రత్యేక చిప్‌లు మరియు సాఫ్ట్‌వేర్‌లను కలిపి ఇన్ఫరెన్స్-ఆప్టిమైజ్డ్ ఇన్‌స్టెన్స్‌లను అందిస్తున్నారు. కొన్ని వర్క్‌లోడ్‌ల కోసం, Kog స్టాక్ నుండి వచ్చే స్వల్ప లాభం మేనేజ్డ్ సర్వీస్ యొక్క సౌలభ్యంతో పోలిస్తే తక్కువగా ఉండవచ్చు.

గమనించవలసినవి

  • మొదటి పెద్ద మోడల్ రోల్‌అవుట్ – Kog తన తదుపరి మైలురాయి "ప్రధాన పెద్ద స్థాయి మోడల్" (major large-scale model) పై 10× వేగవంతం అని చెబుతోంది. 2B డెమో మరియు ఎంటర్‌ప్రైజ్-గ్రేడ్ మోడల్ మధ్య ఉన్న వ్యత్యాసం ఈ విధానానికి స్పష్టమైన పరీక్ష అవుతుంది.
  • హార్డ్‌వేర్ సపోర్ట్ విస్తరణ – కొత్త GPUలు లేదా ఇతర యాక్సిలరేటర్లకు మద్దతు ఇవ్వడం ద్వారా, ఈ లో-లెవల్ మోడల్ వేగంగా మారుతున్న హార్డ్‌వేర్ వేగంతో పోటీ పడగలదా లేదా అనేది తెలుస్తుంది.

ముగింపు

సాఫ్ట్‌వేర్ స్టాక్‌ను మొదటి నుండి తిరిగి రాసినప్పుడు, ఇప్పటికే ఉన్న GPUల నుండి మరింత పనిని పొందవచ్చని Kog చూపుతోంది. 30× వేగవంతమైన LLM డీకోడింగ్ వాగ్దానం, డెవలపర్లు AI సేవలకు ధర నిర్ణయించే మరియు ఆర్కిటెక్ట్ చేసే విధానాన్ని మార్చివేయవచ్చు—కానీ ప్రతి కొత్త సిలికాన్ ముక్క కోసం అవసరమైన తీవ్రమైన ఇంజనీరింగ్ ప్రయత్నాన్ని కంపెనీ కొనసాగించగలిగితేనే ఇది సాధ్యమవుతుంది.