OpenAI GPT-Liveని రూపొందించింది, ఇది ఒక వాయిస్-ఫస్ట్ చాట్‌బాట్. ఇది వింటూ మరియు మాట్లాడుతూ ఒకేసారి పనిచేస్తుంది, దీనివల్ల చాలా అసిస్టెంట్లు ఉపయోగించే అసౌకర్యమైన “మాట్లాడి-తర్వాత-వినడం” (talk-then-listen) విరామాలను ఇది తొలగించింది. ఈ సేవ నిలిచిపోయి మళ్ళీ మొదలయ్యే సంభాషణల కంటే, మనుషుల మధ్య జరిగే సంభాషణలా సాఫీగా సాగేలా లక్ష్యంగా పెట్టుకుంది.

పాత మోడల్ ఎందుకు విఫలమైందని అనిపించింది

సాధారణ వాయిస్ అసిస్టెంట్లు వాకీ-టాకీలలా పనిచేస్తాయి: మీరు ఒక వాక్యం పూర్తి చేయగానే, పరికరం దానిని రికార్డ్ చేసి, ఆడియోను క్లౌడ్‌కు పంపిస్తుంది, సమాధానం కోసం వేచి చూస్తుంది, ఆపై దానిని ప్లే చేస్తుంది. ఈ ప్రక్రియ వల్ల గణనీయమైన ఆలస్యం (lag) ఏర్పడుతుంది మరియు వినియోగదారులు మధ్యలో అడ్డుకోవాలనుకున్నా కూడా ఆగాల్సి వస్తుంది. ఇన్‌స్టంట్ మెసేజింగ్‌తో పెరిగిన తరానికి, ఈ ఆలస్యం చాలా పాతకాలపుదిగా అనిపిస్తుంది.

OpenAI దీనికి turn-less ఆర్కిటెక్చర్‌తో సమాధానం ఇచ్చింది. ప్రతి సెకనుకు, GPT-Live వినడం కొనసాగించాలా, మాట్లాడటం కొనసాగించాలా లేదా ఆగాలా అనేదాన్ని నిర్ణయిస్తుంది. దీనివల్ల మీరు అసిస్టెంట్ సమాధానం చెబుతున్న మధ్యలోనే అడ్డుకోవచ్చు లేదా పూర్తి సమాధానం కోసం వేచి చూడకుండానే తదుపరి ప్రశ్న అడగవచ్చు.

ఫుల్-డ్యూప్లెక్స్ స్టాక్ (full-duplex stack) గురించి సరళంగా

  1. వేర్వేరు ఆడియో లూప్ మరియు రీజనింగ్ పాత్ (reasoning path) – ఒక fast path నిరంతర ఆడియో మార్పిడిని నిర్వహిస్తుంది, while ఒక slow path వెబ్ సెర్చ్‌లు లేదా టూల్ కాల్స్ వంటి భారీ పనులను చేస్తుంది. slow path పని చేస్తున్నప్పుడు కూడా fast path సంభాషణను కొనసాగించేలా చేస్తుంది, దీనివల్ల “నేను ఆలోచిస్తున్నాను కాబట్టి నిశ్శబ్దంగా ఉండండి” అనే ఇబ్బందికరమైన పరిస్థితి ఉండదు.
  2. WARP ప్రోటోకాల్ – సాంప్రదాయ వెబ్ కనెక్షన్లలో ఆడియో ప్రవహించాలంటే అనేక హ్యాండ్‌షేక్‌లు (handshakes) అవసరమవుతాయి, తరచుగా ఆరు రౌండ్-ట్రిప్స్ జరుగుతాయి. OpenAI యొక్క కస్టమ్ ప్రోటోకాల్ ఆ దశలన్నింటినీ ఒకే ట్రిప్‌గా కుదించి, సెషన్ ప్రారంభం దాదాపు తక్షణమే జరిగినట్లు అనిపించేలా చేస్తుంది.
  3. లేటెన్సీ స్థిరత్వం కోసం Python కంటే Goను ఎంచుకోవడం – వేగవంతమైన డెవలప్‌మెంట్ కోసం ప్రాచుర్యం పొందిన Python నుండి రియల్-టైమ్ భాగాలను టీమ్ Go కి మార్చింది, ఎందుకంటే Go మరింత ఊహించదగిన (predictable) ఎగ్జిక్యూషన్ సమయాలను అందిస్తుంది. వాయిస్ AIలో, సగటు వేగం కంటే అత్యధికంగా ఉండే ఆలస్యం (worst-case delay) ముఖ్యం; ఒక చిన్న తడబాటు కూడా అనుభవాన్ని దెబ్బతీస్తుంది, కాబట్టి స్థిరమైన లేటెన్సీ (latency) ముఖ్యం.
  4. GPU కంటే మించి స్కేలింగ్ చేయడం – వందల మిలియన్ల మంది వినియోగదారులతో, సమస్య మోడల్ యొక్క కంప్యూట్ కోర్ల నుండి చుట్టుపక్కల ఉన్న ఇన్‌ఫ్రాస్ట్రక్చర్‌కు మారింది. GPUల కంటే ముందే CPUలు మరియు నెట్‌వర్క్ లింక్‌లు సంతృప్త స్థాయికి (saturated) చేరుకుంటున్నాయని OpenAI గుర్తించింది, కాబట్టి మిగిలిన స్టాక్‌పై భారం పడకుండా GPUలకు నిరంతరం డేటా అందేలా చేయడానికి వారు స్మార్ట్ రూటింగ్ మరియు కనెక్షన్-మేనేజ్‌మెంట్‌ను జోడించారు.

డెవలపర్లకు దీని అర్థం ఏమిటి

  • ఆడియో హ్యాండ్లింగ్‌ను బిజినెస్ లాజిక్ నుండి వేరు చేయండి – మైక్రోఫోన్ ఇన్‌పుట్ మరియు స్పీకర్ అవుట్‌పుట్‌ను ప్రాసెస్ చేసే తేలికపాటి, ఎల్లప్పుడూ ఆన్‌లో ఉండే లూప్‌ను ఉంచండి. డేటాబేస్ క్వెరీలు, ఎక్స్‌టర్నల్ API కాల్స్ వంటి ఆలస్యం చేయగలిగే పనులను వేరే థ్రెడ్ లేదా సర్వీస్‌కు పంపండి.
  • లేటెన్సీ స్థిరతకు ప్రాధాన్యత ఇవ్వండి – కేవలం సగటు సమయాన్ని మాత్రమే కాకుండా, అత్యధికంగా ఉండే ఆలస్యం (worst-case delays) పై దృష్టి పెడుతూ రెస్పాన్స్ టైమ్‌ను కొలవండి. షెడ్యూలింగ్ పై మెరుగైన నియంత్రణ ఇచ్చే లాంగ్వేజెస్ మరియు రన్‌టైమ్స్ (ఉదాహరణకు Go, Rust) కోసం అదనపు ఇంజనీరింగ్ శ్రమ చేసినా అది విలువైనదే.
  • కనెక్షన్ ఓవర్‌హెడ్‌ను తగ్గించండి – ప్రతి అదనపు హ్యాండ్‌షేక్ మిల్లీసెకన్ల ఆలస్యాన్ని పెంచుతుంది. అథెంటికేషన్, స్ట్రీమ్ నెగోషియేషన్ మరియు కోడెక్ ఎంపికను ఒకే ఎక్స్ఛేంజ్‌గా కలిపి చేయండి, అప్పుడు వినియోగదారులు ఆ తేడాను గమనిస్తారు.

లాభనష్టాలు మరియు పెండింగ్ ప్రశ్నలు

ఫుల్-డ్యూప్లెక్స్ డిజైన్ సంక్లిష్టతను పెంచుతుంది.

తదుపరి ఏమి గమనించాలి