OpenAI GPT-Liveని రూపొందించింది, ఇది ఒక వాయిస్-ఫస్ట్ చాట్బాట్. ఇది వింటూ మరియు మాట్లాడుతూ ఒకేసారి పనిచేస్తుంది, దీనివల్ల చాలా అసిస్టెంట్లు ఉపయోగించే అసౌకర్యమైన “మాట్లాడి-తర్వాత-వినడం” (talk-then-listen) విరామాలను ఇది తొలగించింది. ఈ సేవ నిలిచిపోయి మళ్ళీ మొదలయ్యే సంభాషణల కంటే, మనుషుల మధ్య జరిగే సంభాషణలా సాఫీగా సాగేలా లక్ష్యంగా పెట్టుకుంది.
పాత మోడల్ ఎందుకు విఫలమైందని అనిపించింది
సాధారణ వాయిస్ అసిస్టెంట్లు వాకీ-టాకీలలా పనిచేస్తాయి: మీరు ఒక వాక్యం పూర్తి చేయగానే, పరికరం దానిని రికార్డ్ చేసి, ఆడియోను క్లౌడ్కు పంపిస్తుంది, సమాధానం కోసం వేచి చూస్తుంది, ఆపై దానిని ప్లే చేస్తుంది. ఈ ప్రక్రియ వల్ల గణనీయమైన ఆలస్యం (lag) ఏర్పడుతుంది మరియు వినియోగదారులు మధ్యలో అడ్డుకోవాలనుకున్నా కూడా ఆగాల్సి వస్తుంది. ఇన్స్టంట్ మెసేజింగ్తో పెరిగిన తరానికి, ఈ ఆలస్యం చాలా పాతకాలపుదిగా అనిపిస్తుంది.
OpenAI దీనికి turn-less ఆర్కిటెక్చర్తో సమాధానం ఇచ్చింది. ప్రతి సెకనుకు, GPT-Live వినడం కొనసాగించాలా, మాట్లాడటం కొనసాగించాలా లేదా ఆగాలా అనేదాన్ని నిర్ణయిస్తుంది. దీనివల్ల మీరు అసిస్టెంట్ సమాధానం చెబుతున్న మధ్యలోనే అడ్డుకోవచ్చు లేదా పూర్తి సమాధానం కోసం వేచి చూడకుండానే తదుపరి ప్రశ్న అడగవచ్చు.
ఫుల్-డ్యూప్లెక్స్ స్టాక్ (full-duplex stack) గురించి సరళంగా
- వేర్వేరు ఆడియో లూప్ మరియు రీజనింగ్ పాత్ (reasoning path) – ఒక fast path నిరంతర ఆడియో మార్పిడిని నిర్వహిస్తుంది, while ఒక slow path వెబ్ సెర్చ్లు లేదా టూల్ కాల్స్ వంటి భారీ పనులను చేస్తుంది. slow path పని చేస్తున్నప్పుడు కూడా fast path సంభాషణను కొనసాగించేలా చేస్తుంది, దీనివల్ల “నేను ఆలోచిస్తున్నాను కాబట్టి నిశ్శబ్దంగా ఉండండి” అనే ఇబ్బందికరమైన పరిస్థితి ఉండదు.
- WARP ప్రోటోకాల్ – సాంప్రదాయ వెబ్ కనెక్షన్లలో ఆడియో ప్రవహించాలంటే అనేక హ్యాండ్షేక్లు (handshakes) అవసరమవుతాయి, తరచుగా ఆరు రౌండ్-ట్రిప్స్ జరుగుతాయి. OpenAI యొక్క కస్టమ్ ప్రోటోకాల్ ఆ దశలన్నింటినీ ఒకే ట్రిప్గా కుదించి, సెషన్ ప్రారంభం దాదాపు తక్షణమే జరిగినట్లు అనిపించేలా చేస్తుంది.
- లేటెన్సీ స్థిరత్వం కోసం Python కంటే Goను ఎంచుకోవడం – వేగవంతమైన డెవలప్మెంట్ కోసం ప్రాచుర్యం పొందిన Python నుండి రియల్-టైమ్ భాగాలను టీమ్ Go కి మార్చింది, ఎందుకంటే Go మరింత ఊహించదగిన (predictable) ఎగ్జిక్యూషన్ సమయాలను అందిస్తుంది. వాయిస్ AIలో, సగటు వేగం కంటే అత్యధికంగా ఉండే ఆలస్యం (worst-case delay) ముఖ్యం; ఒక చిన్న తడబాటు కూడా అనుభవాన్ని దెబ్బతీస్తుంది, కాబట్టి స్థిరమైన లేటెన్సీ (latency) ముఖ్యం.
- GPU కంటే మించి స్కేలింగ్ చేయడం – వందల మిలియన్ల మంది వినియోగదారులతో, సమస్య మోడల్ యొక్క కంప్యూట్ కోర్ల నుండి చుట్టుపక్కల ఉన్న ఇన్ఫ్రాస్ట్రక్చర్కు మారింది. GPUల కంటే ముందే CPUలు మరియు నెట్వర్క్ లింక్లు సంతృప్త స్థాయికి (saturated) చేరుకుంటున్నాయని OpenAI గుర్తించింది, కాబట్టి మిగిలిన స్టాక్పై భారం పడకుండా GPUలకు నిరంతరం డేటా అందేలా చేయడానికి వారు స్మార్ట్ రూటింగ్ మరియు కనెక్షన్-మేనేజ్మెంట్ను జోడించారు.
డెవలపర్లకు దీని అర్థం ఏమిటి
- ఆడియో హ్యాండ్లింగ్ను బిజినెస్ లాజిక్ నుండి వేరు చేయండి – మైక్రోఫోన్ ఇన్పుట్ మరియు స్పీకర్ అవుట్పుట్ను ప్రాసెస్ చేసే తేలికపాటి, ఎల్లప్పుడూ ఆన్లో ఉండే లూప్ను ఉంచండి. డేటాబేస్ క్వెరీలు, ఎక్స్టర్నల్ API కాల్స్ వంటి ఆలస్యం చేయగలిగే పనులను వేరే థ్రెడ్ లేదా సర్వీస్కు పంపండి.
- లేటెన్సీ స్థిరతకు ప్రాధాన్యత ఇవ్వండి – కేవలం సగటు సమయాన్ని మాత్రమే కాకుండా, అత్యధికంగా ఉండే ఆలస్యం (worst-case delays) పై దృష్టి పెడుతూ రెస్పాన్స్ టైమ్ను కొలవండి. షెడ్యూలింగ్ పై మెరుగైన నియంత్రణ ఇచ్చే లాంగ్వేజెస్ మరియు రన్టైమ్స్ (ఉదాహరణకు Go, Rust) కోసం అదనపు ఇంజనీరింగ్ శ్రమ చేసినా అది విలువైనదే.
- కనెక్షన్ ఓవర్హెడ్ను తగ్గించండి – ప్రతి అదనపు హ్యాండ్షేక్ మిల్లీసెకన్ల ఆలస్యాన్ని పెంచుతుంది. అథెంటికేషన్, స్ట్రీమ్ నెగోషియేషన్ మరియు కోడెక్ ఎంపికను ఒకే ఎక్స్ఛేంజ్గా కలిపి చేయండి, అప్పుడు వినియోగదారులు ఆ తేడాను గమనిస్తారు.
లాభనష్టాలు మరియు పెండింగ్ ప్రశ్నలు
ఫుల్-డ్యూప్లెక్స్ డిజైన్ సంక్లిష్టతను పెంచుతుంది.
