మేము లాంచ్ చేయబోతున్న వాయిస్-ఏజెంట్ (voice-agent) కాల్ చేసేవారిని మధ్యలోనే ఆపేస్తోంది, దీనివల్ల ట్రంకేషన్ రేట్ (truncation rate) 18% కి చేరుకుంది. లాంచ్ కావడానికి కేవలం పది రోజులు మాత్రమే ఉన్న సమయంలో మేము 'ఎండ్-ఆఫ్-టర్న్ లాజిక్' (end-of-turn logic)ను తిరిగి రాయాల్సి వచ్చింది. సైలెన్స్-టైమౌట్ రూల్‌కు (silence-timeout rule) గ్రామర్ చెక్స్ మరియు బ్యాక్-ఛానల్ డిటెక్షన్ (back-channel detection)ను జోడించడం ద్వారా, మేము అంతరాయాలను (interruptions) 3% కి తగ్గించాము మరియు సిస్టమ్ స్పందించనట్లు అనిపించేలా చేసే సుదీర్ఘమైన నిశ్శబ్దాన్ని (dead silences) తొలగించాము.

కేవలం ఒకే సైలెన్స్ టైమౌట్ ఎందుకు సరిపోలేదు

మా అసలు డిజైన్ ప్రకారం, 700 ms పాటు ఏ శబ్దం లేకపోతే యూజర్ మాట్లాడటం ముగించారని భావించేవాళ్లం. ఒక కంట్రోల్డ్ డెమోలో—అంటే నిశ్శబ్దంగా ఉన్న గదిలో ఒకే వ్యక్తి పూర్తి వాక్యాలను చెబుతున్నప్పుడు—ఆ రూల్ బాగానే పనిచేస్తుంది. కానీ, నిజమైన కాల్ చేసేవారు ఆలోచించడానికి ఆగుతారు, నంబర్లను గ్రూపులుగా విడగొడతారు మరియు తాము వింటున్నామని తెలియజేయడానికి “uh-huh” లేదా “mm-hmm” వంటి పదాలను ఉపయోగిస్తారు. ఏజెంట్ ఆ ప్రతి విరామాన్ని (pause) సంభాషణ ముగిసినట్లుగా భావించేది.

312 ప్రొడక్షన్ కాల్స్‌ను విశ్లేషించగా రెండు సమస్యలు బయటపడ్డాయి. మొదటిది, స్పీకర్ తదుపరి వాక్యాన్ని సిద్ధం చేసుకుంటున్నప్పుడే ఏజెంట్ మధ్యలో దూరిపోతోంది, దీనివల్ల 18% టర్న్‌లు దెబ్బతిన్నాయి. రెండవది, అంతరాయాలను ఆపడానికి మేము టైమౌట్‌ను 1500 ms కి పెంచినప్పుడు, సిస్టమ్ నెమ్మదించింది మరియు శబ్దం ఎక్కువగా ఉన్న లైన్లలో హ్యాంగ్ అవ్వడం ప్రారంభించింది. బ్యాక్‌గ్రౌండ్ నాయిస్ (background noise) సైలెన్స్ కౌంటర్‌ను మళ్లీ మళ్లీ రీసెట్ చేస్తూ ఉండటంతో, యూజర్ మాట్లాడటం ముగించారని ఏజెంట్ ఎప్పటికీ నిర్ణయించలేకపోయింది.

ఒకే నంబర్‌కు బదులుగా మూడు సిగ్నల్స్

మేము ఫిక్స్‌డ్ టైమౌట్‌ను పక్కన పెట్టి, మూడు సంకేతాలను గమనించే ఒక చిన్న స్టేట్ మెషీన్ (state machine)ను రూపొందించాము:

  • Silence duration – యూజర్ ఎంతసేపు నిశ్శబ్దంగా ఉన్నారో తెలుపుతుంది.
  • Grammar – ట్రాన్స్‌క్రిప్ట్ (transcript) ఒక పూర్తి వాక్యంతో ముగిసిందా లేదా “the” లేదా “and” వంటి అసంపూర్ణ పదంతో ముగిసిందా?
  • Back-channel detection – చివరి శబ్దం ఒక నిజమైన సమాధానమా (ఉదాహరణకు, మాట్లాడిన సమాధానం) లేదా “yeah” వంటి చిన్న అంగీకారమా?

ఈ సిగ్నల్స్‌తో మేము రెండు సైలెన్స్ బడ్జెట్‌లను (silence budgets) నిర్వచించాము:

  1. Completed transcript – విశ్లేషించిన టెక్స్ట్ పూర్తయినట్లు అనిపించినప్పుడు, మేము 550 ms చిన్న టైమౌట్‌ను వర్తింపజేస్తాము. దీనివల్ల ఏజెంట్ వేగంగా స్పందిస్తుంది.
  2. Dangling transcript – చివరి పదం యూజర్ వాక్యం మధ్యలో ఉన్నట్లు సూచిస్తే, మేము టైమౌట్‌ను 1300 ms కి పెంచుతాము, తద్వారా స్పీకర్ తన మాటను కొనసాగించడానికి సమయం దొరుకుతుంది.

తప్పుడు అంతరాయాలను (false interruptions) ఆపడానికి రెండు అదనపు రక్షణలు ఉన్నాయి:

  • Minimum speech duration – చిన్న “mm-hmm” అనేది పూర్తి టర్న్‌గా పరిగణించబడదు, కాబట్టి ఏజెంట్ నిర్ణయం తీసుకునే ముందు ఎక్కువ సేపు వేచి ఉంటుంది.
  • Hard cap – బ్యాక్‌గ్రౌండ్ నాయిస్ ఏదైనా సరే, ఒక గరిష్ట సైలెన్స్ లిమిట్ ఏజెంట్‌ను నిర్ణీత సమయం తర్వాత స్పందించేలా చేస్తుంది, తద్వారా అనంతమైన హ్యాంగ్ అవ్వడాన్ని నివారిస్తుంది.

ఫలితాలు మరియు వాయిస్ AIకి దీని అర్థం ఏమిటి

మేము ఈ మూడు-సిగ్నల్ సిస్టమ్‌ను అమలు చేసిన తర్వాత, ట్రంకేషన్ రేట్ 18% నుండి 3% కి పడిపోయింది. కాల్ చేసేవారు ఇకపై ఏజెంట్ తమ మాటలను మధ్యలో ఆపేయడాన్ని వినలేదు మరియు పాత “డెడ్ సైలెన్స్” సమస్య కూడా మాయమైపోయింది. ఏజెంట్ స్పందించేలా మరియు మర్యాదగా ఉండేలా ఉంది, ఇది మనుషులు సంభాషణలను నిర్వహించే విధానాన్ని పోలి ఉంటుంది.

వాయిస్ అసిస్టెంట్‌లను రూపొందించే డెవలపర్‌లకు పాఠం స్పష్టంగా ఉంది: ఒక కాన్ఫిగరేషన్ ఫైల్‌లోని (config file) ఒకే స్థిరమైన విలువ (constant) మాట్లాడే సంభాషణలోని సూక్ష్మ భేదాలను (nuances) పట్టుకోలేదు. సైలెన్స్ పొడవు, వ్యాకరణ పరిపూర్ణత మరియు బ్యాక్-ఛానల్ సంకేతాలను అంచనా వేసే ఒక లైట్‌వెయిట్ స్టేట్ మెషీన్ (lightweight state machine), ఎక్కువ కంప్యూటేషనల్ లోడ్ (computational load) లేకుండానే టర్న్-టేకింగ్ ఖచ్చితత్వాన్ని (turn-taking accuracy) గణనీయంగా మెరుగుపరచగలదు.

సంభావ్య లోపాలు మరియు పెండింగ్ ప్రశ్నలు

గ్రామర్ పార్సింగ్ (grammar parsing) మరియు బ్యాక్-ఛానల్ క్లాసిఫికేషన్ (back-channel classification) జోడించడం వల్ల ప్రాసెసింగ్ దశలు పెరుగుతాయి. ఈ అదనపు లేటెన్సీ (latency), సంభాషణ యొక్క సాఫీగా సాగే గుణాన్ని దెబ్బతీయకుండా టీమ్‌లు ధృవీకరించాలి. ఈ విధానం ఖచ్చితమైన ట్రాన్స్‌క్రిప్ట్‌పై ఆధారపడి ఉంటుంది; శబ్దం ఎక్కువగా ఉన్న వాతావరణంలో లేదా యాక్సెంట్ ఉన్న మాటలలో, గ్రామర్ సంకేతాలు విఫలమయ్యే అవకాశం ఉంది, దీనివల్ల సిస్టమ్ మళ్లీ ఎక్కువ టైమౌట్‌లపై ఆధారపడాల్సి వస్తుంది.

భవిష్యత్తులో, వ్యక్తిగత కాల్ చేసేవారి అలవాట్ల నుండి నేర్చుకునే అడాప్టివ్ టైమౌట్ త్రెషోల్డ్స్ (adaptive timeout thresholds) లేదా బ్యాక్-ఛానల్ డిటెక్టర్‌ను బలోపేతం చేయడానికి ప్రోసోడిక్ ఫీచర్స్ (prosodic features - పిచ్, ఎనర్జీ) వంటి వాటిని పరిశీలించవచ్చు. ఈ మెరుగుదలలు కస్టమర్ సంతృప్తి, కాల్ పూర్తి సమయం మరియు ఎర్రర్ రేట్లు వంటి కీలక మెట్రిక్స్‌పై ఎలా ప్రభావం చూపుతాయో పర్యవేక్షించడం, ఈ సాంకేతికతను పెద్ద కాంటాక్ట్-సెంటర్ డిప్లాయ్‌మెంట్‌లకు (contact-center deployments) విస్తరించే ముందు చాలా అవసరం.

ముఖ్య అంశం (Takeaway): టర్న్ కంప్లీషన్‌ను కేవలం ఒక సైలెన్స్ టైమర్‌గా కాకుండా, మల్టీ-సిగ్నల్ నిర్ణయంగా పరిగణించడం వల్ల అంతరాయాల లోపాలను గణనీయంగా తగ్గించవచ్చు మరియు వాయిస్ ఏజెంట్ల నుండి వినియోగదారులు ఆశించే సహజమైన ప్రవాహాన్ని తిరిగి తీసుకురావచ్చు.