ఒక వాయిస్-AI బృందం నిజమైన ఫోన్ కాల్స్లో ఎండ్-టు-ఎండ్ రెస్పాన్స్ లేటెన్సీని 1.8 సెకన్ల కంటే తక్కువకు తగ్గించినట్లు ప్రకటించింది—ఇది వారి మొదటి ప్రోటోటైప్ నుండి 55% తగ్గుదల. ఓవర్ల్యాపింగ్ ప్రాసెసింగ్ స్ట్రీమ్స్, న్యూరల్ వాయిస్-యాక్టివిటీ డిటెక్టర్, స్ట్రీమింగ్ టెక్స్ట్-టు-స్పీచ్ సింథసిస్ మరియు స్పెక్యులేటివ్ ఇంటింట్ ప్రీ-ఫెచింగ్ వంటి సాంకేతికతలు ఈ మెరుగుదలకు కారణమయ్యాయి మరియు అపాయింట్మెంట్ కన్వర్షన్ రేట్లను సుమారు 30% పెంచాయి.
వాయిస్ అసిస్టెంట్లకు లేటెన్సీ ఎందుకు ముఖ్యం
సుదీర్ఘ విరామాలు వల్ల సిస్టమ్ ఇంకా వింటుందో లేదో అని కాల్ చేసేవారు అనుమానిస్తారు. ప్రారంభ పరీక్షల్లో, ప్రోటోటైప్ ప్రతిస్పందించడానికి ముందు 2.9 సెకన్ల పాటు వేచి ఉండేది. కాల్ చేసేవారు తమ మాటను మళ్ళీ మళ్ళీ చెప్పడం లేదా ఫోన్ కట్ చేయడం వంటివి చేసేవారు, ఇది సంభాషణ ప్రవాహాన్ని (conversational flow) ఆలస్యం దెబ్బతీస్తోందని స్పష్టంగా చూపుతుంది. కస్టమర్ సపోర్ట్, బుకింగ్, సమాచార శోధన వంటి ఏ రియల్-టైమ్ సర్వీస్కైనా, ప్రతి సెకను నిశ్శబ్దం నమ్మకాన్ని తగ్గిస్తుంది మరియు కన్వర్షన్ను తగ్గిస్తుంది.
ఒక సెకను సమయాన్ని తగ్గించిన సాంకేతిక మార్పులు
బృందం కేవలం సీక్వెన్షియల్ పైప్లైన్ను వదిలివేసి, ప్రతి దశను పారలల్గా (parallel) నడిచేలా చేసింది, తద్వారా తగినంత డేటా లభించిన వెంటనే తదుపరి దశకు పంపిస్తుంది.
- న్యూరల్ వాయిస్-యాక్టివిటీ డిటెక్షన్ (VAD). ఒక చిన్న న్యూరల్ మోడల్ ఆడియో స్ట్రీమ్ను గమనిస్తూ, మాట్లాడే వ్యక్తి వాక్యాన్ని ఎప్పుడు పూర్తి చేస్తారో అంచనా వేస్తుంది, దీనివల్ల డిటెక్షన్ విండో సుమారు 800 ms నుండి 280 ms కి తగ్గింది.
- స్ట్రీమింగ్ టెక్స్ట్-టు-స్పీచ్ (TTS). పూర్తి సమాధానం కోసం వేచి ఉండటానికి బదులుగా, సిస్టమ్ మొదటి వాక్యాన్ని వెంటనే సింథసైజర్కు పంపిస్తుంది, తద్వారా మిగిలిన సమాధానం తయారవుతున్నప్పుడే ఆడియో ప్రారంభమవుతుంది.
- స్పెక్యులేటివ్ ఇంటింట్ ప్రీ-ఫెచింగ్. వినియోగదారు మాట్లాడుతున్నప్పుడే, మోడల్ వారి సంభావ్య ఉద్దేశాన్ని (intent) అంచనా వేసి ముందుగానే బ్యాకెండ్ను క్వెరీ చేస్తుంది. ఒకవేళ అంచనా సరైనదైతే, మాట ముగియగానే సమాధానం సిద్ధంగా ఉంటుంది; ఒకవేళ తప్పు అయితే, ఫాల్బ్యాక్ (fallback) కూడా వేగంగా అందుతుంది.
గణాంకాలు ఏం చెబుతున్నాయి మరియు తదుపరి ఏమి గమనించాలి
ఓవర్ల్యాపింగ్ డిజైన్తో, మొత్తం రెస్పాన్స్ సమయం 1.8 సెకన్ల కంటే తగ్గింది మరియు అపాయింట్మెంట్ కన్వర్షన్ రేట్లు 30% పెరిగాయి.
ఈ విధానం సంక్లిష్టతను పెంచుతుంది: పారలల్ స్ట్రీమ్స్ మరియు స్పెక్యులేటివ్ క్వెరీల వల్ల కంప్యూటింగ్ వనరులు (compute) ఎక్కువగా వినియోగించబడతాయి మరియు అంచనాలు తప్పినప్పుడు జాగ్రత్తగా ఎర్రర్ హ్యాండ్లింగ్ చేయాల్సి ఉంటుంది. ఇదే మార్గాన్ని అనుసరించాలనుకునే బృందాలు, హార్డ్వేర్ ఖర్చును మరియు యూజర్ ఎంగేజ్మెంట్లో వచ్చే అంచనా పెరిగిన లాభాన్ని తూకం వేయాలి.
