ఒక వాయిస్-AI బృందం నిజమైన ఫోన్ కాల్స్‌లో ఎండ్-టు-ఎండ్ రెస్పాన్స్ లేటెన్సీని 1.8 సెకన్ల కంటే తక్కువకు తగ్గించినట్లు ప్రకటించింది—ఇది వారి మొదటి ప్రోటోటైప్ నుండి 55% తగ్గుదల. ఓవర్‌ల్యాపింగ్ ప్రాసెసింగ్ స్ట్రీమ్స్, న్యూరల్ వాయిస్-యాక్టివిటీ డిటెక్టర్, స్ట్రీమింగ్ టెక్స్ట్-టు-స్పీచ్ సింథసిస్ మరియు స్పెక్యులేటివ్ ఇంటింట్ ప్రీ-ఫెచింగ్ వంటి సాంకేతికతలు ఈ మెరుగుదలకు కారణమయ్యాయి మరియు అపాయింట్‌మెంట్ కన్వర్షన్ రేట్లను సుమారు 30% పెంచాయి.

వాయిస్ అసిస్టెంట్‌లకు లేటెన్సీ ఎందుకు ముఖ్యం

సుదీర్ఘ విరామాలు వల్ల సిస్టమ్ ఇంకా వింటుందో లేదో అని కాల్ చేసేవారు అనుమానిస్తారు. ప్రారంభ పరీక్షల్లో, ప్రోటోటైప్ ప్రతిస్పందించడానికి ముందు 2.9 సెకన్ల పాటు వేచి ఉండేది. కాల్ చేసేవారు తమ మాటను మళ్ళీ మళ్ళీ చెప్పడం లేదా ఫోన్ కట్ చేయడం వంటివి చేసేవారు, ఇది సంభాషణ ప్రవాహాన్ని (conversational flow) ఆలస్యం దెబ్బతీస్తోందని స్పష్టంగా చూపుతుంది. కస్టమర్ సపోర్ట్, బుకింగ్, సమాచార శోధన వంటి ఏ రియల్-టైమ్ సర్వీస్‌కైనా, ప్రతి సెకను నిశ్శబ్దం నమ్మకాన్ని తగ్గిస్తుంది మరియు కన్వర్షన్‌ను తగ్గిస్తుంది.

ఒక సెకను సమయాన్ని తగ్గించిన సాంకేతిక మార్పులు

బృందం కేవలం సీక్వెన్షియల్ పైప్‌లైన్‌ను వదిలివేసి, ప్రతి దశను పారలల్‌గా (parallel) నడిచేలా చేసింది, తద్వారా తగినంత డేటా లభించిన వెంటనే తదుపరి దశకు పంపిస్తుంది.

  • న్యూరల్ వాయిస్-యాక్టివిటీ డిటెక్షన్ (VAD). ఒక చిన్న న్యూరల్ మోడల్ ఆడియో స్ట్రీమ్‌ను గమనిస్తూ, మాట్లాడే వ్యక్తి వాక్యాన్ని ఎప్పుడు పూర్తి చేస్తారో అంచనా వేస్తుంది, దీనివల్ల డిటెక్షన్ విండో సుమారు 800 ms నుండి 280 ms కి తగ్గింది.
  • స్ట్రీమింగ్ టెక్స్ట్-టు-స్పీచ్ (TTS). పూర్తి సమాధానం కోసం వేచి ఉండటానికి బదులుగా, సిస్టమ్ మొదటి వాక్యాన్ని వెంటనే సింథసైజర్‌కు పంపిస్తుంది, తద్వారా మిగిలిన సమాధానం తయారవుతున్నప్పుడే ఆడియో ప్రారంభమవుతుంది.
  • స్పెక్యులేటివ్ ఇంటింట్ ప్రీ-ఫెచింగ్. వినియోగదారు మాట్లాడుతున్నప్పుడే, మోడల్ వారి సంభావ్య ఉద్దేశాన్ని (intent) అంచనా వేసి ముందుగానే బ్యాకెండ్‌ను క్వెరీ చేస్తుంది. ఒకవేళ అంచనా సరైనదైతే, మాట ముగియగానే సమాధానం సిద్ధంగా ఉంటుంది; ఒకవేళ తప్పు అయితే, ఫాల్‌బ్యాక్ (fallback) కూడా వేగంగా అందుతుంది.

గణాంకాలు ఏం చెబుతున్నాయి మరియు తదుపరి ఏమి గమనించాలి

ఓవర్‌ల్యాపింగ్ డిజైన్‌తో, మొత్తం రెస్పాన్స్ సమయం 1.8 సెకన్ల కంటే తగ్గింది మరియు అపాయింట్‌మెంట్ కన్వర్షన్ రేట్లు 30% పెరిగాయి.

ఈ విధానం సంక్లిష్టతను పెంచుతుంది: పారలల్ స్ట్రీమ్స్ మరియు స్పెక్యులేటివ్ క్వెరీల వల్ల కంప్యూటింగ్ వనరులు (compute) ఎక్కువగా వినియోగించబడతాయి మరియు అంచనాలు తప్పినప్పుడు జాగ్రత్తగా ఎర్రర్ హ్యాండ్లింగ్ చేయాల్సి ఉంటుంది. ఇదే మార్గాన్ని అనుసరించాలనుకునే బృందాలు, హార్డ్‌వేర్ ఖర్చును మరియు యూజర్ ఎంగేజ్‌మెంట్‌లో వచ్చే అంచనా పెరిగిన లాభాన్ని తూకం వేయాలి.