ഒരു വോയ്സ്-AI ടീം യഥാർത്ഥ ഫോൺ കോളുകളിലെ എൻഡ്-ടു-എൻഡ് റെസ്പോൺസ് ലേറ്റൻസി (response latency) 1.8 സെക്കൻഡിൽ താഴെയായി കുറച്ചതായി അറിയിച്ചു—ഇത് അവരുടെ ആദ്യ പ്രോട്ടോടൈപ്പിനെ അപേക്ഷിച്ച് 55% കുറവാണ്. ഓവർലാപ്പിംഗ് പ്രോസസ്സിംഗ് സ്ട്രീമുകൾ, ഒരു ന്യൂറൽ വോയ്സ്-ആക്ടിവിറ്റി ഡിറ്റക്ടർ, സ്ട്രീമിംഗ് ടെക്സ്റ്റ്-ടു-സ്പീച്ച് സിന്തസിസ്, സ്പെക്കുലേറ്റീവ് ഇന്റന്റ് പ്രീ-ഫെച്ചിംഗ് (speculative intent pre-fetching) എന്നിവയാണ് ഈ നേട്ടത്തിന് കാരണമായത്. ഇത് അപ്പോയിന്റ്മെന്റ് കൺവേർഷൻ നിരക്കുകൾ ഏകദേശം 30% വർദ്ധിപ്പിക്കുകയും ചെയ്തു.
വോയ്സ് അസിസ്റ്റന്റുകൾക്ക് ലേറ്റൻസി പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
നീണ്ട ഇടവേളകൾ കോളർമാരെ സിസ്റ്റം ഇപ്പോഴും കേൾക്കുന്നുണ്ടോ എന്ന് സംശയിപ്പിക്കാൻ ഇടയാക്കും. ആദ്യകാല പരീക്ഷണങ്ങളിൽ, പ്രോട്ടോടൈപ്പ് മറുപടി നൽകുന്നതിന് മുമ്പ് 2.9 സെക്കൻഡ് കാത്തുനിൽക്കുമായിരുന്നു. കോളർമാർ ഒരേ കാര്യം തന്നെ ആവർത്തിക്കുകയോ അല്ലെങ്കിൽ ഫോൺ കട്ട് ചെയ്യുകയോ ചെയ്തിരുന്നു; ലാഗ് സംഭാഷണത്തിന്റെ ഒഴുക്കിനെ തടസ്സപ്പെടുത്തുന്നു എന്നതിന്റെ വ്യക്തമായ സൂചനയായിരുന്നു ഇത്. കസ്റ്റമർ സപ്പോർട്ട്, ബുക്കിംഗ്, വിവരങ്ങൾ തിരയൽ എന്നിങ്ങനെയുള്ള ഏതൊരു റിയൽ-ടൈം സർവീസിനും, ഓരോ സെക്കൻഡ് നിശബ്ദതയും വിശ്വാസം കുറയ്ക്കുകയും കൺവേർഷൻ കുറയ്ക്കുകയും ചെയ്യുന്നു.
ഒരു സെക്കൻഡ് കുറയ്ക്കാൻ സഹായിച്ച സാങ്കേതിക മാറ്റങ്ങൾ
ടീം കർശനമായ സീക്വൻഷ്യൽ പൈപ്പ്ലൈൻ ഉപേക്ഷിക്കുകയും ഓരോ ഘട്ടവും സമാന്തരമായി (parallel) പ്രവർത്തിപ്പിക്കുകയും ചെയ്തു; ആവശ്യമായ ഡാറ്റ ലഭിച്ചാലുടൻ അടുത്ത ഘട്ടത്തിലേക്ക് അത് കൈമാറുന്നു.
- ന്യൂറൽ വോയ്സ്-ആക്ടിവിറ്റി ഡിറ്റക്ഷൻ (VAD). ഒരു ചെറിയ ന്യൂറൽ മോഡൽ ഓഡിയോ സ്ട്രീം നിരീക്ഷിക്കുകയും സംസാരിക്കുന്ന ആൾ എപ്പോഴാണ് ഒരു വാചകം പൂർത്തിയാക്കുന്നത് എന്ന് പ്രവചിക്കുകയും ചെയ്യുന്നു. ഇത് ഡിറ്റക്ഷൻ വിൻഡോ ഏകദേശം 800 ms-ൽ നിന്ന് 280 ms ആയി കുറയ്ക്കുന്നു.
- സ്ട്രീമിംഗ് ടെക്സ്റ്റ്-ടു-സ്പീച്ച് (TTS). പൂർണ്ണമായ ടെക്സ്റ്റ് മറുപടിക്കായി കാത്തുനിൽക്കുന്നതിന് പകരം, സിസ്റ്റം ആദ്യത്തെ വാചകം ഉടൻ തന്നെ സിന്തസൈസറിലേക്ക് സ്ട്രീം ചെയ്യുന്നു. അതിനാൽ ബാക്കി മറുപടി തയ്യാറാക്കിക്കൊണ്ടിരിക്കുമ്പോൾ തന്നെ ഓഡിയോ ആരംഭിക്കുന്നു.
- സ്പെക്കുലേറ്റീവ് ഇന്റന്റ് പ്രീ-ഫെച്ചിംഗ് (Speculative intent pre-fetching). ഉപയോക്താവ് സംസാരിച്ചുകൊണ്ടിരിക്കുമ്പോൾ തന്നെ, മോഡൽ അവരുടെ ഉദ്ദേശ്യം (intent) പ്രവചിക്കുകയും മുൻകൂട്ടി ബാക്കെൻഡിൽ ക്വറി ചെയ്യുകയും ചെയ്യുന്നു. പ്രവചനം ശരിയാണെങ്കിൽ, സംസാരം അവസാനിക്കുന്ന നിമിഷം തന്നെ മറുപടി തയ്യാറായിരിക്കും; തെറ്റാണെങ്കിൽ പോലും, ഫാൾബാക്ക് (fallback) വേഗത്തിൽ ലഭ്യമാകും.
കണക്കുകൾ എന്ത് കാണിക്കുന്നു, ഇനി ശ്രദ്ധിക്കേണ്ടത് എന്താണ്
ഓവർലാപ്പിംഗ് ഡിസൈൻ ഉപയോഗിച്ചതോടെ, ആകെ റെസ്പോൺസ് സമയം 1.8 സെക്കൻഡിൽ താഴെയായി കുറയുകയും അപ്പോയിന്റ്മെന്റ് കൺവേർഷൻ നിരക്ക് 30% വർദ്ധിക്കുകയും ചെയ്തു.
ഈ രീതി സങ്കീർണ്ണത വർദ്ധിപ്പിക്കുന്നു: പാരലൽ സ്ട്രീമുകളും സ്പെക്കുലേറ്റീവ് ക്വറികളും കൂടുതൽ കമ്പ്യൂട്ട് ഉപയോഗിക്കുന്നു, കൂടാതെ പ്രവചനങ്ങൾ തെറ്റാറുള്ള സാഹചര്യത്തിൽ കൃത്യമായ എറർ ഹാൻഡ്ലിംഗ് ആവശ്യമാണ്. ഇതേ പാത പിന്തുടരാൻ ആഗ്രഹിക്കുന്ന ടീമുകൾ, ഹാർഡ്വെയർ ചിലവും പ്രതീക്ഷിക്കുന്ന യൂസർ എൻഗേജ്മെന്റ് വർദ്ധനവും തമ്മിൽ താരതമ്യം ചെയ്യേണ്ടതുണ്ട്.
