நாங்கள் வெளியிடத் தயாராக இருந்த voice-agent, அழைப்பவர்களைத் தொடர்ந்து இடையில் நிறுத்திவிட்டது, இதனால் truncation rate 18%-ஆக உயர்ந்தது. இது அறிமுகப்படுத்துவதற்கு பத்து நாட்களுக்கு முன்பே end-of-turn logic-ஐ மீண்டும் எழுத வேண்டிய கட்டாயத்தை ஏற்படுத்தியது. silence-timeout விதியுடன் grammar checks மற்றும் back-channel detection ஆகியவற்றைச் சேர்ப்பதன் மூலம், இடையூறுகளை (interruptions) 3%-ஆகக் குறைத்தோம்; மேலும், சிஸ்டம் பதிலளிக்காதது போன்ற உணர்வைத் தந்த நீண்ட, தேவையற்ற அமைதியையும் (dead silences) நீக்கினோம்.

ஏன் ஒரு ஒற்றை silence timeout போதுமானதாக இல்லை

எங்களது ஆரம்பகால வடிவமைப்பில், 700 ms இடைவெளி இருந்தால் பயனர் பேசி முடித்துவிட்டதாகக் கருதப்பட்டது. ஒரு கட்டுப்படுத்தப்பட்ட டெமோவில் (controlled demo)—அதாவது ஒரு அமைதியான அறையில் ஒரு நபர் முழுமையான வாக்கியங்களைச் சொல்லும் சூழலில்—அந்த விதி சரியாக வேலை செய்யும். ஆனால், நிஜமான அழைப்பாளர்கள், யோசிக்க இடைவெளி விடுவார்கள், எண்களைத் தொகுப்புகளாகப் பிரிப்பார்கள், மேலும் தாங்கள் கவனித்துக் கொண்டிருப்பதை உணர்த்த “uh-huh” அல்லது “mm-hmm” போன்ற சொற்களைப் பயன்படுத்துவார்கள். அந்த ஒவ்வொரு இடைவெளியையும் ஏஜென்ட் ஒரு உரையாடல் முடிவாக (end of a turn) தவறாகப் புரிந்துகொண்டது.

312 நேரடி அழைப்புகளை (production calls) ஆய்வு செய்தபோது இரண்டு சிக்கல்கள் தெரியவந்தன. முதலாவதாக, பேசுபவர் அடுத்த வாக்கியத்தை உருவாக்கிக் கொண்டிருக்கும்போதே ஏஜென்ட் குறுக்கிட்டது, இதனால் 18% உரையாடல்கள் பாதிக்கப்பட்டன. இரண்டாவதாக, இடையூறுகளைத் தவிர்க்க timeout-ஐ 1500 ms ஆக உயர்த்தியபோது, சிஸ்டம் மந்தமாகி (sluggish), சத்தமான இணைப்புகளில் (noisy lines) தொய்வடையத் தொடங்கியது. பின்னணிச் சத்தம் (Background noise) silence counter-ஐத் தொடர்ந்து reset செய்ததால், பயனர் பேசி முடித்துவிட்டார் என்பதை ஏஜென்ட்டால் தீர்மானிக்க முடியவில்லை.

ஒரு எண்ணிற்குப் பதிலாக மூன்று சிக்னல்கள்

நாங்கள் நிலையான timeout முறையைத் தவிர்த்துவிட்டு, மூன்று குறிப்புகளைக் கவனிக்கும் ஒரு சிறிய state machine-ஐ உருவாக்கினோம்:

  • Silence duration – பயனர் எவ்வளவு நேரம் அமைதியாக இருக்கிறார்.
  • Grammar – transcript ஒரு முழுமையான வாக்கிய அமைப்பில் (syntactic unit) முடிகிறதா அல்லது “the” அல்லது “and” போன்ற அரைகுறையான சொற்களுடன் முடிகிறதா?
  • Back-channel detection – கடைசிச் சத்தம் ஒரு உண்மையான பதிலா (உதாரணமாக, ஒரு பதில் சொல்வது) அல்லது “yeah” போன்ற ஒரு சிறிய அங்கீகாரமா?

இந்த சிக்னல்களைக் கொண்டு நாங்கள் இரண்டு silence budgets-களை வரையறுத்தோம்:

  1. Completed transcript – பகுப்பாய்வு செய்யப்பட்ட உரை (parsed text) முழுமையாகத் தோன்றும்போது, 550 ms என்ற குறுகிய timeout-ஐப் பயன்படுத்துகிறோம். இதனால் ஏஜென்ட் விரைவாகப் பதிலளிக்கும்.
  2. Dangling transcript – கடைசிச் சொல் பயனர் வாக்கியத்தின் நடுவில் இருப்பதை உணர்த்தும்போது, timeout-ஐ 1300 ms ஆக நீட்டித்து, பேசுபவருக்குத் தொடர இடம் கொடுக்கிறோம்.

தவறான இடையூறுகளைத் தடுக்க இரண்டு கூடுதல் பாதுகாப்பு முறைகள் (guards) உள்ளன:

  • Minimum speech duration – ஒரு சிறிய “mm-hmm” முழுமையான உரையாடல் என்று கருதப்படாது, எனவே ஏஜென்ட் முடிவெடுப்பதற்கு முன் நீண்ட உரையாடலுக்காகக் காத்திருக்கும்.
  • Hard cap – பின்னணிச் சத்தம் எதுவாக இருந்தாலும், ஒரு குறிப்பிட்ட காலத்திற்குப் பிறகு ஏஜென்ட் பதிலளிக்க வேண்டும் என்பதற்காக ஒரு அதிகபட்ச silence limit நிர்ணயிக்கப்பட்டுள்ளது, இது முடிவில்லாத தொய்வைத் தவிர்க்கிறது.

முடிவுகள் மற்றும் voice AI-க்கான அதன் முக்கியத்துவம்

இந்த மூன்று-சிக்னல் முறையைச் செயல்படுத்திய பிறகு, truncation rate 18%-லிருந்து 3%-ஆகக் குறைந்தது. அழைப்பாளர்கள் ஏஜென்ட் தங்களுக்கு இடையில் பேசுவதைக் கேட்கவில்லை, மேலும் முந்தைய “dead silence” சிக்கலும் மறைந்துவிட்டது. ஏஜென்ட் பதிலளிக்கத் தயாராகவும் (responsive) மரியாதையாகவும் இருப்பது போல் உணரப்படுகிறது, இது மனிதர்கள் உரையாடல்களைக் கையாளும் முறையைப் போலவே உள்ளது.

voice assistants உருவாக்கும் டெவலப்பர்களுக்குப் பாடம் தெளிவானது: ஒரு config file-ல் உள்ள ஒற்றை constant மதிப்பால், பேச்சின் நுணுக்கங்களை (nuances) முழுமையாகப் புரிந்துகொள்ள முடியாது. silence அளவு, இலக்கணத் தெளிவு மற்றும் back-channel குறிப்புகளை மதிப்பிடும் ஒரு இலகுரக state machine, அதிகப்படியான கணக்கீட்டுச் சுமை (computational load) இன்றி உரையாடல் துல்லியத்தை (turn-taking accuracy) வியக்கத்தக்க வகையில் மேம்படுத்தும்.

சாத்தியமான குறைபாடுகள் மற்றும் திறந்த கேள்விகள்

Grammar parsing மற்றும் back-channel classification ஆகியவற்றைச் சேர்ப்பது கூடுதல் செயலாக்கப் படிகளை (processing steps) உருவாக்குகிறது. இந்த கூடுதல் தாமதம் (latency), உரையாடலின் மென்மையை (smoothness) பாதித்துவிடாமல் இருப்பதை அணிகள் உறுதி செய்ய வேண்டும். இந்த அணுகுமுறை துல்லியமான transcript-ஐச் சார்ந்துள்ளது; சத்தமான சூழலில் அல்லது உச்சரிப்பு வேறுபாடுகள் (accented speech) உள்ளபோது, இலக்கணக் குறிப்புகள் தவறாகலாம், இதனால் சிஸ்டம் மீண்டும் நீண்ட timeout முறையையே பயன்படுத்த வேண்டியிருக்கும்.

எதிர்கால ஆய்வுகளில், தனிப்பட்ட அழைப்பாளர்களின் பழக்கவழக்கங்களிலிருந்து கற்றுக்கொள்ளும் adaptive timeout thresholds அல்லது back-channel detector-ஐ வலுப்படுத்த prosodic features (pitch, energy) போன்றவற்றை ஒருங்கிணைப்பது குறித்து ஆராயலாம். இந்த மேம்பாடுகள் வாடிக்கையாளர் திருப்தி (customer satisfaction), அழைப்பு நிறைவு நேரம் (call completion time) மற்றும் பிழை விகிதங்கள் (error rates) போன்ற முக்கிய அளவீடுகளை எவ்வாறு பாதிக்கின்றன என்பதைக் கண்காணிப்பது, இந்தத் தொழில்நுட்பத்தை பெரிய அளவிலான contact-center பயன்பாடுகளுக்கு விரிவுபடுத்துவதற்கு முன் அவசியமாகும்.

Takeaway: உரையாடல் முடிவை (turn completion) ஒரு ஒற்றை silence timer-ஆகக் கருதாமல், பல சிக்னல்களைக் கொண்ட முடிவாகக் கருதுவது, இடையூறு பிழைகளைக் கணிசமாகக் குறைப்பதோடு, பயனர்கள் voice agents-லிருந்து எதிர்பார்க்கும் இயல்பான ஓட்டத்தையும் மீட்டெடுக்கிறது.