ನಾವು ಬಿಡುಗಡೆ ಮಾಡಲು ಸಿದ್ಧವಾಗಿದ್ದ ವಾಯ್ಸ್-ಏಜೆಂಟ್ (voice-agent) ಕರೆ ಮಾಡುವವರ ಮಾತನ್ನು ಅರ್ಧಕ್ಕೇ ಕತ್ತರಿಸುತ್ತಿತ್ತು, ಇದರಿಂದ ಕತ್ತರಿಸುವ ದರವು (truncation rate) 18 % ಗೆ ಏರಿತು. ಬಿಡುಗಡೆಗೆ ಕೇವಲ ಹತ್ತು ದಿನಗಳ ಮೊದಲು, ನಾವು 'ಎಂಡ್-ಆಫ್-ಟರ್ನ್' (end-of-turn) ತರ್ಕವನ್ನು ಮರುಬರೆಯುವ ಪರಿಸ್ಥಿತಿ ಎದುರಾಯಿತು. ಸೈಲೆನ್ಸ್-ಟೈಮೌಟ್ (silence-timeout) ನಿಯಮಕ್ಕೆ ವ್ಯಾಕರಣ ತಪಾಸಣೆ (grammar checks) ಮತ್ತು ಬ್ಯಾಕ್-ಚಾನೆಲ್ ಡಿಟೆಕ್ಷನ್ (back-channel detection) ಅನ್ನು ಸೇರಿಸುವ ಮೂಲಕ, ನಾವು ಮಧ್ಯಪ್ರವೇಶದ ದರವನ್ನು 3 % ಕ್ಕೆ ಇಳಿಸಿದೆವು ಮತ್ತು ಸಿಸ್ಟಮ್ ಪ್ರತಿಕ್ರಿಯಿಸದಂತೆ ಕಾಣುವಂತೆ ಮಾಡಿದ ದೀರ್ಘ ಮೌನಗಳನ್ನು ಹೋಗಲಾಡಿಸಿದೆವು.

ಕೇವಲ ಒಂದು ಸೈಲೆನ್ಸ್ ಟೈಮೌಟ್ ಏಕೆ ಸಾಕಾಗಲಿಲ್ಲ

ನಮ್ಮ ಮೂಲ ವಿನ್ಯಾಸವು 700 ms ನ ಯಾವುದೇ ವಿರಾಮವನ್ನು ಬಳಕೆದಾರರು ಮಾತನ್ನು ಮುಗಿಸಿದ್ದಾರೆ ಎಂಬ ಸೂಚನೆಯಾಗಿ ಪರಿಗಣಿಸುತ್ತಿತ್ತು. ನಿಯಂತ್ರಿತ ಪ್ರದರ್ಶನದಲ್ಲಿ—ಅಂದರೆ ಶಾಂತವಾದ ಕೋಣೆಯಲ್ಲಿ ಒಬ್ಬನೇ ವ್ಯಕ್ತಿ ಪೂರ್ಣ ವಾಕ್ಯಗಳನ್ನು ಹೇಳುವಾಗ—ಈ ನಿಯಮವು ಚೆನ್ನಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ. ಆದರೆ, ನಿಜವಾದ ಕರೆ ಮಾಡುವವರು ಯೋಚಿಸಲು ವಿರಾಮ ತೆಗೆದುಕೊಳ್ಳುತ್ತಾರೆ, ಸಂಖ್ಯೆಗಳನ್ನು ಗುಂಪುಗಳಾಗಿ ವಿಂಗಡಿಸುತ್ತಾರೆ ಮತ್ತು ತಾವು ಕೇಳಿಸಿಕೊಳ್ಳುತ್ತಿದ್ದೇವೆ ಎಂದು ತೋರಿಸಲು “uh-huh” ಅಥವಾ “mm-hmm” ಎಂಬ ಪದಗಳನ್ನು ಬಳಸುತ್ತಾರೆ. ನಮ್ಮ ಏಜೆಂಟ್ ಈ ಎಲ್ಲಾ ವಿರಾಮಗಳನ್ನು ಮಾತಿನ ಅಂತ್ಯವೆಂದು ತಪ್ಪಾಗಿ ಅರ್ಥೈಸಿಕೊಳ್ಳುತ್ತಿತ್ತು.

312 ಪ್ರೊಡಕ್ಷನ್ ಕರೆಗಳನ್ನು ವಿಶ್ಲೇಷಿಸಿದಾಗ ಎರಡು ಸಮಸ್ಯೆಗಳು ಕಂಡುಬಂದವು. ಮೊದಲನೆಯದಾಗಿ, ಮಾತನಾಡುವವರು ಮುಂದಿನ ಪದವನ್ನು ರೂಪಿಸುತ್ತಿರುವಾಗಲೇ ಏಜೆಂಟ್ ಮಧ್ಯಪ್ರವೇಶಿಸುತ್ತಿತ್ತು, ಇದು 18 % lượtುಗಳನ್ನು (turns) ಹಾಳುಮಾಡುತ್ತಿತ್ತು. ಎರಡನೆಯದಾಗಿ, ಮಧ್ಯಪ್ರವೇಶವನ್ನು ತಡೆಯಲು ನಾವು ಟೈಮೌಟ್ ಅನ್ನು 1500 ms ಗೆ ಹೆಚ್ಚಿಸಿದಾಗ, ಸಿಸ್ಟಮ್ ನಿಧಾನಗತಿಯಾಯಿತು ಮತ್ತು ಶಬ್ದವಿರುವ ಲೈನ್‌ಗಳಲ್ಲಿ ಅತಿಕ್ರಮಣ (hanging) ಕಾಣಿಸಿಕೊಂಡಿತು. ಹಿನ್ನೆಲೆ ಶಬ್ದವು ಸೈಲೆನ್ಸ್ ಕೌಂಟರ್ ಅನ್ನು ಪದೇ ಪದೇ ರಿಸೆಟ್ ಮಾಡುತ್ತಿದ್ದರಿಂದ, ಬಳಕೆದಾರರು ಮಾತನ್ನು ಮುಗಿಸಿದ್ದಾರೆ ಎಂದು ಏಜೆಂಟ್ ನಿರ್ಧರಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತಿರಲಿಲ್ಲ.

ಒಂದು ಸಂಖ್ಯೆಯ ಬದಲಿಗೆ ಮೂರು ಸಂಕೇತಗಳು

ನಾವು ಸ್ಥಿರವಾದ ಟೈಮೌಟ್ ವಿಧಾನವನ್ನು ಬಿಟ್ಟು, ಮೂರು ಸಂಕೇತಗಳನ್ನು ಗಮನಿಸುವ ಒಂದು ಸಣ್ಣ ಸ್ಟೇಟ್ ಮೆಷಿನ್ (state machine) ಅನ್ನು ನಿರ್ಮಿಸಿದೆವು:

  • Silence duration – ಬಳಕೆದಾರರು ಎಷ್ಟು ಸಮಯದಿಂದ ಮೌನವಾಗಿದ್ದಾರೆ ಎಂಬುದು.
  • Grammar – ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟ್ (transcript) ಒಂದು ಪೂರ್ಣ ವ್ಯಾಕರಣದ ಘಟಕದೊಂದಿಗೆ ಕೊನೆಗೊಳ್ಳುತ್ತದೆಯೇ ಅಥವಾ “the” ಅಥವಾ “and” ನಂತಹ ಅಪೂರ್ಣ ಪದದೊಂದಿಗೆ ಕೊನೆಗೊಳ್ಳುತ್ತದೆಯೇ?
  • Back-channel detection – ಕೊನೆಯ ಶಬ್ದವು ನಿಜವಾದ ಪ್ರತಿಕ್ರಿಯೆಯೇ (ಉದಾಹರಣೆಗೆ, ಮಾತನಾಡಿದ ಉತ್ತರ) ಅಥವಾ “yeah” ನಂತಹ ಒಂದು ಸಣ್ಣ ಒಪ್ಪಿಗೆಯೇ?

ಈ ಸಂಕೇತಗಳೊಂದಿಗೆ ನಾವು ಎರಡು ಸೈಲೆನ್ಸ್ ಬಜೆಟ್‌ಗಳನ್ನು ನಿರ್ಧರಿಸಿದೆವು:

  1. Completed transcript – ಪಾರ್ಸ್ ಮಾಡಿದ ಪಠ್ಯವು ಪೂರ್ಣಗೊಂಡಂತೆ ಕಂಡಾಗ, ನಾವು 550 ms ನ ಸಣ್ಣ ಟೈಮೌಟ್ ಅನ್ನು ಅನ್ವಯಿಸುತ್ತೇವೆ. ಇದರಿಂದ ಏಜೆಂಟ್ ಚುರುಕಾಗಿರುತ್ತದೆ ಮತ್ತು ತಕ್ಷಣವೇ ಪ್ರತಿಕ್ರಿಯಿಸುತ್ತದೆ.
  2. Dangling transcript – ಕೊನೆಯ ಪದವು ಬಳಕೆದಾರರು ವಾಕ್ಯದ ಮಧ್ಯದಲ್ಲಿದ್ದಾರೆ ಎಂದು ಸೂಚಿಸಿದಾಗ, ನಾವು ಟೈಮೌಟ್ ಅನ್ನು 1300 ms ಗೆ ವಿಸ್ತರಿಸುತ್ತೇವೆ, ಇದು ಮಾತನಾಡುವವರಿಗೆ ಮುಂದುವರಿಯಲು ಅವಕಾಶ ನೀಡುತ್ತದೆ.

ತಪ್ಪು ಮಧ್ಯಪ್ರವೇಶಗಳನ್ನು ತಡೆಯಲು ಎರಡು ಹೆಚ್ಚುವರಿ ರಕ್ಷಣೆಗಳಿವೆ:

  • Minimum speech duration – ಒಂದು ಸಣ್ಣ “mm-hmm” ಪೂರ್ಣ ಮಾತಿನಂತೆ ಪರಿಗಣಿಸಲ್ಪಡುವುದಿಲ್ಲ, ಆದ್ದರಿಂದ ಏಜೆಂಟ್ ನಿರ್ಧರಿಸುವ ಮೊದಲು ದೀರ್ಘವಾದ ಮಾತಿಗಾಗಿ ಕಾಯುತ್ತದೆ.
  • Hard cap – ಹಿನ್ನೆಲೆ ಶಬ್ದ ಏನೇ ಇರಲಿ, ಗರಿಷ್ಠ ಮೌನ ಮಿತಿಯು ಏಜೆಂಟ್ ಅನ್ನು ಒಂದು ಸಮಂಜಸವಾದ ಅವಧಿಯ ನಂತರ ಪ್ರತಿಕ್ರಿಯಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ, ಇದರಿಂದ ಸಿಸ್ಟಮ್ ಅತಿಕ್ರಮಣ (hang) ಆಗುವುದನ್ನು ತಪ್ಪಿಸಬಹುದು.

ಫಲಿತಾಂಶಗಳು ಮತ್ತು ವಾಯ್ಸ್ AI ಗೆ ಇದರ ಅರ್ಥವೇನು

ನಾವು ಮೂರು-ಸಂಕೇತ ವ್ಯವಸ್ಥೆಯನ್ನು ಅಳವಡಿಸಿದ ನಂತರ, ಕತ್ತರಿಸುವ ದರವು 18 % ರಿಂದ 3 % ಕ್ಕೆ ಇಳಿಯಿತು. ಕರೆ ಮಾಡುವವರು ಏಜೆಂಟ್ ತಮ್ಮ ಮಾತಿನ ಮೇಲೆ ಮಾತನಾಡುತ್ತಿರುವುದನ್ನು ಇನ್ನು ಮುಂದೆ ಕೇಳಿಸಿಕೊಳ್ಳಲಿಲ್ಲ ಮತ್ತು ಹಿಂದಿನ “ಮೌನ” ಸಮಸ್ಯೆ ಮಾಯವಾಯಿತು. ಏಜೆಂಟ್ ಈಗ ಹೆಚ್ಚು ಪ್ರತಿಕ್ರಿಯಾತ್ಮಕವಾಗಿ ಮತ್ತು ವಿನಯಶೀಲವಾಗಿ ಕಾಣುತ್ತದೆ, ಇದು ಮನುಷ್ಯರು ಸಂಭಾಷಣೆಯನ್ನು ನಡೆಸುವ ರೀತಿಯನ್ನು ಹೋಲುತ್ತದೆ.

ವಾಯ್ಸ್ ಅಸಿಸ್ಟೆಂಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿರುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ, ಪಾಠ ಸ್ಪಷ್ಟವಾಗಿದೆ: ಕನ್ಫಿಗರೇಶನ್ ಫೈಲ್‌ನಲ್ಲಿರುವ ಒಂದು ಸ್ಥಿರ ಸಂಖ್ಯೆಯು (constant) ಸಂಭಾಷಣೆಯ ಸೂಕ್ಷ್ಮತೆಗಳನ್ನು ಸೆರೆಹಿಡಿಯಲು ಸಾಧ್ಯವಿಲ್ಲ. ಸೈಲೆನ್ಸ್ ಉದ್ದ, ವ್ಯಾಕರಣದ ಪೂರ್ಣತೆ ಮತ್ತು ಬ್ಯಾಕ್-ಚಾನೆಲ್ ಸಂಕೇತಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಒಂದು ಲೈಟ್‌ವೇಯ್ಟ್ ಸ್ಟೇಟ್ ಮೆಷಿನ್, ಹೆಚ್ಚಿನ ಕಂಪ್ಯೂಟೇಶನಲ್ ಲೋಡ್ ಅನ್ನು ಸೇರಿಸದೆ ಸಂಭಾಷಣೆಯ ನಿಖರತೆಯನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಸುಧಾರಿಸಬಹುದು.

ಸಂಭಾವ್ಯ ಅನಾನುಕೂಲಗಳು ಮತ್ತು ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು

ವ್ಯಾಕರಣ ಪಾರ್ಸಿಂಗ್ ಮತ್ತು ಬ್ಯಾಕ್-ಚಾನೆಲ್ ವರ್ಗೀಕರಣವನ್ನು ಸೇರಿಸುವುದು ಪ್ರೊಸೆಸಿಂಗ್ ಹಂತಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಈ ಹೆಚ್ಚುವರಿ ವಿಳಂಬವು (latency) ಸಂಭಾಷಣೆಯ ಸುಗಮತೆಯಲ್ಲಿ ಸಿಕ್ಕ ಲಾಭವನ್ನು ಕಡಿಮೆ ಮಾಡದಂತೆ ತಂಡಗಳು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬೇಕು. ಈ ವಿಧಾನವು ನಿಖರವಾದ ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟ್ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ; ಶಬ್ದವಿರುವ ಪರಿಸರದಲ್ಲಿ ಅಥವಾ ಉಚ್ಚಾರಣೆಯ ವ್ಯತ್ಯಾಸಗಳಿರುವಾಗ, ವ್ಯಾಕರಣದ ಸಂಕೇತಗಳು ತಪ್ಪಾಗಬಹುದು, ಇದು ಸಿಸ್ಟಮ್ ಅನ್ನು ದೀರ್ಘ ಟೈಮೌಟ್‌ಗಳ ಮೇಲೆ ಅವಲಂಬಿಸುವಂತೆ ಮಾಡಬಹುದು.

ಭವಿಷ್ಯದ ಕೆಲಸವು ವೈಯಕ್ತಿಕ ಕರೆ ಮಾಡುವವರ ಅಭ್ಯಾಸಗಳಿಂದ ಕಲಿಯುವ ಅಡಾಪ್ಟಿವ್ ಟೈಮೌಟ್ ಮಿತಿಗಳನ್ನು (adaptive timeout thresholds) ಅನ್ವೇಷಿಸಬಹುದು, ಅಥವಾ ಬ್ಯಾಕ್-ಚಾನೆಲ್ ಡಿಟೆಕ್ಟರ್ ಅನ್ನು ಬಲಪಡಿಸಲು ಪ್ರೊಸೋಡಿಕ್ ಫೀಚರ್‌ಗಳನ್ನು (pitch, energy) ಸಂಯೋಜಿಸಬಹುದು. ಈ ಸುಧಾರಣೆಗಳು ಪ್ರಮುಖ ಮೆಟ್ರಿಕ್‌ಗಳಾದ—ಗ್ರಾಹಕರ ತೃಪ್ತಿ, ಕರೆ ಪೂರ್ಣಗೊಳಿಸುವ ಸಮಯ ಮತ್ತು ದೋಷದ ದರಗಳ ಮೇಲೆ ಹೇಗೆ ಪರಿಣಾಮ ಬೀರುತ್ತವೆ ಎಂಬುದನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು, ಈ ತಂತ್ರವನ್ನು ದೊಡ್ಡ ಮಟ್ಟದ ಕಾಂಟ್ಯಾಕ್ಟ್-ಸೆಂಟರ್ ನಿಯೋಜನೆಗಳಿಗೆ ವಿಸ್ತರಿಸುವ ಮೊದಲು ಅತ್ಯಗತ್ಯವಾಗಿರುತ್ತದೆ.

ಸಾರಾಂಶ: ಮಾತಿನ ಅಂತ್ಯವನ್ನು ಕೇವಲ ಒಂದು ಸೈಲೆನ್ಸ್ ಟೈಮರ್ ಆಗಿ ನೋಡದೆ, ಅದನ್ನು ಮಲ್ಟಿ-ಸಿಗ್ನಲ್ ನಿರ್ಧಾರವಾಗಿ ಪರಿಗಣಿಸುವುದರಿಂದ, ಮಧ್ಯಪ್ರವೇಶದ ತಪ್ಪುಗಳನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ಬಳಕೆದಾರರು ವಾಯ್ಸ್ ಏಜೆಂಟ್‌ಗಳಿಂದ ನಿರೀಕ್ಷಿಸುವ ನೈಸರ್ಗಿಕ ಹರಿವನ್ನು ಮರುಸ್ಥಾಪಿಸಬಹುದು.