ಒಂದು ವಾಯ್ಸ್-AI ತಂಡವು ನೈಜ ಫೋನ್ ಕರೆಗಳಲ್ಲಿ ಎಂಡ್-ಟು-ಎಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಯ ವಿಳಂಬವನ್ನು (latency) 1.8 ಸೆಕೆಂಡ್‌ಗಿಂತ ಕಡಿಮೆ ಮಾಡಿದ್ದಾಗಿ ಘೋಷಿಸಿದೆ—ಇದು ಅದರ ಮೊದಲ ಪ್ರೊಟೊಟೈಪ್‌ನಿಂದ 55% ಇಳಿಕೆಯಾಗಿದೆ. ಓವರ್‌ಲ್ಯಾಪಿಂಗ್ ಪ್ರೊಸೆಸಿಂಗ್ ಸ್ಟ್ರೀಮ್‌ಗಳು, ನ್ಯೂರಲ್ ವಾಯ್ಸ್-ಆಕ್ಟಿವಿಟಿ ಡಿಟೆಕ್ಟರ್, ಸ್ಟ್ರೀಮಿಂಗ್ ಟೆಕ್ಸ್ಟ್-ಟು-ಸ್ಪೀಚ್ ಸಿಂಥೆಸಿಸ್ ಮತ್ತು ಸ್ಪೆಕ್ಯುಲೇಟಿವ್ ಇಂಟೆಂಟ್ ಪ್ರಿ-ಫೆಚಿಂಗ್ ತಂತ್ರಗಳು ಈ ಸುಧಾರಣೆಗೆ ಕಾರಣವಾಗಿದ್ದವು ಮತ್ತು ಅಪಾಯಿಂಟ್‌ಮೆಂಟ್ ಕನ್ವರ್ಷನ್ ದರಗಳನ್ನು ಸುಮಾರು 30% ಹೆಚ್ಚಿಸಿದವು.

ವಾಯ್ಸ್ ಅಸಿಸ್ಟೆಂಟ್‌ಗಳಿಗೆ ವಿಳಂಬ (latency) ಏಕೆ ಮುಖ್ಯ

ದೀರ್ಘ ವಿರಾಮಗಳು ಸಿಸ್ಟಮ್ ಇನ್ನೂ ಕೇಳಿಸಿಕೊಳ್ಳುತ್ತಿದೆಯೇ ಎಂದು ಕರೆ ಮಾಡುವವರನ್ನು ಯೋಚಿಸುವಂತೆ ಮಾಡುತ್ತವೆ. ಆರಂಭಿಕ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಪ್ರೊಟೊಟೈಪ್ ಪ್ರತಿಕ್ರಿಯಿಸುವ ಮೊದಲು 2.9 ಸೆಕೆಂಡುಗಳ ಕಾಲ ಕಾಯುತ್ತಿತ್ತು. ಕರೆ ಮಾಡುವವರು ಪದೇ ಪದೇ ಹೇಳುತ್ತಿದ್ದರು ಅಥವಾ ಫೋನ್ ಕಟ್ ಮಾಡುತ್ತಿದ್ದರು, ಇದು ವಿಳಂಬವು ಸಂಭಾಷಣೆಯ ಹರಿವನ್ನು (conversational flow) ಹಾಳುಮಾಡುತ್ತಿದೆ ಎಂಬುದರ ಸ್ಪಷ್ಟ ಸಂಕೇತವಾಗಿತ್ತು. ಯಾವುದೇ ರಿಯಲ್-ಟೈಮ್ ಸೇವೆಗೆ—ಕಸ್ಟಮರ್ ಸಪೋರ್ಟ್, ಬುಕಿಂಗ್, ಮಾಹಿತಿ ಹುಡುಕುವುದು—ಪ್ರತಿ ಸೆಕೆಂಡ್ ಮೌನವು ನಂಬಿಕೆಯನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ ಮತ್ತು ಕನ್ವರ್ಷನ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.

ಒಂದು ಸೆಕೆಂಡ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡಿದ ತಾಂತ್ರಿಕ ಬದಲಾವಣೆಗಳು

ತಂಡವು ಕಟ್ಟುನಿಟ್ಟಾದ ಸೀಕ್ವೆನ್ಶಿಯಲ್ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಬಿಟ್ಟು, ಪ್ರತಿ ಹಂತವೂ ಸಮಾಂತರವಾಗಿ (parallel) ಕಾರ್ಯನಿರ್ವಹಿಸುವಂತೆ ಮಾಡಿತು, ಮತ್ತು ಅಗತ್ಯ ಡೇಟಾ ಸಿಕ್ಕ ತಕ್ಷಣ ಮುಂದಿನ ಹಂತಕ್ಕೆ ಕಳುಹಿಸಿತು.

  • ನ್ಯೂರಲ್ ವಾಯ್ಸ್-ಆಕ್ಟಿವಿಟಿ ಡಿಟೆಕ್ಷನ್ (VAD). ಒಂದು ಸಣ್ಣ ನ್ಯೂರಲ್ ಮಾಡೆಲ್ ಆಡಿಯೋ ಸ್ಟ್ರೀಮ್ ಅನ್ನು ಗಮನಿಸುತ್ತದೆ ಮತ್ತು ಮಾತನಾಡುವವರು ವಾಕ್ಯವನ್ನು ಯಾವಾಗ ಮುಗಿಸುತ್ತಾರೆ ಎಂದು ಮುನ್ಸೂಚನೆ ನೀಡುತ್ತದೆ, ಇದರಿಂದ ಡಿಟೆಕ್ಷನ್ ವಿಂಡೋವು ಸುಮಾರು 800 ms ನಿಂದ 280 ms ಗೆ ಇಳಿಕೆಯಾಯಿತು.
  • ಸ್ಟ್ರೀಮಿಂಗ್ ಟೆಕ್ಸ್ಟ್-ಟು-ಸ್ಪೀಚ್ (TTS). ಪೂರ್ಣ ಪಠ್ಯದ ಉತ್ತರಕ್ಕಾಗಿ ಕಾಯುವ ಬದಲು, ಸಿಸ್ಟಮ್ ಮೊದಲ ವಾಕ್ಯವನ್ನು ತಕ್ಷಣವೇ ಸಿಂಥೆಸೈಜರ್‌ಗೆ ಸ್ಟ್ರೀಮ್ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಉಳಿದ ಉತ್ತರವು ಸಿದ್ಧವಾಗುತ್ತಿರುವಾಗಲೇ ಆಡಿಯೋ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ.
  • ಸ್ಪೆಕ್ಯುಲೇಟಿವ್ ಇಂಟೆಂಟ್ ಪ್ರಿ-ಫೆಚಿಂಗ್. ಬಳಕೆದಾರರು ಮಾತನಾಡುತ್ತಲೇ ಇರುವಾಗ, ಮಾಡೆಲ್ ಸಂಭವನೀಯ ಉದ್ದೇಶವನ್ನು (intent) ಊಹಿಸುತ್ತದೆ ಮತ್ತು ಮುಂಚಿತವಾಗಿ ಬ್ಯಾಕೆಂಡ್ ಅನ್ನು ಪ್ರಶ್ನಿಸುತ್ತದೆ. ಒಂದು ವೇಳೆ ಊಹೆ ಸರಿಯಾಗಿದ್ದರೆ, ಬಳಕೆದಾರರು ಮಾತನಾಡುವುದನ್ನು ಮುಗಿಸಿದ ತಕ್ಷಣ ಉತ್ತರ ಸಿದ್ಧವಾಗಿರುತ್ತದೆ; ಒಂದು ವೇಳೆ ತಪ್ಪಾಗಿದ್ದರೆ, ಫಾಲ್‌ಬ್ಯಾಕ್ (fallback) ಕೂಡ ವೇಗವಾಗಿ ಬರುತ್ತದೆ.

ಅಂಕಿಅಂಶಗಳು ಏನು ತೋರಿಸುತ್ತವೆ ಮತ್ತು ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಓವರ್‌ಲ್ಯಾಪಿಂಗ್ ವಿನ್ಯಾಸದೊಂದಿಗೆ, ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆಯ ಸಮಯವು 1.8 ಸೆಕೆಂಡ್‌ಗಿಂತ ಕಡಿಮೆಯಾಯಿತು ಮತ್ತು ಅಪಾಯಿಂಟ್‌ಮೆಂಟ್ ಕನ್ವರ್ಷನ್ ದರಗಳು 30% ಹೆಚ್ಚಿದವು.

ಈ ವಿಧಾನವು ಸಂಕೀರ್ಣತೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ: ಸಮಾಂತರ ಸ್ಟ್ರೀಮ್‌ಗಳು ಮತ್ತು ಸ್ಪೆಕ್ಯುಲೇಟಿವ್ ಕ್ವೇರಿಗಳು ಹೆಚ್ಚಿನ ಕಂಪ್ಯೂಟ್ ಶಕ್ತಿಯನ್ನು ಬಳಸುತ್ತವೆ ಮತ್ತು ಮುನ್ಸೂಚನೆಗಳು ತಪ್ಪಾದಾಗ ಎಚ್ಚರಿಕೆಯ ದೋಷ ನಿರ್ವಹಣೆಯನ್ನು (error handling) ಬಯಸುತ್ತವೆ. ಇದೇ ಹಾದಿಯನ್ನು ಅನುಸರಿಸಲು ಬಯಸುವ ತಂಡಗಳು, ಹಾರ್ಡ್‌ವೇರ್ ವೆಚ್ಚ ಮತ್ತು ಬಳಕೆದಾರರ ತೊಡಗಿಸಿಕೊಳ್ಳುವಿಕೆಯಲ್ಲಿ (user engagement) ನಿರೀಕ್ಷಿತ ಹೆಚ್ಚಳದ ನಡುವೆ ಸಮತೋಲನವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಬೇಕು.