ಸಿಯೋಲ್‌ನಲ್ಲಿರುವ ಪೂರೈಕೆದಾರರೊಂದಿಗೆ ಅಥವಾ ಸಾਓ ಪಾಲೊದಲ್ಲಿರುವ ಗ್ರಾಹಕರೊಂದಿಗೆ ವೀಡಿಯೊ ಕಾಲ್ ಮಾಡುವಾಗ, ನಿಮ್ಮ ಪಕ್ಕದ ಕೋಣೆಯಲ್ಲಿರುವ ಸಹೋದ್ಯೋಗಿಯೊಂದಿಗೆ ಮಾತನಾಡುವಂತೆಯೇ ಮಾತನಾಡುತ್ತಿದ್ದೀರಿ ಎಂದು ಕಲ್ಪಿಸಿಕೊಳ್ಳಿ. ಮ್ಯೂಟ್‌ನಲ್ಲಿ ಕಾಯುತ್ತಿರುವ ಯಾವುದೇ ಅನುವಾದಕರಿಲ್ಲ. ಚಾಟ್ ಬಾಕ್ಸ್‌ನಲ್ಲಿ ಟೈಪ್ ಮಾಡಲು ಕೀಬೋರ್ಡ್ ಮುಂದೆ ಬಾಗಿದವರೂ ಇಲ್ಲ. ರಿಯಲ್-ಟೈಮ್ AI ಧ್ವನಿ ಅನುವಾದವು ಈಗ ಇದನ್ನು ಸಾಧ್ಯವಾಗಿಸುತ್ತಿದೆ. ಇದು ಮಾನವ ಸಂಬಂಧವನ್ನು ಬದಲಿಸುವ ಬದಲು, ಜನರನ್ನು ದೂರವಿಡುವ ಅಡೆತಡೆಗಳನ್ನು ನಿವಾರಿಸುತ್ತದೆ. ಆದರೆ ನೈಸರ್ಗಿಕ ಸಂಭಾಷಣೆಯಂತೆ ಭಾಸವಾಗುವ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸುವುದು ನಿಜವಾಗಿಯೂ ಕಷ್ಟದ ಕೆಲಸ. ನೀವು ಕೇವಲ ಪದಗಳನ್ನು ಪರಿವರ್ತಿಸುತ್ತಿಲ್ಲ; ನೀವು ಸಾಫ್ಟ್‌ವೇರ್‌ನೊಳಗೆ ಮಾನವನ ಮಾತಿನ ಹರಿವನ್ನು ಮರುನಿರ್ಮಾಣ ಮಾಡುತ್ತಿದ್ದೀರಿ.

ಪೈಪ್‌ಲೈನ್‌ನ ಐದು ಪದರಗಳು (The Five Layers of the Pipeline)

ಒಂದು ಕಾರ್ಯನಿರ್ವಹಿಸುವ ವ್ಯವಸ್ಥೆಯು ಐದು ವಿಭಿನ್ನ ಭಾಗಗಳಾಗಿ ವಿಂಗಡಿಸಲ್ಪಟ್ಟಿದೆ. ಒಂದನ್ನು ಬಿಟ್ಟರೆ ಅಥವಾ ದುರ್ಬಲಗೊಳಿಸಿದರೆ, ಇಡೀ ಭ್ರಮೆ ಮುರಿದುಬೀಳುತ್ತದೆ.

Voice Communication Layer ಮೂಲಾಧಾರವಾಗಿದೆ. ಇದು ಮೈಕ್ರೊಫೋನ್ ಕ್ಯಾಪ್ಚರ್, ನಾಯ್ಸ್ ಸಪ್ರೆಷನ್ (noise suppression), ಎಕೋ ಕ್ಯಾನ್ಸಲೇಶನ್ (echo cancellation) ಮತ್ತು ಇಂಟರ್ನೆಟ್ ಮೂಲಕ ಪ್ಯಾಕೆಟ್ ವರ್ಗಾವಣೆಯನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ. ಇದನ್ನು ಡಿಜಿಟಲ್ ಫೋನ್ ಲೈನ್ ಎಂದು ಭಾವಿಸಿ. ಈ ಪದರವು ಪ್ಯಾಕೆಟ್‌ಗಳನ್ನು ಕಳೆದುಕೊಂಡರೆ ಅಥವಾ ಜಿಟ್ಟರ್ (jitter) ಉಂಟುಮಾಡಿದರೆ, ಉಳಿದ ಪೈಪ್‌ಲೈನ್ ಕೆಲಸ ಮಾಡುವುದು ಕಷ್ಟವಾಗುತ್ತದೆ. ಹೆಚ್ಚಿನ ತಂಡಗಳು ಇಲ್ಲಿ WebRTC ಅನ್ನು ಬಳಸುತ್ತವೆ ಏಕೆಂದರೆ ಇದು ಪೀರ್-ಟು-ಪೀರ್ (peer-to-peer) ಸಂಪರ್ಕಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ ಮತ್ತು ಅಂತರ್ಗತ ಅಕೌಸ್ಟಿಕ್ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳನ್ನು ಒಳಗೊಂಡಿದೆ.

ನಂತರ ಬರುವುದು Speech-to-Text (STT). ನೀವು ಬರುವ ಧ್ವನಿಯನ್ನು ಸಾಧ್ಯವಾದಷ್ಟು ವೇಗವಾಗಿ ಬರವಣಿಗೆಯ ಪದಗಳಾಗಿ ಪರಿವರ್ತಿಸಬೇಕಾಗುತ್ತದೆ. ಸ್ಟ್ರೀಮಿಂಗ್ STT ಇಂಜಿನ್‌ಗಳು ಮೌನಕ್ಕಾಗಿ ಕಾಯುವುದಿಲ್ಲ. ಅವು ಅಕ್ಷರಗಳು ಬರುವಂತೆ ಭಾಗಶಃ ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟ್‌ಗಳನ್ನು ನೀಡುತ್ತವೆ. ಈ ವರ್ತನೆಯು ಅತ್ಯಗತ್ಯ. ನಿಮ್ಮ STT ಮಾಡ್ಯೂಲ್ ವಿರಾಮಕ್ಕಾಗಿ ಕಾಯುತ್ತಿದ್ದರೆ, ನೀವು ಈಗಾಗಲೇ ಅಮೂಲ್ಯವಾದ ಮಿಲಿಸೆಕೆಂಡುಗಳನ್ನು ವ್ಯರ್ಥ ಮಾಡಿದ್ದೀರಿ ಎಂದರ್ಥ. ಆಧುನಿಕ ಸ್ಟ್ರೀಮಿಂಗ್ ಅನುಷ್ಠಾನಗಳು ಬರುವ ಆಡಿಯೊವನ್ನು ನಿರಂತರವಾಗಿ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತವೆ ಮತ್ತು ಹೆಚ್ಚಿನ ಸಂದರ್ಭಗಳು (context) ಲಭ್ಯವಾದಂತೆ ತಮ್ಮ ಅಂದಾಜುಗಳನ್ನು ತಿದ್ದಿಕೊಳ್ಳುತ್ತವೆ.

Machine Translation (MT) ಮಧ್ಯಭಾಗದಲ್ಲಿದೆ. ಇದು ಕಚ್ಚಾ ಪಠ್ಯವನ್ನು ಪಡೆದು ಅದನ್ನು ಗುರಿ ಭಾಷೆಯಲ್ಲಿ ಮರುಬರೆಯುತ್ತದೆ. ಆರಂಭಿಕ ವ್ಯವಸ್ಥೆಗಳು ಪದಗಳ ಬದಲಾವಣೆಯಷ್ಟೇ ಮಾಡುತ್ತಿದ್ದವು. ಪ್ರಸ್ತುತ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್ ಆಧಾರಿತ ಮಾಡೆಲ್‌ಗಳು ಸಿಂಟ್ಯಾಕ್ಸ್ (syntax) ಮತ್ತು ದೀರ್ಘ ವ್ಯಾಪ್ತಿಯ ಅವಲಂಬನೆಗಳನ್ನು ಉತ್ತಮವಾಗಿ ನಿರ್ವಹಿಸುತ್ತವೆ, ಆದರೆ ಅವುಗಳಿಗೆ ಎಚ್ಚರಿಕೆಯ ಸಂಯೋಜನೆಯ ಅಗತ್ಯವಿದೆ. ಮಾತನಾಡುವವರು ಆಲೋಚನೆಯನ್ನು ಪೂರ್ಣಗೊಳಿಸುವ ಮೊದಲೇ ವಾಕ್ಯದ ತುಣುಕುಗಳನ್ನು ಅನುವಾದಿಸಲು ಪ್ರಾರಂಭಿಸಲು, ಸ್ಟ್ರೀಮಿಂಗ್ ಇನ್‌ಪುಟ್ ಅನ್ನು ಸ್ವೀಕರಿಸುವ MT ಮಾಡ್ಯೂಲ್ ನಿಮಗೆ ಬೇಕು.

ನಂತರ Text-to-Speech (TTS) ಇದೆ. ಇಲ್ಲಿ ನಿಮ್ಮ ವ್ಯವಸ್ಥೆಯು ತನ್ನ ಧ್ವನಿಯನ್ನು ಕಂಡುಕೊಳ್ಳುತ್ತದೆ. ಹಳೆಯ ಕಾಂಕಟನೇಟಿವ್ (concatenative) TTS ವ್ಯವಸ್ಥೆಗಳು ಫ್ರೀವೇ ಎಕ್ಸಿಟ್ ಪ್ರಕಟಿಸುವ GPS ನಂತೆ ಕೇಳಿಸುತ್ತಿದ್ದವು. ನ್ಯೂರಲ್ TTS ಮಾಡೆಲ್‌ಗಳು ಸ್ಪೆಕ್ಟ್ರೋಗ್ರಾಮ್‌ಗಳನ್ನು ಅಥವಾ ನೇರ ವೇವ್‌ಫಾರ್ಮ್‌ಗಳನ್ನು ಮುನ್ಸೂಚಿಸುವ ಮೂಲಕ ಈ ಆಟವನ್ನೇ ಬದಲಿಸಿವೆ. ಅವು ಏರಿಳಿತ ಮತ್ತು ಉಸಿರಾಟದ ಲಯವಿರುವ ಧ್ವನಿಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತವೆ. ಅವು ಭಾವನಾತ್ಮಕ ಬಣ್ಣವನ್ನು ಸಹ ಉಳಿಸಿಕೊಳ್ಳಬಲ್ಲವು, ಇದು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ರೋಬೋಟಿಕ್ ಧ್ವನಿಯಲ್ಲಿ ಕ್ಷಮೆಯಾಚಿಸುವುದು ಅಕಸ್ಮಾತ್ ವ್ಯಂಗ್ಯದಂತೆ ಕೇಳಿಸಬಹುದು.

ಕೊನೆಯದಾಗಿ, Audio Streaming ಪದರವು ಅನುವಾದಿತ ಮಾತನ್ನು ಕೇಳುವವರಿಗೆ ಮರಳಿ ಕಳುಹಿಸುತ್ತದೆ. ಇಲ್ಲಿ ಸಮಯದ ನಿರ್ವಹಣೆ ಕೂಡ ಮುಖ್ಯವಾಗಿದೆ. ಸಂಶ್ಲೇಷಿತ ಆಡಿಯೊವು ನೆಟ್‌ವರ್ಕ್ ಸಮಯಕ್ಕೆ ಅನುಗುಣವಾಗಿರಬೇಕು, ಇಲ್ಲದಿದ್ದರೆ ಅದು ಬೇಗನೆ ಬಂದು ಎಕೋ (echo) ಸೃಷ್ಟಿಸಬಹುದು ಅಥವಾ ತಡವಾಗಿ ಬಂದು ಕೇಳುವವರನ್ನು ಮೌನದಲ್ಲಿ ಕಾಯುವಂತೆ ಮಾಡಬಹುದು.

ವಿಳಂಬದ ಸಮಸ್ಯೆ (The Latency Problem)

ವಿಳಂಬ (Latency) ನಿಮ್ಮ ದೊಡ್ಡ ಶತ್ರು. ಮಾನವ ಸಂಭಾಷಣೆಯು ಕೇವಲ ಅಲ್ಪ ಕಾಲದ ವಿರಾಮಗಳನ್ನು ಮಾತ್ರ ಸಹಿಸಿಕೊಳ್ಳುತ್ತದೆ. ಬಳಕೆದಾರರು ಇಡೀ ವಾಕ್ಯವನ್ನು ಮುಗಿಸುವವರೆಗೆ ವ್ಯವಸ್ಥೆಯು ಅನುವಾದಿಸಲು ಕಾಯುತ್ತಿದ್ದರೆ, ಸಂವಹನವು ನಿಧಾನ ಮತ್ತು ಅಸ್ತವ್ಯಸ್ತವಾಗಿ ಕಾಣುತ್ತದೆ. ಜನರು ಒಬ್ಬರ ಮಾತು ಇನ್ನೊಬ್ಬರ ಮಾತು ಮಧ್ಯೆ ತಡೆಯಲು ಪ್ರಾರಂಭಿಸುತ್ತಾರೆ ಅಥವಾ ವಾಕಿ-ಟಾಕಿ ಮಾತುಕತೆಯಂತಹ ಏಕತಾನತೆಯ ಲಯಕ್ಕೆ ಬಲಿಯಾಗುತ್ತಾರೆ. ನಿಮ್ಮ ಗುರಿ ಇಡೀ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ ಒಟ್ಟು ವಿಳಂಬವು ಒಂದು ಸೆಕೆಂಡಿಗಿಂತ ಕಡಿಮೆ ಇರಬೇಕು.

ಆ ಗುರಿಯನ್ನು ತಲುಪಲು, ನೀವು ಆಡಿಯೊವನ್ನು ಸಣ್ಣ ತುಣುಕುಗಳಲ್ಲಿ (chunks) ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬೇಕು. ಚಂಕ್ ಗಾತ್ರವನ್ನು 20 ಮಿಲಿಸೆಕೆಂಡು ಮತ್ತು 100 ಮಿಲಿಸೆಕೆಂಡುಗಳ ನಡುವೆ ಇರಿಸಿ. ಇಪ್ಪತ್ತು ಮಿಲಿಸೆಕೆಂಡುಗಳು ಸರಿಸುಮಾರು ಒಂದು ವ್ಯಂಜನ ಧ್ವನಿಯ ಅವಧಿಯನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ. ನೂರು ಮಿಲಿಸೆಕೆಂಡುಗಳು ಸುಮಾರು ಒಂದೂವರೆ ಸಿಲಬಲ್ (syllable) ಅನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ. ಈ ಚಂಕ್‌ಗಳನ್ನು ಸ್ಟ್ರೀಮಿಂಗ್ ಪೈಪ್‌ಲೈನ್‌ಗೆ ನೀಡಿ, ಇದರಿಂದ STT, ಅನುವಾದ ಮತ್ತು TTS ಎಲ್ಲವೂ ಭಾಗಶತ್ ಮಾಹಿತಿಯ ಮೇಲೆ ಕೆಲಸ ಮಾಡಬಹುದು. ಯಾವುದೇ ವಾಕ್ಯದ ಅಂತ್ಯಕ್ಕಾಗಿ ಕಾಯಬಾರದು.

ಪ್ರತಿ ಹಂತದಲ್ಲೂ ಸ್ಟ್ರೀಮಿಂಗ್ ಆಡಿಯೊ ಪ್ರೊಸೆಸಿಂಗ್ ಬಳಸಿ. ಅಂದರೆ STT ಇಂಜಿನ್ ನಿರಂತರವಾಗಿ ಭಾಗಶತ್ ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟ್‌ಗಳನ್ನು ನೀಡುತ್ತದೆ, MT ಇಂಜಿನ್ ಒಂದು ಅರ್ಥಪೂರ್ಣ ವಾಕ್ಯ ರಚಿಸಲು ಬೇಕಾದಷ್ಟು ಪದಗಳು ಸಿಕ್ಕ ತಕ್ಷಣ ತುಣುಕುಗಳನ್ನು ಅನುವಾದಿಸುತ್ತದೆ ಮತ್ತು ಎರಡನೇ ಅರ್ಧದ ಭಾಗ ಇನ್ನೂ ಡಿಕೋಡ್ ಆಗುತ್ತಿರುವಾಗಲೇ TTS ಇಂಜಿನ್ ವಾಕ್ಯದ ಮೊದಲಾರ್ಧವನ್ನು ಮಾತನಾಡಲು ಪ್ರಾರಂಭಿಸುತ್ತದೆ.

ಸೆಕೆಂಡಿಗಿಂತ ಕಡಿಮೆ ವಿಳಂಬವನ್ನು ಸಾಧಿಸಲು ಕ್ಯಾಪ್ಚರ್, ಎನ್‌ಕೋಡ್, ಟ್ರಾನ್ಸ್‌ಮಿಟ್, ಕ್ಯೂ (queue), ಪ್ರೊಸೆಸ್, ಸಿಂಥೆಸೈಸ್ ಮತ್ತು ಪ್ಲೇಬ್ಯಾಕ್ ಹೀಗೆ ಪ್ರತಿ ಹಂತದಲ್ಲೂ ಶಿಸ್ತು ಅಗತ್ಯವಿದೆ. ಪ್ರತಿ ಹಂತದಲ್ಲೂ ಅನಗತ್ಯ ಬಫರಿಂಗ್ ಅನ್ನು ತೆಗೆದುಹಾಕಿ. ಉದಾಹರಣೆಗೆ, ಅತ್ಯಗತ್ಯವಲ್ಲದಿದ್ದರೆ ಅರ್ಧ ಸೆಕೆಂಡ್ ಮುಂಚಿತವಾಗಿ ನೋಡುವ (lookahead) ಅಗತ್ಯವಿರುವ ನಾಯ್ಸ್-ರಿಮೂವಲ್ ಅಲ್ಗಾರಿದಮ್‌ಗಳನ್ನು ಬಳಸಬೇಡಿ. ರೊ (raw) PCM ಬದಲಿಗೆ Opus ನಂತಹ ದಕ್ಷ ಕಂಪ್ರೆಶನ್ ಪ್ರೊಟೊಕಾಲ್‌ಗಳನ್ನು ಬಳಸಿ. ನೆಟ್‌ವರ್ಕ್ ರೌಂಡ್ ಟ್ರಿಪ್‌ಗಳು ಕಡಿಮೆಯಿರಲು ಕರೆ ಮಾಡುವ ಇಬ್ಬರಿಗೂ ಭೌಗೋಳಿಕವಾಗಿ ಹತ್ತಿರವಿರುವ ಎಡ್ಜ್ ಸರ್ವರ್‌ಗಳಲ್ಲಿ (edge servers) ಇನ್‌ಫರೆನ್ಸ್ (inference) ನಡೆಸುವಿ.

ಎಐ ಮಾಡೆಲ್‌ಗಳು ಎಲ್ಲಿ ಇನ್ನೂ ಕಷ್ಟಪಡುತ್ತಿವೆ (Where AI Models Still Struggle)

ಕ್ಲಿಪ್‌ಬೋರ್ಡ್ ಅನುವಾದಕರು ಎದುರಿಸದ ನಿರ್ದಿಷ್ಟ ಸವಾಲುಗಳನ್ನು ಎಐ ತರುತ್ತದೆ.

ಸಂದರ್ಭವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ನಿಜವಾಗಿಯೂ ಕಷ್ಟಕರವಾಗಿದೆ. ಇಂಗ್ಲಿಷ್‌ನಲ್ಲಿ, 'duck' ಎಂಬ ಪದವು ಒಂದು ಪ್ರಾಣಿಯಾಗಿರಬಹುದು, ತಲೆ ತಗ್ಗಿಸುವುದನ್ನು ಸೂಚಿಸುವ ಕ್ರಿಯಾಪದವಾಗಿರಬಹುದು ಅಥವಾ ಕೆಲವು ಉಪಭಾಷೆಗಳಲ್ಲಿ ಪ್ರೀತಿಯಿಂದ ಕರೆಯುವ ಪದವಾಗಿರಬಹುದು. ಪದವನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ನೋಡುವ ಇಂಜಿನ್ ತಪ್ಪಾಗಿ ಊಹಿಸಬಹುದು. ಸ್ಟ್ರೀಮಿಂಗ್ ಆಂಪ್ಲಿಫಿಕೇಶನ್ (streaming amplification) ಇದನ್ನು ಇನ್ನಷ್ಟು ಕಷ್ಟವಾಗಿಸುತ್ತದೆ ಏಕೆಂದರೆ ಪೂರ್ಣ ವಾಕ್ಯವು ಅದರ ಅರ್ಥವನ್ನು ಸ್ಪಷ್ಟಪಡಿಸುವ ಮೊದಲು ವ್ಯವಸ್ಥೆಯು ಒಂದು ಪದಕ್ಕೆ ಬದ್ಧವಾಗಿರಬೇಕಾಗುತ್ತದೆ. ಕೆಲವು ತಂಡಗಳು STT ಇಂಜಿನ್‌ನಲ್ಲಿ ಸಣ್ಣ ರೋಲ್‌ಬ್ಯಾಕ್ ವಿಂಡೋಗಳನ್ನು (rollback windows) ನಿರ್ಮಿಸುವ ಮೂಲಕ ಇದನ್ನು ಪರಿಹರಿಸುತ್ತವೆ, ಇದರಿಂದ ನಂತರದ ಆಡಿಯೋ ಅರ್ಥವನ್ನು ಬದಲಾಯಿಸಿದರೆ ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಟ್ ಅನ್ನು ತಿದ್ದುಪಡಿ ಮಾಡಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

ಎಂಜಿನಿಯರ್‌ಗಳು ನಿರೀಕ್ಷಿಸುವುದಕ್ಕಿಂತ ಧ್ವನಿಯ ನೈಸರ್ಗಿಕತೆ ಹೆಚ್ಚು ಮುಖ್ಯವಾಗಿದೆ. ಜನರಿಗೆ ಯಾಂತ್ರಿಕ ಶಬ್ದಗಳು ಇಷ್ಟವಾಗುವುದಿಲ್ಲ. ನ್ಯೂರಲ್ TTS ಮಾಡೆಲ್‌ಗಳು ಮಾನವನ ಮಾತಿನ ಪ್ರೊಸೋಡಿ ಮಾದರಿಗಳನ್ನು (prosody patterns) ಕ್ಲೋನ್ ಮಾಡುವ ಮೂಲಕ ಧ್ವನಿಯಲ್ಲಿ ಭಾವನೆಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತವೆ. ಮೂಲ ಸ್ಪೀಕರ್ ಉತ್ಸುಕರಾಗಿ ಅಥವಾ ಕಳವಳಗೊಂಡಂತೆ ಕೇಳಿಸಿದರೆ, ಅನುವಾದಿತ ಔಟ್‌ಪುಟ್ ಹವಾಮಾನ ವರದಿಯಂತೆ ಪ್ರತಿಯೊಂದು ಸಾಲನ್ನು ಹೇಳುವ ಬದಲು ಆ ಶಕ್ತಿಯನ್ನು ಹೊಂದಿರಬೇಕು. ಮೂಲ ಆಡಿಯೋದಿಂದ ವಿರಾಮ ಚಿಹ್ನೆಗಳ ಸೂಚನೆಗಳನ್ನು ಅಥವಾ ಸ್ವರದ ಏರಿಳಿತದ ಸೂಚಕಗಳನ್ನು (intonation markers) TTS ಮಾಡ್ಯೂಲ್‌ಗೆ ವರ್ಗಾಯಿಸುವುದು ಆ ಮಾನವೀಯ ಸ್ಪರ್ಶವನ್ನು ಉಳಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.

ಸಂಭಾಷಣೆಗಳು ಅಸ್ತವ್ಯಸ್ತವಾಗಿರುತ್ತವೆ. ಜನರು ಒಬ್ಬರನ್ನೊಬ್ಬರು ಮಧ್ಯಪ್ರವೇಶಿಸುತ್ತಾರೆ, ಹಿಂದಕ್ಕೆ ಹೋಗುತ್ತಾರೆ, "ಅಹ್" ಎಂದು ಹೇಳುತ್ತಾರೆ ಮತ್ತು ಅರ್ಧಕ್ಕೆ ನಿಲ್ಲಿಸಿದ ವಾಕ್ಯಗಳನ್ನು ಪ್ರಾರಂಭಿಸುತ್ತಾರೆ. ಇಂತಹ ವಿರಾಮಗಳನ್ನು ಬುದ್ಧಿವಂತಿಕೆಯಿಂದ ನಿರ್ವಹಿಸಲು ನಿಮ್ಮ ವ್ಯವಸ್ಥೆಗೆ Voice Activity Detection (VAD) ಅಗತ್ಯವಿದೆ. ಉತ್ತಮ VAD ನಿಜವಾದ ಮಾತು ಮತ್ತು ಹಿನ್ನೆಲೆ ಶಬ್ದದ ನಡುವೆ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರುತಿಸುತ್ತದೆ, ಹಾಗೆಯೇ ಒಂದು ಮಾತಿನ ನಡುವಿನ ಸಣ್ಣ ವಿರಾಮ ಮತ್ತು ಮಾತಿನ ನಿಜವಾದ ಅಂತ್ಯದ ನಡುವೆಯೂ ವ್ಯತ್ಯಾಸ ಮಾಡುತ್ತದೆ. VAD ಅತಿಯಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸಿದರೆ (too trigger-happy), ಅದು ಉತ್ತರಗಳ ಆರಂಭವನ್ನು ಕತ್ತರಿಸುತ್ತದೆ. ಅದು ಅತಿಯಾದ ಎಚ್ಚರಿಕೆಯಿಂದ ಇದ್ದರೆ, ಅದು ಮೌನವನ್ನು ಅನುವಾದ ಇಂಜಿನ್ ಮೂಲಕ ಕಳುಹಿಸುತ್ತದೆ, ಇದರಿಂದ ಕಂಪ್ಯೂಟ್ ಶಕ್ತಿ ವ್ಯರ್ಥವಾಗುತ್ತದೆ ಮತ್ತು ಸಂಭಾಷಣೆಯ ಹರಿವಿನಲ್ಲಿ ವಿಚಿತ್ರ ಅಂತರಗಳು ಉಂಟಾಗುತ್ತವೆ.

ಸ್ಕೇಲ್ ಮತ್ತು ಸೆಕ್ಯೂರಿಟಿ

ಮೊದಲ ವಾಸ್ತುಶಿಲ್ಪದ ಕರಡಿನಿಂದಲೇ ಸ್ಕೇಲಿಂಗ್‌ಗಾಗಿ (scale) ಸಿದ್ಧರಾಗಿ ನಿರ್ಮಿಸಿ. ಒಂದೇ ಕರೆಯನ್ನು ಸುಗಮವಾಗಿ ಅನುವಾದಿಸುವ ಮೊನೊಲಿತ್ (monolith) ವ್ಯವಸ್ಥೆಯು, ಸಾವಿರಾರು ಏಕಕಾಲಿಕ ಸಂಭಾಷಣೆಗಳ ಹೊರೆಯನ್ನು ತಡೆದುಕೊಳ್ಳಲಾಗದೆ ಕುಸಿಯಬಹುದು. ಪ್ರತಿಯೊಂದು ಹಂತವನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ಸ್ಕೇಲ್ ಮಾಡಲು ಮೈಕ್ರೋಸರ್ವಿಸಸ್ (microservices) ಬಳಸಿ. ಒಂದು ಭಾಷೆಯು ಇನ್ನೊಂದಕ್ಕಿಂತ ಹೆಚ್ಚು ಫೋನೆಟಿಕ್ ಸಂಕೀರ್ಣತೆಯನ್ನು ಬಯಸುವ ಕಾರಣ ನಿಮ್ಮ TTS ಕ್ಯೂ (queue) ವಿಳಂಬವಾದರೆ, ನೀವು STT ಕ್ಲಸ್ಟರ್ ಅನ್ನು ಮುಟ್ಟದೆಯೇ ಹೆಚ್ಚಿನ TTS ವರ್ಕರ್ಸ್‌ಗಳನ್ನು ಬಳಸಬಹುದು. ನಿಮ್ಮ MT ಸೇವೆ ನಿರ್ದಿಷ್ಟ ಭಾಷಾ ಜೋಡಿಯ ಮೇಲೆ ವಿಫಲವಾದರೆ, ನೀವು ಆ ಘಟಕವನ್ನು ಮಾತ್ರ ಪ್ರತ್ಯೇಕಿಸಿ ಸ್ಕೇಲ್ ಮಾಡಬಹುದು.

ಭದ್ರತೆಯ ವಿಷಯದಲ್ಲಿ ಯಾವುದೇ ರಾಜಿ ಮಾಡಿಕೊಳ್ಳುವಂತಿಲ್ಲ. ಧ್ವನಿ ಡೇಟಾವು ಬಯೋಮೆಟ್ರಿಕ್ ಮತ್ತು ಅತ್ಯಂತ ವೈಯಕ್ತಿಕವಾದುದು. ಸಂಚಾರದಲ್ಲಿರುವ ಕಚ್ಚಾ ಆಡಿಯೋವನ್ನು ರಕ್ಷಿಸಲು ಎಂಡ್-ಟು-ಎಂಡ್ ಎನ್‌ಕ್ರಿಪ್ಶನ್ ಬಳಸಿ. ಮಾಡೆಲ್ ಸುಧಾರಣೆಗಾಗಿ ಬಳಕೆದಾರರ ಸ್ಪಷ್ಟ ಸಮ್ಮತಿಯಂತಹ ನಿರ್ದಿಷ್ಟ ಮತ್ತು ಬಹಿರಂಗ ಕಾರಣವಿಲ್ಲದ ಹೊರತು ಕಚ್ಚಾ ಧ್ವನಿ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಬೇಡಿ. ಹಾಗಿದ್ದರೂ ಸಹ, ರೆಕಾರ್ಡಿಂಗ್‌ಗಳನ್ನು ಎನ್‌ಕ್ರಿಪ್ಟ್ ಮಾಡಿ ಸಂಗ್ರಹಿಸಿ ಮತ್ತು ಕಟ್ಟುನಿಟ್ಟಾದ ವೇಳಾಪಟ್ಟಿಯಂತೆ ಅವುಗಳನ್ನು ಅಳಿಸಿಹಾಕಿ. ಕರೆಯ ವಿಷಯವನ್ನು ಸೋರಿಕೆ ಮಾಡುವ ಅಥವಾ ರಹಸ್ಯವಾಗಿ ಸಂಭಾಷಣೆಗಳನ್ನು ಇಟ್ಟುಕೊಳ್ಳುವ ಧ್ವನಿ ಅನುವಾದ ವ್ಯವಸ್ಥೆಯು ಬಳಕೆದಾರರ ನಂಬಿಕೆಯನ್ನು ಶಾಶ್ವತವಾಗಿ ನಾಶಪಡಿಸುತ್ತದೆ.

ನಿರ್ಮಾಣ ಪ್ರಾರಂಭಿಸಿ

ಡೆವಲಪರ್‌ಗಳಿಗೆ ಈಗ ಓಪನ್-ಸೋರ್ಸ್ STT ಮಾಡೆಲ್‌ಗಳು, ಕ್ಲೌಡ್-ಆಧಾರಿತ MT APIಗಳು ಮತ್ತು ಪೂರ್ವ-ತರಬೇತಿ ಪಡೆದ ನ್ಯೂರಲ್ TTS ಚೆಕ್‌ಪಾಯಿಂಟ್‌ಗಳು ಲಭ್ಯವಿವೆ, ಇವುಗಳನ್ನು ಕೆಲವು ವರ್ಷಗಳ ಹಿಂದೆಯೇ ಕಂಡುಹಿಡಿಯುವುದು ಅಸಾಧ್ಯವಾಗಿತ್ತು. ಅಗತ್ಯವಿರುವ ಎಲ್ಲಾ ಭಾಗಗಳು ಲಭ್ಯವಿವೆ. ವಾಸ್ತುಶಿಲ್ಪವು ಅರ್ಥವಾಗುವಂತಿದೆ.

ಸಣ್ಣದಾಗಿ ಪ್ರಾರಂಭಿಸಿ. ಮೈಕ್ರೊಫೋನ್ ಆಡಿಯೋದ ಎರಡು ಸೆಕೆಂಡುಗಳನ್ನು ಸ್ಟ್ರೀಮಿಂಗ್ STT ಇಂಜಿನ್ ಮೂಲಕ ಕಳುಹಿಸಿ.