ಒಂದು ಕ್ರಾಸ್-ಮೋಡಲ್ knowledge-distillation ಚೌಕಟ್ಟು ಬಹುಭಾಷಾ ಸಿಬ್ಬಂದಿಗಾಗಿ ಸಾಫ್ಟ್-ರೋಬೋಟಿಕ್ಸ್ ನಿರ್ವಹಣಾ ಸಮಯವನ್ನು 34% ರಷ್ಟು ಕಡಿಮೆ ಮಾಡಿದೆ, ಇನ್ಫರೆನ್ಸ್ ಇಂಜಿನ್ ಅನ್ನು 60% ರಷ್ಟು ಕುಗ್ಗಿಸಿದೆ ಮತ್ತು 45 ms ಗಿಂತ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಸೂಚನೆಗಳನ್ನು ನೀಡಿದೆ. ಈ ಕ್ರಾಂತಿಕಾರಿ ಬದಲಾವಣೆ ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ನಮ್ಯ ಪಾಲೀಮರ್ಗಳು ಮತ್ತು ಫ್ಲೂಯಿಡಿಕ್ ಆಕ್ಚುಯೇಟರ್ಗಳಿಂದ ನಿರ್ಮಿಸಲಾದ ಸಾಫ್ಟ್-ರೋಬೋಟ್ಗಳು ಉತ್ಪಾದನೆ, ವೈದ್ಯಕೀಯ ಸಾಧನಗಳು ಮತ್ತು ಅಪಾಯಕಾರಿ ಸ್ಥಳಗಳಲ್ಲಿ ವ್ಯಾಪಿಸುತ್ತಿವೆ, ಆದರೂ ಭಾಷಾ ಅಡೆತಡೆಗಳು ಮತ್ತು ವಿಭಿನ್ನ ಸೆನ್ಸರ್ ಸ್ಟ್ರೀಮ್ಗಳು ಅವುಗಳ ನಿರ್ವಹಣೆಯನ್ನು ಕುಂಠಿತಗೊಳಿಸುತ್ತಿವೆ.
ಸಾಫ್ಟ್-ರೋಬೋಟಿಕ್ಸ್ ನಿರ್ವಹಣೆಯು ಏಕೆ ಮಲ್ಟಿಮೋಡಲ್ ಸಮಸ್ಯೆಯಾಗಿದೆ
ಸಾಫ್ಟ್ ರೋಬೋಟ್ಗಳು ಲೋಹದ ಕೈಗಳಿಗಿಂತ ಭಿನ್ನವಾಗಿವೆ: ಎಲಾಸ್ಟೋಮರ್ಗಳು, ಸಿಲಿಕೋನ್ ಚರ್ಮಗಳು ಮತ್ತು ಅಂತರ್ಗತ ಚಾನಲ್ಗಳು ದ್ರವಗಳನ್ನು ಪಂಪ್ ಮಾಡುತ್ತವೆ. ಮೆಂಬ್ರೇನ್ನಲ್ಲಿನ ಬಿರುಕು, ನ್ಯೂಮ್ಯಾಟಿಕ್ ಲೈನ್ನಲ್ಲಿನ ಸೋರಿಕೆ ಅಥವಾ ಪಂಪ್ನ ಶಬ್ದದಲ್ಲಿನ ಸಣ್ಣ ಬದಲಾವಣೆಯು ತಕ್ಷಣದ ವೈಫಲ್ಯದ ಸಂಕೇತವಾಗಿರಬಹುದು. ಅಂತಹ ಲಕ್ಷಣಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಒಂದಕ್ಕಿಂತ ಹೆಚ್ಚು ಡೇಟಾ ಮೂಲಗಳ ಅಗತ್ಯವಿದೆ.
- ದೃಶ್ಯ (Visual) ಫೀಡ್ಗಳು ಮೇಲ್ಮೈ ವಿರೂಪಗಳು ಅಥವಾ ಬಣ್ಣ ಬದಲಾವಣೆಯನ್ನು ತೋರಿಸುತ್ತವೆ.
- ಸ್ಪರ್ಶ (Tactile) ಸೆನ್ಸರ್ಗಳು ಅನಿರೀಕ್ಷಿತ ಹೊಂದಾಣಿಕೆ ಅಥವಾ ಜಾರುವಿಕೆಯನ್ನು ವರದಿ ಮಾಡುತ್ತವೆ.
- ಧ್ವನಿ (Acoustic) ಮೈಕ್ರೋಫೋನ್ಗಳು ಅಸಹಜ ಪಂಪ್ ಫ್ರೀಕ್ವೆನ್ಸಿಗಳನ್ನು ಸೆರೆಹಿಡಿಯುತ್ತವೆ.
- ಭಾಷಾ (Linguistic) ಇನ್ಪುಟ್ಗಳು ತಂತ್ರಜ್ಞನಿನ ಮಾತೃಭಾಷೆಯಲ್ಲಿ ದುರಸ್ತಿ ಪ್ರಕ್ರಿಯೆಗಳನ್ನು ತಿಳಿಸುತ್ತವೆ.
ಒಬ್ಬ ಸ್ಪ್ಯಾನಿಷ್ ಮಾತನಾಡುವ ಆಪರೇಟರ್ ಪ್ರಮಾಣಿತ ಅನುವಾದ ಮಾದರಿಯಿಂದ ಇಂಗ್ಲಿಷ್ನಲ್ಲಿ ಮಾತ್ರ ಇರುವ ಸೂಚನೆಗಳನ್ನು ಅನುಸರಿಸಿದಾಗ, ಆ ಮಾದರಿಯು ಪಠ್ಯವನ್ನು ಸರಿಯಾಗಿ ನೀಡಿತು ಆದರೆ ಬೆಳೆಯುತ್ತಿರುವ ಬಿರುಕಿನ ದೃಶ್ಯ ಸೂಚನೆಯನ್ನು ಗಮನಿಸತೇ ತಪ್ಪಿತು. ಇದರಿಂದ ದುರಸ್ತಿ ವಿಳಂಬವಾಯಿತು ಮತ್ತು ಶಟ್ಡೌನ್ನಿಂದ ಹಣದ ನಷ್ಟವಾಯಿತು. ಈ ಘಟನೆಯು ಮೂರು ಪರಸ್ಪರ ಸಂಬಂಧಿತ ಸವಾಲುಗಳನ್ನು ಎತ್ತಿ ತೋರಿಸಿತು: ಅಸಮಂಜಸವಾದ ಮೋಡಾಲಿಟಿಗಳು (mismatched modalities), ನೇರ ಅನುವಾದಕ್ಕೆ ಒಳಪಡದ ತಾಂತ್ರಿಕ ಪದಕೋಶ ಮತ್ತು ನೈಜ-ಸಮಯದ ಶಾಪ್-ಫ್ಲೋರ್ ಪ್ರತಿಕ್ರಿಯೆಯ ಅಗತ್ಯತೆ.
ಕ್ರಾಸ್-ಮೋಡಲ್ knowledge distillation ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ
ಸಂಶೋಧಕರು ಏಕಶಿಲಾ (monolithic) AI ಬದಲಿಗೆ ಪ್ರತಿಯೊಂದು ಮೋಡಾಲಿಟಿಯಲ್ಲಿ ಪರಿಣಿತರಾದ "ಟೀಚರ್" ಮಾದರಿಗಳ ಸಮೂಹ ಮತ್ತು ಅವುಗಳ ಒಳನೋಟಗಳನ್ನು ವಿಲೀನಗೊಳಿಸುವ ಲಘುವಾದ "ಸ್ಟೂಡೆಂಟ್" ಮಾದರಿಯನ್ನು ಬಳಸಿದ್ದಾರೆ. ಈ ಪೈಪ್ಲೈನ್ ಮೂರು ಹಂತಗಳನ್ನು ಹೊಂದಿದೆ:
- ಮೋಡಾಲಿಟಿ-ನಿರ್ದಿಷ್ಟ ಟೀಚರ್ಗಳು (Modality-specific teachers) – ದೃಶ್ಯ, ಆಡಿಯೋ ಮತ್ತು ಪಠ್ಯ ಕೋಪರಗಳ ಮೇಲೆ ತರಬೇತಿ ಪಡೆದ ಪ್ರತ್ಯೇಕ ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್ಗಳು. ದೃಶ್ಯ ಟೀಚರ್ ಬಿರುಕುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುತ್ತದೆ, ಆಡಿಯೋ ಟೀಚರ್ ಅಸಹಜ ಪಂಪ್ ಶಬ್ದಗಳನ್ನು ಗುರುತಿಸುತ್ತದೆ ಮತ್ತು ಭಾಷಾ ಟೀಚರ್ ತಾಂತ್ರಿಕ ಕೈಪಿಡಿಗಳನ್ನು ವಿಶ್ಲೇಷಿಸುತ್ತದೆ.
- ಅಲೈನ್ಮೆಂಟ್ ಮಾಡ್ಯೂಲ್ (Alignment module) – ವಿಭಿನ್ನ ಔಟ್ಪುಟ್ಗಳನ್ನು ಹಂಚಿಕೆಯ ಎಂಬೆಡ್ಡಿಂಗ್ ಸ್ಪೇಸ್ಗೆ ಪ್ರಕ್ಷೇಪಿಸುವ ನ್ಯೂರಲ್ ಸೇತುವೆ. ಕಾಂಟ್ರಾಸ್ಟಿವ್ ಲರ್ನಿಂಗ್ (Contrastive learning) ವ್ಯವಸ್ಥೆಯು ಉದಾಹರಣೆಗೆ, ದೃಶ್ಯ ಬಿರುಕನ್ನು ಅದರ ಧ್ವನಿ ಗುಣಲಕ್ಷಣದೊಂದಿಗೆ ಸಂಬಂಧಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ, ಇದರಿಂದ ಎಂಬೆಡ್ಡಿಂಗ್ಗಳು ಕ್ರಾಸ್-ಮೋಡಲ್ ಅರ್ಥವನ್ನು ಸೆರೆಹಿಡಿಯುತ್ತವೆ.
- ಬಹುಭಾಷಾ ಸ್ಟೂಡೆಂಟ್ (Multilingual student) – ಅಲೈನ್ ಮಾಡಿದ ಎಂಬೆಡ್ಡಿಂಗ್ಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಯಾವುದೇ ಬೆಂಬಲಿತ ಭಾಷೆಯಲ್ಲಿ ದುರಸ್ತಿ ಸೂಚನೆಗಳನ್ನು ರಚಿಸುವ ಸಂಕುಚಿತ ಮಾದರಿ. ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ನಾಲಗೆ-ಗ್ರಾಫ್ (knowledge graph) "pneumatic diaphragm" ಅಥವಾ "hydrogel actuator" ನಂತಹ ವಿಶೇಷ ಪದಗಳಿಗೆ ಸರಿಯಾದ ಅನುವಾದಗಳನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಕ್ವಾಂಟೈಸೇಶನ್ (Quantization)—ತೂಕದ ನಿಖರತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು—ಸ್ಟೂಡೆಂಟ್ ಮಾದರಿಯ ಗಾತ್ರವನ್ನು 60% ರಷ್ಟು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಇದು ಕಡಿಮೆ ಕಂಪ್ಯೂಟ್ ಬಜೆಟ್ ಹೊಂದಿರುವ ಎಡ್ಜ್ ಸಾಧನಗಳಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ ಸಿಗುವ 45 ms ಇನ್ಫರೆನ್ಸ್ ವಿಳಂಬವು (inference latency), ಪಂಪ್ ಶಬ್ದಗಳನ್ನು ಕೇಳುತ್ತಾ ಲೈವ್ ಕ್ಯಾಮೆರಾ ಫೀಡ್ ನೋಡುತ್ತಿರುವ ಆಪರೇಟರ್ನ ನೈಜ-ಸಮಯದ ಅಗತ್ಯಗಳನ್ನು ಪೂರೈಸುತ್ತದೆ.
ಕಾರ್ಯಕ್ಷಮತೆಯ ಲಾಭಗಳು ಮತ್ತು ನೈಜ-ಪ್ರಪಂಚದ ಪ್ರಭಾವ
ಒಂದು ಪಾಲುದಾರ ಘಟಕದಲ್ಲಿ ಈ ಚೌಕಟ್ಟನ್ನು ಪೈಲಟ್ ಮಾಡಲಾಯಿತು.
- ಸಮಯದ ಉಳಿತಾಯ: ದೃಶ್ಯ ಮತ್ತು ಧ್ವನಿ ಅಸಹಜತೆಗಳನ್ನು ಒಟ್ಟಿಗೇ ಎತ್ತಿ ತೋರಿಸುವ ತಕ್ಷಣದ, ಭಾಷಾ ಹೊಂದಾಣಿಕೆಯ ಮಾರ್ಗದರ್ಶನದಿಂದಾಗಿ ಬಹುಭಾಷಾ ತಂಡಗಳು ದಿನನಿತ್ಯದ ತಪಾಸಣೆಗಳನ್ನು 34% ವೇಗವಾಗಿ ಪೂರ್ಣಗೊಳಿಸಿದವು.
ಸೆನ್ಸರ್ ಸ್ಟ್ರೀಮ್ಗಳನ್ನು ಭಾಷಾ ಪ್ರಕ್ರಿಯೆಯೊಂದಿಗೆ ವಿಲೀನಗೊಳಿಸುವುದರಿಂದ ಸಾಫ್ಟ್-ರೋಬೋಟಿಕ್ಸ್ ನಿರ್ವಹಣೆಯನ್ನು ಪ್ರತಿಕ್ರಿಯಾತ್ಮಕದಿಂದ (reactive) ಮುನ್ಸೂಚನಾತ್ಮಕವಾಗಿ (predictive) ಬದಲಾಯಿಸಬಹುದು ಎಂದು ಈ ಅಂಕಿಅಂಶಗಳು ತೋರಿಸುತ್ತವೆ.
ಸಂಭಾವ್ಯ ಅನಾನುಕೂಲಗಳು
ಈ ವಿಧಾನವು ಏಕೈಕ ಬೃಹತ್ ಮಾದರಿಯ ಸರಳತೆಯ ಬದಲಿಗೆ ಟೀಚರ್ಗಳು ಮತ್ತು ಅಲೈನ್ಮೆಂಟ್ ಲೇಯರ್ನ ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾದ ಸಂಯೋಜನೆಯನ್ನು ಬಳಸುತ್ತದೆ. ಹಲವಾರು ತಜ್ಞ ಮಾದರಿಗಳನ್ನು ನಿರ್ವಹಿಸುವುದು ಪ್ರತಿ ಮೋಡಾಲಿಟಿಗೂ ಹೆಚ್ಚಿನ ತರಬೇತಿ ಡೇಟಾ ಮತ್ತು ಎಚ್ಚರಿಕೆಯ ವರ್ಷನ್ ಕಂಟ್ರೋಲ್ ಅನ್ನು ಬಯಸುತ್ತದೆ.
ಮುಂದೆ ಏನು?
ಸಾರಾಂಶ: ದೃಶ್ಯ, ಶಬ್ದ ಮತ್ತು ಪಠ್ಯವನ್ನು ಒಟ್ಟಿಗೆ ಕೇಳಲು ಒಂದು ಲೀನ್ (lean) ಬಹುಭಾಷಾ ಮಾದರಿಗೆ ಕಲಿಸುವುದರಿಂದ ಎಂಜಿನಿಯರ್ಗಳು ನಿರ್ವಹಣಾ ಚಕ್ರಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ವೈವಿಧ್ಯಮಯ ಕಾರ್ಯಪಡೆಗಳಿಗೆ ಸಾಫ್ಟ್-ರೋಬೋಟಿಕ್ಸ್ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ತಲುಪಿಸಬಹುದು. ದೊಡ್ಡದಲ್ಲಲ್ಲದೆ, ಸ್ಮಾರ್ಟ್ AI ಭಾಷಾ ಅಂತರ ಮತ್ತು ಸೆನ್ಸರ್ ಸೈಲೋಗಳನ್ನು ನೈಜ ಸಮಯದಲ್ಲಿ ಸೇರಿಸಬಲ್ಲದು ಎಂದು ಈ ವಿಧಾನವು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
