Google DeepMind ತನ್ನ Gemini Robotics 2 ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡುವ ಮೂಲಕ 'embodied AI' (ಭೌತಿಕ ರೂಪದ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ) ನ ಹೊಸ ಯುಗಕ್ಕೆ ಅಧಿಕೃತವಾಗಿ ಪ್ರವೇಶಿಸಿದೆ. ಇದು ಅತ್ಯಾಧುನಿಕ vision-language-action (VLA) ಮಾದರಿಯಾಗಿದೆ. ಈ ಕ್ರಾಂತಿಕಾರಿ ತಂತ್ರಜ್ಞಾನವು ಒಂದು ಸಾರ್ವತ್ರಿಕ ಬುದ್ಧಿಮತ್ತೆಯ ಪದರವಾಗಿ (universal intelligence layer) ಕಾರ್ಯನಿರ್ವಹಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ, ಇದು ವಿವಿಧ ಹಾರ್ಡ್‌ವೇರ್ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ಗಳಲ್ಲಿ ರೋಬೋಟ್‌ಗಳು ಭೌತಿಕ ಪ್ರಪಂಚದಲ್ಲಿ ಸಂಚರಿಸಲು ಮತ್ತು ಸಂವಹನ ನಡೆಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

Vision-Language-Action (VLA) ಮಾದರಿಗಳ ಉದಯ

ಈ ಘೋಷಣೆಯ ಕೇಂದ್ರಬಿಂದು ಸುಧಾರಿತ VLA ಮಾದರಿಗಳತ್ತ ಆಗುತ್ತಿರುವ ಬದಲಾವಣೆಯಾಗಿದೆ. ಕಟ್ಟುನಿಟ್ಟಾದ, ಪೂರ್ವನಿರ್ಧರಿತ ಸೂಚನೆಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುವ ಸಾಂಪ್ರದಾಯಿಕ ರೋಬೊಟಿಕ್ಸ್ ಪ್ರೋಗ್ರಾಮಿಂಗ್‌ನಂತಲ್ಲದೆ, Gemini Robotics 2 ಚಿತ್ರ ಗುರುತಿಸುವಿಕೆ (image recognition), ಭಾಷಾ ಸಂಸ್ಕರಣೆ (language processing) ಮತ್ತು ನೈಜ-ಸಮಯದ ಕ್ರಿಯೆ ನಿಯಂತ್ರಣವನ್ನು (real-time action control) ಸಂಯೋಜಿಸುತ್ತದೆ. ಈ ಸಮನ್ವಯವು ರೋಬೋಟ್ ಕೇವಲ ಒಂದು ವಸ್ತುವನ್ನು "ನೋಡಲು" ಮತ್ತು ಮೌಖಿಕ ಆದೇಶವನ್ನು "ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು" ಮಾತ್ರವಲ್ಲದೆ, ಆ ವಸ್ತುವಿನೊಂದಿಗೆ ಸಂವಹನ ನಡೆಸಲು ಅಗತ್ಯವಿರುವ ನಿಖರವಾದ ಭೌತಿಕ ಚಲನೆಗಳನ್ನು ನಿರ್ವಹಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

DeepMind ನ ಹೊಸ ಆರ್ಕಿಟೆಕ್ಚರ್ ಅತ್ಯಂತ ಬಹುಮುಖವಾಗಿದ್ದು, ವಿವಿಧ ರೂಪರೇಷೆಗಳಿಗೆ (form factors) ಅನುಗುಣವಾಗಿ ವಿಸ್ತರಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ. ಈ ಮಾದರಿಯು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಬಳಸುವ ವಿಶೇಷ ಟೇಬಲ್ ಟಾಪ್ ರೋಬೋಟಿಕ್ ಆರ್ಮ್‌ಗಳಿಂದ ಹಿಡಿದು ಸಂಕೀರ್ಣವಾದ, ಪೂರ್ಣ ದೇಹದ ಹ್ಯೂಮನಾಯ್ಡ್ ರೋಬೋಟ್‌ಗಳವರೆಗೆ ಎಲ್ಲವನ್ನೂ ನಿಯಂತ್ರಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಹೊಂದಿದೆ. ಈ ಸಾಮರ್ಥ್ಯವು, ಒಂದು ಮೂಲಭೂತ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ವಿವಿಧ ಹಾರ್ಡ್‌ವೇರ್‌ಗಳಿಗೆ ವರ್ಗಾಯಿಸಬಹುದಾದ ಭವಿಷ್ಯವನ್ನು ಸೂಚಿಸುತ್ತದೆ, ಇದು ಅನಿಶ್ಚಿತ ಪರಿಸರಗಳಲ್ಲಿ ಸುಧಾರಿತ ರೋಬೊಟಿಕ್ಸ್ ಅನ್ನು ನಿಯೋಜಿಸುವ ಅಡೆತಡೆಗಳನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.

Gemini Robotics ER 2: Embodied Reasoning ಅನ್ನು ಮುನ್ನಡೆಸುವುದು

VLA ಮಾದರಿಗೆ ಪೂರಕವಾಗಿ Gemini Robotics ER 2 ಅನ್ನು ಪರಿಚಯಿಸಲಾಗಿದೆ, ಇದು ವಿಶೇಷವಾಗಿ "embodied reasoning" (ಭೌತಿಕ ತರ್ಕ) ಗಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ ಮಾದರಿಯಾಗಿದೆ. VLA ಮಾದರಿಗಳು ಗ್ರಹಿಕೆ ಮತ್ತು ಕ್ರಿಯೆಯ (perception and action) ಚಕ್ರದ ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸಿದರೆ, ER 2 ಉನ್ನತ ಮಟ್ಟದ ಬೌದ್ಧಿಕ ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವ ಪ್ರಕ್ರಿಯೆಯ ಮೇಲೆ ಗಮನಹರಿಸುತ್ತದೆ—ಅಂದರೆ ಪರಿಸರದ ಭೌತಿಕ ಸೂಕ್ಷ್ಮತೆಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಮತ್ತು ಗುರಿಯನ್ನು ತಲುಪಲು ಅತ್ಯುತ್ತಮ ಕ್ರಿಯೆಗಳ ಅನುಕ್ರಮವನ್ನು ನಿರ್ಧರಿಸುವುದು.

Gemini Robotics ER 2 ಎಂಬುದು ಏಪ್ರಿಲ್‌ನಲ್ಲಿ ಬಿಡುಗಡೆಯಾದ Gemini Robotics ER 1.6 ಮಾದರಿಯ ಉತ್ತರಾಧಿಕಾರಿಯಾಗಿದ್ದು, ಇದು ತರ್ಕ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ ಗಮನಾರ್ಹ ಜಿಗಿತವನ್ನು ಸೂಚಿಸುತ್ತದೆ. ಉನ್ನತ ಮಟ್ಟದ ನಿಯಂತ್ರಣ ವ್ಯವಸ್ಥೆಯಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಮೂಲಕ, ER 2 ರೋಬೋಟ್‌ಗಳು ಸರಳ ಪುನರಾವರ್ತಿತ ಕಾರ್ಯಗಳಿಂದ ಹೊರಬಂದು ನೈಜ ಪ್ರಪಂಚದ ಸಂದರ್ಭಗಳಲ್ಲಿ ಸಂಕೀರ್ಣ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುವತ್ತ ಸಾಗಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಈ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಸಂಯೋಜಿಸಲು ಬಯಸುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ, ER 2 ಈಗಾಗಲೇ Google AI Studio ಮೂಲಕ ಲಭ್ಯವಿದೆ.

AI ವಲಯಕ್ಕೆ ಇದು ಏಕೆ ಮುಖ್ಯ

Gemini Robotics 2 ನ ಅಭಿವೃದ್ಧಿಯು General Purpose Robotics (ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ರೋಬೊಟಿಕ್ಸ್) ಗಾಗಿ ನಡೆಯುತ್ತಿರುವ ಹುಡುಕಾಟದಲ್ಲಿ ಒಂದು ನಿರ್ಣಾಯಕ ಹೆಜ್ಜೆಯಾಗಿದೆ. ವರ್ಷಗಳಿಂದ, ಉದ್ಯಮವು "brittleness" (ದುರ್ಬಲತೆ)—ಅಂದರೆ ಪರಿಸರದಲ್ಲಿನ ಸಣ್ಣ ಬದಲಾವಣೆಗಳನ್ನು ಎದುರಿಸಿದಾಗ ರೋಬೋಟ್‌ಗಳು ವಿಫಲವಾಗುವ ಪ್ರವೃತ್ತಿಯೊಂದಿಗೆ ಹೋರಾಡುತ್ತಿದೆ. Gemini ಕುಟುಂಬದ ಸ್ಕೇಲಿಂಗ್ ನಿಯಮಗಳು ಮತ್ತು transformer-ಆಧಾರಿತ ತರ್ಕವನ್ನು ಭೌತಿಕ ಚಲನೆಗೆ ಅನ್ವಯಿಸುವ ಮೂಲಕ, DeepMind ಹೊಂದಾಣಿಕೆಯ ಸಮಸ್ಯೆಯನ್ನು (adaptability problem) ಪರಿಹರಿಸಲು ಶ್ರಮಿಸುತ್ತಿದೆ.

ಯಶಸ್ವಿಯಾದರೆ, ಈ "intelligence layer" ವಿಧಾನವು ಸಾಫ್ಟ್‌ವೇರ್ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ಹಾರ್ಡ್‌ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನಿಂದ ಬೇರ್ಪಡಿಸಬಹುದು. ಇದು ರೋಬೊಟಿಕ್ಸ್ ನಿಯೋಜನೆಯಲ್ಲಿ ಭಾರಿ ವೇಗವರ್ಧನೆಗೆ ಕಾರಣವಾಗಬಹುದು, ಏಕೆಂದರೆ ಡೆವಲಪರ್‌ಗಳು ಚಲನೆ ಮತ್ತು ಸ್ಥಳೀಯ ತರ್ಕದ (spatial reasoning) ಸಂಕೀರ್ಣ ತರ್ಕವನ್ನು ನಿರ್ವಹಿಸಲು Google ನ ಸುಭದ್ರ, ಪೂರ್ವ-ತರಬೇತಿ ಪಡೆದ ಮಾದರಿಗಳನ್ನು ಅವಲಂಬಿಸಿ, ಭೌತಿಕ ಆಕ್ಚುಯೇಟರ್‌ಗಳನ್ನು (physical actuators) ಸುಧಾರಿಸುವತ್ತ ಗಮನ ಹರಿಸಬಹುದು.

ಪ್ರಮುಖ ಅಂಶಗಳು

  • ಸಾರ್ವತ್ರಿಕ ಹೊಂದಾಣಿಕೆ (Universal Compatibility): Gemini Robotics 2 ಎಂಬುದು ಸಣ್ಣ ಟೇಬಲ್ ಟಾಪ್ ಆರ್ಮ್‌ಗಳಿಂದ ಹಿಡಿದು ಸಂಕೀರ್ಣ ಹ್ಯೂಮನಾಯ್ಡ್ ರೋಬೋಟ್‌ಗಳವರೆಗೆ ವಿವಿಧ ಹಾರ್ಡ್‌ವೇರ್‌ಗಳನ್ನು ನಿಯಂತ್ರಿಸುವ ಸಾಮರ್ಥ್ಯವಿರುವ VLA ಮಾದರಿಯಾಗಿದೆ.
  • ಸುಧಾರಿತ ತರ್ಕ (Enhanced Reasoning): ಹೊಸ Gemini Robotics ER 2 ಅತ್ಯಾಧುನಿಕ "embodied reasoning" ಅನ್ನು ಒದಗಿಸುತ್ತದೆ, ಇದು ಭೌತಿಕ ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವಿಕೆಗೆ ಉನ್ನತ ಮಟ್ಟದ ಬೌದ್ಧಿಕ ನಿಯಂತ್ರಕವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.
  • ಡೆವಲಪರ್‌ಗಳ ಲಭ್ಯತೆ: Google ಈ ಪರಿಕರಗಳನ್ನು ಪರಿಸರಕ್ಕೆ (ecosystem) ಮುಕ್ತಗೊಳಿಸುತ್ತಿದೆ, ER 2 ಅನ್ನು Google AI Studio ನಲ್ಲಿ ಲಭ್ಯವಿದೆ ಮತ್ತು Gemini Robotics 2 ಅನ್ನು ವೇಟ್ಲಿಸ್ಟ್ ಮೂಲಕ ಮುಂಚಿತವಾಗಿ ಪಡೆಯಬಹುದು.

ಅಂತಿಮವಾಗಿ

Gemini Robotics 2 ಮತ್ತು ಅದರೊಂದಿಗೆ ಬಂದ ER 2 ಮಾಡ್ಯೂಲ್ ರೋಬೋಟ್‌ಗಳಿಗಾಗಿ ಒಂದು ಸಾರ್ವತ್ರಿಕ AI ಮೆದುಳಿನತ್ತ ಒಂದು ನಿರ್ದಿಷ್ಟ ಹೆಜ್ಜೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ, ಇದು ಗ್ರಹಿಕೆ, ಭಾಷೆ ಮತ್ತು ನಿಯಂತ್ರಣವನ್ನು ಒಂದೇ ತರಬೇತಿ ನೀಡಬಹುದಾದ ವ್ಯವಸ್ಥೆಯಲ್ಲಿ ಸಂಯೋಜಿಸುತ್ತದೆ. ಈ ವಿಧಾನವು ಸುಧಾರಿತ ರೋಬೋಟ್‌ಗಳನ್ನು ನಿಯೋಜಿಸುವ ವೆಚ್ಚ ಮತ್ತು ಸಂಕೀರ್ಣತೆಯನ್ನು ನಾಟಕೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು.