Google DeepMind ತನ್ನ GenCeption ಅನ್ನು ಘೋಷಿಸಿದೆ, ಇದು ಕೇವಲ 7,500 ಕೃತಕ ವೀಡಿಯೊಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಪಠ್ಯದಿಂದ ವೀಡಿಯೊ ತಯಾರಿಸುವ ಜನರೇಟರ್ ಅನ್ನು ವಿವಿಧ ದೃಷ್ಟಿ ಕಾರ್ಯಗಳಿಗಾಗಿ (vision tasks) ಒಂದೇ ಫೌಂಡೇಶನ್ ಮಾಡೆಲ್ ಆಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ. ಇದರ ವಾದ ಸರಳವಾಗಿದೆ: ವಸ್ತುಗಳು ಹೇಗೆ ಚಲಿಸುತ್ತವೆ ಮತ್ತು ಪರಸ್ಪರ ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಎಂಬುದು ಈಗಾಗಲೇ ತಿಳಿದಿರುವ ವೀಡಿಯೊ ಜನರೇಟರ್ ಅನ್ನು, ಪ್ರತಿಯೊಂದಕ್ಕೂ ಪ್ರತ್ಯೇಕ ನೆಟ್‌ವರ್ಕ್ ಅನ್ನು ನಿರ್ಮಿಸುವ ಬದಲು ਡೆಪ್ತ್ (depth), ಸರ್ಫೇಸ್ ನಾರ್ಮಲ್ಸ್ (surface normals), ಸೆಗ್ಮೆಂಟೇಶನ್ ಮಾಸ್ಕ್‌ಗಳು (segmentation masks) ಮತ್ತು 3D ಪೋಸ್ (3D pose) ಅನ್ನು ಊಹಿಸಲು ಬಳಸಬಹುದು.

ಚದುರಿದ ದೃಷ್ಟಿ ಪೈಪ್‌ಲೈನ್‌ಗಳಿಂದ ಏಕೀಕೃತ ಮಾಡೆಲ್‌ವರೆಗೆ

ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳು (Large language models) ಮುಂದಿನ ಪದವನ್ನು ಊಹಿಸುವುದನ್ನು ಕಲಿಯುವ ಮೂಲಕ ಬಹುಮುಖಿಯಾಗಿದ್ದವು. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ಕಂಪ್ಯೂಟರ್-ವಿಷನ್ ಸಂಶೋಧನೆಯು ಇಂದಿಗೂ ಪರಿಣಿತ ವ್ಯವಸ್ಥೆಗಳೊಂದಿಗೆ (specialist systems) ಹೋರಾಡುತ್ತಿದೆ—ಸೆಗ್ಮೆಂಟೇಶನ್‌ಗೆ ಒಂದು, ਡೆಪ್ತ್‌ಗೆ ಇನ್ನೊಂದು ಮತ್ತು ಪೋಸ್‌ಗೆ ಮತ್ತೊಂದು. GenCeption ಈ ಚದುರಿದ ವ್ಯವಸ್ಥೆಯನ್ನು ತಪ್ಪಿಸುತ್ತದೆ. ಒಂದು ಪಠ್ಯ ಪ್ರಾಂಪ್ಟ್ ಮಾಡೆಲ್‌ಗೆ ಯಾವ ಔಟ್‌ಪುಟ್ ನೀಡಬೇಕೆಂದು ತಿಳಿಸುತ್ತದೆ ಮತ್ತು ಅದೇ 14-ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಆರ್ಕಿಟೆಕ್ಚರ್ ਡೆಪ್ತ್ ಮ್ಯಾಪ್‌ಗಳು, ನಾರ್ಮಲ್ ಮ್ಯಾಪ್‌ಗಳು, ಸೆಗ್ಮೆಂಟೇಶನ್ ಮಾಸ್ಕ್‌ಗಳು ಅಥವಾ ಕೀಪಾಯಿಂಟ್ ಮುನ್ಸೂಚನೆಗಳನ್ನು ನೀಡುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಔಟ್‌ಪುಟ್ ಅನ್ನು ಪ್ರಮಾಣಿತ ಮೂರು-ಚಾನಲ್ RGB ಚಿತ್ರ ಎಂದು ಪರಿಗಣಿಸುವ ಮೂಲಕ, ಈ ವ್ಯವಸ್ಥೆಯು ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಏಕರೂಪವಾಗಿರಿಸುತ್ತದೆ; ನೈಸರ್ಗಿಕವಾಗಿ ಚಿತ್ರಗಳನ್ನು ಉತ್ಪಾದಿಸದ ಕಾರ್ಯಗಳಿಗಾಗಿ, ಸಂಶೋಧಕರು ಸಣ್ಣ ತರಬೇತಿಗೊಳಿಸಬಹುದಾದ ಮಾಡ್ಯೂಲ್‌ಗಳನ್ನು ಸೇರಿಸಿದ್ದಾರೆ.

ಸಣ್ಣ ಕೃತಕ ಕೋಪಸ್‌ನಲ್ಲಿ ತರಬೇತಿ

ತಂಡವು Blender ನಲ್ಲಿ ಒಂದು ಕೃತಕ ಡೇಟಾಸೆಟ್ ಅನ್ನು ನಿರ್ಮಿಸಿತು, ಅದರಲ್ಲಿ 200 ಮೋಷನ್-ಕ್ಯಾಪ್ಚರ್ ಸೀಕ್ವೆನ್ಸ್‌ಗಳಿಂದ ಚಲಿಸುವ 800 ಡಿಜಿಟಲ್ ಮಾನವ ಮಾದರಿಗಳಿಂದ 7,500 ಕಿರು ವೀಡಿಯೊಗಳನ್ನು ರೆಂಡರ್ ಮಾಡಲಾಗಿದೆ. D4RT ಅಥವಾ VGGT Omega ನಂತಹ ಸಾಂಪ್ರದಾಯಿಕ ವೀಡಿಯೊ-ಜನರೇಷನ್ ಮಾಡೆಲ್‌ಗಳು ಲಕ್ಷಾಂತರ ಕ್ಲಿಪ್‌ಗಳ ಮೇಲೆ ತರಬೇತಿ ಪಡೆಯುತ್ತವೆ; GenCeption ಅಷ್ಟೇ ಅಥವಾ ಅದಕ್ಕಿಂತ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತಲುಪುತ್ತದೆ, ಆದರೆ ಅದಕ್ಕೆ ಬೇಕಾಗುವ ಡೇಟಾ ಪ್ರಮಾಣವು ಸಾಂಪ್ರದಾಯಿಕವುಗಳ ಶೇಕಡಾ ಒಂದು-ಏಳನೇ ಅಥವಾ ಒಂದು-ಐನೂರು ಭಾಗದಷ್ಟಷ್ಟೇ ಇರುತ್ತದೆ. ವರದಿಯಾದ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು ಹೀಗಿವೆ:

  • DepthAnything 3 ನಂತಹ ವಿಶೇಷ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಸಮಾನವಾದ ਡೆಪ್ತ್ ಅಂದಾಜು (Depth estimation).
  • NormalCrafter ಮತ್ತು Lotus-2 ಅನ್ನು ಮೀರಿಸುವ ಸರ್ಫೇಸ್-ನಾರ್ಮಲ್ ಮುನ್ಸೂಚನೆ (Surface-normal prediction).
  • Genmo ಮತ್ತು TRAM ಅನ್ನು ಮೀರಿದ 3D ಪೋಸ್ ಗುರುತಿಸುವಿಕೆ (3D pose recognition).
  • Meta ನ SAM 3 ಮತ್ತು Gemini 3.5 Flash ನ ಸಂಯೋಜಿತ ಸಾಮರ್ಥ್ಯಕ್ಕೆ ಸರಿಸಾಟಿಯಾದ ಭಾಷೆ-ಮಾರ್ಗದರ್ಶಿತ ಸೆಗ್ಮೆಂಟೇಶನ್ (Language-guided segmentation).

ಜನರೇಟಿವ್ ಉದ್ದೇಶವು ನೆಟ್‌ವರ್ಕ್ ಅನ್ನು ಸೀನ್ ಜಿಯೋಮೆಟ್ರಿ ಮತ್ತು ಭೌತಶಾಸ್ತ್ರವನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುವಂತೆ ಮಾಡುತ್ತದೆ, ಇದು ನಂತರ ಡೌನ್‌ಸ್ಟ್ರೀಮ್ ಪರ್ಸೆಪ್ಶನ್ ಕಾರ್ಯಗಳಿಗೆ ವರ್ಗಾವಣೆಯಾಗುತ್ತದೆ ಎಂದು ಲೇಖಕರು ಹೇಳುತ್ತಾರೆ.

ವೇಗಕ್ಕಾಗಿ ಆರ್ಕಿಟೆಕ್ಚರಲ್ ಶಾರ್ಟ್‌ಕಟ್‌ಗಳು

GenCeption ಅಲಿಬಾಬಾ (Alibaba) ನ ಓಪನ್-ಸೋರ್ಸ್ Wan2.1 ವೀಡಿಯೊ ಮಾಡೆಲ್ ಮೇಲೆ ನಿರ್ಮಿತವಾಗಿದೆ. ಅನೇಕ ಇಟರೇಷನ್‌ಗಳ ಮೂಲಕ ಫ್ರೇಮ್‌ಗಳನ್ನು ಸುಧಾರಿಸುವ ಸಾಮಾನ್ಯ ಡಿಫ್ಯೂಷನ್ ಪ್ರಕ್ರಿಯೆಯ ಬದಲಿಗೆ, ಸಂಶೋಧಕರು ಒಂದೇ ಫಾರ್ವರ್ಡ್ ಪಾಸ್‌ನಲ್ಲಿ ಮುನ್ಸೂಚನೆಯನ್ನು ನೀಡುವಂತೆ ವ್ಯವಸ್ಥೆಯನ್ನು ಮರು-ಎಂಜಿನಿಯರ್ ಮಾಡಿದ್ದಾರೆ. ಇದರ ಫಲಿತಾಂಶ: ಮಾಡೆಲ್ ಪ್ರಸ್ತುತ ಹಾರ್ಡ್‌ವೇರ್‌ನಲ್ಲಿ ಸುಮಾರು ಹತ್ತು ಸೆಕೆಂಡುಗಳಲ್ಲಿ 81-ಫ್ರೇಮ್ ಕ್ಲಿಪ್ ಅನ್ನು ಪ್ರೊಸೆಸ್ ಮಾಡುತ್ತದೆ. 14-ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಗಾತ್ರವು ದೊಡ್ಡದಾಗಿದ್ದರೂ, ತರಬೇತಿಯ ಉಳಿತಾಯ ಮತ್ತು ಬಹು ಕಾರ್ಯ-ನಿರ್ದಿಷ್ಟ ನೆಟ್‌ವರ್ಕ್‌ಗಳ ತೆಗೆದುಹಾಕುವಿಕೆಯು ಗಮನಾರ್ಹ ದಕ್ಷತೆಯನ್ನು ನೀಡುತ್ತದೆ.

AI ಸಮುದಾಯವು ಏಕೆ ಗಮನ ಹರಿಸಬೇಕು

ಒಂದು ವೀಡಿಯೊ ಜನರೇಟರ್ "ವರ್ಲ್ಡ್ ಮಾಡೆಲ್" (world model)—ಅಂದರೆ ವಸ್ತುಗಳು ಸ್ಥಳವನ್ನು ಹೇಗೆ ಆಕ್ರಮಿಸುತ್ತವೆ ಮತ್ತು ಕಾಲಾನಂತರದಲ್ಲಿ ಹೇಗೆ ಚಲಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಸೆರೆಹಿಡಿಯುವ ಪ್ರತಿನಿಧಿಸುವಿಕೆ—ಅನ್ನಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲದಾದರೆ, ದೃಷ್ಟಿ AI (visual AI) ನಲ್ಲಿನ ಮುಂದಿನ ಜಿಗಿತವು ದೊಡ್ಡ ಡೇಟಾಸೆಟ್‌ಗಳನ್ನು ಅಂಕಿತಗೊಳಿಸುವುದಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ಜನರೇಟಿವ್ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಹೆಚ್ಚಿಸುವುದರಿಂದ ಬರಬಹುದು. ಒಂದೇ, ಪ್ರಾಂಪ್ಟ್-ಚಾಲಿತ ಮಾಡೆಲ್ ಉತ್ಪನ್ನ ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ಸರಳಗೊಳಿಸಬಹುದು, ಎಂಜಿನಿಯರಿಂಗ್ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ದೃಷ್ಟಿ ವೈಶಿಷ್ಟ್ಯಗಳು ಬೇಕಾದ ಆದರೆ ಅನೇಕ ಪರಿಣಿತ ನೆಟ್‌ವರ್ಕ್‌ಗಳನ್ನು ತರಬೇತಿಗೊಳಿಸಲು ಸಂಪನ್ಮೂಲಗಳಿಲ್ಲದ ಅಭಿವೃದ್ಧಿಪಡಿಸುವವರಿಗೆ (developers) ಸುಲಭವಾಗಿಸಬಹುದು.

ಎಚ್ಚರಿಕೆಗಳು ಮತ್ತು ಉತ್ತರಿಸಲಾಗದ ಪ್ರಶ್ನೆಗಳು

ಕಾರ್ಯಕ್ಷಮತೆಯ ಅಂಕಿಅಂಶಗಳು ಕೃತಕ ಡೇಟಾ ಮತ್ತು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಸೂಟ್‌ಗಳಿಂದ ಬಂದಿವೆ, ಇದು ನೈಜ ಪ್ರಪಂಚದ ವೀಡಿಯೊಗಳ ಗೊಂದಲವನ್ನು ಪ್ರತಿಬಿಂಬಿಸದಿರಬಹುದು. ನಿಯಂತ್ರಣವಿಲ್ಲದ ಬೆಳಕು, ಹವಾಮಾನ ಅಥವಾ ಕ್ಯಾಮೆರಾ ಚಲನೆಗೆ ಇದರ ಸಾಮಾನ್ಯೀಕರಣವು ಇನ್ನೂ ಸಾಬೀತಾಗಿಲ್ಲ. 81-ಫ್ರೇಮ್ ಕ್ಲಿಪ್‌ಗೆ ಹತ್ತು ಸೆಕೆಂಡುಗಳ ಇನ್ಫರೆನ್ಸ್ (inference), ಇಟರೇಟಿವ್ ಡಿಫ್ಯೂಷನ್ ಗಿಂತ ವೇಗವಾಗಿದ್ದರೂ, ರೋಬೊಟಿಕ್ಸ್ ಅಥವಾ AR ಗಾಗಿ ನೈಜ-ಸಮಯಕ್ಕೆ (real-time) ಇನ್ನೂ ಬಹಳ ದೂರವಿದೆ. ಇದಲ್ಲದೆ, ಮಾಡೆಲ್‌ನ 14-ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳು ನಿಯೋಜನೆಗಾಗಿ (deployment) ಗಮನಾರ್ಹ ಕಂಪ್ಯೂಟ್ ಬಜೆಟ್ ಅನ್ನು ಬಯಸುತ್ತವೆ, ಇದು ಉತ್ತಮವಾಗಿ ಹಣಕಾಸು ಹೊಂದಿರುವ ಪ್ರಯೋಗಾಲಯಗಳ ಹೊರಗೆ ಇದರ ಲಭ್ಯತೆಯನ್ನು ಸೀಮಿತಗೊಳಿಸಬಹುದು.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

  • ನೈಜ-ಪ್ರಪಂಚದ ಮೌಲ್ಯೀಕರಣ: ಹೊರಾಂಗಣ ಚಾಲನಾ ವೀಡಿಯೊಗಳು, ಕೈಯಲ್ಲಿ ಹಿಡಿದ ಫೋನ್ ವೀಡಿಯೊಗಳು ಅಥವಾ ಕೈಗಾರಿಕಾ ತಪಾಸಣಾ ದೃಶ್ಯಗಳಲ್ಲಿ GenCeption ಅನ್ನು ಪರೀಕ್ಷಿಸುವ ಅಧ್ಯಯನಗಳು.
  • ಮಾಡೆಲ್ ಸ್ಕೇಲಿಂಗ್: ಡೇಟಾ-ದಕ್ಷತೆಯನ್ನು ಉಳಿಸಿಕೊಳ್ಳುವಾಗ ದೊಡ್ಡ ಅಥವಾ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ತರಬೇತಿ ಪಡೆದ ಆವೃತ್ತಿಗಳು ವಿಳಂಬದ ಅಂತರವನ್ನು (latency gap) ಕಡಿಮೆ ಮಾಡಬಲ್ಲವೇ ಎಂಬುದು.
  • ಸಂಯೋಜನಾ ಮಾರ್ಗಗಳು: ಕ್ಲೌಡ್ ಪ್ರೊವೈಡರ್‌ಗಳು ಅಥವಾ ಎಡ್ಜ್-AI ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ಗಳು ಪಠ್ಯ ರೂಪದ ಕಾರ್ಯ ವಿವರಣೆಯನ್ನು ಸ್ವೀಕರಿಸಿ ಸೂಕ್ತ ದೃಷ್ಟಿ ಔಟ್‌ಪುಟ್ ಅನ್ನು ನೀಡುವ ಏಕೈಕ API ಅನ್ನು ಹೇಗೆ ಪ್ರದರ್ಶಿಸಬಹುದು.
  • ಪರ್ಯಾಯ ತರಬೇತಿ ಮೂಲಗಳು: ದೃಢತೆಯನ್ನು ಸುಧಾರಿಸಲು ಕೃತಕ ಕ್ಲಿಪ್‌ಗಳನ್ನು ಸಣ್ಣ ಪ್ರಮಾಣದ ನೈಜ ವೀಡಿಯೊಗಳೊಂದಿಗೆ ಬೆರೆಸುವ ಪ್ರಯತ್ನಗಳು.

ಮುಖ್ಯಾಂಶಗಳು

GenCeption ಒಂದು ವೀಡಿಯೊ-ಜನರೇಷನ್ ಇಂಜಿನ್, ಮಲ್ಟಿ-ಟಾಸ್ಕ್ ವಿಷನ್ ಫೌಂಡೇಶನ್ ಮಾಡೆಲ್ ಆಗಿಯೂ ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲದು ಎಂದು ತೋರಿಸುತ್ತದೆ; ಇದು ಸಾಂಪ್ರದಾಯಿಕ ವಿಧಾನಗಳಿಗಿಂತ ಹಲವು ಪಟ್ಟು ಚಿಕ್ಕದಾದ ಡೇಟಾಸೆಟ್‌ನಿಂದ ಕಲಿಯುವಾಗೆಯೇ ಅತ್ಯಾಧುನಿಕ depth, normals, pose ಮತ್ತು segmentation ಅನ್ನು ಒದಗಿಸುತ್ತದೆ. ಹಲವಾರು ತಜ್ಞ ನೆಟ್‌ವರ್ಕ್‌ಗಳ ಸಮೂಹವನ್ನು ಒಂದೇ ಪ್ರಾಂಪ್ಟ್-ಚಾಲಿತ ವ್ಯವಸ್ಥೆಯಾಗಿ ಸಂಯೋಜಿಸುವುದು ಇದರ ಭರವಸೆಯಾಗಿದೆ; ಸಿಂಥೆಟಿಕ್ ಲ್ಯಾಬ್‌ಗಳಿಂದ ಹೊರಗಿನ ಅನಿಶ್ಚಿತ ಪ್ರಪಂಚಕ್ಕೆ ಈ ತಂತ್ರಜ್ಞಾನವು ವಿಸ್ತರಿಸಿದಾಗ ಆ ಭರವಸೆ ಉಳಿಯುತ್ತದೆಯೇ ಎಂಬುದು ಇದರ ಮುಂದಿನ ಪರೀಕ್ಷೆಯಾಗಿದೆ.