ಈ ತಿಂಗಳ Hugging Face ಪೇಪರ್ ಶ್ರೇಯಾಂಕಗಳು (rankings) ಒಂದು ಬೆಳೆಯುತ್ತಿರುವ ಕ್ಷೇತ್ರವನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ. ಪ್ರಮುಖ ಕೆಲಸವು ಕೇವಲ ಪ್ಯಾರಾಮೀಟರ್ ಸಂಖ್ಯೆಯನ್ನು ಹೆಚ್ಚಿಸುವುದರ ಬಗ್ಗೆ ಅಲ್ಲದೆ, ಮಾಡೆಲ್ಗಳು ನೋಡುವುದನ್ನು, ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದನ್ನು ಮತ್ತು ಅವು ಪ್ರಾರಂಭಿಸಿದ ಕೆಲಸವನ್ನು ಪೂರ್ಣಗೊಳಿಸುವುದನ್ನು ಹೇಗೆ ಮಾಡಬಹುದು ಎಂಬುದರ ಬಗ್ಗೆ ಇದೆ. ಕೆಳಗಿನ ಹತ್ತು ಪೇಪರ್ಗಳು ರಿಯಲ್-ಟೈಮ್ ವಿಡಿಯೋ, ರೋಬೋಟ್ ತಿಳುವಳಿಕೆ (cognition), ಪ್ರಾಮಾಣಿಕ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್ ಮತ್ತು ಜನರೇಟರ್ಗಳನ್ನು ಶಿಕ್ಷಕರನ್ನಾಗಿ ಪರಿಗಣಿಸುವ ನಿಶ್ಯಬ್ದ ಕ್ರಾಂತಿಯನ್ನು ಸ್ಪರ್ಶಿಸುತ್ತವೆ.
ನೀವು ನಿಜವಾಗಿಯೂ ಬಳಸಬಹುದಾದ ರಿಯಲ್-ಟೈಮ್ ವಿಡಿಯೋ
ಹೆಚ್ಚಿನ ವಿಡಿಯೋ ಮಾಡೆಲ್ಗಳು ಇನ್ನೂ ದುಬಾರಿ ಪ್ರಯೋಗಾಲಯದ ಪ್ರಯೋಗಗಳಂತೆ ವರ್ತಿಸುತ್ತವೆ. ಅವು ಭಾರೀ ಹಾರ್ಡ್ವೇರ್ ಮೇಲೆ ನಿಮಿಷಗಟ್ಟಲೆ ಕೆಲಸ ಮಾಡಿ, ನೀವು ಮಧ್ಯದಲ್ಲಿ ನಿಯಂತ್ರಿಸಲು ಸಾಧ್ಯವಾಗದ ಕ್ಲಿಪ್ಗಳನ್ನು ನೀಡುತ್ತವೆ. Vidu S1 ಈ ಸಮೀಕರಣವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ಇದು ರಿಯಲ್-ಟೈಮ್ ಸಂವಹನವನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿದೆ, TurboDiffusion ಎಂಬ ತಂತ್ರಜ್ಞಾನದ ಮೂಲಕ ಮಾಡೆಲ್ ಸಾಮಾನ್ಯ ಗ್ರಾಹಕ GPUಗಳ ಮೇಲೆ ಚಲಿಸುವಾಗ ಬಳಕೆದಾರರು ಧ್ವನಿ ಆಜ್ಞೆಗಳ ಮೂಲಕ ಡಿಜಿಟಲ್ ಪಾತ್ರಗಳನ್ನು ನಿರ್ದೇಶಿಸಲು ಇದು ಅವಕಾಶ ನೀಡುತ್ತದೆ.
ಆ ಹಾರ್ಡ್ವೇರ್ ಬದಲಾವಣೆಯು ಮುಖ್ಯವಾಗಿದೆ. ಒಂದು ಮಾಡೆಲ್ಗೆ ಇನ್ನು ಮುಂದೆ ಅತ್ಯುನ್ನತ ವೇಗವರ್ಧಕಗಳ (accelerators) ಅಗತ್ಯವಿಲ್ಲದಿದ್ದಾಗ, ಅದು ಕೇವಲ ಒಂದು ಪ್ರದರ್ಶನವಾಗಿ ಉಳಿಯದೆ ಮೂಲಸೌಕರ್ಯವಾಗಿ (infrastructure) ಬದಲಾಗುತ್ತದೆ. ಚಾಟ್ಗೆ ರಿಯಲ್-ಟೈಮ್ನಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯಿಸುವ ಲೈವ್-ಸ್ಟ್ರೀಮಿಂಗ್ ಅವತಾರ್ಗಳು ಅಥವಾ ಅಗತ್ಯಕ್ಕೆ ತಕ್ಕಂತೆ ಕಣ್ಣಿನ ಸಂಪರ್ಕವನ್ನು (eye contact) ಕಾಪಾಡಿಕೊಳ್ಳುವ ಮತ್ತು ಧ್ವನಿಯ ಶೈಲಿಯನ್ನು ಬದಲಾಯಿಸುವ ಗ್ರಾಹಕ ಸೇವಾ ಪಾತ್ರಗಳ ಬಗ್ಗೆ ಯೋಚಿಸಿ. Vidu S1 ಕೇವಲ ಸಂಶೋಧನಾ ಪ್ರಿಪ್ರಿಂಟ್ ಆಗಿ ಉಳಿಯದೆ, ಒಂದು ಉತ್ಪನ್ನವಾಗಿ ಲಭ್ಯವಾಗುವ ವಿಡಿಯೋ AI ಕಡೆಗೆ ದಾರಿ ತೋರಿಸುತ್ತದೆ.
ನಿರ್ದೇಶನಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ರೋಬೋಟ್ಗಳು
ಭೌತಿಕ AI ಗೆ ನ್ಯಾವಿಗೇಷನ್ (Navigation) ಇನ್ನೂ ಒಂದು ಮೂಲಭೂತ ಅಡೆತಡೆಯಾಗಿದೆ. ABot-N1 ಸಾಮಾನ್ಯ ಭಾಷೆಯ ಸೂಚನೆಗಳಿಂದ ಚಲಿಸುವ ರೋಬೋಟ್ ನ್ಯಾವಿಗೇಷನ್ಗಾಗಿ ಫೌಂಡೇಶನ್ ಮಾಡೆಲ್ ಅನ್ನು ಪ್ರಸ್ತಾಪಿಸುವ ಮೂಲಕ ಈ ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸುತ್ತದೆ. ಅಸ್ಥಿರವಾದ, ಮೊದಲೇ ನಕ್ಷೆ ಮಾಡಲಾದ ಮಾರ್ಗಗಳ ಬದಲಿಗೆ, ಈ ವ್ಯವಸ್ಥೆಯು ತಾನು ನೋಡುವ ಮತ್ತು ಕೇಳುವ ವಿಷಯಗಳಲ್ಲಿನ ಮಾದರಿಗಳನ್ನು ಗುರುತಿಸುವ ಮೂಲಕ ವೈವಿಧ್ಯಮಯ ಪರಿಸರದಲ್ಲಿ ಚಲಿಸಲು ಕಲಿಯುತ್ತದೆ.
ಇದರ ತಕ್ಷಣದ ಪ್ರಯೋಜನವು ಲಾಜಿಸ್ಟಿಕ್ಸ್ನಲ್ಲಿ (logistics) ಇದೆ. "ಬೈಕ್ ರಾಕ್ ದಾಟಿ ಪಕ್ಕದ ಪ್ರವೇಶದ್ವಾರದಲ್ಲಿ ಪ್ಯಾಕೇಜ್ ಇಡಿ" ಎಂಬ ಧ್ವನಿ ಸೂಚನೆಯನ್ನು ನೀಡಿದಾಗ, ಡೆಲಿವರಿ ರೋಬೋಟ್ ಆ ಸೂಚನೆಯನ್ನು ವಿಶ್ಲೇಷಿಸಬಹುದು ಮತ್ತು ರಾಕ್ ಚಲಿಸಿದಾಗ ತನ್ನನ್ನು ತಾನು ಹೊಂದಿಸಿಕೊಳ್ಳಬಹುದು. ಹೋಮ್ ಅಸಿಸ್ಟೆಂಟ್ಗಳು ಸಹ ಇದೇ ರೀತಿಯ ನಮ್ಯತೆಯನ್ನು ಪಡೆಯುತ್ತವೆ, ಮೊದಲೇ ನಿಖರವಾದ ಫ್ಲೋರ್ ಪ್ಲಾನ್ಗಳನ್ನು ಅಪ್ಲೋಡ್ ಮಾಡದೆಯೇ ಅಪಾರ್ಟ್ಮೆಂಟ್ಗಳಲ್ಲಿ ಸಂಚರಿಸಬಹುದು.
ನಿನ್ನೆ ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವ ರೋಬೋಟ್ಗಳು
ABot-AgentOS ಆ ನ್ಯಾವಿಗೇಷನ್ ಕೆಲಸದೊಂದಿಗೆ ಸೇರಿ ಮತ್ತೊಂದು ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುತ್ತದೆ: ರೋಬೋಟ್ಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರತಿ ಕಮಾಂಡ್ ನಂತರ ಮರುಹೊಂದಿಕೊಳ್ಳುತ್ತವೆ (reset). ಈ ವ್ಯವಸ್ಥೆಯು ಯಂತ್ರವನ್ನು ಬಳಕೆದಾರರು, ವಸ್ತುಗಳು ಮತ್ತು ದೈನಂದಿನ ಅಭ್ಯಾಸಗಳ ಬಗ್ಗೆ ದೀರ್ಘಕಾಲದ ನೆನಪನ್ನು ಹೊಂದಿರುವ ಒಂದು ಸ್ಥಿರ ಏಜೆಂಟ್ (persistent agent) ಎಂದು ಪರಿಗಣಿಸುತ್ತದೆ.
ಒಂದು ಬಾರಿಯ ಪ್ರೊಸೆಸರ್ ಮತ್ತು ನಿರಂತರ ಏಜೆಂಟ್ ನಡುವಿನ ವ್ಯತ್ಯಾಸವು ಒಂದು ಉಪಕರಣ ಮತ್ತು ಸಹೋದ್ಯೋಗಿಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸದಂತಿದೆ. ವೇರ್ಹೌಸ್ ಆಟೊಮೇಷನ್ನಲ್ಲಿ, ನೆನಪಿನ ಶಕ್ತಿಯಿರುವ ರೋಬೋಟ್ ಮಂಗಳವಾರದ ಶಿಪ್ಮೆಂಟ್ಗಳಲ್ಲಿ ಯಾವಾಗಲೂ ನಾಜೂಕಾದ ವಸ್ತುಗಳು ಇರುತ್ತವೆ ಎಂಬುದನ್ನು ಗಮನಿಸುತ್ತದೆ ಮತ್ತು ತನ್ನ ಹಿಡಿತವನ್ನು (grip) ಹೊಂದಿಸಿಕೊಳ್ಳುತ್ತದೆ. ಮನೆಯ ಆರೈಕೆಯ ವಿಷಯದಲ್ಲಿ, ನಿರ್ದಿಷ್ಟ ನಿವಾಸಿ ಮಧ್ಯಾಹ್ನ 3 ಗಂಟೆಗೆ ಕಿಟಕಿ ಪರದೆಗಳನ್ನು (blinds) ಅರ್ಧ ತೆರೆದಿಡಲು ಇಷ್ಟಪಡುತ್ತಾರೆ ಎಂಬುದನ್ನು ಅದು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುತ್ತದೆ. ಆ ನಿರಂತರತೆಯು ದೊಡ್ಡ ಮಟ್ಟದಲ್ಲಿ ವೈಯಕ್ತೀಕರಣವನ್ನು (personalization) ಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ.
ವಿಡಿಯೋ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳ ಸುಳ್ಳನ್ನು ಬಯಲು ಮಾಡುವುದು
Video-Oasis ಒಂದು ಅಹಿತಕರ 진단을 ನೀಡುತ್ತದೆ: ಅನೇಕ ಜನಪ್ರಿಯ ವಿಡಿಯೋ ಅಂಡರ್ಸ್ಟ್ಯಾಂಡಿಂಗ್ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ದೋಷಪೂರಿತವಾಗಿವೆ. ಮಾಡೆಲ್ಗಳು ಕೇವಲ ಪಠ್ಯ ಜ್ಞಾನವನ್ನು ಬಳಸಿಕೊಂಡು ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸುತ್ತವೆ, ಆದರೆ ವಾಸ್ತವಿಕ ಫ್ರೇಮ್ಗಳನ್ನು ನೋಡಲು ಪ್ರಯತ್ನಿಸುವುದಿಲ್ಲ. ಪ್ರಸ್ತುತ ಬೆಂಚ್ಮಾರ್ಕ್ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ ಅರ್ಧದಷ್ಟು ಪ್ರಶ್ನೆಗಳನ್ನು ಯಾವುದೇ ದೃಶ್ಯ ಇನ್ಪುಟ್ ಇಲ್ಲದೆಯೇ ಪರಿಹರಿಸಬಹುದು ಎಂದು ಈ ಪೇಪರ್ ತೋರಿಸುತ್ತದೆ.
ಇದರರ್ಥ ಸಂಶೋಧಕರು ನಿಜವಾದ ಗ್ರಹಿಕೆಗಿಂತ ಚತುರ ಅಂದಾಜಿಗೆ ಪ್ರತಿಫಲ ನೀಡುತ್ತಿದ್ದಾರೆ ಎಂದರ್ಥ. ಮಾಡೆಲ್ಗಳು ಪ್ರತಿಯೊಂದು ಉತ್ತರವನ್ನು ಪಿಕ್ಸೆಲ್-ಮಟ್ಟದ ಪುರಾವೆಗಳೊಂದಿಗೆ ಸಮರ್ಥಿಸಿಕೊಳ್ಳುವಂತೆ ಮಾಡುವ ಮೌಲ್ಯಮಾಪನ ಪ್ರೋಟೋಕಾಲ್ಗಳ ಅಗತ್ಯ ಸಮುದಾಯಕ್ಕಿದೆ. ಇಲ್ಲದಿದ್ದರೆ, ಬೆಳಕಿನ ವ್ಯವಸ್ಥೆ ಬದಲಾದಾಗ ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ಭ್ರಮೆಗಳನ್ನು (hallucinate) ಸೃಷ್ಟಿಸುವ ಸಿಸ್ಟಮ್ಗಳನ್ನು ನಾವು ಬಿಡುಗಡೆ ಮಾಡುವ ಅಪಾಯವಿದೆ.
ದೀರ್ಘ ಕೆಲಸಗಳನ್ನು ಪೂರ್ಣಗೊಳಿಸುವ ಕೋಡಿಂಗ್ ಏಜೆಂಟ್ಗಳು
ಕೋಡಿಂಗ್ ಅಸಿಸ್ಟೆಂಟ್ಗಳು ಸ್ನಿಪೆಟ್ಗಳನ್ನು (snippets) ಚೆನ್ನಾಗಿ ಬರೆಯುತ್ತವೆ, ಆದರೆ ನೂರಾರು ಹಂತಗಳ DevOps ವರ್ಕ್ಫ್ಲೋಗಳು ಇಂದಿಗೂ ಸವಾಲಿನಿಂದ ಕೂಡಿವೆ. Long-Horizon-Terminal-Bench ಎಂಬುದು ಏಜೆಂಟ್ಗಳು ವಿಸ್ತೃತ ಕಾರ್ಯಗಳನ್ನು ಹೇಗೆ ನಿಭಾಯಿಸುತ್ತವೆ, ಮಧ್ಯದಲ್ಲಿ ಉಂಟಾಗುವ ದೋಷಗಳಿಂದ ಹೇಗೆ ಚೇತರಿಸಿಕೊಳ್ಳುತ್ತವೆ ಮತ್ತು ಮಾನವ ಸಹಾಯವಿಲ್ಲದೆ ಹೇಗೆ ಮರು ಯೋಜಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಪರೀಕ್ಷಿಸುತ್ತದೆ.
ಸ್ವಾಯತ್ತ ಸಿಸ್ಟಮ್ ಅಡ್ಮಿನಿಸ್ಟ್ರೇಷನ್ (autonomous system administration) ಕನಸು ಕಾಣುವವರಿಗೆ ಇದು ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ. ಸರ್ವರ್ ಅನ್ನು ಪ್ಯಾಚ್ ಮಾಡಬಲ್ಲ, ಅವಲಂಬನೆಗಳ (dependencies) ಮೂಲಕ ಡಯಾಗ್ನೋಸ್ಟಿಕ್ಸ್ ನಡೆಸಬಲ್ಲ ಮತ್ತು ಒಂದು ಹಂತ ವಿಫಲವಾದರೆ ಹಿಂದಕ್ಕೆ ಹೋಗಬಲ್ಲ (roll back) ಏಜೆಂಟ್, ಪರಿಪೂರ್ಣ Python ಬರೆಯಬಲ್ಲ ಆದರೆ ಮೊದಲ API ಕೀ ಕಾಣೆಯಾದಾಗ ಸ್ಥಗಿತಗೊಳ್ಳುವ ಏಜೆಂಟ್ಗಿಂತ ಹೆಚ್ಚು ಮೌಲ್ಯಯುತವಾಗಿದೆ. ಈ ಬೆಂಚ್ಮಾರ್ಕ್ ಸಂಶೋಧಕರಿಗೆ ಅಂತಹ ದೈರ್ಯ ಮತ್ತು ಸಾಮರ್ಥ್ಯವನ್ನು ಅಳೆಯಲು ಸ್ಕೋರ್ಬೋರ್ಡ್ ನೀಡುತ್ತದೆ.
ಅಗ್ಗದ ರಿಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್
Direct OPD ರಿಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ನಲ್ಲಿನ ವೆಚ್ಚದ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುತ್ತದೆ. ದೊಡ್ಡ ಮಾಡೆಲ್ಗಳಿಗಾಗಿ RL ಮಾಡುವುದು ಹಣ ಮತ್ತು GPU ಸಮಯವನ್ನು ವ್ಯರ್ಥ ಮಾಡುತ್ತದೆ. ಪ್ರಸ್ತಾಪಿಸಲಾದ ಸುಲಭ ಮಾರ್ಗವೆಂದರೆ: ಮೊದಲು RL ಮೂಲಕ ಸಣ್ಣ ಮಾಡೆಲ್ ಅನ್ನು ತರಬೇತಿಗೊಳಿಸಿ, ನಂತರ ಆ ಕಲಿತ ನೀತಿಯನ್ನು (policy) ದೊಡ್ಡ ಮಾಡೆಲ್ಗೆ ವರ್ಗಾಯಿಸುವುದು.
ಸಣ್ಣ ಎಕ್ಸ್ಪ್ಲೋರರ್ಗಳು ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ತಪ್ಪುಗಳನ್ನು ಮಾಡುತ್ತಾರೆ. ಒಮ್ಮೆ ತಂತ್ರವು ದೃಢೀಕರಿಸಲ್ಪಟ್ಟ ನಂತರ, ದೊಡ್ಡ ಮಾಡೆಲ್ ಪೂರ್ಣ ವೆಚ್ಚವನ್ನು ಭರಿಸದೆ ಆ ಪಾಠಗಳನ್ನು ಪಡೆದುಕೊಳ್ಳುತ್ತದೆ. ದೊಡ್ಡ ಭಾಷಾ ಮಾಡೆಲ್ಗಳನ್ನು (large language models) ಅಲೈನ್ ಮಾಡಲು ಅಥವಾ ಏಜೆಂಟ್ಗಳನ್ನು ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಲು ಪ್ರಯತ್ನಿಸುತ್ತಿರುವ ಸಣ್ಣ ತಂಡಗಳಿಗೆ,
