Hugging Face ಕೇವಲ ಒಂದು model zoo ಗಿಂತಲೂ ಹೆಚ್ಚು ಚುರುಕಾದ ವಸ್ತುವಾಗಿ ಮಾರ್ಪಟ್ಟಿದೆ. ಅಲ್ಲಿ ಈಗ ಟ್ರೆಂಡ್ ಆಗುತ್ತಿರುವ ಸಂಶೋಧನಾ ಪ್ರಬಂಧಗಳು (papers) AI ಸಮುದಾಯವು ನಿಜವಾಗಿಯೂ ಎತ್ತ ಸಾಗುತ್ತಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುವ ಹವಾಮಾನ ಸೂಚಕಗಳಂತೆ (weather vane) ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿವೆ. ವರ್ಷಗಳ ಕಾಲ, ಪ್ರಬಲವಾದ ನಿರೂಪಣೆಯು ಸರಳವಾಗಿತ್ತು: ಪ್ಯಾರಾಮೀಟರ್ಗಳನ್ನು ಹೆಚ್ಚಿಸಿ, ಡೇಟಾವನ್ನು ಹೆಚ್ಚಿಸಿ, ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸಿ. ಆ ಯುಗವು ಅಂತ್ಯಗೊಂಡಿಲ್ಲ, ಆದರೆ ಅದು ಈಗ ಸಂಪೂರ್ಣ ಕಥೆಯಲ್ಲ. ಇತ್ತೀಚಿನ ಪ್ರಭಾವಶಾಲಿ ಪ್ರಬಂಧಗಳು ಸ್ಪಷ್ಟವಾದ ಆದ್ಯತೆಯ ಬದಲಾವಣೆಯನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ. ಈ ವ್ಯವಸ್ಥೆಗಳು ವಾಸ್ತವದೊಂದಿಗೆ ಸಂಪರ್ಕ ಹೊಂದಿದಾಗ ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಎಂಬ ಬಗ್ಗೆ ಸಂಶೋಧಕರು ಮತ್ತು ನಿರ್ಮಾತೃಗಳು ಕಠಿಣ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುತ್ತಿದ್ದಾರೆ. ಗಮನವು ಕೇವಲ ಪ್ರಮಾಣದಿಂದ (raw scale) ಕಾರ್ಯಾಚರಣೆಗೆ (operationalization) ಬದಲಾಗುತ್ತಿದೆ—ಮಾಡೆಲ್ಗಳು ಹೇಗೆ ತರ್ಕ ಮಾಡುತ್ತವೆ, ಅವು ಅಗ್ಗದ ಹಾರ್ಡ್ವೇರ್ನಲ್ಲಿ ಹೇಗೆ ಚಲಿಸುತ್ತವೆ, ಒಂದು ಸಾಫ್ಟ್ವೇರ್ ಪರಿಸರದಿಂದ ಇನ್ನೊಂದಕ್ಕೆ ಹೇಗೆ ಬದಲಾಗುತ್ತವೆ ಮತ್ತು ವಿಜ್ಞಾನವು ವೇಗವಾಗಿ ಚಲಿಸಲು ಅವು ಹೇಗೆ ಸಹಾಯ ಮಾಡುತ್ತವೆ ಎಂಬುದರ ಮೇಲೆ ಈಗ ಹೆಚ್ಚಿನ ಗಮನವಿದೆ.
ಒತ್ತಡದ ಸಂದರ್ಭದಲ್ಲೂ ನಿಲ್ಲುವ ತರ್ಕಬದ್ಧತೆ (Reasoning)
ನಾವು ದೊಡ್ಡ ಭಾಷಾ ಮಾಡೆಲ್ಗಳನ್ನು (large language models) ತರಬೇತಿ ಮಾಡುವ ವಿಧಾನ ಮತ್ತು ಅವುಗಳನ್ನು ಬಳಸುವ ವಿಧಾನದ ನಡುವೆ ಬೆಳೆಯುತ್ತಿರುವ ಅಂತರವಿದೆ. ಒಂದು ಮಾಡೆಲ್ ತರಬೇತಿಯ ಸಮಯದಲ್ಲಿ loss ಅನ್ನು ಅತ್ಯಂತ ಸುಂದರವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು, ಆದರೆ ಕೋಡಿಂಗ್ ಬಗ್ ಅಥವಾ ಬಹು-ಹಂತದ ಗಣಿತದ ಪುರಾವೆಯನ್ನು (math proof) ತರ್ಕಬದ್ಧವಾಗಿ ಪರಿಹರಿಸಲು ಪ್ರಯತ್ನಿಸಿದಾಗ ಅದು ವಿಫಲವಾಗಬಹುದು. ಇತ್ತೀಚಿನ ಒಂದು ಪ್ರಬಂಧವು, ಇದಕ್ಕೆ ಪರಿಹಾರವು ಮತ್ತೊಂದು ತರಬೇತಿ ತಂತ್ರವಲ್ಲ ಎಂದು ವಾದಿಸುತ್ತದೆ. ನಾವು ಕೇವಲ ತರಬೇತಿಯ ಮೆಟ್ರಿಕ್ಗಳ ಮೇಲೆ ಸ್ಕೋರ್ ಮಾಡುವುದಕ್ಕಾಗಿ ಅಲ್ಲದೆ, inference ಸಮಯದಲ್ಲಿ ಮಾಡೆಲ್ಗಳು ಹೇಗೆ ವರ್ತಿಸುತ್ತವೆ ಎಂಬುದಕ್ಕಾಗಿ ಅವುಗಳನ್ನು ಉತ್ತಮಗೊಳಿಸಬೇಕಾಗಿದೆ. ಹೆಚ್ಚಿನ reinforcement learning ಪೈಪ್ಲೈನ್ಗಳು ಇನ್ನೂ ತರಬೇತಿಯ ಸಮಯದ ಬಹುಮಾನಗಳನ್ನೇ (training-time rewards) ಬೆನ್ನಟ್ಟುತ್ತಿವೆ. ಈ ಪ್ರಸ್ತಾವಿತ ಮರುಚಿಂತನೆಯು chain of thought ಅನ್ನು ಸ್ಥಿರೀಕರಿಸುವುದನ್ನು ಸೂಚಿಸುತ್ತದೆ. ಕೋಡಿಂಗ್ ಅಸಿಸ್ಟೆಂಟ್ಗಳು ಅಥವಾ ಗಣಿತ ಟ್ಯೂಟರ್ಗಳನ್ನು ನಿರ್ಮಿಸುವ ಯಾರಿಗಾದರೂ, ಇದು ಒಂದು ಪ್ರಾಯೋಗಿಕ ಬದಲಾವಣೆಯಾಗಿದೆ. ನೀವು ಲೀಡರ್ಬೋರ್ಡ್ ನಿಖರತೆಯನ್ನು ಮಾತ್ರ ನಂಬುವುದನ್ನು ನಿಲ್ಲಿಸಬೇಕು ಮತ್ತು ಪ್ರಾಂಪ್ಟ್ (prompt) ಗೊಂದಲಮಯವಾದಾಗ ಮಾಡೆಲ್ನ ತರ್ಕವು ಸುಸಂಬದ್ಧವಾಗಿ ಉಳಿಯುತ್ತದೆಯೇ ಎಂದು ಸ್ಟ್ರೆಸ್-ಟೆಸ್ಟ್ ಮಾಡಲು ಪ್ರಾರಂಭಿಸಬೇಕು.
ಕಲಿತದ್ದನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವ GUI ಏಜೆಂಟ್ಗಳು
ಏಜೆಂಟ್ಗಳಿಗೆ ಪ್ಲಾಟ್ಫಾರ್ಮ್ ಸಮಸ್ಯೆ ಇದೆ. Chrome ಟ್ಯಾಬ್ನ ಒಳಗೆ ವಿಮಾನದ ಟಿಕೆಟ್ಗಳನ್ನು ಪರಿಪೂರ್ಣವಾಗಿ ಬುಕ್ ಮಾಡುವ ವ್ಯವಸ್ಥೆಯು, ನೀವು Android ಫೋನ್ನಲ್ಲಿ ಸೆಟ್ಟಿಂಗ್ಗಳನ್ನು ಬದಲಾಯಿಸಲು ಕೇಳಿದಾಗ ಎಲ್ಲವನ್ನೂ ಮರೆತುಹೋಗಬಹುದು. ಈ ವೈಫಲ್ಯವನ್ನು catastrophic forgetting ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಹೊಸ ಸಂಶೋಧನೆಯು multi-teacher distillation ಮೂಲಕ ಇದನ್ನು ಪರಿಹರಿಸುತ್ತದೆ. ಒಂದೇ ಇಂಟರ್ಫೇಸ್ನಲ್ಲಿ ತರಬೇತಿ ನೀಡಿ ಜ್ಞಾನವು ವರ್ಗಾವಣೆಯಾಗಲಿ ಎಂದು ಕಾಯುವ ಬದಲು, ಏಜೆಂಟ್ ಏಕಕಾಲದಲ್ಲಿ ಹಲವಾರು ಶಿಕ್ಷಕರಿಂದ ಕಲಿಯುತ್ತದೆ, ಪ್ರತಿಯೊಬ್ಬರೂ ವಿಭಿನ್ನ ಪ್ಲಾಟ್ಫಾರ್ಮ್ನಲ್ಲಿ ಪರಿಣಿತರಾಗಿರುತ್ತಾರೆ. ವಿದ್ಯಾರ್ಥಿ ನೆಟ್ವರ್ಕ್ ಏಕಕಾಲದಲ್ಲಿ web, mobile, ಮತ್ತು desktop ತರ್ಕಗಳಿಗೆ ಒಡ್ಡಲ್ಪಟ್ಟಿರುವುದರಿಂದ, ಅದು ಹಳೆಯ ಕೌಶಲ್ಯಗಳನ್ನು ಅಳಿಸದೆ ವಿವಿಧ ಪರಿಸರಗಳನ್ನು ದಾಟುತ್ತದೆ. ಉತ್ಪನ್ನ ತಂಡಗಳಿಗೆ, ಇದರರ್ಥ ನೀವು ನಿಮ್ಮ web backend ಮತ್ತು mobile frontend ಎರಡನ್ನೂ ಸ್ಪರ್ಶಿಸುವ ಏಕೈಕ ಅಸಿಸ್ಟೆಂಟ್ ಅನ್ನು ನಿರ್ಮಿಸಬಹುದು, ಅದಕ್ಕಾಗಿ ಎರಡು ಸಂಪೂರ್ಣವಾಗಿ ಪ್ರತ್ಯೇಕ ಏಜೆಂಟ್ ವ್ಯವಸ್ಥೆಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಅಗತ್ಯವಿರುವುದಿಲ್ಲ.
ದೊಡ್ಡ ಮಾಡೆಲ್ಗಳನ್ನು ವಾಸ್ತವಕ್ಕೆ ತರುವುದು
ರೋಬೋಟ್ನಲ್ಲಿ ದೊಡ್ಡ ಫೌಂಡೇಶನ್ ಮಾಡೆಲ್ ಅನ್ನು ರನ್ ಮಾಡುವುದು ಯಾವಾಗಲೂ ಸಾಫ್ಟ್ವೇರ್ ಸಮಸ್ಯೆಯಂತೆ ಕಾಣುವ ಭೌತಿಕ ಸಮಸ್ಯೆಯಾಗಿದೆ. ಮಾಡೆಲ್ ಸರ್ವರ್ ರಾಕ್ನಲ್ಲಿ ಹೊಂದಿಕೆಯಾಗಬಹುದು, ಆದರೆ ಅದು ಡ್ರೋನ್ನ ಪವರ್ ಬಜೆಟ್ ಅಥವಾ ಉತ್ಪಾದನಾ ಕೈಯ (manufacturing arm) ಆನ್ಬೋರ್ಡ್ ಕಂಪ್ಯೂಟರ್ನಲ್ಲಿ ಹೊಂದಿಕೆಯಾಗುವುದಿಲ್ಲ. ಈ ಅಂತರವನ್ನು ನಿಖರವಾಗಿ ತುಂಬಲು ಹೊಸ C++ runtime ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ, ಇದು ಭಾರೀ ಮಾಡೆಲ್ಗಳನ್ನು ವಿವಿಧ ರೋಬೋಟ್ ಹಾರ್ಡ್ವೇರ್ ಮತ್ತು edge devicesಗಳಿಗೆ ವರ್ಗಾಯಿಸುತ್ತದೆ. ಇದು ಕೇವಲ ವೇಗದ inference ಬಗ್ಗೆ ಮಾತ್ರವಲ್ಲ. ಇದು portability ಬಗ್ಗೆಯೂ ಆಗಿದೆ. ದುಬಾರಿ GPUs ಗಳಲ್ಲಿ ಲ್ಯಾಬ್ನಲ್ಲಿ ಅಭಿವೃದ್ಧಿಪಡಿಸಿದ ಮಾಡೆಲ್ ಅನ್ನು ಯಾವುದೇ ಹೊಸದಾಗಿ ಬರೆಯುವ ಅಗತ್ಯವಿಲ್ಲದೆ Jetson module ಅಥವಾ ರೋಬೋಟ್ನ ಸ್ಥಳೀಯ ಕಂಟ್ರೋಲರ್ಗೆ ತರಬಹುದು. ಈ portabilityಯೇ ಒಂದು ಅನುದಾನಿತ ಡೆಮೋ ಮತ್ತು ಮಾರುಕಟ್ಟೆಗೆ ಬಿಡುಗಡೆಯಾಗುವ ಉತ್ಪನ್ನದ ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗಿದೆ.
ಡೇಟಾ ಫಿಲ್ಟರ್ಗಿಂತ ಡೇಟಾ ರೆಸಿಪಿ ಹೆಚ್ಚು ಮುಖ್ಯ
Vision-language ಮಾಡೆಲ್ಗಳಿಗೆ ಕೇವಲ ದೊಡ್ಡ ತಟ್ಟೆಗಳಲ್ಲ, ಬದಲಾಗಿ ಉತ್ತಮ ಆಹಾರದ (better diets) ಅಗತ್ಯವಿದೆ. ಹೊಸ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಒಂದು ಕಠಿಣ ಸತ್ಯವನ್ನು ತಿಳಿಸುತ್ತವೆ: ಕೆಟ್ಟ ಡೇಟಾವನ್ನು ಫಿಲ್ಟರ್ ಮಾಡುವುದು ಕೇವಲ ಅರ್ಧದಷ್ಟು ಹೋರಾಟವಷ್ಟೇ. ನೀವು image captions, chart parsing, grounded conversation, ಮತ್ತು visual question answering ಅನ್ನು ಯಾವ ಅನುಪಾತದಲ್ಲಿ ಬೆರೆಸುತ್ತೀರಿ ಎಂಬುದು ನಿಮ್ಮ multimodal ಅಸಿಸ್ಟೆಂಟ್ ಸೂಕ್ಷ್ಮತೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುತ್ತದೆಯೇ ಅಥವಾ ಭ್ರಮೆಯನ್ನು (hallucinates) ಸೃಷ್ಟಿಸುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ರೆಸಿಪಿ ತಪ್ಪಾದರೆ, ಪರಿಪೂರ್ಣವಾಗಿ ಸ್ವಚ್ಛವಾದ ಡೇಟಾ ಇದ್ದರೂ ಮಾಡೆಲ್ ಎಡವುತ್ತದೆ. ಇದು ಡೇಟಾಸೆಟ್ ನಿರ್ಮಾಣವನ್ನು ಕೇವಲ ಸ್ವಚ್ಛಗೊಳಿಸುವ ಕೆಲಸದಿಂದ (janitorial work) recipe engineering ಕಡೆಗೆ ಬದಲಾಯಿಸುತ್ತದೆ. ನಿಮ್ಮ ತಂಡವು ವಿಶುವಲ್ ಅಸಿಸ್ಟೆಂಟ್ ಅನ್ನು ನಿರ್ಮಿಸುತ್ತಿದ್ದರೆ, ಕೇವಲ ನಿಮ್ಮ ಫಿಲ್ಟರ್ಗಳನ್ನು ಮಾತ್ರವಲ್ಲದೆ, ನಿಮ್ಮ ಮಿಶ್ರಣಗಳನ್ನು (mixtures) ಕೂಡ ಪರಿಶೀಲಿಸಿ.
ಪಿಕ್ಸೆಲ್ ಸ್ಪೇಸ್ನಲ್ಲಿ 3D ಜನರೇಷನ್
ಹೆಚ್ಚಿನ generative 3D ಪೈಪ್ಲೈನ್ಗಳು ಜಗತ್ತನ್ನು ಒಂದು ಗುಪ್ತ latent space ಗೆ ಸಂಕುಚಿತಗೊಳಿಸುತ್ತವೆ. ವಿವರಗಳು ಕಣ್ಮರೆಯಾಗುತ್ತವೆ. ಅಂಚುಗಳು ಮಸುಕಾಗುತ್ತವೆ. ಈ ನಷ್ಟವು (lossiness) ತ್ವರಿತ ಪೂರ್ವವೀಕ್ಷಣೆಗಾಗಿ (quick preview) ಸ್ವೀಕಾರಾರ್ಹವಾಗಿರಬಹುದು, ಆದರೆ ಗೇಮ್ ಅಸೆಟ್ ಅಥವಾ ನೈಜ ಜ್ಯಾಮಿತಿಯೊಂದಿಗೆ ಹೊಂದಿಕೆಯಾಗಬೇಕಾದ AR overlayಗೆ ಇದು ಬಳಕೆಗೆ ಬರುವುದಿಲ್ಲ. ಉದಯೋನ್ಮುಖ ವಿಧಾನಗಳು ಈ ಅಡಚಣೆಯನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ತಪ್ಪಿಸಿ ನೇರವಾಗಿ pixel space ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿವೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ ಮೂಡಿಬರುವ ದೃಶ್ಯಗಳು ಚುರುಕಾಗಿರುತ್ತವೆ, spatial relationships ಸುಸಂಬದ್ಧವಾಗಿರುತ್ತವೆ ಮತ್ತು ಔಟ್ಪುಟ್ ಅನ್ನು ಗೇಮಿಂಗ್ ಮತ್ತು AR/VR ಗಾಗಿ ಉತ್ಪಾದನಾ ಪೈಪ್ಲೈನ್ಗಳಿಗೆ ನೇರವಾಗಿ ಬಳಸಬಹುದು. ಕಲಾವಿದರು ಮತ್ತು ತಾಂತ್ರಿಕ ನಿರ್ದೇಶಕರಿಗೆ ಇದು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಇದು 3D ಜನರೇಷನ್ ಅನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳಲು ಕಷ್ಟವಾಗುವಂತೆ ಮಾಡಿದ ದುಬಾರಿ post-processing cleanup ಅನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ.
AI ಸಂಶೋಧನೆಯ ಕೆಲಸಗಳನ್ನು ಮಾಡಲು ಪ್ರಾರಂಭಿಸಿದಾಗ
ಸಂಶೋಧನಾ ಪ್ರಬಂಧವನ್ನು ಬರೆಯುವುದು ವಿಜ್ಞಾನಿಯ ಕೆಲಸವನ್ನು ವಿಳಂಬಗೊಳಿಸುವ ಮುಖ್ಯ ಕಾರಣ ಎಂದಿಗೂ ಆಗಿರುವುದಿಲ್ಲ. ಪೋಸ್ಟರ್, ಮೂರು ನಿಮಿಷದ ವೀಡಿಯೊ ಸಾರಾಂಶ, ಬ್ಲಾಗ್ ರೂಪಾಂತರ ಮತ್ತು ಸೋಶಿಯಲ್ ಮೀಡಿಯಾ ಥ್ರೆಡ್ಗಳೇ ಇಡೀ ವಾರವನ್ನು ವ್ಯರ್ಥ ಮಾಡುತ್ತವೆ. ಹೊಸ ಪರಿಕರಗಳು ಈಗ ಕೇವಲ ಒಂದು ಪ್ರಬಂಧವನ್ನು ಪಡೆದು, ಸಂಪೂರ್ಣ ಸಂವಹನ ವ್ಯವಸ್ಥೆಯನ್ನು (communication stack) ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಸಿದ್ಧಪಡಿಸುತ್ತವೆ. ಸಂಶೋಧನೆಯ ದೃಷ್ಟಿಕೋನದಿಂದ ನೋಡುವುದಾದರೆ, ಇತರ ವ್ಯವಸ್ಥೆಗಳು ನೈಜ ಪುರಾವೆಗಳಿಗಾಗಿ ಸಾಹಿತ್ಯವನ್ನು ಓದುತ್ತವೆ ಮತ್ತು ಕೇವಲ ಅಂದಾಜಿನ ಮೇಲೆ ಅಲ್ಲದೆ, ದಾಖಲಿತ ಕೊರತೆಗಳ ಆಧಾರದ ಮೇಲೆ ಸಂಶೋಧನಾ ದಿಕ್ಕುಗಳನ್ನು ಸೂಚಿಸುತ್ತವೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ, ಪ್ರಯೋಗದಿಂದ ಒಳನೋಟದವರೆಗೆ ಇರುವ ಸಮಯದ ಅವಧಿ ಕಡಿಮೆಯಾಗುತ್ತದೆ. ಸ್ನಾತಕೋತ್ತರ ವಿದ್ಯಾರ್ಥಿಗಳು ಮತ್ತು ಪ್ರಧಾನ ಸಂಶೋಧಕರು (principal investigators) ಫಾರ್ಮ್ಯಾಟಿಂಗ್ ಮಾಡುವ ಬದಲು ಆ ಸಮಯವನ್ನು ಆಲೋಚನೆಗಾಗಿ ಬಳಸಿಕೊಳ್ಳಬಹುದು.
ಗೆಸ್ವರ್ಕ್ (ಅಂದಾಜು) ಮಾಡದೆ, ಜ್ಯಾಮಿತಿಯ ಮೂಲಕ ಆಪ್ಟಿಮೈಸರ್ಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡುವುದು
Adam ಮತ್ತು Lion ನಡುವೆ ಆಯ್ಕೆ ಮಾಡುವುದು ಇಂದಿಗೂ ಲ್ಯಾಬ್ನ Slack ಚಾನೆಲ್ಗಳ ಮೂಲಕ ಹರಿದಾಡುವ ಗುಪ್ತ ಜ್ಞಾನದಂತೆ ಭಾಸವಾಗುತ್ತದೆ. ಹೊಸ ಸಂಶೋಧನೆಯು ಜ್ಯಾಮಿತೀಯ ವರ್ಗೀಕರಣ ವ್ಯವಸ್ಥೆಯನ್ನು (geometric classification system) ಬಳಸಿಕೊಂಡು ಈ ಸಮಸ್ಯೆಯನ್ನು ಮರುರೂಪಿಸುತ್ತದೆ. ಮತ್ತೊಂದು ಸ್ವೀಪ್ (sweep) ಗಾಗಿ GPU ಸಮಯವನ್ನು ವ್ಯರ್ಥ ಮಾಡುವ ಬದಲು, ನೀವು ಆಪ್ಟಿಮೈಸರ್ಗಳನ್ನು ಅವುಗಳ ಜ್ಯಾಮಿತೀಯ ಗುಣಲಕ್ಷಣಗಳ ಮೂಲಕ ಹೋಲಿಸಬಹುದು ಮತ್ತು ಅವು ನಿಮ್ಮ loss landscape ಜೊತೆಗೆ ಹೇಗೆ ಪ್ರತಿಕ್ರಿಯಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಊಹಿಸಬಹುದು. ಇದು ಆಯ್ಕೆ ಮಾಡುವ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಮಾಟಮಂತ್ರದಿಂದ (wizardry) ರೋಗನಿರ್ಣಯದ (diagnosis) ಪ್ರಕ್ರಿಯೆಯನ್ನಾಗಿ ಬದಲಾಯಿಸುತ್ತದೆ. ತಜ್ಞರಿಗೆ (practitioners), ಇದರರ್ಥ ಆಪ್ಟಿಮೈಸರ್ನ ಜ್ಯಾಮಿತಿಯು ಡೇಟಾದ ಜ್ಯಾಮಿತಿಯೊಂದಿಗೆ ಹೊಂದಾಣಿಕೆಯಾಗದೆ ವಿಫಲವಾಗುವ ತರಬೇತಿ ಪ್ರಕ್ರಿಯೆಗಳು (training runs) ಕಡಿಮೆಯಾಗುತ್ತವೆ ಎಂದರ್ಥ.
ಪರಿಣಾಮಗಳನ್ನು ನಿಜವಾಗಿಯೂ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ವರ್ಲ್ಡ್ ಮಾಡೆಲ್ಗಳು
ತನ್ನ ಹಾದಿಯನ್ನು ಯೋಜಿಸುವ ರೋಬೋಟ್ನ ರೆಂಡರ್ ಮಾಡಿದ ವೀಡಿಯೊ ಅದ್ಭುತವಾಗಿ ಕಾಣಿಸಬಹುದು, ಆದರೆ ಅದು ಯಾವುದನ್ನೂ ಸಾಬೀತುಪಡಿಸುವುದಿಲ್ಲ. ವರ್ಲ್ಡ್ ಮಾಡೆಲ್ ತನ್ನ ಕ್ರಿಯೆಗಳ ದೀರ್ಘಕಾಲೀನ ಪರಿಣಾಮಗಳನ್ನು ಊಹಿಸುತ್ತದೆಯೇ ಎಂಬುದು ನಿಜವಾದ ಪರೀಕ್ಷೆಯಾಗಿದೆ. ಈಗ ಆ ಪೆಟ್ಟಿಗೆಯನ್ನು ಎತ್ತುವುದರಿಂದ ನಂತರ ರೋಬೋಟ್ನ ಕೈ ಕಪಾಟಿನ ಹಿಂದೆ ಸಿಕ್ಕಿಹಾಕಿಕೊಳ್ಳುತ್ತದೆಯೇ? ಹೊಸ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ದೃಶ್ಯ ವೈಭವವನ್ನು ತೆಗೆದುಹಾಕಿ, ಕೇವಲ ಕಾರ್ಯಕಾರಣ ಸಂಬಂಧದ ದೂರದೃಷ್ಟೆಯ (causal foresight) ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ಗಳಿಗೆ ಅಂಕ ನೀಡುತ್ತವೆ. ಇದು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಸುಂದರವಾದ ಸಿಮ್ಯುಲೇಟರ್ (simulator) ಹಾನಿಗೊಳಗಾದ ಸೆನ್ಸರ್ ಅಥವಾ ಉರುಳಿಬಿದ್ದ ಪ್ಯಾಲೆಟ್ ಅನ್ನು ಸರಿಪಡಿಸುವುದಿಲ್ಲ. ರೋಬೋಟಿಕ್ಸ್ ತಜ್ಞರಿಗೆ ಭೌತಿಕ ಪ್ರಪಂಚದ ಸವಾಲುಗಳಿಗೆ ಅನುಗುಣವಾದ ಮೌಲ್ಯಮಾಪನದ ಅಗತ್ಯವಿದೆ.
ಹೆಚ್ಚಿನ GPU ವೆಚ್ಚವಿಲ್ಲದೆ ಡಿಫ್ಯೂಷನ್ ಚಲಾಯಿಸುವುದು
ಡಿಫ್ಯೂಷನ್ ಮಾಡೆಲ್ಗಳು ಅದ್ಭುತ ಚಿತ್ರಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತವೆ, ಆದರೆ ಅವುಗಳ ಕಂಪ್ಯೂಟಿಂಗ್ ವೆಚ್ಚವು ತುಂಬಾ ಹೆಚ್ಚಿರುತ್ತದೆ. ಹೊಸ ಕ್ವಾಂಟೈಸೇಶನ್ ತಂತ್ರಗಳು (quantization techniques) ಬೃಹತ್ ಡೇಟಾ ಸೆಟ್ಗಳು ಅಥವಾ ಸಂಪೂರ್ಣ ಮರುತರಬೇತಿಯ ಅಗತ್ಯವಿಲ್ಲದೆ, ಸಣ್ಣ GPUಗಳಿಗಾಗಿ ಈ ತೂಕಗಳನ್ನು (weights) ಸಂಕುಚಿತಗೊಳಿಸುತ್ತವೆ. ನೀವು ಸ್ವಲ್ಪ ಮಟ್ಟಿನ ನಿಖರತೆಯನ್ನು (fidelity) ಬಿಟ್ಟು, ಸ್ಥಳೀಯವಾಗಿ (locally) ಚಲಾಯಿಸುವ ಸಾಮರ್ಥ್ಯ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಹಾರ್ಡ್ವೇರ್ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಕೆಲಸಗಳನ್ನು ಮಾಡುವುದು ಅಥವಾ ಪ್ರೀಮಿಯಂ ಕ್ಲಸ್ಟರ್ಗಳನ್ನು ಬಾಡಿಗೆಗೆ ಪಡೆಯದೆ ಇನ್ಫರೆನ್ಸ್ (inference) ಮಾಡುವ ಅವಕಾಶವನ್ನು ಪಡೆಯುತ್ತೀರಿ. ಸ್ಟುಡಿಯೋಗಳು ಮತ್ತು ಸ್ವತಂತ್ರ ಸೃಷ್ಟಿಕರ್ತರಿಗೆ (indie creators), ಇದು ಜನರೇಟಿವ್ ಮೀಡಿಯಾದ ಆರ್ಥಿಕತೆಯನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ವೀಡಿಯೊ ಮತ್ತು ಚಿತ್ರ ತಯಾರಿಕೆಯಲ್ಲಿ ಪ್ರಯೋಗಗಳನ್ನು ಮಾಡುವ ಅಡೆತಡೆಗಳು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆಯಾಗುತ್ತವೆ.
ನಿಜವಾದ ಸಾರಾಂಶ
ಈ ಎಲ್ಲಾ ಕೆಲಸಗಳ ಮೂಲಕ ಸಾಗುತ್ತಿರುವ ಪ್ರಮುಖ ಅಂಶವೆಂದರೆ ಆಪರೇಷನಲೈಸೇಶನ್ (operationalization). ದೊಡ್ಡದಾಗಿದ್ದರಷ್ಟೇ ಉತ್ತಮ ಎಂಬ ಹಂತವನ್ನು ಸಮುದಾಯವು ದಾಟಿದೆ. ಪ್ರಚಲಿತದಲ್ಲಿರುವ ಸಂಶೋಧನಾ ಪ್ರಬಂಧಗಳು ಇನ್ಫರೆನ್ಸ್-ಸಮಯದ ಸ್ಥಿರತೆ (inference-time stability), ಡೇಟಾ ಮಿಕ್ಸಿಂಗ್ ತಂತ್ರ, ಕ್ರಾಸ್-ಪ್ಲಾಟ್ಫಾರ್ಮ್ ಮೆಮೊರಿ, ಎಡ್ಜ್ ಡಿಪ್ಲಾಯ್ಮೆಂಟ್ ಮತ್ತು ಪುರಾವೆ ಆಧಾರಿತ ಸಂಶೋಧನೆಗಾಗಿ ಆಪ್ಟಿಮೈಸ್ ಮಾಡುತ್ತಿವೆ. ಅವು ಮಾಡೆಲ್ ಅನ್ನು ಹಾರ್ಡ್ವೇರ್ ಮಿತಿಗಳು, ಬಳಕೆದಾರರ ಇಂಟರ್ಫೇಸ್ಗಳು ಮತ್ತು ಸಂಶೋಧನಾ ಕಾರ್ಯವಿಧಾನಗಳನ್ನು ಒಳಗೊಂಡ ದೊಡ್ಡ ವ್ಯವಸ್ಥೆಯ ಒಂದು ಭಾಗವಾಗಿ ಪರಿಗಣಿಸುತ್ತವೆ.
ನೀವು ಉತ್ಪನ್ನಗಳನ್ನು ಮಾರುಕಟ್ಟೆಗೆ ತರುತ್ತಿದ್ದರೆ, ಸಂದೇಶವು ಸ್ಪಷ್ಟವಾಗಿದೆ. ಪ್ರಬಂಧದ ಅಂಕಿಅಂಶಗಳಿಗಾಗಿ (paper metrics) ಅಲ್ಲದೆ, ಡಿಪ್ಲಾಯ್ಮೆಂಟ್ ವಾಸ್ತವಕ್ಕಾಗಿ (deployment reality) ಆಪ್ಟಿಮೈಸ್ ಮಾಡಿ. ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವ ಏಜೆಂಟ್ಗಳನ್ನು ಮತ್ತು ನೈಜ ಸಾಧನಗಳಿಗೆ ಹೊಂದಿಕೆಯಾಗುವ ಮಾಡೆಲ್ಗಳನ್ನು ನಿರ್ಮಿಸಿ.
