Qwen-Drive-1.0 ಗ್ರಹಿಕೆ (perception), ಯೋಜನೆ (planning) ಮತ್ತು ಭಾಷೆಯನ್ನು (language) ಒಂದೇ ಮಾಡೆಲ್ನಲ್ಲಿ ಸಂಯೋಜಿಸುತ್ತದೆ, ಇದು ಸ್ವಯಂಚಾಲಿತ ವಾಹನ ಎಂಜಿನಿಯರ್ಗಳಿಗೆ ಮೌಖಿಕ ಅಥವಾ ಪಠ್ಯ ಸೂಚನೆಗಳನ್ನು ಪಾಲಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಕಳೆದುಕೊಳ್ಳದೆ, ಹೆಚ್ಚು ಸುಸಜ್ಜಿತವಾದ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ನೀಡುವ ಭರವಸೆ ನೀಡುತ್ತದೆ. ಈ ಏಕೀಕೃತ ವಾಸ್ತುಶಿಲ್ಪವು ಅಭಿವೃದ್ಧಿ ಸಂಕೀರ್ಣತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ಅದೇ ಸಮಯದಲ್ಲಿ ಕಾರುಗಳು “ನೀವು ಏಕೆ ತಿರುಗಿದಿರಿ?” ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಲು ಅಥವಾ “ಮುಂದಿನ ಎಕ್ಸಿಟ್ ತೆಗೆದುಕೊಳ್ಳಿ” ಎಂಬ ಆದೇಶವನ್ನು ಪಾಲಿಸಲು ಶಕ್ತವಾಗುವಂತೆ ಮಾಡುತ್ತದೆ.
ಏಕೀಕೃತ ಅಡಿಪಾಯ ಏಕೆ ಮುಖ್ಯ
ಇಂದಿನ ಹೆಚ್ಚಿನ ಸ್ವಯಂಚಾಲಿತ ಚಾಲನಾ ಸಾಫ್ಟ್ವೇರ್ಗಳು ಪ್ರತ್ಯೇಕ ಮಾಡ್ಯೂಲ್ಗಳ ಸಂಗಮವಾಗಿವೆ: ಕ್ಯಾಮೆರಾ ಮತ್ತು ಲಿಡಾರ್ (lidar) ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವ ದೃಷ್ಟಿ ವ್ಯವಸ್ಥೆ (vision system), ಹಾದಿಯನ್ನು ನಿರ್ಧರಿಸುವ ಪ್ಲಾನರ್ (planner), ಮತ್ತು ಬಳಕೆದಾರರ ಆದೇಶಗಳು ಅಥವಾ ವಿವರಣೆಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಭಾಷಾ ಇಂಟರ್ಫೇಸ್. ಪ್ರತಿಯೊಂದು ಭಾಗವು ಪ್ರತ್ಯೇಕವಾಗಿ ತರಬೇತಿ ಪಡೆಯುತ್ತದೆ, ಆದ್ದರಿಂದ ದೃಷ್ಟಿ ಅಥವಾ ಯೋಜನಾ ಭಾಗಗಳು loss ಮೇಲೆ ಪ್ರಾಬಲ್ಯ ಸಾಧಿಸಿದಾಗ ಭಾಷಾ ಘಟಕವು ವಿಚಲಿತವಾಗುವ ಸಾಧ್ಯತೆ ಇರುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ, ವಾಹನವು ಸಂಚರಿಸಬಲ್ಲದೇ ಹೊರತು ನೈಸರ್ಗಿಕ ಭಾಷೆಯನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಅಥವಾ ಸೃಷ್ಟಿಸಲು ವಿಫಲವಾಗುತ್ತದೆ.
Qwen-Drive-1.0 ಏಕಕಾಲದಲ್ಲಿ ಮೂರು ಕಾರ್ಯಗಳ ಮೇಲೆ—3-D ಗ್ರಹಿಕೆ, ದೃಶ್ಯ ಪ್ರಶ್ನೋತ್ತರ (VQA), ಮತ್ತು ಚಲನ ಯೋಜನೆ (motion planning)—ಒಂದೇ ಬ್ಯಾಕ್ಬೋನ್ ಮೇಲೆ ತರಬೇತಿ ನೀಡುವ ಮೂಲಕ ಈ ವಿಭಜನೆಯನ್ನು ಎದುರಿಸುತ್ತದೆ. ಚಾಲನಾ ಡೇಟಾ ಸೆಟ್ಗಳನ್ನು ಸಾಮಾನ್ಯ ದೃಷ್ಟಿ-ಭಾಷಾ ಕೋಪರಾಗಳೊಂದಿಗೆ (vision-language corpora) ಬೆರೆಸುವ ಮೂಲಕ, ಈ ಮಾಡೆಲ್ ನೋಡಲು ಮತ್ತು ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಕಲಿಯುವಾಗ ತನ್ನ ಭಾಷಾ ಜ್ಞಾನವನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ. ಈ “ಮಲ್ಟಿಮೋಡಲ್ ಅಡಿಪಾಯ”ವು ಅನೇಕ ಡೌನ್ಸ್ಟ್ರೀಮ್ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗೆ ಅಡಿಪಾಯವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ಗಳ ಪ್ರವೃತ್ತಿಯನ್ನು ಹೋಲುತ್ತದೆ, ಆದರೆ ಇದು ಸುರಕ್ಷಿತ ಸಂಚಲನಕ್ಕೆ ಅಗತ್ಯವಾದ ಸ್ಥಳೀಯ ತರ್ಕವನ್ನು (spatial reasoning) ಸೇರಿಸುತ್ತದೆ.
ಮಾಡೆಲ್ ಅನ್ನು ಹೇಗೆ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಯಿತು
ಸಂಶೋಧಕರು ಮಾಡೆಲ್ ಅನ್ನು ಓಪನ್-ಲೂಪ್ ಮತ್ತು ಕ್ಲೋಸ್ಡ್-ಲೂಪ್ ಪರೀಕ್ಷೆಗಳ ಮೂಲಕ ನಡೆಸಿದರು. ಓಪನ್-ಲೂಪ್ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ, ವ್ಯವಸ್ಥೆಯು ಪರಿಸರವನ್ನು ಪ್ರಭಾವಿಸುವ ಪ್ರಭಾವವಿಲ್ಲದೆ ರೆಕಾರ್ಡ್ ಮಾಡಿದ ಸೆನ್ಸರ್ ಸ್ಟ್ರೀಮ್ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ಮುನ್ಸೂಚನೆಗಳನ್ನು ನೀಡುತ್ತದೆ; ಕ್ಲೋಸ್ಡ್-ಲೂಪ್ ಪ್ರಯೋಗಗಳಲ್ಲಿ, ಅದು ವಾಸ್ತವವಾಗಿ ಸಿಮ್ಯುಲೇಟೆಡ್ ವಾಹನವನ್ನು ನಿಯಂತ್ರಿಸುತ್ತದೆ. ಈ ಎಲ್ಲಾ ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ, Qwen-Drive-1.0 ನ ಚಲನ-ಯೋಜನಾ ಕಾರ್ಯಕ್ಷಮತೆಯು ಕೇವಲ ಚಾಲನೆಗೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸುವ ತಜ್ಞ ಮಾಡೆಲ್ಗಳಿಗೆ ಸಮನಾಗಿದೆ. ಅದೇ ಸಮಯದಲ್ಲಿ, ಅದರ VQA ಘಟಕವು ದೃಶ್ಯದ ಬಗ್ಗೆ ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸಿತು, ಇದು ಸಂಯೋಜಿತ ತರಬೇತಿಯ ನಂತರವೂ ಭಾಷಾ ಸಾಮರ್ಥ್ಯವು ಉಳಿದಿದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ.
ಉಳಿದಿರುವ ಅಡೆತಡೆಗಳು
ಪ್ರಸ್ತುತ ಕೆಲಸವು ಸಂಪೂರ್ಣ ಸೆನ್ಸರ್ ಸೂಟ್ಗಿಂತ ಸ್ವಲ್ಪ ಕಡಿಮೆ ಇದೆ. ಹೈವೇ ಚಾಲನೆಗೆ ನಿರ್ಣಾಯಕವಾದ ಹೈ-ರೆಸಲ್ಯೂಶನ್ ಲಿಡಾರ್ ಇನ್ಪುಟ್ಗಳು ಮತ್ತು ದೀರ್ಘ-ದೂರದ ಮುನ್ಸೂಚನೆಗಳು ತರಬೇತಿ ಸೆಟ್ನಲ್ಲಿ ಇಲ್ಲದಿವೆ. ಗ್ರಹಿಕೆಯು ಸೀಮಿತ ಡೇಟಾ ಸೆಟ್ಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ, ಇದು ವಿಭಿನ್ನ ಹವಾಮಾನ, ಬೆಳಕು ಮತ್ತು ಸಂಚಾರ ಪರಿಸ್ಥಿತಿಗಳಿಗೆ ಸಾಮಾನ್ಯೀಕರಣದ ಬಗ್ಗೆ ಪ್ರಶ್ನೆಗಳನ್ನು ಎತ್ತುತ್ತದೆ. ಈ ಮಾಡೆಲ್ ನೈಜ ಪ್ರಪಂಚದ, ಹೈ-ಬ್ಯಾಂಡ್ವಿಡ್ತ್ ಸೆನ್ಸರ್ ಸ್ಟ್ರೀಮ್ಗಳಲ್ಲಿ ತನ್ನನ್ನು ತಾನು ಸಾಬೀತುಪಡಿಸುವವರೆಗೆ, ಎಂಜಿನಿಯರ್ಗಳು ಈಗಾಗಲೇ ಸಾಬೀತಾದ ಪೈಪ್ಲೈನ್ಗಳನ್ನು ಬದಲಾಯಿಸಲು ಹಿಂಜರಿಯುತ್ತಾರೆ.
ಈ ವಿಧಾನವು ವಿಸ್ತರಿಸಿದರೆ ಏನಾಗಬಹುದು
ಒಂದೇ ಅಡಿಪಾಯವು ಸಂಪೂರ್ಣ ಗ್ರಹಿಕೆ-ಯೋಜನೆ-ಭಾಷಾ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲದಿದ್ದರೆ, ಆಟೋಮೋಟಿವ್ ತಂಡಗಳು ಪ್ರತ್ಯೇಕ ಮಾಡ್ಯೂಲ್ಗಳ ಗೊಂದಲಮಯ ಸಂಘಟನೆಯನ್ನು ಕೈಬಿಡಬಹುದು. ಇದು ಏಕೀಕರಣದ ಪ್ರಯತ್ನವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಮಾಡ್ಯೂಲ್ಗಳ ನಡುವಿನ ಸಂವಹನದಿಂದ ಉಂಟಾಗುವ ವಿಳಂಬವನ್ನು (latency) ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಅಪ್ಡೇಟ್ಗಳನ್ನು ಸರಳಗೊಳಿಸುತ್ತದೆ: ಪ್ಲಾನರ್ ಅನ್ನು ಮರು-ತರಬೇತಿಗೊಳಿಸದೆ ಹೊಸ ಭಾಷಾ ಸಾಮರ್ಥ್ಯವನ್ನು ಸೇರಿಸಬಹುದು. ಸ್ವಯಂಚಾಲಿತ ಚಾಲನೆಗಾಗಿ ಬೆಂಚ್ಮಾರ್ಕ್ ಸೂಟ್ಗಳು ಕೂಡ ವಿಕಸನಗೊಳ್ಳಬೇಕಾಗುತ್ತದೆ, ಸಾಂಪ್ರದಾಯಿಕ ಸುರಕ್ಷತೆ ಮತ್ತು ದಕ್ಷತೆಯ ಸ್ಕೋರ್ಗಳ ಜೊತೆಗೆ ಭಾಷಾ-ಕೇಂದ್ರಿತ ಮಾಪಕಗಳನ್ನು ಸೇರಿಸಬೇಕಾಗುತ್ತದೆ.
ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ವಿಶೇಷೀಕರಣಕ್ಕೆ ಇನ್ನೂ ಸ್ಥಾನವಿದೆ
ತಜ್ಞ ಮಾಡೆಲ್ಗಳು ಅತ್ಯುತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಏಕೆಂದರೆ ಅವುಗಳನ್ನು ಬೃಹತ್, ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ಡೇಟಾದ ಮೇಲೆ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಬಹುದು. ಏಕೀಕೃತ ಮಾಡೆಲ್ ಕೇವಲ ಲಿಡಾರ್-ಮಾತ್ರದ ಗ್ರಹಿಕೆ ನೆಟ್ವರ್ಕ್ ಅಥವಾ ಬಿಲಿಯನ್ಗಟ್ಟಲೆ ಮೈಲಿಗಳ ಚಾಲನಾ ಲಾಗ್ಗಳ ಮೇಲೆ ತರಬೇತಿ ಪಡೆದ ಪ್ಲಾನರ್ನ ಅತ್ಯುನ್ನತ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತಲುಪಲು ಕಷ್ಟಪಡಬಹುದು. ಸುರಕ್ಷತೆಗೆ ನಿರ್ಣಾಯಕವಾದ ಕಾರ್ಯಗಳಿಗಾಗಿ, ನಿಯಂತ್ರಕರು ಮತ್ತು ತಯಾರಕರು ಪ್ರತ್ಯೇಕವಾದ, ವ್ಯಾಪಕವಾಗಿ ದೃಢೀಕರಿಸಿದ ಘಟಕಗಳನ್ನು ಕೇಳುವುದನ್ನು ಮುಂದುವರಿಸಬಹುದು.
ಮುಂದಿನ ಗಮನಾರ್ಹ ಅಂಶಗಳು
Qwen-Drive-1.0 ಹೈ-ರೆಸಲ್ಯೂಶನ್ ಲಿಡಾರ್ ಅನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳಬಲ್ಲದೇ ಮತ್ತು ದೀರ್ಘಾವಧಿಯ ಮುನ್ಸೂಚನೆಯನ್ನು ನೀಡಬಲ್ಲದೇ ಎಂಬುದನ್ನು ಭವಿಷ್ಯದ ಬಿಡುಗಡೆಗಳು ಬಹಿರಂಗಪಡಿಸಬೇಕು. ನೈಜ ಪ್ರಪಂಚದ ರಸ್ತೆ ಪರೀಕ್ಷೆಗಳು, ವಿಶೇಷವಾಗಿ ವೈವಿಧ್ಯಮಯ ನಗರ ಪರಿಸರಗಳಲ್ಲಿ, ಈ ಏಕೀಕೃತ ವಿಧಾನಕ್ಕೆ ನಿಜವಾದ ಪರೀಕ್ಷೆಯಾಗಲಿವೆ. ಆ ಪ್ರಯೋಗಗಳು ಯಶಸ್ವಿಯಾದರೆ, ಸ್ವಯಂಚಾಲಿತ ವಾಹನಗಳಲ್ಲಿ ಭಾಷೆಯನ್ನು ಪ್ರಮುಖ ಅಂಶವಾಗಿ ಪರಿಗಣಿಸುವ ಮಲ್ಟಿಮೋಡಲ್ ಅಡಿಪಾಯಗಳತ್ತ ಉದ್ಯಮವು ಬದಲಾಗಬಹುದು.
