Xiaomi ತನ್ನ MiMo-V2.5 ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ, ಇದು ಆಡಿಯೋ, ಚಿತ್ರ ಮತ್ತು ವಿಡಿಯೋಗಳನ್ನು ನೇಟಿವ್ ಟೋಕನ್ಗಳಾಗಿ ಪರಿಗಣಿಸುವ ಒಂದು ಓಪನ್-ವೇಟ್ ಮಲ್ಟಿಮೋಡಲ್ ಮಾಡೆಲ್ ಆಗಿದೆ. ಇದು 1,050,000-ಟೋಕನ್ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು ಒದಗಿಸುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $0.14 ಹಾಗೂ ಪ್ರತಿ ಮಿಲಿಯನ್ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $0.28 ರಂತೆ 'ಪೇ-ಆಸ್-ಯೂ-ಗೋ' ಬೆಲೆಯನ್ನು ಹೊಂದಿದೆ. ಇದು ಆನ್-ಪ್ರೆಮಿಸ್ ಮತ್ತು ಮೀಡಿಯಾ-ಹೆವಿ AI ಅಗತ್ಯವಿರುವ ಸಂಸ್ಥೆಗಳನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿದೆ.
ಹೊಸ ಮಲ್ಟಿಮೋಡಲ್ ವಿಧಾನ ಏಕೆ ಮುಖ್ಯ
ಹೆಚ್ಚಿನ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಮಲ್ಟಿಮೋಡಲ್ ವ್ಯವಸ್ಥೆಗಳು ಸುಲಭ ಮಾರ್ಗವನ್ನು ಅನುಸರಿಸುತ್ತವೆ. ಅವು ಮೊದಲು ಸ್ಪೀಚ್-ಟು-ಟೆಕ್ಸ್ಟ್ ಇಂಜಿನ್ ಅನ್ನು ರನ್ ಮಾಡುತ್ತವೆ, ನಂತರ ಚಿತ್ರಗಳನ್ನು ಕ್ಯಾಪ್ಶನ್ಗಳಾಗಿ ಪರಿವರ್ತಿಸುವ ವಿಷನ್ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸುತ್ತವೆ ಮತ್ತು ಅಂತಿಮವಾಗಿ ಬರುವ ಪಠ್ಯವನ್ನು ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ (LLM) ಗೆ ನೀಡುತ್ತವೆ. ಇಲ್ಲಿ LLM ಎಂದಿಗೂ ಮೂಲ ಶಬ್ದದ ಅಲೆ (sound wave) ಅಥವಾ ಪಿಕ್ಸೆಲ್ ಡೇಟಾವನ್ನು ನೋಡುವುದಿಲ್ಲ, ಆದ್ದರಿಂದ ನಿಟ್ಟುಸಿರು, ವಿರಾಮ, ಮುಖದ ಸಣ್ಣ ಚಲನೆ ಅಥವಾ ಕೈ ಸನ್ನೆಗಳಂತಹ ಸೂಕ್ಷ್ಮತೆಗಳು ಕಣ್ಮರೆಯಾಗುತ್ತವೆ. MiMo-V2.5 ಈ ಪರೋಕ್ಷ ಮಾರ್ಗವನ್ನು ಬಿಟ್ಟು ನೇರವಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ: ಇದು ಆಡಿಯೋ ಮತ್ತು ವಿಡಿಯೋಗಳನ್ನು ನೇರವಾಗಿ "ಟೋಕನ್ಗಳ" ರೂಪದಲ್ಲಿ ಅಳವಡಿಸಿಕೊಳ್ಳುತ್ತದೆ, ಇದರಿಂದಾಗಿ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ ಮೂಲಕ ಸೆರೆಹಿಡಿಯಲು ಸಾಧ್ಯವಾಗದ ಸಮಯ (timing), ಧ್ವನಿಯ ಏರಿಳಿತ (tone) ಮತ್ತು ದೃಶ್ಯ ಸೂಚನೆಗಳನ್ನು ಇದು ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ.
ತಾಂತ್ರಿಕ ವ್ಯಾಪ್ತಿ
- ಟೋಕನ್ ವಿಂಡೋ: 1,050,000 ಟೋಕನ್ಗಳು – ಇದು ಗಂಟೆಗಟ್ಟಲೆ ನಡೆಯುವ ಸಭೆಯ ರೆಕಾರ್ಡಿಂಗ್ಗಳನ್ನು ತುಂಡುಗಳಾಗಿ ವಿಂಗಡಿಸದೆ ಅಳವಡಿಸಿಕೊಳ್ಳಲು ಸಾಕಾಗುತ್ತದೆ.
- ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್: ಕಂಪನಿಯ ಸ್ವಂತ ಸರ್ವರ್ಗಳ ಮೇಲೆ ಮಾಡೆಲ್ ಅನ್ನು ನಿಯೋಜಿಸಬಹುದು, ಇದರಿಂದಾಗಿ ಮೂಲ ಮೀಡಿಯಾ ಡೇಟಾ ಸಂಸ್ಥೆಯ ಆವರಣವನ್ನು ಬಿಟ್ಟು ಹೊರಗೆ ಹೋಗುವುದಿಲ್ಲ.
- ಬೆಲೆ: ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $0.14, ಪ್ರತಿ ಮಿಲಿಯನ್ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $0.28 – ಇದು ಬಳಕೆಗೆ ಅನುಗುಣವಾಗಿ ಬದಲಾಗುವ ಪಾರದರ್ಶಕ ವೆಚ್ಚವಾಗಿದೆ.
ಪಠ್ಯ-ಮಾತ್ರೆಯ ಕೋರ್ (text-only core) ಅನ್ನು ಶೀಘ್ರವಾಗಿ ಪರಿಶೀಲಿಸಿದಾಗ, ಈ ಮಾಡೆಲ್ ನಿರೀಕ್ಷಿತ O(n log n) ಅಲ್ಗಾರಿದಮ್ ಬಳಸಿ ಕ್ಲಾಸಿಕ್ 'ಮರ್ಜ್-ಇಂಟರ್ವಲ್' ಕೋಡಿಂಗ್ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಿತು, ಟ್ಯಾಂಕ್ ತುಂಬುವ ದರದ ಗಣಿತದ ಸಮಸ್ಯೆಯನ್ನು ಹಂತ ಹಂತವಾಗಿ ಲೆಕ್ಕಹಾಕಿತು ಮತ್ತು ಇನ್ವಾಯ್ಸ್ನಿಂದ ಯಾವುದೇ ತಪ್ಪುಗಳಿಲ್ಲದೆ JSON ಪೇಲೋಡ್ ಅನ್ನು ಹೊರತೆಗೆಯಿತು. ಆ ಪರೀಕ್ಷೆಯಲ್ಲಿ ಆಡಿಯೋ ಮತ್ತು ವಿಡಿಯೋ ಪೈಪ್ಲೈನ್ಗಳನ್ನು ಬಳಸಲಾಗಿರಲಿಲ್ಲ.
ಯಾರು ಪ್ರಯೋಜನ ಪಡೆಯಬಹುದು
ಆರೋಗ್ಯ ಸೇವೆ ಮತ್ತು ಹಣಕಾಸಿನಂತಹ ಗೌಪ್ಯತೆಗೆ ಹೆಚ್ಚಿನ ಆದ್ಯತೆ ನೀಡುವ ಉದ್ಯಮಗಳು ಮೂಲ ಆಡಿಯೋ ಅಥವಾ ವಿಡಿಯೋವನ್ನು ಥರ್ಡ್-ಪಾರ್ಟಿ APIs ಗೆ ಕಳುಹಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಡೇಟಾವನ್ನು ಫೈರ್ವಾಲ್ನ ಹಿಂದೆ ಇರಿಸುವ ಮೂಲಕ, MiMo-V2.5 ಈ ಸಂಸ್ಥೆಗಳು ಡೇಟಾ ಸಂರಕ್ಷಣಾ ನಿಯಮಗಳನ್ನು ಪಾಲಿಸಲು ಮತ್ತು ಅದೇ ಸಮಯದಲ್ಲಿ AI-ಚಾಲಿತ ಒಳನೋಟಗಳನ್ನು ಪಡೆಯಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಸಂಭಾವ್ಯ ಅನ್ವಯಿಕೆಗಳು ಹೀಗಿವೆ:
- ಮೀಟಿಂಗ್ ಇಂಟೆಲಿಜೆನ್ಸ್: ಪ್ರತ್ಯೇಕ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ ಹಂತವಿಲ್ಲದೆ, ನಿರ್ಧಾರಗಳು, ಮುಂದಿನ ಕ್ರಮಗಳು (action items) ಮತ್ತು ವಕ್ತಾರರ ಭಾವನೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಸಂಪೂರ್ಣ ವಿಡಿಯೋ ರೆಕಾರ್ಡಿಂಗ್ಗಳನ್ನು ವಿಶ್ಲೇಷಿಸುವುದು.
- ಕಾಲ್-ಸೆಂಟರ್ ಅನಾಲಿಟಿಕ್ಸ್: ಕರೆ ಮಾಡುವವರ ಧ್ವನಿಯಲ್ಲಿನ ಹತಾಶೆ, ಹಿಂಜರಿಕೆ ಅಥವಾ ಆತ್ಮವಿಶ್ವಾಸವನ್ನು ನೈಜ ಸಮಯದಲ್ಲಿ ಪತ್ತೆಹಚ್ಚುವುದು.
- ಆನ್-ಡೈವೈಸ್ ಅಸಿಸ್ಟೆಂಟ್ಸ್: ಆಡಿಯೋವನ್ನು ಕ್ಲೌಡ್ಗೆ ಕಳುಹಿಸದೆ, ಧ್ವನಿಯ ಏರಿಳಿತವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಮತ್ತು ಅಲಿಖಿತ ಸೂಚನೆಗಳಿಗೆ (non-verbal cues) ಪ್ರತಿಕ್ರಿಯಿಸುವ ವಾಯ್ಸ್ ಇಂಟರ್ಫೇಸ್ಗಳನ್ನು ನಿರ್ಮಿಸುವುದು.
ಪ್ರಾಯೋಗಿಕ ಅಡೆತಡೆಗಳು
MiMo-V2.5 ನ ಭರವಸೆಯು ಅದರ ಆಡಿಯೋ ಮತ್ತು ವಿಡಿಯೋ ಎನ್ಕೋಡರ್ಗಳ ಕಾರ್ಯಕ್ಷಮತೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ - ಲೇಖಕರು ಇವುಗಳನ್ನು ಇನ್ನೂ ಬೆಂಚ್ಮಾರ್ಕ್ ಮಾಡಿಲ್ಲ. ಉದ್ಯಮಗಳು ಪ್ರೊಡಕ್ಷನ್ಗೆ ಬಳಸುವ ಮೊದಲು ತಮ್ಮದೇ ಆದ ಡೇಟಾ ಸೆಟ್ಗಳ ಮೇಲೆ ಲ್ಯಾಟೆನ್ಸಿ, ನಿಖರತೆ ಮತ್ತು ಹಾರ್ಡ್ವೇರ್ ಬಳಕೆಯನ್ನು ಪರಿಶೀಲಿಸಬೇಕು. ಕೇವಲ ಪಠ್ಯದ ಅಗತ್ಯವಿರುವ ತಂಡಗಳಿಗೆ ಸಣ್ಣದಾದ, ಪಠ್ಯ-ಮಾತ್ರೆಯ ಮಾಡೆಲ್ ಕಂಪ್ಯೂಟ್ ಮತ್ತು ವೆಚ್ಚ ಎರಡರಲ್ಲೂ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಕಂಡುಬರಬಹುದು. MiMo-V2.5 ನ ಓಪನ್-ವೇಟ್ ಸ್ವಭಾವವು ಅದರ ಕೋಡ್ ಮತ್ತು ವೇಟ್ಗಳು ಸಾರ್ವಜನಿಕವಾಗಿ ಲಭ್ಯವಿರುವುದನ್ನು ಸೂಚಿಸುತ್ತದೆ; ಇದು ಆಳವಾದ ಕಸ್ಟಮೈಸೇಶನ್ಗೆ ಅವಕಾಶ ನೀಡುತ್ತದೆ ಆದರೆ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ನಿರ್ವಹಿಸಲು ಮತ್ತು ಸುರಕ್ಷಿತವಾಗಿಡಲು ಆಂತರಿಕ ಪರಿಣತಿಯನ್ನು ಬಯಸುತ್ತದೆ.
ಸಾರಾಂಶ
MiMo-V2.5 ನೇಟಿವ್ ಮೀಡಿಯಾ ಟೋಕನೈಸೇಶನ್, ದೊಡ್ಡ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಮತ್ತು ಸ್ಪಷ್ಟವಾದ ಪ್ರತಿ-ಟೋಕನ್ ವೆಚ್ಚದೊಂದಿಗೆ ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಅನ್ನು ನೀಡುತ್ತದೆ. ಮೂಲ ಆಡಿಯೋ ಮತ್ತು ವಿಡಿಯೋವನ್ನು ಸಂಸ್ಥೆಯ ಒಳಗೇ ಇರಿಸಿಕೊಳ್ಳಬೇಕಾದ ಗೌಪ್ಯತೆಗೆ ಸೂಕ್ಷ್ಮವಾಗಿರುವ ಸಂಸ್ಥೆಗಳಿಗೆ, ಇದು ಒಂದು ಉತ್ತಮ ಪೈಲಟ್ ಮಾರ್ಗವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಇದರ ಆಡಿಯೋ ಮತ್ತು ವಿಡಿಯೋ ಎನ್ಕೋಡರ್ಗಳು ಎಂಟರ್ಪ್ರೈಸ್ ವರ್ಕ್ಲೋಡ್ಗಳ ಅಡಿಯಲ್ಲಿ ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಮತ್ತು ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ನ ಕಾರ್ಯಾಚರಣೆಯ ಹೊರೆ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ AI ತಂಡಗಳ ಕೌಶಲ್ಯಗಳಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆಯೇ ಎಂಬುದರ ಮೇಲೆ ಇದರ ನೈಜ ಮೌಲ್ಯವು ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.
