Xiaomi MiMo V2.5 ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ, ಇದು ಆಡಿಯೋ, ಚಿತ್ರಗಳು ಮತ್ತು ವೀಡಿಯೊಗಳನ್ನು ನೇರ ಟೋಕನ್‌ಗಳಾಗಿ ಪರಿಗಣಿಸುವ ಒಂದು ಓಪನ್-ವೇಟ್ ಮಲ್ಟಿಮೋಡಲ್ ಮಾಡೆಲ್ ಆಗಿದೆ ಮತ್ತು ಇದು 1.05 ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು (context window) ನೀಡುತ್ತದೆ. ಇದರ ಬೆಲೆ ಪಟ್ಟಿಯ ಪ್ರಕಾರ, ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.14 ಮತ್ತು ಪ್ರತಿ ಮಿಲಿಯನ್ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.28 ಆಗಿರುತ್ತದೆ. ಈ ಬೆಲೆ ರಚನೆಯು ದೀರ್ಘಾವಧಿಯ ಸಭೆಗಳು ಅಥವಾ ವೀಡಿಯೊ ಸ್ಟ್ರೀಮ್‌ಗಳನ್ನು ಒಂದೇ ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿ ನಡೆಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

“ಓಪನ್-ವೇಟ್” (open-weight) ಏಕೆ ಮುಖ್ಯ

ಹೆಚ್ಚಿನ ಮಲ್ಟಿಮೋಡಲ್ AIಗಳು ಪ್ರತ್ಯೇಕ ಫ್ರಂಟ್-ಎಂಡ್‌ಗಳನ್ನು ಒಟ್ಟುಗೂಡಿಸುತ್ತವೆ: ಒಂದು ಸ್ಪೀಚ್-ಟು-ಟೆಕ್ಸ್ಟ್ ಇಂಜಿನ್, ಒಂದು ಇಮೇಜ್-ಕ್ಯಾಪ್ಷನಿಂಗ್ ಮಾಡೆಲ್, ನಂತರ ಬರುವ ಪಠ್ಯವನ್ನು ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್‌ಗೆ (LLM) ನೀಡಲಾಗುತ್ತದೆ. ಇಲ್ಲಿ LLM ಎಂದಿಗೂ ಕಚ್ಚಾ ವೇವ್‌ಫಾರ್ಮ್ ಅಥವಾ ಪಿಕ್ಸೆಲ್ ಡೇಟಾವನ್ನು ನೋಡುವುದಿಲ್ಲ, ಆದ್ದರಿಂದ ಧ್ವನಿಯ ಏರಿಳಿತ (tone), ವಿರಾಮಗಳು ಅಥವಾ ಭಂಗಿಗಳಂತಹ ಸೂಕ್ಷ್ಮತೆಗಳು ಕಳೆದುಹೋಗಬಹುದು. Xiaomi ನ ಪ್ರಕಾರ, MiMo V2.5 ಆಡಿಯೋ ಮತ್ತು ವೀಡಿಯೊಗಳನ್ನು ನೇರವಾಗಿ ಸ್ವೀಕರಿಸುತ್ತದೆ, ಇದರಿಂದ ಸಮಯದ ನಿಖರತೆ, ಧ್ವನಿಯ ಏರಿಳಿತ ಮತ್ತು ದೃಶ್ಯ ಸೂಚನೆಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳಬಹುದು. ಸೈದ್ಧಾಂತಿಕವಾಗಿ, ಇದು ಫೋನ್ ಕರೆಗಳಲ್ಲಿನ ನಿಟ್ಟುಸಿರನ್ನು ಪತ್ತೆಹಚ್ಚಲು, ವೈಟ್‌ಬೋರ್ಡ್ ಮೇಲಿನ ಸ್ಕೆಚ್ ಅನ್ನು ಅನುಸರಿಸಲು ಅಥವಾ ಮಧ್ಯಂತರ ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಶನ್ ಹಂತವಿಲ್ಲದೆಯೇ ಒಂದೇ ಸಮಯದಲ್ಲಿ ಮಾತನಾಡುವ ವ್ಯಕ್ತಿಗಳನ್ನು ಗುರುತಿಸಲು ಮಾಡೆಲ್‌ಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ.

ಈ ಮಾಡೆಲ್‌ನ ತೂಕಗಳು (weights) ಮುಕ್ತವಾಗಿ ಬಿಡುಗಡೆಯಾಗಿರುವುದರಿಂದ, ಸಂಸ್ಥೆಗಳು ಇದನ್ನು ಡೌನ್‌ಲೋಡ್ ಮಾಡಿಕೊಂಡು ತಮ್ಮದೇ ಆದ ಸ್ಥಳೀಯ ಸರ್ವರ್‌ಗಳಲ್ಲಿ (on-premise) ಬಳಸಬಹುದು. ಇದು ಕಚ್ಚಾ ಮೀಡಿಯಾವನ್ನು ಕ್ಲೌಡ್ APIಗಳಿಗೆ ಕಳುಹಿಸುವ ಸಾಮಾನ್ಯ ಪದ್ಧತಿಯನ್ನು ತಪ್ಪಿಸುತ್ತದೆ, ಇದು ಆರೋಗ್ಯ ಮತ್ತು ಹಣಕಾಸಿನಂತಹ ಅನೇಕ ನಿಯಂತ್ರಿತ ವಲಯಗಳು ಮಾಡಲು ಹಿಂಜರಿಯುವ ಅಥವಾ ನಿಷೇಧಿಸಲ್ಪಟ್ಟಿರುವ ಹಂತವಾಗಿದೆ.

ತಾಂತ್ರಿಕ ಮುಖ್ಯಾಂಶಗಳು

  • Context window: 1.05 ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳು, ಇದು ಒಂದು ವಿನಂತಿಯಲ್ಲಿ (request) ಹಲವು ಗಂಟೆಗಳ ಸಭೆ ಅಥವಾ ಪೂರ್ಣ ಪ್ರಮಾಣದ ಸಾಕ್ಷ್ಯಚಿತ್ರವನ್ನು ಅಡಕಗೊಳಿಸಲು ಸಾಕಾಗುತ್ತದೆ.
  • Pricing: ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.14, ಪ್ರತಿ ಮಿಲಿಯನ್ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.28.
  • Modalities: ಆಡಿಯೋ, ಚಿತ್ರ, ವೀಡಿಯೊ, ಜೊತೆಗೆ ಸಾಮಾನ್ಯ ಪಠ್ಯ ನಿರ್ವಹಣೆ.

ಇದರಲ್ಲಿ ದೊಡ್ಡ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಎಲ್ಲರ ಗಮನ ಸೆಳೆಯುತ್ತದೆ. ಸಾಂಪ್ರದಾಯಿಕ LLMಗಳು ಕೆಲವು ಸಾವಿರ ಟೋಕನ್‌ಗಳಿಗೆ ಸೀಮಿತವಾಗಿರುತ್ತವೆ, ಇದರಿಂದಾಗಿ ಡೆವಲಪರ್‌ಗಳು ದೀರ್ಘ ರೆಕಾರ್ಡಿಂಗ್‌ಗಳನ್ನು ತುಂಡು ಮಾಡಬೇಕಾಗುತ್ತದೆ ಅಥವಾ ವೀಡಿಯೊವನ್ನು ಸಣ್ಣ ಕ್ಲಿಪ್‌ಗಳಾಗಿ ವಿಂಗಡಿಸಬೇಕಾಗುತ್ತದೆ. MiMo V2.5 ನೊಂದಿಗೆ, ಒಂದು ದೀರ್ಘಾವಧಿಯ ಸಭೆಯನ್ನು ತುಂಡು ಮಾಡದೆ ಒಂದೇ ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿ ಬಳಸಬಹುದು.

ಪಠ್ಯ ಇಂಜಿನ್‌ನ (text engine) ಮೊದಲ ನೋಟ

ಆಡಿಯೋ ಮತ್ತು ವೀಡಿಯೊ ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ಪರೀಕ್ಷಿಸದಿದ್ದರೂ, ಪಠ್ಯದ ಕೋರ್ (text core) ಒಂದು ಸಣ್ಣ ಪರೀಕ್ಷೆಯಲ್ಲಿ ಯಶಸ್ವಿಯಾಗಿದೆ:

  • Coding: ಮಾಡೆಲ್ ಒಂದು ಕ್ಲಾಸಿಕ್ “merge intervals” ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಿತು ಮತ್ತು O(n log n) ಸಂಕೀರ್ಣತೆಯ (complexity) ಅಲ್ಗಾರಿದಮ್ ಅನ್ನು ನೀಡಿತು, ಇದು ಅಲ್ಗಾರಿದಮಿಕ್ ನಿರ್ಬಂಧಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬಲ್ಲದು ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ.
  • Reasoning: ಇದು ನಾಲ್ಕು ಸ್ಪಷ್ಟ ಲೆಕ್ಕಾಚಾರಗಳ ಮೂಲಕ ಬಹು-ಹಂತದ ಗಣಿತದ ಪದ ಸಮಸ್ಯೆಗೆ ಉತ್ತರಿಸಿತು, ಇದು ಚೈನ್-ಆಫ್-ಥಾಟ್ (chain-of-thought) ಸಾಮರ್ಥ್ಯವನ್ನು ಪ್ರದರ್ಶಿಸುತ್ತದೆ.
  • Structured output: ಇನ್‌ವಾಯ್ಸ್ ಚಿತ್ರದ ವಿವರಣೆಯನ್ನು ನೀಡಿದಾಗ, ಇದು ಲೈನ್ ಐಟಂಗಳು, ಒಟ್ಟು ಮೊತ್ತ ಮತ್ತು ದಿನಾಂಕಗಳೊಂದಿಗೆ ಸರಿಯಾದ ಫಾರ್ಮ್ಯಾಟ್‌ನಲ್ಲಿರುವ JSON ಆಬ್ಜೆಕ್ಟ್ ಅನ್ನು ನೀಡಿತು.

ಪಠ್ಯದ ಬಲವಾದ ಅಡಿಪಾಯವು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಅದೇ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್ ಆರ್ಕಿಟೆಕ್ಚರ್ ಮಲ್ಟಿಮೋಡಲ್ ಮಾರ್ಗಗಳಿಗೂ ಅಡಿಪಾಯವಾಗಿದೆ. ಭಾಷೆಯ ಭಾಗವು ವಿಫಲವಾದರೆ, ಆಡಿಯೋ ಅಥವಾ ವೀಡಿಯೊ ಸೂಚನೆಗಳನ್ನು ಸಂಯೋಜಿಸುವ ಮಾಡೆಲ್‌ನ ಸಾಮರ್ಥ್ಯವು ಸೀಮಿತವಾಗಿರುತ್ತದೆ.

ಗೌಪ್ಯತೆಗೆ ಆದ್ಯತೆ ನೀಡುವ ಬಳಕೆಗಳು (Privacy-first use cases)

ಕಚ್ಚಾ ಮೀಡಿಯಾವನ್ನು ತಮ್ಮದೇ ಆದ ಸಂಸ್ಥೆಯೊಳಗೆ ಇಟ್ಟುಕೊಳ್ಳಲೇಬೇಕಾದ ಉದ್ಯಮಗಳು ಈಗ ಈ ಕೆಳಗಿನವುಗಳಿಗಾಗಿ ಒಂದೇ, ಸೆಲ್ಫ್-ಹೋಸ್ಟೆಡ್ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಬಳಸಬಹುದು:

  • Meeting intelligence: ರೆಕಾರ್ಡಿಂಗ್‌ಗಳನ್ನು ಮೂರನೇ ವ್ಯಕ್ತಿಯ ಸೇವೆಗೆ ಕಳುಹಿಸದೆ ಸಾರಾಂಶಗಳು, ಕಾರ್ಯಸೂಚಿಗಳ ಹೊರತೆಗೆಯುವಿಕೆ (action-item extraction), ವಕ್ತಾರರ ಗುರುತಿಸುವಿಕೆ ಮತ್ತು ಭಾವನಾತ್ಮಕ ವಿಶ್ಲೇಷಣೆ (sentiment analysis).
  • Call analytics: ನೈಜ ಸಮಯದಲ್ಲಿ ಒತ್ತಡ, ಹತಾಶೆ ಅಥವಾ ಅನುಸರಣೆ ಸಂಬಂಧಿತ (compliance-related) ಕೀವರ್ಡ್‌ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು.
  • Voice interfaces: ಧ್ವನಿಯ ಏರಿಳಿತವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬಲ್ಲ ಮತ್ತು ಸೂಕ್ತವಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸಬಲ್ಲ ಚಾಟ್‌ಬಾಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುವುದು.
  • Video analysis: ವೆಬಿನಾರ್‌ಗಳ ಸಮಯದಲ್ಲಿ ಭಂಗಿಗಳು, ಸ್ಲೈಡ್ ಬದಲಾವಣೆಗಳು ಅಥವಾ ಪರದೆಯ ಮೇಲಿನ ಚಿತ್ರಣಗಳನ್ನು ಗುರುತಿಸುವುದು.

ಮೂರು ಪ್ರತ್ಯೇಕ ವೆಂಡರ್ ಪರಿಹಾರಗಳ ಬದಲಿಗೆ ಒಂದೇ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸುವುದರಿಂದ ಇಂಟಿಗ್ರೇಷನ್ ವೆಚ್ಚ ಕಡಿಮೆಯಾಗುತ್ತದೆ ಮತ್ತು ಡೇಟಾ ಸೋರಿಕೆಯ ಸಾಧ್ಯತೆಗಳು ತಗ್ಗುತ್ತವೆ.

ಎಚ್ಚರಿಕೆಗಳು ಮತ್ತು ಪರಿಶೀಲಿಸಬೇಕಾದ ಅಂಶಗಳು

ಆಡಿಯೋ ಮತ್ತು ವೀಡಿಯೊ ಸಾಮರ್ಥ್ಯಗಳು ತಯಾರಕರ ಹೇಳಿಕೆಗಳಾಗಿವೆ; ಯಾವುದೇ ಸ್ವತಂತ್ರ ಅಳತೆಗಳು ಪ್ರಕಟವಾಗಿಲ್ಲ. ಬಳಕೆದಾರರು ಉತ್ಪಾದನಾ ಕೆಲಸಗಳಿಗೆ (production workloads) ಬಳಸುವ ಮೊದಲು ಪ್ರತಿನಿಧಿಸುವ ಡೇಟಾ ಸೆಟ್‌ಗಳ ಮೇಲೆ ತಮ್ಮದೇ ಆದ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳನ್ನು ನಡೆಸಬೇಕು.

ಬೆಲೆ ಪಾರದರ್ಶಕವಾಗಿದ್ದರೂ, ಅದು ಪ್ರತಿ ಟೋಕನ್‌ಗೆ ಇರುತ್ತದೆ.

ಮುಂದೆ ಗಮನಿಸಬೇಕಾದವುಗಳು

  • Benchmark releases: ಆಡಿಯೋ/ವೀಡಿಯೊ ಟೋಕನೈಸೇಶನ್ ಗುಣಮಟ್ಟ, ವಿಳಂಬ (latency) ಮತ್ತು ಮೆಮೊರಿ ಫುಟ್‌ಪ್ರಿಂಟ್ ಕುರಿತ ಮೂರನೇ ವ್ಯಕ್ತಿಯ ಮೌಲ್ಯಮಾಪನಗಳು.
  • Tooling ecosystem: MiMo V2.5 ಗೆ ನೇರವಾಗಿ ಫೀಡ್ ಆಗುವ ಜನಪ್ರಿಯ ಆಡಿಯೋ ಕೋಡೆಕ್‌ಗಳು ಮತ್ತು ವೀಡಿಯೊ ಕಂಟೇನರ್‌ಗಳಿಗಾಗಿ ಓಪನ್-ಸೋರ್ಸ್ ಅಡಾಪ್ಟರ್‌ಗಳು.
  • Regulatory feedback: ಡೇಟಾ-ಪ್ರೈವೆಸಿ ನಿಯಂತ್ರಕರು ಕ್ಲೌಡ್ APIಗಳಿಗೆ ಹೋಲಿಸಿದರೆ ಸೆಲ್ಫ್-ಹೋಸ್ಟೆಡ್ ಓಪನ್-ವೇಟ್ ಮಾಡೆಲ್‌ಗಳನ್ನು ಸಾಕಷ್ಟು ಸುರಕ್ಷಿತವೆಂದು ಪರಿಗಣಿಸುತ್ತಾರೆಯೇ ಎಂಬುದು.
  • Community contributions: ತೂಕಗಳು (weights) ಸಾರ್ವಜನಿಕವಾಗಿರುವುದರಿಂದ, ಸಮುದಾಯವು ಮಾಡೆಲ್ ಅನ್ನು ನಿರ್ದಿಷ್ಟ ಕ್ಷೇತ್ರಗಳಿಗಾಗಿ (ಉದಾಹರಣೆಗೆ: ವೈದ್ಯಕೀಯ ಡಿಕ್ಟೇಶನ್, ಕಾನೂನು ಸಾಕ್ಷ್ಯಗಳು) ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಬಹುದು.

MiMo V2.5 ಸಂಭಾಷಣೆಯ ದಿಕ್ಕನ್ನು "multimodal glue" ನಿಂದ "multimodal brain" ಕಡೆಗೆ ಬದಲಾಯಿಸುತ್ತದೆ, ಇದು ಕಾರ್ಪೊರೇಟ್ ಫೈರ್‌ವಾಲ್‌ನ ಹಿಂದೆ ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲದು. ಇದರ ಓಪನ್-ವೇಟ್ ಸ್ವರೂಪವು ಗೌಪ್ಯತೆಗೆ ಹೆಚ್ಚಿನ ಆದ್ಯತೆ ನೀಡುವ ಸಂಸ್ಥೆಗಳಿಗೆ ಇರುವ ಅಡೆತಡೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಆದರೆ ಭರವಸೆ ನೀಡಲಾದ ಆಡಿಯೋ/ವಿಡಿಯೋ ನಿಖರತೆಯು ಇನ್ನೂ ಸಾಬೀತುಪಡಿಸಬೇಕಿದೆ. ಸ್ವತಂತ್ರ ಪರೀಕ್ಷೆಗಳು ಈ ಹೇಳಿಕೆಗಳನ್ನು ಖಚಿತಪಡಿಸುವವರೆಗೆ, ಈ ಮಾಡೆಲ್‌ನ ಅತಿದೊಡ್ಡ ಆಕರ್ಷಣೆಯ ಅಂಶವೆಂದರೆ ಅದರ ಬೃಹತ್ ಕಾನ್ಟೆಕ್ಸ್ಟ್ ವಿಂಡೋ ಮತ್ತು ಹಲವಾರು AI ಸೇವೆಗಳನ್ನು ಒಂದೇ ಸೆಲ್ಫ್-ಹೋಸ್ಟೆಡ್ ಸ್ಟ್ಯಾಕ್‌ನಲ್ಲಿ ಸಂಯೋಜಿಸುವ ಸಾಧ್ಯತೆಯಾಗಿದೆ.