Xiaomi, MiMo V2.5ని విడుదల చేసింది. ఇది ఆడియో, చిత్రాలు మరియు వీడియోలను నేటివ్ టోకెన్లుగా పరిగణించే ఒక ఓపెన్-వెయిట్ మల్టీమోడల్ మోడల్ మరియు 1.05-మిలియన్ టోకెన్ల కాంటెక్స్ట్ విండోను అందిస్తుంది. దీని ధరల వివరాల ప్రకారం, ప్రతి మిలియన్ ఇన్పుట్ టోకెన్లకు $0.14 మరియు ప్రతి మిలియన్ అవుట్పుట్ టోకెన్లకు $0.28 ఉంటుంది. ఈ ధరల నిర్మాణం వల్ల సుదీర్ఘ సమావేశాలు లేదా వీడియో స్ట్రీమ్లను ఒకే ప్రాంప్ట్లో నడపడం సాధ్యమవుతుంది.
“open-weight” ఎందుకు ముఖ్యం
చాలా మల్టీమోడల్ AIలు వేర్వేరు ఫ్రంట్-ఎండ్లను కలిపి ఉపయోగిస్తాయి: ఒక స్పీచ్-టు-టెక్స్ట్ ఇంజిన్, ఒక ఇమేజ్-క్యాప్షనింగ్ మోడల్, ఆపై వచ్చిన టెక్స్ట్ను లార్జ్ లాంగ్వేజ్ మోడల్ (LLM)కి పంపిస్తాయి. LLM ఎప్పుడూ ముడి వేవ్ఫామ్ (raw waveform) లేదా పిక్సెల్ డేటాను చూడలేదు, కాబట్టి స్వరం (tone), విరామాలు (pauses) లేదా హావభావాల (gestures) వంటి సూక్ష్మ అంశాలు కోల్పోయే అవకాశం ఉంది. Xiaomi ప్రకారం, MiMo V2.5 ఆడియో మరియు వీడియోలను నేరుగా గ్రహిస్తుంది, తద్వారా టైమింగ్, ఇంటొనేషన్ మరియు విజువల్ క్యూలను (visual cues) కాపాడుతుంది. సిద్ధాంతపరంగా, ఇది ఒక ఫోన్ కాల్లో నిట్టూర్పును గుర్తించడానికి, వైట్బోర్డ్పై ఉన్న స్కెచ్ను అనుసరించడానికి లేదా మధ్యంతర ట్రాన్స్క్రిప్షన్ దశ లేకుండా ఒకేసారి మాట్లాడుతున్న వ్యక్తులను వేరు చేయడానికి మోడల్కు సహాయపడుతుంది.
మోడల్ వెయిట్స్ (weights) బహిరంగంగా విడుదల చేయబడినందున, సంస్థలు వీటిని డౌన్లోడ్ చేసుకుని తమ సొంత సర్వర్లలో (on-premise) నడుపుకోవచ్చు. ఇది ముడి మీడియాను క్లౌడ్ APIలకు పంపే సాధారణ పద్ధతిని నివారిస్తుంది. హెల్త్కేర్ మరియు ఫైనాన్స్ వంటి నియంత్రణలు ఉన్న రంగాల్లో ఈ పద్ధతిని అనుసరించడానికి చాలామంది ఇష్టపడరు లేదా అనుమతి ఉండదు.
సాంకేతిక ముఖ్యాంశాలు
- కాంటెక్స్ట్ విండో: 1.05 మిలియన్ టోకెన్లు, ఇది ఒక సుదీర్ఘ సమావేశాన్ని లేదా పూర్తి స్థాయి డాక్యుమెంటరీని ఒకే రిక్వెస్ట్లో సరిపోల్చడానికి సరిపోతుంది.
- ధర: ప్రతి మిలియన్ ఇన్పుట్ టోకెన్లకు $0.14, ప్రతి మిలియన్ అవుట్పుట్ టోకెన్లకు $0.28.
- మోడాలిటీస్: ఆడియో, ఇమేజ్, వీడియో, మరియు ప్రామాణిక టెక్స్ట్ హ్యాండ్లింగ్.
ఈ పెద్ద కాంటెక్స్ట్ విండో అందరి దృష్టిని ఆకర్షిస్తోంది. సాంప్రదాయ LLMలు కొన్ని వేల టోకెన్లకే పరిమితమవుతాయి, దీనివల్ల డెవలపర్లు సుదీర్ఘ రికార్డింగ్లను ముక్కలుగా చేయాల్సి వస్తుంది లేదా వీడియోలను చిన్న క్లిప్లుగా విభజించాల్సి వస్తుంది. MiMo V2.5తో, ఒక సుదీర్ఘ సమావేశాన్ని ముక్కలు చేయకుండానే ఒకే ప్రాంప్ట్లో ఉంచవచ్చు.
టెక్స్ట్ ఇంజిన్పై ఒక చూపు
ఆడియో మరియు వీడియో పైప్లైన్లను స్వతంత్రంగా బెంచ్మార్క్ చేయనప్పటికీ, టెక్స్ట్ కోర్ ప్రాథమిక పరీక్షలో ఉత్తమంగా నిలిచింది:
- కోడింగ్: ఈ మోడల్ క్లాసిక్ “merge intervals” సమస్యను పరిష్కరించింది మరియు
O(n log n)కాంప్లెక్సిటీతో ఒక అల్గారిథమ్ను రూపొందించింది, ఇది అల్గారిథమిక్ పరిమితులను అర్థం చేసుకోగలదని చూపుతుంది. - రీజనింగ్: ఇది మల్టీ-స్టెప్ మ్యాథ్ వర్డ్ ప్రాబ్లమ్ను నాలుగు స్పష్టమైన గణనలతో పరిష్కరించింది, ఇది chain-of-thought సామర్థ్యాన్ని ప్రదర్శిస్తుంది.
- స్ట్రక్చర్డ్ అవుట్పుట్: ఒక ఇన్వాయిస్ ఇమేజ్ వివరణను ఇచ్చినప్పుడు, ఇది లైన్ ఐటమ్స్, టోటల్స్ మరియు తేదీలతో కూడిన సరిగ్గా ఫార్మాట్ చేయబడిన JSON ఆబ్జెక్ట్ను అందించింది.
మల్టీమోడల్ మార్గాలకు అదే ట్రాన్స్ఫార్మర్ ఆర్కిటెక్చర్ పునాది కావడంతో, బలమైన టెక్స్ట్ ఫౌండేషన్ చాలా ముఖ్యం. భాషా విభాగం సరిగ్గా పనిచేయకపోతే, ఆడియో లేదా వీడియో క్యూలను అనుసంధానించే మోడల్ సామర్థ్యం పరిమితం అవుతుంది.
ప్రైవసీ-ఫస్ట్ యూస్ కేసెస్
ముడి మీడియాను తమ సొంత సంస్థలోనే ఉంచుకోవాల్సిన ఎంటర్ప్రైజ్లు ఇప్పుడు ఈ క్రింది వాటి కోసం ఒకే సెల్ఫ్-హోస్టెడ్ స్టాక్ను ఊహించుకోవచ్చు:
- మీటింగ్ ఇంటెలిజెన్స్: రికార్డింగ్లను థర్డ్-పార్టీ సర్వీస్కు పంపకుండానే సమ్మరీలు, యాక్షన్-ఐటమ్ ఎక్స్ట్రాక్షన్, స్పీకర్ అట్రిబ్యూషన్ మరియు సెంటిమెంట్ అనాలిసిస్.
- కాల్ అనలిటిక్స్: రియల్ టైమ్లో ఒత్తిడి, అసహనం లేదా నిబంధనలకు సంబంధించిన కీవర్డ్లను గుర్తించడం.
- వాయిస్ ఇంటర్ఫేస్లు: స్వరాన్ని అర్థం చేసుకుని, తగిన వాయిస్ ఇన్ఫ్లెక్షన్తో స్పందించే చాట్బాట్లను నిర్మించడం.
- వీడియో అనాలిసిస్: వెబినార్ల సమయంలో హావభావాలు, స్లైడ్
MiMo V2.5 చర్చను "మల్టీమోడల్ గ్లూ" స్థాయి నుండి, కార్పొరేట్ ఫైర్వాల్ వెనుక కూడా పనిచేయగలిగే "మల్టీమోడల్ బ్రెయిన్" స్థాయికి తీసుకెళ్తోంది. దీని ఓపెన్-వెయిట్ స్వభావం గోప్యత పట్ల సున్నితమైన సంస్థలకు అడ్డంకులను తగ్గిస్తుంది, కానీ వాగ్దానం చేయబడిన ఆడియో/వీడియో నాణ్యతకు ఇంకా నిరూపణ కావాలి. స్వతంత్ర పరీక్షలు ఈ వాదనలను ధృవీకరించే వరకు, ఈ మోడల్ యొక్క అతిపెద్ద ఆకర్షణ దాని భారీ కాంటెక్స్ట్ విండో మరియు అనేక AI సేవలను ఒకే సెల్ఫ్-హోస్టెడ్ స్టాక్లోకి ఏకీకృతం చేసే అవకాశం మాత్రమే.
