Xiaomi نے MiMo V2.5 متعارف کروا دیا ہے، جو کہ ایک open-weight multimodal ماڈل ہے جو آڈیو، تصاویر اور ویڈیو کو native tokens کے طور پر استعمال کرتا ہے اور 1.05 ملین ٹوکنز کا context window فراہم کرتا ہے۔ قیمتوں کی فہرست میں ہر ملین input tokens کے لیے $0.14 اور ہر ملین output tokens کے لیے $0.28 درج ہے، یہ قیمت کا ڈھانچہ اسے ایک ہی پرومپٹ میں طویل میٹنگز یا ویڈیو اسٹریمز چلانے کے لیے موزوں بناتا ہے۔
"open-weight" کیوں اہم ہے
زیادہ تر multimodal AI الگ الگ front-ends کو آپس میں جوڑتے ہیں: ایک speech-to-text انجن، ایک image-captioning ماڈل، اور پھر حاصل ہونے والے متن کو ایک large language model (LLM) میں بھیج دیتے ہیں۔ LLM کبھی بھی اصل waveform یا pixel ڈیٹا نہیں دیکھ پاتا، اس لیے لہجہ (tone)، وقفے (pauses) یا اشاروں (gestures) جیسی باریکیاں کھو سکتی ہیں۔ Xiaomi کا دعویٰ ہے کہ MiMo V2.5 آڈیو اور ویڈیو کو براہ راست جذب کرتا ہے، جس سے timing، intonation اور بصری اشارے (visual cues) محفوظ رہتے ہیں۔ نظریاتی طور پر، یہ ماڈل کو فون کال میں آہ بھرنے، وائٹ بورڈ پر بنائے گئے خاکے (sketch) پر نظر رکھنے، یا کسی درمیانی transcription مرحلے کے بغیر ایک ساتھ بولنے والے افراد کے درمیان فرق کرنے کی صلاحیت دیتا ہے۔
چونکہ ماڈل کے weights عوامی طور پر جاری کیے گئے ہیں، اس لیے تنظیمیں اسے ڈاؤن لوڈ کر کے اپنے مقامی سرورز (on-premise) پر چلا سکتی ہیں۔ یہ خام میڈیا (raw media) کو cloud APIs پر بھیجنے کے عام طریقے سے بچاتا ہے، جو کہ ایک ایسا قدم ہے جسے بہت سے ریگولیٹڈ شعبے—جیسے صحت اور مالیات—لینے سے کتراتے ہیں یا انہیں اس کی اجازت نہیں ہوتی۔
تکنیکی اہم اعداد و شمار
- Context window: 1.05 ملین ٹوکنز، جو ایک ہی درخواست میں کئی گھنٹوں کی میٹنگ یا مکمل دستاویزی فلم (documentary) کو شامل کرنے کے لیے کافی ہیں۔
- Pricing: ہر ملین input tokens کے لیے $0.14، ہر ملین output tokens کے لیے $0.28۔
- Modalities: آڈیو، تصویر، ویڈیو، کے ساتھ ساتھ معیاری متن (text) کی ہینڈلنگ۔
بڑا context window سب سے زیادہ توجہ حاصل کرتا ہے۔ روایتی LLMs چند ہزار ٹوکنز پر محدود ہوتے ہیں، جس سے ڈویلپرز کو طویل ریکارڈنگز کو ٹکڑوں میں تقسیم کرنے یا ویڈیو کو مختصر کلپس میں توڑنے پر مجبور ہونا پڑتا ہے۔ MiMo V2.5 کے ساتھ، ایک ہی پرومپٹ میں کئی گھنٹوں کی میٹنگ شامل ہو سکتی ہے بغیر اسے ٹکڑوں میں تقسیم کیے ۔
ٹیکسٹ انجن کا براہ راست جائزہ
اگرچہ آڈیو اور ویڈیو پائپ لائنز کی آزادانہ طور پر جانچ (benchmark) نہیں کی گئی ہے، لیکن ٹیکسٹ کور نے ایک فوری جانچ (sanity check) پاس کر لی ہے:
- Coding: ماڈل نے ایک کلاسک "merge intervals" مسئلہ حل کیا اور
O(n log n)پیچیدگی (complexity) کے ساتھ ایک الگورتھم تیار کیا، جو ظاہر کرتا ہے کہ یہ الگورتھمک حدود کو سمجھ سکتا ہے۔ - Reasoning: اس نے چار صاف ستھرے حسابات کے ذریعے ریاضی کے ایک کثیر مرحلہ وار مسئلے کا جواب دیا، جو chain-of-thought کی صلاحیت کو ظاہر کرتا ہے۔
- Structured output: انوائس کی تصویر کی تفصیل دیے جانے پر، اس نے لائن آئٹمز، ٹوٹل اور تاریخوں کے ساتھ ایک درست فارمیٹ شدہ JSON آبجیکٹ فراہم کیا۔
ایک مضبوط ٹیکسٹ بنیاد اس لیے اہم ہے کیونکہ وہی transformer architecture multimodal راستوں کی بنیاد بنتی ہے۔ اگر زبان کا پہلو کمزور پڑ جائے تو آڈیو یا ویڈیو اشاروں کو یکجا کرنے کی ماڈل کی صلاحیت محدود ہو جائے گی۔
رازداری کو ترجیح دینے والے استعمال کے کیسز
وہ ادارے جنہیں خام میڈیا اپنے پاس رکھنا ضروری ہے، اب درج ذیل کاموں کے لیے ایک ہی، خود سے ہوسٹ شدہ (self-hosted) سسٹم کا تصور کر سکتے ہیں:
- Meeting intelligence: ریکارڈنگز کو کسی تیسرے فریق کی سروس پر بھیجے بغیر خلاصے، ایکشن آئٹمز کا اخراج، اسپیکر کی شناخت، اور جذبات کا تجزیہ (sentiment analysis)۔
- Call analytics: ریئل ٹائم میں تناؤ، مایوسی، یا تعمیل (compliance) سے متعلقہ کلیدی الفاظ کا پتہ لگانا۔
- Voice interfaces: ایسے چیٹ بوٹس بنانا جو لہجے کو سمجھ سکیں اور مناسب آواز کے اتار چڑھاؤ کے ساتھ جواب دے سکیں۔
- Video analysis: ویبنار کے دوران اشاروں، سلائیڈ کی تبدیلیوں، یا اسکرین پر بنائے گئے خاکوں کو پہچاننا۔
تین الگ الگ وینڈر سلوشنز کی جگہ ایک ہی ماڈل کا استعمال کرنے سے انٹیگریشن کا بوجھ کم ہو جاتا ہے اور ڈیٹا لیک ہونے کے امکانات بھی کم ہو جاتے ہیں۔
احتیاطی تدابیر اور تصدیق کے امور
آڈیو اور ویڈیو کی صلاحیتیں ابھی تک صرف مینوفیکچرر کے دعوے ہیں؛ کوئی آزادانہ پیمائش شائع نہیں کی گئی ہے۔ ممکنہ صارفین کو پروڈکشن ورک لوڈز کے لیے عزم کرنے سے پہلے نمائندہ ڈیٹا سیٹس پر اپنے خود کے بینچ مارکس چلانے چاہئیں۔
قیمتیں، اگرچہ شفاف ہیں، لیکن فی ٹوکن (per-token) ہیں۔
آگے کیا دیکھنا ہے
- Benchmark releases: آڈیو/ویڈیو ٹوکنائزیشن کے معیار، لیٹنسی (latency) اور میموری فٹ پرنٹ کے لیے تیسرے فریق کے جائزے۔
- Tooling ecosystem: مقبول آڈیو کوڈیکس اور ویڈیو کنٹینرز کے لیے اوپن سورس ایڈاپٹرز جو براہ راست MiMo V2.5 میں ڈیٹا فراہم کریں۔
- Regulatory feedback: آیا ڈیٹا پرائیویسی ریگولیٹرز کلاؤڈ APIs کے مقابلے میں خود سے ہوسٹ شدہ open-weight ماڈلز کو کافی حفاظتی تدبیر سمجھتے ہیں۔
- Community contributions: چونکہ weights عوامی ہیں، اس لیے کمیونٹی مخصوص شعبوں (مثلاً طبی ڈکٹیشن، قانونی بیانات) کے لیے ماڈل کو فائن ٹیون کر سکتی ہے۔
MiMo V2.5 بحث کو "multimodal glue" سے "multimodal brain" کی طرف لے جاتا ہے جو کہ کارپوریٹ فائر وال کے پیچھے چل سکتا ہے۔ اس کی open-weight نوعیت رازداری کے حوالے سے حساس اداروں کے لیے رکاوٹیں کم کرتی ہے، لیکن وعدہ کردہ آڈیو/ویڈیو فائیڈلٹی کو ابھی ثبوت کی ضرورت ہے۔ جب تک آزادانہ ٹیسٹ ان دعووں کی تصدیق نہیں کر دیتے، اس ماڈل کا سب سے بڑا اہم پہلو اس کی وسیع context window اور کئی AI سروسز کو ایک واحد، self-hosted stack میں یکجا کرنے کا امکان ہے۔
