گوگل نے منگل کے روز Gemini 3.5 Transcribe لانچ کیا۔ یہ اسپیچ ٹو ٹیکسٹ ماڈل فالتو الفاظ (filler words) کو ہٹا دیتا ہے، صارف کی فراہم کردہ اصطلاحات کا احترام کرتا ہے اور ایک ہی ریکارڈنگ میں تین مقررین تک کو ٹیگ کر سکتا ہے۔ خام آڈیو کو انسانی ایڈیٹر کے بغیر نکھرے ہوئے اور منظم متن میں تبدیل کر کے، یہ سروس میٹنگ نوٹس، قانونی دستاویزات اور دیگر کاموں کے لیے ٹرانسکرپٹس کو صاف کرنے میں ڈویلپرز کے لگنے والے وقت کو کم کر دیتی ہے۔
گوگل نے اب یہ قدم کیوں اٹھایا
گوگل کا آڈیو پروسیسنگ اسٹیک برسوں سے ارتقاء پذیر ہے، لیکن اس کی پچھلی پیشکش، Chirp 3، اب بھی وقفوں، تکنیکی اصطلاحات اور مقررین کی تبدیلیوں کے دوران دشواری کا شکار ہوتی تھی۔ ریموٹ ورک اور پوڈ کاسٹنگ نے ٹرانسکرپشن مارکیٹ کو بڑھا دیا ہے، پھر بھی بہت سے ادارے اب بھی دستی طور پر ڈیٹا پروسیسنگ یا مہنگے مخصوص وینڈرز پر انحصار کرتے ہیں۔ Gemini 3.5 Transcribe اس رکاوٹ کا حل ہے: ایک ایسا ماڈل جو نہ صرف آواز کو پہچانتا ہے بلکہ اسے فوری طور پر ایڈٹ بھی کرتا ہے۔
نیا ماڈل اصل میں کیا کرتا ہے
- خودکار طور پر فالتو الفاظ کا خاتمہ – ٹرانسکرپٹ تیار ہوتے وقت "um"، "uh" اور اس طرح کی غیر ضروری آوازیں غائب ہو جاتی ہیں، جس سے ایک صاف ستھرا متن حاصل ہوتا ہے۔
- مخصوص اصطلاحات (Custom vocabularies) – صارفین مخصوص شعبے کے الفاظ کی فہرست اپ لوڈ کر سکتے ہیں، جس سے ماڈل انہیں عام الفاظ میں تبدیل کرنے سے رک جاتا ہے۔ یہ ان شعبوں کے لیے اہم ہے جہاں مخففات (acronyms)، مصنوعات کے نام یا غیر ملکی ہجے کثرت سے استعمال ہوتے ہیں۔
- مقررین کی شناخت (Speaker attribution) – سسٹم تین الگ الگ آوازوں تک کی شناخت کرتا ہے، ہر جملے کو ایک مقرر کا لیبل دیتا ہے اور لفظ کی سطح پر ٹائم اسٹیمپ شامل کرتا ہے۔ قانونی ٹیمیں، طبی لکھاری اور صحافی براہ راست اصل فائل سے ٹائم کوڈ شدہ ریکارڈ تیار کر سکتے ہیں۔
- کثیر لسانی رسائی – گوگل کا دعویٰ ہے کہ اس کی درستگی 85 سے زیادہ زبانوں میں بہتر ہوئی ہے، جو کہ اس کے پچھلے ماڈل کے مقابلے میں ایک بڑا قدم ہے۔
یہ تمام صلاحیتیں ایک ڈویلپر پر مرکوز API کے ذریعے دستیاب ہیں۔ ایپس ٹرانسکرپٹ کی درخواست کرتی ہیں اور ایک JSON پے لوڈ وصول کرتی ہیں جس میں پہلے سے ہی صاف شدہ متن، اسپیکر ٹیگز اور ٹائم اسٹیمپس شامل ہوتے ہیں۔
Gemini آڈیو کا وسیع تر پھیلاؤ
Gemini 3.5 Transcribe آڈیو ماڈلز کے ایک وسیع خاندان کا حصہ ہے:
- Gemini 3.5 Live – ریئل ٹائم بات چیت کے لیے موزوں، یہ جملے کے درمیان مداخلت کو پچھلے لائیو ماڈلز کے مقابلے میں بہتر طریقے سے سنبھالتا ہے۔
- Gemini 3.5 Live Experimental – ایک اعلیٰ سطح کا استدلال کرنے والا ورژن جو پیچیدہ کاموں کو حل کرتے وقت اپنے مرحلہ وار سوچنے کے عمل کو بیان کرتا ہے۔
دونوں لائیو ماڈلز فی الحال انگریزی میں macOS Gemini ایپ پر اور چند علاقوں میں اینڈرائیڈ پر Rambler ڈکٹیشن فیچر کے ذریعے دستیاب ہیں۔
کون فائدہ اٹھا سکتا ہے
ڈویلپرز تعاون کے ٹولز، مواد تخلیق کرنے والے پلیٹ فارمز اور آواز پر مبنی اسسٹنٹس میں "بات کرتے ہوئے صفائی" (clean-as-you-speak) کا عمل شامل کر سکتے ہیں۔ ادارے تیار شدہ ٹرانسکرپٹس تیار کر سکتے ہیں، جس سے ان تیسرے فریق کی خدمات پر انحصار کم ہو جائے گا جو فی منٹ کے حساب سے چارج کرتے ہیں اور ڈیٹا ہینڈلنگ کے سخت قواعد نافذ کرتے ہیں۔ مواد تخلیق کرنے والے الگ سے ایڈیٹنگ کے بغیر نکھرے ہوئے کیپشنز شائع کر سکتے ہیں، جس سے ویڈیو اور پوڈ کاسٹ کے کام کی رفتار بڑھ جائے گی۔
کون متاثر ہو سکتا ہے
مخصوص ٹرانسکرپشن وینڈرز جو مقررین کی شناخت اور اصطلاحات کے استعمال کے لیے زیادہ قیمت وصول کرتے ہیں، ان کی مانگ میں کمی آ سکتی ہے، خاص طور پر لاگت کے حساس اسٹارٹ اپس میں۔ ماڈل کی تین مقررین کی حد بڑی تنظیموں کو ان مخصوص حلوں کی طرف بھی دھکیل سکتی ہے جو ایک ہی کال میں زیادہ شرکاء کو سپورٹ کرتے ہیں۔
حدود اور کھلے سوالات
- مقررین کی تعداد – فی فائل صرف تین مقررین کی شناخت کی جا سکتی ہے؛ بڑے پینلز والی میٹنگز کے لیے اب بھی بیرونی ٹولز کی ضرورت ہوگی۔
- زبانوں کا پھیلاؤ – کثیر لسانی سپورٹ کا اعلان کیا گیا ہے، لیکن لائیو ماڈلز اب بھی صرف انگریزی تک محدود ہیں، جس سے غیر انگریزی بولنے والے صارفین مکمل فعالیت کے لیے انتظار کر رہے ہیں۔
- پرائیویسی – کسی بھی کلاؤڈ پر مبنی اسپیچ سروس کی طرح، اداروں کو گوگل کے انفراسٹرکچر کی سہولت اور حساس آڈیو کو بیرونی سرورز سے دور رکھنے کی ضرورت کے درمیان توازن برقرار رکھنا ہوگا۔ گوگل کی شرائط مخصوص صارفین کے لیے آن پریمائس ڈیپلائمنٹ کی اجازت دیتی ہیں، لیکن وہ آپشن ابھی تک عوامی نہیں ہے۔
آگے کیا دیکھنا ہے
گوگل نے مستقبل کی اپ ڈیٹس کا اشارہ دیا ہے جو مقررین کی تعداد میں اضافہ کریں گی اور لائیو ماڈل کی کوریج کو مزید زبانوں تک پھیلائیں گی۔ API کے پرائسنگ لیولز پر نظر رکھنا بھی ضروری ہوگا؛ فی منٹ کے زیادہ اخراجات زیادہ حجم والے صارفین کے لیے پیداواری فائدے کو کم کر سکتے ہیں۔ آخر میں، ڈویلپرز کے درمیان اس کا استعمال یہ ظاہر کرے گا کہ آیا خودکار طور پر فالتو الفاظ کے خاتمے کی سہولت مخصوص اصطلاحات میں رہ جانے والی غلطیوں پر غالب آتی ہے یا نہیں۔
خلاصہ: Gemini 3.5 Transcribe بولے گئے ریکارڈنگز کو بہتر بنانے کے تھکا دینے والے کام کو ایک ہی API کال میں تبدیل کر دیتا ہے، جو ڈویلپرز کو صاف ستھرے اور اسپیکر ٹیگ شدہ متن کے لیے ایک تیار شدہ ٹول فراہم کرتا ہے۔ اس کی کامیابی کا دارومدار اس بات پر ہے کہ گوگل کتنی تیزی سے زبانوں کی سپورٹ کو وسعت دیتا ہے، اسپیکرز کی حد کو بڑھاتا ہے اور کاروباری رازداری کے خدشات کو دور کرتا ہے۔
