اے آئی (AI) آواز کے لیے حروفِ تہجی گانا سب سے آسان کام ہونا چاہیے۔ A-B-C-D-E-F-G۔ زمین پر موجود ہر بچے کے لیے سات الگ الگ آوازیں مانوس ہیں۔ پھر بھی، جس کسی نے بھی اے آئی میوزک جنریشن (AI music generation) کے ساتھ تجربہ کیا ہے، وہ جانتا ہے کہ حقیقت اس سے کہیں زیادہ الجھی ہوئی ہے۔ اگر آپ کسی ماڈل سے حروفِ تہجی گانے کو کہیں، تو اکثر L، M، N، O، اور P جیسے حروف ایک ہی دھندلے لفظ میں ضم ہو جاتے ہیں۔ "Elemmennopee" کوئی حرف نہیں ہے۔ یہ ایک علامت ہے۔
یہ LMNOP کا مسئلہ ہے، اور اس کا دائرہ کار نرسری نظموں سے کہیں زیادہ وسیع ہے۔ ہفتے کے دن، نمبروں والی ہدایات، اور کسی بھی قسم کی ترتیب وار فہرستیں اسی کمزوری کو ظاہر کرتی ہیں۔ ایک ڈویلپر نے حال ہی میں ایک اے آئی پائپ لائن (AI pipeline) کے ذریعے آٹھ گانے تیار کر کے اور mlx-whisper (جو کہ ایک خودکار تقریر کی شناخت کرنے والا ٹول ہے) کے ذریعے ان کے نتائج کو ناپ کر اس کا امتحان لیا۔ موضوعی سماعت (subjective listening) پر بھروسہ کرنے کے بجائے، انہوں نے ٹرانسکرپشن سافٹ ویئر کو یہ رپورٹ کرنے دیا کہ اے آئی نے اصل میں کیا گایا تھا۔ نتائج بالکل واضح تھے۔ گنتی یا ترتیب بتانا مصنوعی گلوکاروں کو ان طریقوں سے الجھا دیتا ہے جو عام زبان میں نہیں ہوتا۔
فہرستیں اے آئی آوازوں کو کیوں خراب کرتی ہیں
بول چال کی زبان میں سیاق و سباق (context) ہوتا ہے۔ اگر کوئی بڑبڑاتے ہوئے کہے، "میں کتے کو پارک لے جا رہا ہوں،" اور آپ لفظ "کتا" نہ سن پائیں، تب بھی جملہ سمجھ میں آ جاتا ہے۔ ارد گرد کے الفاظ خلا کو پر کر دیتے ہیں۔ فہرستیں وہ حفاظتی جال فراہم نہیں کرتیں۔ ہر آئٹم الگ ہوتا ہے۔ اگر ماڈل "B" اور "D" کے درمیان فرق کو دھندلا دیتا ہے، تو سننے والے کو کوئی جزوی معنی نہیں ملتا، بلکہ اسے صرف شور سنائی دیتا ہے۔
حروفِ تہجی کے گانے میں، LMNOP کا مجموعہ سب سے واضح ناکامی کا نقطہ ہے۔ آواز کا ماڈل اس ترتیب کو پانچ الگ الگ حروف کے بجائے ایک ہی صوتی مجموعے (phonetic blob) کے طور پر لیتا ہے۔ ہر آواز کو مستحکم کرنے کے لیے سیاق و سباق کے اشاروں کے بغیر، سنتیسائزر (synthesizer) حروفِ صحیح (consonants) کے درمیان تبدیلیوں کا اندازہ لگاتا ہے۔ اور عام طور پر اس کا اندازہ غلط ہوتا ہے۔ یہی چیز ہفتے کے دنوں یا نمبروں والے مراحل کے ساتھ بھی ہوتی ہے۔ ماڈل اس ترتیب میں تیزی دکھاتا ہے، اور مختلف آئٹمز کو ایک غیر واضح مجموعے میں دبا دیتا ہے۔
نقصان کی پیمائش
اس کا معروضی مطالعہ کرنے کے لیے، ڈویلپر نے آٹھ گانے تیار کیے اور بول کی درستگی کو جانچنے کے لیے انہیں mlx-whisper کے ذریعے چلایا۔ پائپ لائن سادہ تھی: ایک پرامپٹ (prompt) لکھیں، آڈیو تیار کریں، نتیجے کی ٹرانسکرپشن کریں، اور ٹرانسکرائب شدہ متن کا اصل بول سے موازنہ کریں۔
عام بیانیہ بول (narrative lyrics) کے لیے، نتیجہ کافی حد تک درست تھا۔ الفاظ اپنی صحیح جگہ پر تھے۔ لیکن جب پرامپٹس میں فہرستیں، حروفِ تہجی، یا گنتی شامل تھی، تو mlx-whisper نے بے معنی الفاظ (gibberish) واپس کیے۔ حروف غائب ہو گئے یا آپس میں مل گئے۔ نمبر ناقابل شناخت الفاظ میں بدل گئے۔ تجربے نے اس بات کی تصدیق کی کہ فہرستوں پر مشتمل بول، نثر (prose) کے مقابلے میں نمایاں طور پر کم سمجھ میں آنے والے ہوتے ہیں۔
پرامپٹ کی ایسی ساخت جو مددگار ثابت ہو
آپ کسی بگڑے ہوئے لسٹ کو ٹھیک کرنے کے لیے پوسٹ پروسیسنگ (post-processing) پر بھروسہ نہیں کر سکتے۔ اصلاح پہلی نوٹ کے تیار ہونے سے پہلے ہونی چاہیے۔ ایک احتیاط سے تیار کردہ پہلا پرامپٹ ماڈل کو واضح تلفظ پر مجبور کر سکتا ہے۔ ان تبدیلیوں کی کوئی قیمت نہیں لگتی، لیکن یہ ماڈل کے سانس لینے اور رکنے کے انداز کو بدل دیتی ہیں۔
لمبی ترتیبوں کو چھوٹے گروہوں میں تقسیم کریں۔ A-B-C-D-E کے بجائے، لائن کو A-B-C-D اور E-F-G کے طور پر ترتیب دیں۔ گروہوں کے درمیان یہ چھوٹا سا وقفہ ماڈل کو حروف کو آپس میں ملانے کے بجائے صحیح حروفِ صحیح (consonants) پر ٹھہرنے کا موقع دیتا ہے۔
نمبروں کو لفظوں میں لکھیں۔ "30" کے بجائے "thirty" استعمال کریں۔ لکھے ہوئے ہندسے تجریدی علامات ہوتے ہیں؛ ماڈل کبھی کبھی انہیں مختصر اور بے آواز شور میں دبا دیتا ہے۔ ایک مکمل انگریزی لفظ صوتی مواد (phonetic substance) فراہم کرتا ہے۔
حروف کے گرد بصری فاصلہ ڈالیں۔ "ABC" کے بجائے ہائفن یا سپیس کے ساتھ "A - B - C" لکھیں۔ یہ بصری علیحدگی ماڈل کو اشارہ دیتی ہے کہ یہ آزاد آئٹمز ہیں، نہ کہ کوئی ایک مخفف یا لفظ۔
مقطع (syllable) کی تعداد کو محدود رکھیں۔ ہر لائن کو چھ سے دس مقاطع کے درمیان رکھیں۔ بہت زیادہ فرق کی وجہ سے ماڈل چھوٹی لائنوں میں تیزی دکھاتا ہے اور لمبی لائنوں کو کھینچتا ہے۔ فہرستوں کے لیے پہلے ہی درستگی کی ضرورت ہوتی ہے؛ غیر ہموار تال (rhythm) درست ادائیگی کو تقریباً ناممکن بنا دیتی ہے۔
فہرستوں سے لفظ "and" نکال دیں۔ عام بول چال میں "and" ایک حرفِ عطف (conjunction) کے طور پر کام کرتا ہے۔ گائے جانے والی فہرست میں، یہ ایک نرم مقطع شامل کر دیتا ہے جو اکثر پچھلے آئٹم کے سخت تلفظ کو نگل لیتا ہے۔ "Monday, Tuesday, and Wednesday" کے مقابلے میں "Monday, Tuesday, Wednesday" زیادہ صاف سنائی دیتا ہے۔
دوبارہ جنریشن کا جال
یہاں انسانی وجدان الٹا پڑ جاتا ہے۔ عام بول کے لیے، بار بار پرامپٹ تبدیل کرنا (iterative prompting) عام طور پر نتائج کو بہتر بناتا ہے۔ آپ کوئی غلط لفظ سنتے ہیں، الفاظ میں تبدیلی کرتے ہیں، اور دوبارہ جنریٹ کرتے ہیں۔ اگلا ورژن بہتر لگتا ہے۔ ٹیسٹ نے دکھایا کہ یہ طریقہ غیر فہرست والے گانوں کے لیے کام کرتا ہے۔ لیکن فہرستوں پر مشتمل گانوں کے لیے، پرامپٹ کو دوبارہ لکھنے سے نتیجہ سمجھنا مزید مشکل ہو گیا۔
ڈیٹا بالکل واضح تھا۔ غیر فہرست والے گانوں میں پرامپٹ کی اصلاح کے بعد بہتری آئی، جبکہ گنتی یا ترتیب والے گانوں کی صورتحال مزید بگڑ گئی۔
اصل قصوروار acoustic seed ہے۔ lyrics-to-song ماڈلز میں، پرامپٹ تبدیل کرنے سے صرف موجودہ آڈیو میں ترمیم نہیں ہوتی، بلکہ یہ پورے تخلیقی ڈھانچے (generative foundation) کو دوبارہ ترتیب دے دیتا ہے۔ ماڈل پرفارمنس کو بالکل شروع سے دوبارہ بناتا ہے۔ بیانیہ متن (narrative text) کے لیے، نئے ڈائس رول کا نتیجہ ایک زیادہ واضح ورژن کے طور پر نکل سکتا ہے۔ لیکن فہرستوں (lists) کے معاملے میں، آپ عام طور پر مزید بدتر اور غیر واضح ادائیگی کو دعوت دے رہے ہوتے ہیں۔ ہو سکتا ہے کہ آپ ایک حرف کی ٹائمنگ ٹھیک کر لیں، لیکن اگلے ہی لمحے ماڈل اگلی کوشش میں "J," "K," اور "L" کو مکمل طور پر دبا دے یا خراب کر دے۔ اصل ورژن میں خامیاں تھیں، لیکن نظرثانی اکثر ایک فونٹیاتی (phonetic) گڑبڑ کے بدلے دوسری گڑبڑ لے آتی ہے۔
فہرستوں پر مبنی بول (lyrics) کے لیے ایک بہتر طریقہ کار
چونکہ دوبارہ جنریٹ کرنے سے وضاحت (clarity) ختم ہونے کا خطرہ ہوتا ہے، اس لیے آپ کے طریقہ کار کو بدلنے کی ضرورت ہے۔ مکمل نظرثانی کے پیچھے بھاگنا چھوڑ دیں۔ اس کے بجائے، پہلے پرامپٹ کو ایک کاسٹنگ کال (casting call) کی طرح سمجھیں۔
مختلف random seeds کا استعمال کرتے ہوئے بالکل ایک ہی پرامپٹ سے متعدد ورژن تیار کریں۔ متن کو نہ چھیڑیں۔ بول (lyrics) کو مستقل رکھیں اور ماڈل کو اپنی کارکردگی میں تبدیلی کرنے دیں۔ آپ ایک آڈیشن کر رہے ہیں، ایڈیٹنگ کا سیشن نہیں۔
پھر ہر امیدوار (ورژن) کو نمبر دیں۔ ہر ورژن کو mlx-whisper یا اسی طرح کے ٹرانسکرپشن ٹول کے ذریعے چلا کر دیکھیں کہ کون سا ورژن آپ کے پرامپٹ کے ساتھ سب سے زیادہ وفاداری سے مطابقت رکھتا ہے۔ جیتنے والے کا انتخاب بول کی درستگی کی بنیاد پر کریں، چاہے موسیقی (instrumentation) یا آواز کا لہجہ تھوڑا کم پالش ہو۔ فہرستوں پر مبنی مواد کے لیے، 'vibe' سے زیادہ بات کی سمجھ میں آنے (intelligibility) کی اہمیت ہے۔
سب سے اہم بات یہ ہے کہ اپنی اصلاحات کو شروع میں ہی کر لیں۔ جنریٹ بٹن دبانے سے پہلے ہی سپیسنگ کے اصول، ہجوں (syllable) کی حد، اور گروپنگ لاگو کر لیں۔ حروفِ تہجی والا گانا سادہ انگریزی میں نہ لکھیں اور بعد میں اسے ٹھیک کرنے کی کوشش نہ کریں۔ جب فہرستیں شامل ہوں تو ماڈل بعد میں کی جانے والی ترامیم کے معاملے میں کم رعایت دیتا ہے۔ A
