वर्णमाला गाना एक AI आवाज़ के लिए सबसे आसान काम होना चाहिए। A-B-C-D-E-F-G। सात अलग-अलग ध्वनियाँ, जो दुनिया के हर बच्चे के लिए परिचित हैं। फिर भी, जिसने भी AI संगीत निर्माण (music generation) के साथ प्रयोग किया है, वह जानता है कि वास्तविकता कहीं अधिक जटिल है। किसी मॉडल को वर्णमाला गाने के लिए कहें, और अक्षर L, M, N, O, और P अक्सर एक ही धुंधले शब्दांश (syllable) में सिमट जाते हैं। "Elemmennopee" कोई अक्षर नहीं है। यह एक लक्षण है।
यह LMNOP समस्या है, और यह नर्सरी राइम्स (nursery rhymes) से कहीं आगे तक फैली हुई है। सप्ताह के दिन, क्रमांकित निर्देश, और किसी भी प्रकार की क्रमबद्ध सूची (ordered list) इसी कमजोरी को उजागर करती है। एक डेवलपर ने हाल ही में एक AI पाइपलाइन के माध्यम से आठ गाने बनाकर और mlx-whisper, जो कि एक ऑटोमैटिक स्पीच रिकग्निशन टूल है, के साथ आउटपुट को मापकर इसका परीक्षण किया। व्यक्तिपरक सुनने (subjective listening) पर भरोसा करने के बजाय, उन्होंने ट्रांसक्रिप्शन सॉफ्टवेयर को यह रिपोर्ट करने दिया कि AI ने वास्तव में क्या गाया था। परिणाम चौंकाने वाले थे। गणना (enumeration) सिंथेटिक गायकों को उन तरीकों से उलझा देती है, जिनमें सामान्य भाषा नहीं उलझती।
सूचियाँ AI आवाज़ों को क्यों बिगाड़ देती हैं
बोली जाने वाली भाषा में संदर्भ (context) होता है। यदि कोई बुदबुदाता है, "मैं कुत्ते को पार्क ले जा रहा हूँ," और आप "कुत्ता" शब्द मिस कर देते हैं, तो भी वाक्य का अर्थ समझ में आ जाता है। आस-पास के शब्द खाली जगहों को भर देते हैं। सूचियाँ वह सुरक्षा कवच प्रदान नहीं करती हैं। प्रत्येक आइटम अलग खड़ा होता है। यदि मॉडल "B" और "D" के बीच के अंतर को अस्पष्ट कर देता है, तो श्रोता को आंशिक अर्थ नहीं मिलता। उन्हें केवल शोर (noise) सुनाई देता है।
वर्णमाला गीत में, LMNOP का समूह सबसे स्पष्ट विफलता बिंदु है। वॉइस मॉडल इस अनुक्रम को पांच अलग-अलग अक्षरों के बजाय एक एकल ध्वन्यात्मक समूह (phonetic blob) के रूप में मानता है। प्रत्येक ध्वनि को स्थिर करने के लिए संदर्भ संकेतों के बिना, सिंथेसाइज़र व्यंजनों (consonants) के बीच के बदलावों का अनुमान लगाता है। और यह आमतौर पर गलत अनुमान लगाता है। सप्ताह के दिनों या क्रमांकित चरणों के साथ भी ऐसा ही होता है। मॉडल अनुक्रम में जल्दबाजी करता है, जिससे अलग-अलग आइटम एक अस्पष्ट मिश्रण में दब जाते हैं।
नुकसान का मापन
इसका वस्तुनिष्ठ रूप से अध्ययन करने के लिए, डेवलपर ने आठ गाने तैयार किए और गीत की सटीकता को स्कोर करने के लिए उन्हें mlx-whisper के माध्यम से चलाया। पाइपलाइन सरल थी: एक प्रॉम्प्ट लिखें, ऑडियो जेनरेट करें, परिणाम का ट्रांसक्रिप्शन करें, और ट्रांसक्राइब किए गए टेक्स्ट की तुलना इच्छित गीतों से करें।
मानक कथात्मक गीतों (standard narrative lyrics) के लिए, आउटपुट काफी हद तक सटीक था। शब्द वहीं आए जहाँ उन्हें होना चाहिए था। लेकिन जब प्रॉम्प्ट में सूचियाँ, वर्णमाला, या गणनाएँ शामिल थीं, तो mlx-whisper ने अर्थहीन शब्द (gibberish) दिए। अक्षर गायब हो गए या मिल गए। संख्याएँ अपरिचित शब्दांशों में बदल गईं। प्रयोग ने पुष्टि की कि सूचियों से भरे गीतों की बोधगम्यता (intelligibility), गद्य (prose) की तुलना में काफी खराब होती है।
प्रॉम्प्ट आर्किटेक्चर जो मदद करता है
आप एक बिगड़ी हुई सूची को ठीक करने के लिए पोस्ट-प्रोसेसिंग पर भरोसा नहीं कर सकते। सुधार पहली धुन (note) जेनरेट होने से पहले ही होना चाहिए। सावधानीपूर्वक बनाया गया पहला प्रॉम्प्ट मॉडल को स्पष्ट उच्चारण (diction) के लिए मजबूर कर सकता है। इन समायोजनों में कोई लागत नहीं आती, लेकिन वे मॉडल के सांस लेने और रुकने के तरीके को बदल देते हैं।
लंबे अनुक्रमों को छोटे समूहों में तोड़ें। A-B-C-D-E के बजाय, पंक्ति को A-B-C-D और E-F-G के रूप में व्यवस्थित करें। समूहों के बीच छोटा सा रीसेट मॉडल को उन्हें आपस में मिलाने के बजाय सही व्यंजनों पर रुकने का मौका देता है।
संख्याओं को शब्दों में लिखें। "30" के बजाय "thirty" का उपयोग करें। लिखित अंक अमूर्त प्रतीक होते हैं; मॉडल कभी-कभी उन्हें संक्षिप्त, बिना स्वर वाले शोर में सिकोड़ देता है। एक पूरा अंग्रेजी शब्द ध्वन्यात्मक आधार प्रदान करता है।
अक्षरों के चारों ओर विजुअल स्पेसिंग डालें। "ABC" के बजाय हाइफ़न या स्पेस के साथ "A - B - C" लिखें। विजुअल अलगाव मॉडल को संकेत देता है कि ये स्वतंत्र आइटम हैं, न कि कोई एकल संक्षिप्त नाम (acronym) या शब्द।
शब्दांशों (syllable) की संख्या तय करें। प्रत्येक पंक्ति को छह से दस शब्दांशों के बीच रखें। अत्यधिक भिन्नता के कारण मॉडल छोटी पंक्तियों में जल्दबाजी करता है और लंबी पंक्तियों को खींचता है। सूचियों के लिए पहले से ही सटीकता की आवश्यकता होती है; असमान लय सटीक प्रस्तुति को लगभग असंभव बना देती है।
सूचियों से "and" शब्द हटा दें। प्राकृतिक बातचीत में, "and" एक संयोजक (conjunction) के रूप में कार्य करता है। गाई जाने वाली सूची में, यह एक नरम शब्दांश जोड़ता है जो अक्सर पिछले आइटम के स्पष्ट उच्चारण को निगल जाता है। "Monday, Tuesday, Wednesday" का उच्चारण "Monday, Tuesday, and Wednesday" की तुलना में अधिक स्पष्ट होता है।
पुनरुत्पादन का जाल
यहीं पर मानवीय अंतर्ज्ञान उल्टा पड़ जाता है। साधारण गीतों के साथ, बार-बार प्रॉम्प्टिंग (iterative prompting) करने से आमतौर पर परिणाम बेहतर होते हैं। आप एक गलत वाक्यांश सुनते हैं, शब्दों में थोड़ा बदलाव करते हैं, और फिर से जेनरेट करते हैं। अगला संस्करण बेहतर सुनाई देता है। परीक्षण ने दिखाया कि यह दृष्टिकोण गैर-गणना वाले गीतों के लिए काम करता है। लेकिन सूचियों वाले गीतों के लिए, प्रॉम्प्ट को फिर से लिखने से आउटपुट को समझना और भी कठिन हो गया।
डेटा स्पष्ट था। प्रॉम्प्ट सुधार के बाद गैर-सूची वाले गीतों में सुधार हुआ। गणना वाले गीतों की गुणवत्ता और गिर गई।
असली अपराधी 'acoustic seed' है। lyrics-to-song मॉडल्स में, प्रॉम्प्ट बदलने का मतलब केवल मौजूदा ऑडियो को एडिट करना नहीं होता है। यह पूरे जनरेटिव आधार (generative foundation) को फिर से व्यवस्थित कर देता है। मॉडल परफॉरमेंस को बिल्कुल शुरुआत से फिर से बनाता है। कथात्मक टेक्स्ट (narrative text) के लिए, नया डाइस रोल (dice roll) एक स्पष्ट टेक (take) पर रुक सकता है। सूचियों (lists) के मामले में, आप आमतौर पर और भी खराब उच्चारण (slur) को निमंत्रण दे रहे होते हैं। हो सकता है कि आप एक अक्षर की टाइमिंग ठीक कर लें, लेकिन अगले प्रयास में मॉडल 'J', 'K', और 'L' को पूरी तरह खराब कर दे। मूल टेक त्रुटिपूर्ण था, लेकिन सुधार अक्सर एक ध्वन्यात्मक गड़बड़ी (phonetic mess) की जगह दूसरी गड़बड़ी ले आता है।
लिस्ट-भारी लिरिक्स के लिए एक बेहतर वर्कफ़्लो
चूंकि पुनरुत्पादन (regeneration) से स्पष्टता खत्म होने का जोखिम रहता है, इसलिए आपकी प्रक्रिया बदलने की जरूरत है। परफेक्ट रीराइट (rewrite) के पीछे भागना बंद करें। इसके बजाय, पहले प्रॉम्प्ट को एक कास्टिंग कॉल की तरह मानें।
अलग-अलग रैंडम सीड्स (random seeds) का उपयोग करके बिल्कुल उसी प्रॉम्प्ट से कई वर्ज़न जनरेट करें। टेक्स्ट को न छुएं। लिरिक्स को स्थिर रखें और मॉडल को अपनी परफॉरमेंस बदलने दें। आप एक ऑडिशन ले रहे हैं, कोई एडिटिंग सेशन नहीं।
फिर प्रत्येक उम्मीदवार को स्कोर दें। प्रत्येक वर्ज़न को mlx-whisper या किसी समान ट्रांसक्रिप्शन टूल के माध्यम से चलाएं और मापें कि कौन सा टेक आपके प्रॉम्प्ट से सबसे सटीक रूप से मेल खाता है। लिरिक्स की सटीकता के आधार पर विजेता चुनें, भले ही इंस्ट्रूमेंटेशन या वोकल टोन थोड़ा कम पॉलिश किया हुआ हो। लिस्ट-भारी कंटेंट के लिए, वाइब (vibe) से ज्यादा स्पष्टता (intelligibility) मायने रखती है।
सबसे महत्वपूर्ण बात यह है कि अपने सुधारों को पहले ही कर लें (front-load)। जनरेट बटन दबाने से पहले ही स्पेसिंग नियम, शब्दांश सीमा (syllable limits) और ग्रुपिंग लागू कर दें। वर्णमाला वाला गाना साधारण अंग्रेजी में न लिखें और बाद में उसे ठीक करने की कोशिश न करें। जब सूचियाँ शामिल होती हैं, तो मॉडल बाद में किए गए सुधारों (retroactive edits) के प्रति कम उदार होता है। A
