एआय (AI) आवाजासाठी वर्णमाला गाणे ही सर्वात सोपी गोष्ट असायला हवी. A-B-C-D-E-F-G. सात वेगळे ध्वनी, जे पृथ्वीवरील प्रत्येक मुलाला परिचित आहेत. तरीही, ज्या कोणी AI संगीत निर्मितीचा (AI music generation) प्रयोग केला आहे, त्यांना माहित आहे की वास्तव अधिक गुंतागुंतीचे आहे. एखाद्या मॉडेलला वर्णमाला गाण्यास सांगितले की, L, M, N, O आणि P ही अक्षरे अनेकदा एकाच अस्पष्ट शब्दांत विलीन होतात. "Elemmennopee" हे अक्षर नाही. ते एक लक्षण आहे.
ही 'LMNOP समस्या' आहे आणि ती केवळ बालगीतांपुरती मर्यादित नाही. आठवड्याचे वार, क्रमांकाच्या सूचना आणि कोणत्याही प्रकारच्या क्रमाने दिलेल्या यादीमध्ये हीच कमजोरी दिसून येते. एका डेव्हलपरने अलीकडेच एका AI पाइपलाइनद्वारे आठ गाणी तयार करून आणि mlx-whisper (एक ऑटोमॅटिक स्पीच रिकग्निशन टूल) वापरून त्याचे मोजमाप करून याची चाचणी घेतली. वैयक्तिक श्रवणावर अवलंबून राहण्याऐवजी, त्यांनी ट्रान्सक्रिप्शन सॉफ्टवेअरला AI ने नेमके काय गायले आहे, याचा अहवाल देऊ दिला. निकाल धक्कादायक होते. सामान्य भाषेमध्ये जे घडत नाही, तेच 'एनुमरेशन' (क्रमांक किंवा यादी) मुळे सिंथेटिक गायकांसाठी अडथळा ठरते.
याद्यांमुळे AI आवाज का बिघडतात
बोलल्या जाणाऱ्या भाषेत संदर्भ असतो. जर कोणी पुटपुटले, "मी कुत्र्याला बागेत नेतोय," आणि तुमचे "कुत्रा" हे शब्द सुटले, तरीही वाक्याचा अर्थ समजतो. आजूबाजूचे शब्द रिकाम्या जागा भरून काढतात. याद्यांमध्ये अशी कोणतीही सुरक्षा कवच नसते. प्रत्येक घटक स्वतंत्र असतो. जर मॉडेलने "B" आणि "D" मधील फरक अस्पष्ट केला, तर श्रोत्याला अर्धवट अर्थ मिळत नाही, तर फक्त गोंधळ (noise) ऐकू येतो.
वर्णमाला गाण्यात, LMNOP चा समूह हा सर्वात स्पष्ट अपयशाचा बिंदू आहे. व्हॉइस मॉडेल या क्रमाला पाच वेगवेगळ्या अक्षरांच्या ऐवजी एकच ध्वन्यात्मक समूह (phonetic blob) मानते. प्रत्येक ध्वनीला आधार देण्यासाठी संदर्भाशिवाय, सिंथेसायझर व्यंजनांमधील बदलांचा अंदाज लावण्याचा प्रयत्न करतो. त्याचा अंदाज सहसा चुकीचा असतो. आठवड्याचे वार किंवा क्रमांकाच्या पायऱ्यांच्या बाबतीतही हेच घडते. मॉडेल या क्रमाने वेगाने पुढे जाते, ज्यामुळे स्वतंत्र घटक एका अस्पष्ट मिश्रणात विलीन होतात.
नुकसानीचे मोजमाप
याचा वस्तुनिष्ठ अभ्यास करण्यासाठी, डेव्हलपरने आठ गाणी तयार केली आणि गीतांच्या अचूकतेचे मोजमाप करण्यासाठी ती mlx-whisper मधून चालवली. ही प्रक्रिया सोपी होती: एक प्रॉम्प्ट लिहा, ऑडिओ तयार करा, निकालाचे ट्रान्सक्रिप्शन करा आणि ट्रान्सक्राइब केलेल्या मजकुराची मूळ गीतांशी तुलना करा.
सामान्य वर्णनात्मक गीतांसाठी, आउटपुट बऱ्यापैकी अचूक होते. शब्द योग्य ठिकाणी आले. परंतु जेव्हा प्रॉम्प्टमध्ये याद्या, वर्णमाला किंवा क्रमांक समाविष्ट होते, तेव्हा mlx-whisper ने अर्थहीन शब्द (gibberish) दिले. अक्षरे गायब झाली किंवा एकमेकांत मिसळली. अंक ओळखता न येणाऱ्या अक्षरांमध्ये (syllables) बदलले. या प्रयोगातून हे सिद्ध झाले की, गद्यापेक्षा याद्यांनी भरलेली गीते समजण्यास लक्षणीयरीत्या कठीण असतात.
मदत करणारी प्रॉम्प्ट आर्किटेक्चर (Prompt Architecture)
विस्कळीत झालेली यादी सुधारण्यासाठी तुम्ही पोस्ट-प्रोसेसिंगवर अवलंबून राहू शकत नाही. सुधारणा पहिली नोट तयार होण्यापूर्वीच होणे आवश्यक आहे. काळजीपूर्वक तयार केलेला पहिला प्रॉम्प्ट मॉडेलला अधिक स्पष्ट उच्चार करण्यास भाग पाडू शकतो. या बदलांसाठी काहीही खर्च येत नाही, परंतु ते मॉडेलचा श्वास घेण्याचा आणि थांबण्याचा (pauses) मार्ग बदलतात.
लांब ओळींचे लहान गटांत विभाजन करा. A-B-C-D-E ऐवजी, ओळीची रचना A-B-C-D आणि E-F-G अशी करा. गटांमधील हा छोटा विराम मॉडेलला अक्षरे एकत्र मिसळण्याऐवजी योग्य व्यंजनांवर लक्ष केंद्रित करण्याची संधी देतो.
अंकांचे शब्द रूपात लिहा. '30' ऐवजी 'thirty' वापरा. लिखित अंक हे अमूर्त प्रतीक आहेत; मॉडेल कधीकधी त्यांना संक्षिप्त, अस्पष्ट आवाजात दाबते. पूर्ण इंग्रजी शब्द ध्वन्यात्मक स्पष्टता प्रदान करतो.
अक्षरांच्या भोवती दृश्य अंतर (visual spacing) ठेवा. 'ABC' ऐवजी हायफन किंवा स्पेस वापरून 'A - B - C' असे लिहा. हे दृश्य विलगीकरण मॉडेलला संकेत देते की हे स्वतंत्र घटक आहेत, कोणताही एक संक्षिप्त शब्द (acronym) किंवा शब्द नाही.
अक्षरांच्या संख्येवर (syllable count) नियंत्रण ठेवा. प्रत्येक ओळ सहा ते दहा अक्षरांच्या (syllables) दरम्यान ठेवा. खूप जास्त तफावत असल्यास मॉडेल लहान ओळी वेगाने गाते आणि लांब ओळी ओढते. याद्यांसाठी आधीच अचूकतेची गरज असते; असमान लय अचूक सादरीकरण जवळजवळ अशक्य करते.
याद्यांमधून 'and' हा शब्द काढून टाका. नैसर्गिक बोलण्यात 'and' हा उभयान्वयी अव्यय म्हणून काम करतो. गाण्यात यादी सांगताना, तो एक मऊ ध्वनी जोडतो जो अनेकदा मागील घटकाचा स्पष्ट उच्चार दाबून टाकतो. "Monday, Tuesday, Wednesday" हे "Monday, Tuesday, and Wednesday" पेक्षा अधिक स्पष्ट वाटते.
पुनरुत्पादन सापळा (The Regeneration Trap)
येथे मानवी अंतर्ज्ञान उलट लागू पडते. सामान्य गीतांच्या बाबतीत, वारंवार प्रॉम्प्ट बदलल्याने (iterative prompting) सहसा निकाल सुधारतात. एखादा शब्द चुकीचा वाटल्यास, शब्दरचना बदलून पुन्हा जनरेट करा. पुढची आवृत्ती अधिक चांगली वाटते. चाचणीतून असे दिसून आले की हा दृष्टिकोन अशा गाण्यांसाठी काम करतो ज्यात याद्या नाहीत. परंतु ज्या गाण्यांमध्ये याद्या आहेत, अशा गाण्यांसाठी प्रॉम्प्ट पुन्हा लिहिण्यामुळे आउटपुट समजणे अधिक कठीण झाले.
डेटा स्पष्ट होता. प्रॉम्प्ट सुधारल्यानंतर याद्या नसलेली गाणी सुधारली, तर याद्या असलेली गाणी अधिक बिघडली.
दोष 'acoustic seed' चा आहे. लिरिक्स-टू-सॉन्ग मॉडेल्समध्ये, प्रॉम्प्ट बदलल्याने केवळ सध्याचे ऑडिओ एडिट होत नाही. ते संपूर्ण जनरेटिव्ह पाया (generative foundation) पुन्हा पुनर्रचित करते. मॉडेल शून्यापासून पुन्हा परफॉर्मन्स तयार करते. कथात्मक मजकुरासाठी, नवीन 'डाइस रोल' अधिक स्पष्ट रिझल्ट देऊ शकतो. पण याद्यांच्या बाबतीत, तुम्ही सहसा अधिक खराब उच्चार किंवा अस्पष्टता आमंत्रित करत असता. तुम्ही एका अक्षराचे टायमिंग सुधारू शकता, पण पुढच्या प्रयत्नात मॉडेल 'J,' 'K,' आणि 'L' पूर्णपणे अस्पष्ट करू शकते. मूळ टेक दोषपूर्ण होता, पण सुधारित आवृत्तीमध्ये अनेकदा एका ध्वन्यात्मक गोंधळाच्या जागी दुसरा गोंधळ निर्माण होतो.
याद्यांनी भरलेल्या गीतांसाठी अधिक स्मार्ट वर्कफ्लो
पुन्हा जनरेट केल्यामुळे स्पष्टता नष्ट होण्याचा धोका असल्याने, तुमची प्रक्रिया बदलणे आवश्यक आहे. परिपूर्ण पुनर्लेखनाच्या मागे लागणे थांबवा. त्याऐवजी, पहिल्या प्रॉम्प्टकडे 'कास्टिंग कॉल' प्रमाणे पहा.
वेगवेगळ्या रँडम सीड्स (random seeds) वापरून त्याच प्रॉम्प्टमधून अनेक आवृत्त्या तयार करा. मजकुराला स्पर्श करू नका. शब्द (lyrics) स्थिर ठेवा आणि मॉडेलला त्याचा परफॉर्मन्स बदलू द्या. तुम्ही ऑडिशन घेत आहात, एडिटिंग सेशन नाही.
त्यानंतर प्रत्येक पर्यायाला गुण द्या. प्रत्येक आवृत्ती mlx-whisper किंवा तत्सम ट्रान्सक्रिप्शन टूलद्वारे तपासा आणि कोणता टेक तुमच्या प्रॉम्प्टशी सर्वात अचूकपणे जुळतो ते मोजा. इन्स्ट्रुमेंटेशन किंवा व्होकल टोन थोडा कमी पॉलिश असला तरीही, गीतांच्या अचूकतेच्या आधारावर विजेता निवडा. याद्यांनी भरलेल्या मजकुरासाठी, 'व्हाइब' पेक्षा स्पष्टता अधिक महत्त्वाची असते.
सर्वात महत्त्वाचे म्हणजे, तुमच्या सुधारणा आधीच करा. जनरेट बटण दाबण्यापूर्वीच स्पेसिंग नियम, शब्दांच्या अक्षरांची मर्यादा (syllable limits) आणि ग्रुपिंग लागू करा. वर्णमालेचे गाणे साध्या इंग्रजीत लिहून नंतर त्यात सुधारणा करण्याचा प्रयत्न करू नका. जेव्हा याद्यांचा समावेश असतो, तेव्हा मॉडेल नंतरच्या सुधारणांना (retroactive edits) तितकेसे स्वीकारत नाही. A
