એબીસીડી (alphabet) ગાવાનું એઆઈ (AI) અવાજ માટે સૌથી સરળ કામ હોવું જોઈએ. A-B-C-D-E-F-G. સાત અલગ-અલગ અવાજો, જે પૃથ્વી પરના દરેક બાળક માટે જાણીતા છે. છતાં, જે કોઈએ AI મ્યુઝિક જનરેશન સાથે પ્રયોગ કર્યો હોય તેને ખબર હશે કે વાસ્તવિકતા વધુ જટિલ છે. જો તમે મોડેલને મૂળાક્ષરો ગાવા માટે કહેશો, તો અક્ષરો L, M, N, O, અને P ઘણીવાર એક જ અસ્પષ્ટ શબ્દમાં ભળી જાય છે. "Elemmennopee" એ કોઈ અક્ષર નથી. તે એક લક્ષણ છે.

આ LMNOP સમસ્યા છે, અને તે માત્ર બાળગીતો પૂરતી મર્યાદિત નથી. અઠવાડિયાના દિવસો, ક્રમબદ્ધ સૂચનાઓ અને કોઈપણ પ્રકારની ક્રમબદ્ધ યાદી આ જ નબળાઈને ઉજાગર કરે છે. તાજેતરમાં એક ડેવલપરે AI પાઇપલાઇન દ્વારા આઠ ગીતો બનાવીને અને mlx-whisper (એક ઓટોમેટિક સ્પીચ રેકગ્નિશન ટૂલ) દ્વારા તેનું પરિણામ માપીને આનું પરીક્ષણ કર્યું. વ્યક્તિગત સાંભળવા પર આધાર રાખવાને બદલે, તેમણે ટ્રાન્સક્રિપ્શન સોફ્ટવેરને એ જણાવવા દીધું કે AI એ બરાબર શું ગાયું હતું. પરિણામો ચોંકાવનારા હતા. સામાન્ય ભાષામાં જે સમસ્યા નથી આવતી, તેવી જ રીતે ક્રમબદ્ધ યાદીઓ (enumeration) સિન્થેટિક ગાયકોને અટકી જાય છે.

યાદીઓ AI અવાજોને કેમ બગાડે છે

બોલાતી ભાષામાં સંદર્ભ હોય છે. જો કોઈ બબડે, "હું કૂતરાને બગીચામાં લઈ જઈ રહ્યો છું," અને તમે "કૂતરા" શબ્દ ચૂકી જાઓ, તો પણ વાક્યનો અર્થ સમજાય છે. આસપાસના શબ્દો ખાલી જગ્યા ભરી દે છે. યાદીઓ આવી સુરક્ષા આપતી નથી. દરેક વસ્તુ સ્વતંત્ર હોય છે. જો મોડેલ "B" અને "D" વચ્ચેનો તફાવત ભૂલી જાય, તો શ્રોતાને અંશતઃ અર્થ મળતો નથી. તેમને માત્ર અવાજ (noise) સંભળાય છે.

મૂળાક્ષરોના ગીતમાં, LMNOP નો સમૂહ સૌથી સ્પષ્ટ નિષ્ફળતાનું બિંદુ છે. વોઇસ મોડેલ આ ક્રમને પાંચ અલગ અક્ષરોને બદલે એક જ ફોનેટિક બ્લોબ (phonetic blob) તરીકે ગણે છે. દરેક અવાજને સ્થિર કરવા માટે સંદર્ભના સંકેતો વિના, સિન્થેસાઇઝર વ્યંજન વચ્ચેના સંક્રમણનો અંદાજ લગાવે છે. તે સામાન્ય રીતે ખોટો અંદાજ લગાવે છે. અઠવાડિયાના દિવસો અથવા ક્રમબદ્ધ પગલાં સાથે પણ આવું જ થાય છે. મોડેલ ક્રમમાં ઉતાવળ કરે છે, જેનાથી અલગ-અલગ વસ્તુઓ એક અસ્પષ્ટ મિશ્રણમાં ફેરવાઈ જાય છે.

નુકસાનનું માપન

આનો નિષ્પક્ષ અભ્યાસ કરવા માટે, ડેવલપરે આઠ ગીતો બનાવ્યા અને લિરિક્સની ચોકસાઈ માપવા માટે તેને mlx-whisper દ્વારા ચલાવ્યા. પાઇપલાઇન સરળ હતી: એક પ્રોમ્પ્ટ લખો, ઓડિયો જનરેટ કરો, પરિણામનું ટ્રાન્સક્રિપ્શન કરો અને ટ્રાન્સક્રાઇબ કરેલા લખાણને નિર્ધારિત લિરિક્સ સાથે સરખાવો.

સામાન્ય વર્ણનાત્મક લિરિક્સ માટે, પરિણામ પ્રમાણમાં સચોટ હતું. શબ્દો યોગ્ય જગ્યાએ હતા. પરંતુ જ્યારે પ્રોમ્પ્ટમાં યાદીઓ, મૂળાક્ષરો અથવા ક્રમબદ્ધ યાદીઓનો સમાવેશ થયો, ત્યારે mlx-whisper એ અર્થહીન શબ્દો (gibberish) આપ્યા. અક્ષરો ગાયબ થઈ ગયા અથવા ભળી ગયા. નંબરો અસ્પષ્ટ સિલેબલ્સમાં ફેરવાઈ ગયા. પ્રયોગે પુષ્ટિ કરી કે લિસ્ટ-ભર્યા લિરિક્સની સમજણ ક્ષમતા ગદ્ય (prose) કરતા નોંધપાત્ર રીતે ખરાબ હોય છે.

મદદરૂપ થાય તેવી પ્રોમ્પ્ટ આર્કિટેક્ચર

બગડેલી યાદીને સુધારવા માટે તમે પોસ્ટ-પ્રોસેસિંગ પર આધાર રાખી શકતા નથી. સુધારો પ્રથમ સૂર જનરેટ થાય તે પહેલાં થવો જોઈએ. કાળજીપૂર્વક તૈયાર કરેલ પ્રથમ પ્રોમ્પ્ટ મોડેલને સ્પષ્ટ ઉચ્ચારણ કરવા માટે મજબૂર કરી શકે છે. આ ફેરફારોમાં કોઈ ખર્ચ થતો નથી, પરંતુ તે મોડેલ કેવી રીતે શ્વાસ લે છે અને વિરામ લે છે તે બદલી નાખે છે.

  • લાંબા ક્રમને નાના જૂથોમાં વહેંચો. A-B-C-D-E ને બદલે, લાઇનને A-B-C-D અને E-F-G તરીકે ગોઠવો. જૂથો વચ્ચેનો નાનો વિરામ મોડેલને અક્ષરોને ભેગા કરવાને બદલે સાચા વ્યંજનો પર આવવાની તક આપે છે.

  • નંબરોને શબ્દોમાં લખો. "30" ને બદલે "thirty" નો ઉપયોગ કરો. લખેલા અંકો અમૂર્ત પ્રતીકો છે; મોડેલ ક્યારેક તેને ટૂંકા, અસ્પષ્ટ અવાજમાં સંકુચિત કરી દે છે. આખું અંગ્રેજી શબ્દ ફોનેટિક પાયો પૂરો પાડે છે.

  • અક્ષરોની આસપાસ વિઝ્યુઅલ સ્પેસિંગ ઉમેરો. "ABC" ને બદલે હાઇફન અથવા સ્પેસ સાથે "A - B - C" લખો. આ વિઝ્યુઅલ વિભાજન મોડેલને સંકેત આપે છે કે આ સ્વતંત્ર વસ્તુઓ છે, કોઈ એક એકાક્ષરી શબ્દ કે શબ્દ નથી.

  • સિલેબલની સંખ્યા નક્કી કરો. દરેક લાઇન છ થી દસ સિલેબલની વચ્ચે રાખો. વધુ પડતો તફાવત મોડેલને ટૂંકી લાઇન ઝડપથી ગાવા અને લાંબી લાઇન ખેંચવા માટે પ્રેરે છે. યાદીઓ માટે પહેલેથી જ ચોકસાઈની જરૂર હોય છે; અસમાન લય સચોટ ડિલિવરીને લગભગ અશક્ય બનાવે છે.

  • યાદીઓમાંથી "and" શબ્દ દૂર કરો. કુદરતી બોલીમાં, "and" એક સંયોજક તરીકે કામ કરે છે. ગીતમાં યાદી ગાતી વખતે, તે એક નરમ સિલેબલ ઉમેરે છે જે ઘણીવાર અગાઉની વસ્તુના સ્પષ્ટ અવાજને દબાવી દે છે. "Monday, Tuesday, Wednesday" એ "Monday, Tuesday, and Wednesday" કરતા વધુ સ્પષ્ટ લાગે છે.

રી-જનરેશનનો જાળ (The Regeneration Trap)

અહીં માનવીય અંતર્જ્ઞાન ઉલટું પરિણામ આપે છે. સામાન્ય લિરિક્સ સાથે, વારંવાર પ્રોમ્પ્ટ બદલવાથી પરિણામોમાં સુધારો થાય છે. તમે કોઈ ખોટો શબ્દ સાંભળો છો, શબ્દોમાં ફેરફાર કરો છો અને ફરીથી જનરેટ કરો છો. પછીનું વર્ઝન વધુ સારું લાગે છે. પરીક્ષણે બતાવ્યું કે આ અભિગમ બિન-ક્રમબદ્ધ ગીતો માટે કામ કરે છે. પરંતુ યાદીઓ ધરાવતા ગીતો માટે, પ્રોમ્પ્ટ ફરીથી લખવાથી પરિણામ સમજવું વધુ અઘરું બની ગયું.

ડેટા સ્પષ્ટ હતો. પ્રોમ્પ્ટ સુધાર્યા પછી બિન-યાદીવાળા ગીતોમાં સુધારો થયો, જ્યારે ક્રમબદ્ધ યાદીવાળા ગીતોની ગુણવત્તા ઘટી ગઈ.

દોષી એકોસ્ટિક સીડ (acoustic seed) છે. લિરિક્સ-ટુ-સૉંગ મોડલ્સમાં, પ્રોમ્પ્ટ બદલવાથી માત્ર હાલના ઓડિયોમાં સુધારો થતો નથી. તે સમગ્ર જનરેટિવ પાયાને ફરીથી ગોઠવી નાખે છે. મોડલ પર્ફોર્મન્સને ફરીથી શૂન્યથી બનાવે છે. નરેટિવ ટેક્સ્ટ માટે, નવો ડાઈસ રોલ કદાચ વધુ સ્પષ્ટ પરિણામ આપી શકે છે. લિસ્ટ માટે, તમે સામાન્ય રીતે વધુ ખરાબ અસ્પષ્ટ ઉચ્ચારણનું જોખમ ખેડો છો. તમે કદાચ એક અક્ષરનું ટાઈમિંગ સુધારો, પણ પછી જોશો કે મોડલ આગલા પ્રયાસમાં "J," "K," અને "L" ને દબાવી દે છે. મૂળ ટેક ખામીયુક્ત હતો, પરંતુ સુધારો ઘણીવાર એક ફોનેટિક અરાજકતાના બદલે બીજી અરાજકતા લાવે છે.

લિસ્ટ-ભર્યા લિરિક્સ માટે વધુ સ્માર્ટ વર્કફ્લો

કારણ કે ફરીથી જનરેટ કરવાથી સ્પષ્ટતા નાશ પામવાનું જોખમ રહેલું છે, તેથી તમારી પ્રક્રિયા બદલવાની જરૂર છે. પરફેક્ટ રીરાઈટ પાછળ દોડવાનું બંધ કરો. તેના બદલે, પ્રથમ પ્રોમ્પ્ટને 'કાસ્ટિંગ કોલ'ની જેમ ગણો.

અલગ-અલગ રેન્ડમ સીડ્સનો ઉપયોગ કરીને બરાબર એ જ પ્રોમ્પ્ટમાંથી અનેક વર્ઝન જનરેટ કરો. ટેક્સ્ટને અડશો નહીં. લિરિક્સને સ્થિર રાખો અને મોડલને તેના પર્ફોર્મન્સમાં વિવિધતા લાવવા દો. તમે ઓડિશન કરી રહ્યા છો, એડિટ સેશન નહીં.

પછી દરેક ઉમેદવારને સ્કોર આપો. દરેક વર્ઝનને mlx-whisper અથવા સમાન ટ્રાન્સક્રિપ્શન ટૂલ દ્વારા ચલાવો અને માપો કે કયું ટેક તમારા પ્રોમ્પ્ટ સાથે સૌથી વધુ વફાદારીથી મેળ ખાય છે. લિરિક્સની ચોકસાઈના આધારે વિજેતા પસંદ કરો, ભલે ઇન્સ્ટ્રુમેન્ટેશન અથવા વોકલ ટોન થોડો ઓછો પોલિશ્ડ હોય. લિસ્ટ-ભર્યા કન્ટેન્ટ માટે, વાઇબ કરતા સમજણક્ષમતા વધુ મહત્વની છે.

સૌથી મહત્વનું, તમારા સુધારાઓને શરૂઆતમાં જ કરી લો. જનરેટ બટન દબાવતા પહેલા સ્પેસિંગ નિયમો, સિલેબલ મર્યાદા અને ગ્રુપિંગ લાગુ કરો. મૂળાક્ષરોનું ગીત સાદા અંગ્રેજીમાં લખીને પછી તેને સુધારવાનો પ્રયાસ ન કરો. જ્યારે લિસ્ટ સામેલ હોય ત્યારે મોડલ રેટ્રોએક્ટિવ એડિટ્સ માટે ઓછી ક્ષમાશીલ હોય છે. A