Menyanyikan alfabet seharusnya menjadi hal termudah yang bisa dilakukan suara AI. A-B-C-D-E-F-G. Tujuh bunyi diskrit, yang akrab bagi setiap anak di planet ini. Namun, siapa pun yang pernah bereksperimen dengan pembuatan musik AI tahu bahwa kenyataannya lebih berantakan. Minta sebuah model untuk menyanyikan alfabet, dan huruf L, M, N, O, dan P sering kali runtuh menjadi satu suku kata yang kabur. "Elemmennopee" bukanlah sebuah huruf. Itu adalah sebuah gejala.
Ini adalah masalah LMNOP, dan dampaknya jauh melampaui lagu anak-anak. Nama-nama hari, instruksi bernomor, dan segala jenis daftar berurutan menunjukkan kelemahan yang sama. Seorang pengembang baru-baru ini menguji hal ini dengan menghasilkan delapan lagu melalui alur kerja AI dan mengukur hasilnya dengan mlx-whisper, sebuah alat pengenalan ucapan otomatis. Alih-alih mengandalkan pendengaran subjektif, mereka membiarkan perangkat lunak transkripsi melaporkan dengan tepat apa yang telah dinyanyikan oleh AI. Hasilnya sangat mencolok. Enumerasi menyulitkan penyanyi sintetis dengan cara yang tidak dialami oleh bahasa normal.
Mengapa Daftar Merusak Suara AI
Bahasa lisan membawa konteks. Jika seseorang bergumam, "I'm taking the dog to the park," dan Anda melewatkan kata "dog," kalimat tersebut tetap masuk akal. Kata-kata di sekitarnya mengisi kekosongan tersebut. Daftar tidak menawarkan jaring pengaman itu. Setiap item berdiri sendiri. Jika model mengaburkan perbedaan antara "B" dan "D," pendengar tidak mendapatkan makna parsial. Mereka hanya mendapatkan derau.
Dalam lagu alfabet, klaster LMNOP adalah titik kegagalan yang paling nyata. Model suara memperlakukan urutan tersebut sebagai satu gumpalan fonetik tunggal, bukan sebagai lima huruf terpisah. Tanpa petunjuk kontekstual untuk menambatkan setiap bunyi, synthesizer menebak transisi antar konsonan. Biasanya tebakannya salah. Hal yang sama terjadi pada nama-nama hari atau langkah-langkah bernomor. Model tersebut terburu-buru melewati urutan, mengompresi item-item yang berbeda menjadi campuran yang tidak jelas.
Mengukur Kerusakan
Untuk mempelajari hal ini secara objektif, pengembang tersebut menghasilkan delapan lagu dan menjalankannya melalui mlx-whisper untuk menilai akurasi lirik. Alur kerjanya sederhana: tulis prompt, hasilkan audio, transkripsikan hasilnya, dan bandingkan teks hasil transkripsi dengan lirik yang dimaksudkan.
Untuk lirik naratif standar, hasilnya cukup setia. Kata-kata muncul di tempat yang seharusnya. Namun, ketika prompt menyertakan daftar, alfabet, atau enumerasi, mlx-whisper mengembalikan teks yang tidak masuk akal. Huruf-huruf menghilang atau menyatu. Angka berubah menjadi suku kata yang tidak dapat dikenali. Eksperimen tersebut mengonfirmasi bahwa lirik yang padat dengan daftar mengalami penurunan kejelasan yang jauh lebih buruk dibandingkan prosa.
Arsitektur Prompt yang Membantu
Anda tidak bisa mengandalkan pasca-pemrosesan untuk memperbaiki daftar yang kacau. Perbaikannya harus dilakukan sebelum nada pertama dihasilkan. Prompt pertama yang disusun dengan cermat dapat memaksa model untuk memiliki diksi yang lebih jelas. Penyesuaian ini tidak memakan biaya, tetapi mereka mengubah cara model bernapas dan berhenti sejenak.
Pecah rangkaian panjang menjadi kelompok yang lebih kecil. Alih-alih A-B-C-D-E, susunlah baris tersebut sebagai A-B-C-D dan E-F-G. Reset kecil di antara kelompok memberikan kesempatan bagi model untuk mendarat pada konsonan yang tepat, alih-alih mengaburkannya menjadi satu.
Eja angka dengan kata-kata. Gunakan "thirty" alih-alih "30." Digit tertulis adalah simbol abstrak; model terkadang mengompresinya menjadi derau yang terputus-putus dan tidak bersuara. Kata bahasa Inggris yang lengkap memberikan substansi fonetik.
Sisipkan spasi visual di sekitar huruf. Tulis "A - B - C" dengan tanda hubung atau spasi, bukan "ABC." Pemisahan visual memberi sinyal kepada model bahwa ini adalah item yang berdiri sendiri, bukan satu akronim atau kata tunggal.
Kunci jumlah suku kata. Jaga agar setiap baris terdiri dari enam hingga sepuluh suku kata. Variasi yang liar menyebabkan model terburu-buru pada baris pendek dan memperpanjang baris yang panjang. Daftar sudah membutuhkan presisi; ritme yang tidak merata membuat penyampaian yang akurat menjadi hampir mustahil.
Hapus kata "and" dari daftar. Dalam percakapan alami, "and" berfungsi sebagai kata sambung. Dalam daftar yang dinyanyikan, kata tersebut menambah suku kata lembut yang sering kali menelan ketegasan item sebelumnya. "Monday, Tuesday, Wednesday" terdengar lebih bersih daripada "Monday, Tuesday, and Wednesday."
Jebakan Regenerasi
Di sinilah intuisi manusia bisa menjadi bumerang. Untuk lirik biasa, penggunaan prompt secara iteratif biasanya meningkatkan hasil. Anda mendengar frasa yang salah, mengubah kata-katanya, dan membuatnya lagi. Versi berikutnya terdengar lebih baik. Pengujian menunjukkan bahwa pendekatan ini berhasil untuk lagu yang bukan berisi enumerasi. Namun, untuk lagu yang berisi daftar, menulis ulang prompt justru membuat hasilnya lebih sulit untuk dipahami.
Datanya tidak ambigu. Lagu non-daftar membaik setelah perbaikan prompt. Lagu enumerasi justru menurun kualitasnya.
The culprit is the acoustic seed. In lyrics-to-song models, changing the prompt does not simply edit the existing audio. It reshuffles the entire generative foundation. The model rebuilds the performance from scratch. For narrative text, the new dice roll might land on a clearer take. For lists, you are usually inviting a worse slur. You might fix the timing on one letter only to watch the model bury "J," "K," and "L" in the next attempt. The original take was flawed, but the revision often traded one phonetic mess for another.
A Smarter Workflow for List-Heavy Lyrics
Because regeneration risks destroying clarity, your process needs to change. Stop chasing the perfect rewrite. Instead, treat the first prompt like a casting call.
Generate multiple versions from the exact same prompt using different random seeds. Do not touch the text. Hold the lyrics constant and let the model vary its performance. You are running an audition, not an edit session.
Then score every candidate. Run each version through mlx-whisper or a similar transcription tool and measure which take matches your prompt most faithfully. Pick the winner based on lyric accuracy, even if the instrumentation or vocal tone is slightly less polished. For list-heavy content, intelligibility matters more than vibe.
Most importantly, front-load your fixes. Apply spacing rules, syllable limits, and grouping before you ever hit generate. Do not write the alphabet song in plain English and try to patch it later. The model is less forgiving of retroactive edits when lists are involved. A
