Menyanyikan abjad sepatutnya menjadi perkara paling mudah bagi suara AI. A-B-C-D-E-F-G. Tujuh bunyi diskret, yang dikenali oleh setiap kanak-kanak di planet ini. Namun, sesiapa yang pernah bereksperimen dengan penjanaan muzik AI tahu bahawa realitinya lebih rumit. Minta model menyanyikan abjad, dan huruf L, M, N, O, dan P sering kali runtuh menjadi satu suku kata yang kabur. "Elemmennopee" bukanlah satu huruf. Ia adalah satu simptom.

Inilah masalah LMNOP, dan ia melangkaui sekadar lagu kanak-kanak. Hari dalam seminggu, arahan bernombor, dan sebarang jenis senarai tersusun mendedahkan kelemahan yang sama. Seorang pembangun baru-baru ini menguji perkara ini dengan menjana lapan lagu melalui saluran paip AI dan mengukur hasilnya dengan mlx-whisper, sebuah alat pengecaman pertuturan automatik. Daripada bergantung kepada pendengaran subjektif, mereka membiarkan perisian transkripsi melaporkan dengan tepat apa yang telah dinyanyikan oleh AI. Keputusannya sangat ketara. Penyenaraian mengelirukan penyanyi sintetik dalam cara yang tidak berlaku pada bahasa biasa.

Mengapa Senarai Merosakkan Suara AI

Bahasa lisan membawa konteks. Jika seseorang menggumam, "Saya membawa anjing itu ke taman," dan anda terlepas perkataan "anjing," ayat tersebut masih masuk akal. Perkataan di sekelilingnya mengisi kekosongan tersebut. Senarai tidak menawarkan jaring keselamatan itu. Setiap item berdiri sendiri. Jika model melalukan perbezaan antara "B" dan "D," pendengar tidak akan mendapat makna separa. Mereka hanya mendapat bunyi bising.

Dalam lagu abjad, kelompok LMNOP adalah titik kegagalan yang paling ketara. Model suara melayan urutan tersebut sebagai satu gumpalan fonetik tunggal dan bukannya lima huruf berasingan. Tanpa petunjuk kontekstual untuk menetapkan setiap bunyi, penyintesis meneka peralihan antara konsonan. Ia biasanya meneka dengan salah. Perkara yang sama berlaku dengan hari dalam seminggu atau langkah-langkah bernombor. Model tersebut tergesa-gesa melalui urutan itu, memampatkan item yang berbeza menjadi satu campuran yang tidak jelas.

Mengukur Kerosakan

Untuk mengkaji perkara ini secara objektif, pembangun tersebut menjana lapan lagu dan menjalankannya melalui mlx-whisper untuk menilai ketepatan lirik. Saluran paip tersebut adalah ringkas: tulis prom, jana audio, transkripsi hasil, dan bandingkan teks yang ditranskripsi dengan lirik yang dimaksudkan.

Untuk lirik naratif standard, hasilnya agak tepat. Perkataan diletakkan di tempat yang sepatutnya. Tetapi apabila prom merangkumi senarai, abjad, atau penyenaraian, mlx-whisper memulangkan teks yang tidak bermakna. Huruf hilang atau bercampur. Nombor bertukar menjadi suku kata yang tidak dapat dikenali. Eksperimen tersebut mengesahkan bahawa lirik yang padat dengan senarai mengalami tahap kejelasan yang jauh lebih buruk berbanding prosa.

Seni Bina Prom yang Membantu

Anda tidak boleh bergantung kepada pasca-pemprosesan untuk membetulkan senarai yang bercelaru. Pembaikan mesti berlaku sebelum nota pertama dijana. Prom pertama yang dibina dengan teliti boleh memaksa model menggunakan diksi yang lebih jelas. Pelarasan ini tidak menelan kos, tetapi ia mengubah cara model bernafas dan berhenti seketika.

  • Pecahkan urutan panjang kepada kumpulan yang lebih kecil. Daripada A-B-C-D-E, susun baris tersebut sebagai A-B-C-D dan E-F-G. Penyelarasan semula (reset) kecil antara kumpulan memberi peluang kepada model untuk menyebut konsonan yang betul dan bukannya mencampurkannya sekali.

  • Eja nombor dengan perkataan. Gunakan "thirty" dan bukannya "30." Digit bertulis adalah simbol abstrak; model kadangkala memampatkannya menjadi bunyi bising yang pendek dan tidak bersuara. Perkataan bahasa Inggeris yang lengkap memberikan substansi fonetik.

  • Masukkan jarak visual di sekeliling huruf. Tulis "A - B - C" dengan tanda sempang atau ruang dan bukannya "ABC." Pemisahan visual memberi isyarat kepada model bahawa ini adalah item yang berdiri sendiri, bukannya satu akronim atau perkataan tunggal.

  • Tetapkan bilangan suku kata. Pastikan setiap baris mempunyai antara enam hingga sepuluh suku kata. Variasi yang melampau menyebabkan model tergesa-gesa pada baris pendek dan memanjangkan baris yang panjang. Senarai sudah pun memerlukan ketepatan; ritma yang tidak sekata menjadikan penyampaian yang tepat hampir mustahil.

  • Buang perkataan "and" daripada senarai. Dalam pertuturan semula jadi, "and" bertindak sebagai kata hubung. Dalam senarai yang dinyanyikan, ia menambah suku kata lembut yang sering menelan bunyi tajam item sebelumnya. "Monday, Tuesday, Wednesday" kedengaran lebih kemas berbanding "Monday, Tuesday, and Wednesday."

Perangkap Penjanaan Semula

Di sinilah intu

Puncanya ialah benih akustik. Dalam model lirik-ke-lagu, mengubah prom tidak sekadar menyunting audio sedia ada. Ia menyusun semula keseluruhan asas generatif tersebut. Model tersebut membina semula persembahan dari awal. Bagi teks naratif, balingan dadu baharu mungkin menghasilkan rakaman yang lebih jelas. Bagi senarai, anda biasanya akan mengundang sebutan yang lebih tidak jelas. Anda mungkin membetulkan masa pada satu huruf, hanya untuk melihat model tersebut menenggelamkan "J", "K", dan "L" dalam percubaan seterusnya. Rakaman asal memang cacat, tetapi semakan sering kali menukar satu kekacauan fonetik kepada kekacauan yang lain.

Aliran Kerja yang Lebih Bijak untuk Lirik Padat Senarai

Oleh sebab penjanaan semula berisiko merosakkan kejelasan, proses anda perlu berubah. Berhenti mengejar penulisan semula yang sempurna. Sebaliknya, anggap prom pertama seperti sesi uji bakat.

Jana pelbagai versi daripada prom yang sama persis menggunakan benih rawak yang berbeza. Jangan usik teks tersebut. Kekalkan lirik yang sama dan biarkan model mempelbagaikan persembahannya. Anda sedang menjalankan sesi uji bakat, bukan sesi penyuntingan.

Kemudian, berikan skor kepada setiap calon. Jalankan setiap versi melalui mlx-whisper atau alat transkripsi yang serupa dan ukur rakaman mana yang paling menepati prom anda dengan tepat. Pilih pemenang berdasarkan ketepatan lirik, walaupun instrumentasi atau nada vokal kurang kemas sedikit. Bagi kandungan yang padat dengan senarai, kejelasan sebutan lebih penting daripada vibe.

Paling penting, lakukan pembetulan di peringkat awal. Gunakan peraturan jarak, had suku kata, dan pengelompokan sebelum anda menekan butang jana. Jangan tulis lagu abjad dalam bahasa Inggeris biasa dan cuba membaikinya kemudian. Model tersebut kurang bertolak ansur dengan suntingan retroaktif apabila melibatkan senarai. A