Śpiewanie alfabetu powinno być najłatwiejszą rzeczą, jaką potrafi zrobić głos AI. A-B-C-D-E-F-G. Siedem odrębnych dźwięków, znanych każdemu dziecku na planecie. Jednak każdy, kto eksperymentował z generowaniem muzyki przez AI, wie, że rzeczywistość jest bardziej skomplikowana. Poproś model o zaśpiewanie alfabetu, a litery L, M, N, O i P często zleją się w jedną rozmytą sylabę. „Elemmennopee” to nie litera. To objaw.

To problem LMNOP, który wykracza daleko poza wyliczanki. Dni tygodnia, ponumerowane instrukcje i wszelkie rodzaje uporządkowanych list obnażają tę samą słabość. Deweloper niedawno poddał to testowi, generując osiem utworów za pomocą potoku AI i mierząc wynik za pomocą mlx-whisper, narzędzia do automatycznego rozpoznawania mowy. Zamiast polegać na subiektywnym słuchaniu, pozwolił oprogramowaniu do transkrypcji dokładnie zaraportować to, co zaśpiewał model AI. Wyniki były uderzające. Wyliczanie sprawia trudności syntetycznym śpiewakom w sposób, w jaki zwykły język tego nie robi.

Dlaczego listy psują głosy AI

Język mówiony niesie ze sobą kontekst. Jeśli ktoś mruczy: „Idę z psem do parku”, a ty przeoczysz słowo „pies”, zdanie wciąż ma sens. Otaczające słowa wypełniają luki. Listy nie oferują takiej siatki bezpieczeństwa. Każdy element istnieje samodzielnie. Jeśli model zatarte różnice między „B” a „D”, słuchacz nie otrzyma częściowego znaczenia. Otrzyma szum.

W piosence o alfabecie klaster LMNOP jest najbardziej oczywistym punktem awarii. Model głosu traktuje tę sekwencję jako jedną fonetyczną masę, a nie pięć oddzielnych liter. Bez wskazówek kontekstowych, które zakotwiczyłyby każdy dźwięk, syntezator zgaduje przejścia między spółgłoskami. Zazwyczaj zgaduje źle. To samo dzieje się z dniami tygodnia lub ponumerowanymi krokami. Model spieszy się przez sekwencję, kompresując odrębne elementy w nieczytelną papkę.

Pomiar szkód

Aby zbadać to obiektywnie, deweloper wygenerował osiem piosenek i przepuścił je przez mlx-whisper, aby ocenić dokładność tekstu. Proces był prosty: napisz prompt, wygeneruj dźwięk, przeprowadź transkrypcję wyniku i porównaj przetranskrybowany tekst z zamierzonym tekstem piosenki.

W przypadku standardowych tekstów narracyjnych wynik był dość wierny. Słowa trafiały tam, gdzie powinny. Jednak gdy prompty zawierały listy, alfabet lub wyliczenia, mlx-whisper zwracało bełkot. Litery znikały lub zlewały się ze sobą. Liczby zmieniały się w nierozpoznawalne sylaby. Eksperyment potwierdził, że teksty oparte na listach cierpią na znacznie gorszą zrozumiałość niż proza.

Architektura promptów, która pomaga

Nie można polegać na postprocessingu, aby naprawić zniekształconą listę. Naprawa musi nastąpić przed wygenerowaniem pierwszej nuty. Starannie skonstruowany pierwszy prompt może wymusić na modelu wyraźniejszą dykcję. Te poprawki nic nie kosztują, ale zmieniają sposób, w jaki model bierze oddech i robi pauzy.

  • Dziel długie ciągi na mniejsze grupy. Zamiast A-B-C-D-E, ustrukturyzuj linię jako A-B-C-D i E-F-G. Mały reset między grupami daje modelowi szansę na postawienie na właściwych spółgłoskach zamiast ich rozmywania.

  • Zapisuj liczby słownie. Używaj „thirty” zamiast „30”. Cyfry są abstrakcyjnymi symbolami; model czasami kompresuje je do urywanych, bezgłosowych szumów. Pełne angielskie słowo zapewnia substancję fonetyczną.

  • Wstawiaj wizualne odstępy wokół liter. Zapisuj „A - B - C” z myślnikami lub spacjami zamiast „ABC”. Wizualne oddzielenie sygnalizuje modelowi, że są to samodzielne elementy, a nie pojedynczy akronim lub słowo.

  • Zablokuj liczbę sylab. Utrzymuj każdą linię w granicach od sześciu do dziesięciu sylab. Duże wahania powodują, że model przyspiesza krótkie linie i rozciąga długie. Listy i tak wymagają precyzji; nierówny rytm sprawia, że dokładne wykonanie jest niemal niemożliwe.

  • Usuń słowo „and” z list. W naturalnej mowie „and” pełni funkcję spójnika. W śpiewanej liście dodaje miękką sylabę, która często pożera twardą krawędź poprzedniego elementu. „Monday, Tuesday, Wednesday” brzmi czyściej niż „Monday, Tuesday, and Wednesday”.

Pułapka regeneracji

Tutaj ludzka intuicja zawodzi. W przypadku zwykłych tekstów iteracyjne promptowanie zazwyczaj poprawia wyniki. Słyszysz niepasującą frazę, poprawiasz słownictwo i generujesz ponownie. Kolejna wersja brzmi lepiej. Test wykazał, że podejście to działa w przypadku piosenek bez wyliczeń. Jednak w przypadku piosenek zawierających listy, przepisywanie promptu sprawiało, że wynik był trudniejszy do zrozumienia.

Dane były jednoznaczne. Piosenki bez list poprawiały się po poprawkach w promptach. Piosenki z wyliczeniami ulegały pogorszeniu.

The culprit is the acoustic seed. In lyrics-to-song models, changing the prompt does not simply edit the existing audio. It reshuffles the entire generative foundation. The model rebuilds the performance from scratch. For narrative text, the new dice roll might land on a clearer take. For lists, you are usually inviting a worse slur. You might fix the timing on one letter only to watch the model bury "J," "K," and "L" in the next attempt. The original take was flawed, but the revision often traded one phonetic mess for another.

A Smarter Workflow for List-Heavy Lyrics

Because regeneration risks destroying clarity, your process needs to change. Stop chasing the perfect rewrite. Instead, treat the first prompt like a casting call.

Generate multiple versions from the exact same prompt using different random seeds. Do not touch the text. Hold the lyrics constant and let the model vary its performance. You are running an audition, not an edit session.

Then score every candidate. Run each version through mlx-whisper or a similar transcription tool and measure which take matches your prompt most faithfully. Pick the winner based on lyric accuracy, even if the instrumentation or vocal tone is slightly less polished. For list-heavy content, intelligibility matters more than vibe.

Most importantly, front-load your fixes. Apply spacing rules, syllable limits, and grouping before you ever hit generate. Do not write the alphabet song in plain English and try to patch it later. The model is less forgiving of retroactive edits when lists are involved. A