Het zingen van het alfabet zou het makkelijkste moeten zijn wat een AI-stem kan doen. A-B-C-D-E-F-G. Zeven afzonderlijke klanken, bekend bij elk kind op de planeet. Toch weet iedereen die heeft geëxperimenteerd met AI-muziekgeneratie dat de werkelijkheid rommeliger is. Vraag een model om het alfabet te zingen, en de letters L, M, N, O en P vallen vaak samen in één wazige lettergreep. "Elemmennopee" is geen letter. Het is een symptoom.
Dit is het LMNOP-probleem, en het reikt veel verder dan kinderliedjes. Dagen van de week, genummerde instructies en elk type geordende lijst leggen dezelfde zwakte bloot. Een ontwikkelaar heeft dit onlangs getest door acht nummers te genereren via een AI-pipeline en de output te meten met mlx-whisper, een tool voor automatische spraakherkenning. In plaats van te vertrouwen op subjectief luisteren, lieten ze de transcriptiesoftware precies rapporteren wat de AI had gezongen. De resultaten waren schrijnend. Opsommingen brengen synthetische zangers in verwarring op manieren waarop normale taal dat simpelweg niet doet.
Waarom lijsten AI-stemmen laten haperen
Gesproken taal bevat context. Als iemand mompelt: "Ik neem de hond mee naar het park," en je mist het woord "hond", dan maakt de zin nog steeds zin. De omliggende woorden vullen de gaten op. Lijsten bieden dat vangnet niet. Elk item staat op zichzelf. Als het model het verschil tussen "B" en "D" laat versmelten, krijgt de luisteraar geen gedeeltelijke betekenis. Ze krijgen ruis.
In het alfabetliedje is de LMNOP-cluster het meest voor de hand liggende foutpunt. Het stemmodel behandelt de reeks als één fonetische klont in plaats van vijf afzonderlijke letters. Zonder contextuele aanwijzingen om elke klank te verankeren, gokt de synthesizer de overgangen tussen medeklinkers. Meestal gokt hij fout. Hetzelfde gebeurt met de dagen van de week of genummerde stappen. Het model haast zich door de reeks en comprimeert afzonderlijke items tot een onduidelijke brij.
De schade meten
Om dit objectief te bestuderen, genereerde de ontwikkelaar acht nummers en haalde deze door mlx-whisper om de nauwkeurigheid van de tekst te scoren. De pipeline was eenvoudig: schrijf een prompt, genereer de audio, transcribeer het resultaat en vergelijk de getranscribeerde tekst met de beoogde songtekst.
Voor standaard verhalende songteksten was de output redelijk getrouw. Woorden kwamen terecht waar ze hoorden. Maar wanneer de prompts lijsten, alfabetten of opsommingen bevatten, gaf mlx-whisper onzin terug. Letters verdwenen of versmolten. Getallen veranderden in onherkenbare lettergrepen. Het experiment bevestigde dat tekst met veel lijsten een meetbaar slechtere verstaanbaarheid heeft dan proza.
Prompt-architectuur die helpt
Je kunt niet vertrouwen op nabewerking om een onverstaanbare lijst te herstellen. De oplossing moet plaatsvinden voordat de eerste noot wordt gegenereerd. Een zorgvuldig geconstrueerde eerste prompt kan het model dwingen tot een duidelijkere dictie. Deze aanpassingen kosten niets, maar ze veranderen hoe het model ademt en pauzeert.
Breek lange reeksen op in kleinere groepen. Structureer de regel in plaats van A-B-C-D-E als A-B-C-D en E-F-G. De kleine reset tussen de groepen geeft het model de kans om de juiste medeklinkers aan te houden in plaats van ze in elkaar te laten overvloeien.
Schrijf getallen voluit. Gebruik "thirty" in plaats van "30". Geschreven cijfers zijn abstracte symbolen; het model comprimeert ze soms tot afgekapte, stemloze ruis. Een volledig Engels woord biedt fonetische substantie.
Voeg visuele tussenruimte rond letters toe. Schrijf "A - B - C" met koppeltekens of spaties in plaats van "ABC". De visuele scheiding geeft het model het signaal dat dit afzonderlijke items zijn, en geen enkel acroniem of woord.
Leg het aantal lettergrepen vast. Houd elke regel tussen de zes en tien lettergrepen. Grote variatie zorgt ervoor dat het model korte regels haast en lange regels uitrekt. Lijsten vereisen al precisie; een ongelijkmatig ritme maakt een nauwkeurige voordracht bijna onmogelijk.
Verwijder het woord "and" uit lijsten. In natuurlijke spraak fungeert "and" als voegwoord. In een gezongen lijst voegt het een zachte lettergreep toe die vaak de harde rand van het vorige item opslokt. "Monday, Tuesday, Wednesday" klinkt strakker dan "Monday, Tuesday, and Wednesday."
De regeneratieval
Hier werkt menselijke intuïtie averechts. Bij gewone songteksten zorgen iteratieve prompts meestal voor betere resultaten. Je hoort een verkeerde frase, past de bewoording aan en genereert opnieuw. De volgende versie klinkt beter. De test toonde aan dat deze aanpak werkt voor nummers zonder opsommingen. Maar bij nummers met lijsten maakte het herschrijven van de prompt de output juist moeilijker te begrijpen.
De data was eenduidig. Nummers zonder lijsten verbeterden na prompt-aanpassingen. Nummers met opsommingen verslechterden.
De boosdoener is de acoustic seed. In lyrics-to-song-modellen bewerk je met het wijzigen van de prompt niet simpelweg de bestaande audio. Het husselt de gehele generatieve basis volledig door elkaar. Het model bouwt de uitvoering vanaf nul opnieuw op. Bij narratieve tekst kan de nieuwe worp van de dobbelsteen op een duidelijkere opname uitvallen. Bij lijsten lok je meestal alleen maar een slechtere articulatie uit. Je lost misschien de timing van één letter op, om vervolgens te zien hoe het model "J", "K" en "L" in de volgende poging volledig begraaft. De oorspronkelijke opname was gebrekkig, maar de revisie ruilde vaak de ene fonetische puinhoop in voor de andere.
Een slimmere workflow voor lijst-zware songteksten
Omdat regeneratie het risico loopt de helderheid te vernietigen, moet je proces veranderen. Stop met het najagen van de perfecte herschrijving. Behandel de eerste prompt in plaats daarvan als een castingcall.
Genereer meerdere versies vanuit de exact dezelfde prompt met behulp van verschillende random seeds. Raak de tekst niet aan. Houd de songtekst constant en laat het model de uitvoering variëren. Je voert een auditie uit, geen bewerkingssessie.
Geef vervolgens elke kandidaat een score. Haal elke versie door mlx-whisper of een vergelijkbare transcriptietool en meet welke opname je prompt het meest getrouw volgt. Kies de winnaar op basis van de nauwkeurigheid van de songtekst, zelfs als de instrumentatie of de vocale toon iets minder gepolijst is. Bij lijst-zware content is verstaanbaarheid belangrijker dan de vibe.
Het belangrijkste is: pas je aanpassingen vooraf toe. Pas regels voor spatiering, lettergreeplimieten en groepering toe voordat je op 'generate' drukt. Schrijf het alfabetliedje niet in gewoon Engels om het later te proberen te repareren. Het model is minder vergevingsgezind bij achteraf uitgevoerde bewerkingen wanneer er lijsten in het spel zijn. A
