Cantar el alfabeto debería ser lo más fácil que puede hacer una voz de IA. A-B-C-D-E-F-G. Siete sonidos discretos, familiares para cada niño en el planeta. Sin embargo, cualquiera que haya experimentado con la generación de música por IA sabe que la realidad es más caótica. Pídele a un modelo que cante el alfabeto, y las letras L, M, N, O y P a menudo colapsarán en una sola sílaba borrosa. "Elemmennopee" no es una letra. Es un síntoma.
Este es el problema del LMNOP, y se extiende mucho más allá de las canciones infantiles. Los días de la semana, las instrucciones numeradas y cualquier tipo de lista ordenada exponen la misma debilidad. Un desarrollador puso esto a prueba recientemente generando ocho canciones a través de un pipeline de IA y midiendo el resultado con mlx-whisper, una herramienta de reconocimiento automático del habla. En lugar de confiar en una escucha subjetiva, dejaron que el software de transcripción informara exactamente lo que la IA había cantado. Los resultados fueron contundentes. La enumeración hace tropezar a los cantantes sintéticos de formas en las que el lenguaje normal simplemente no lo hace.
Por qué las listas rompen las voces de IA
El lenguaje hablado conlleva contexto. Si alguien murmura: "Voy a llevar al perro al parque" y te pierdes la palabra "perro", la frase sigue teniendo sentido. Las palabras circundantes llenan los huecos. Las listas no ofrecen esa red de seguridad. Cada elemento se mantiene solo. Si el modelo desibuja la diferencia entre la "B" y la "D", el oyente no obtiene un significado parcial. Obtiene ruido.
En la canción del alfabeto, el grupo LMNOP es el punto de falla más obvio. El modelo de voz trata la secuencia como una única masa fonética en lugar de cinco letras separadas. Sin pistas contextuales que anclen cada sonido, el sintetizador adivina las transiciones entre consonantes. Por lo general, adivina mal. Lo mismo ocurre con los días de la semana o los pasos numerados. El modelo se apresura a través de la secuencia, comprimiendo elementos distintos en una mezcla indistinta.
Midiendo el daño
Para estudiar esto de manera objetiva, el desarrollador generó ocho canciones y las pasó por mlx-whisper para calificar la precisión de la letra. El proceso fue sencillo: escribir un prompt, generar el audio, transcribir el resultado y comparar el texto transcrito con la letra deseada.
Para las letras narrativas estándar, el resultado fue razonablemente fiel. Las palabras caían donde debían. Pero cuando los prompts incluían listas, alfabetos o enumeraciones, mlx-whisper devolvía galimatías. Las letras desaparecían o se fusionaban. Los números se convertían en sílabas irreconocibles. El experimento confirmó que las letras con muchas listas sufren una inteligibilidad notablemente peor que la prosa.
Arquitectura de prompts que ayuda
No puedes confiar en el post-procesamiento para arreglar una lista distorsionada. La solución debe ocurrir antes de que se genere la primera nota. Un prompt cuidadosamente construido puede obligar al modelo a tener una dicción más clara. Estos ajustes no cuestan nada, pero cambian la forma en que el modelo respira y hace pausas.
Divide las secuencias largas en grupos más pequeños. En lugar de A-B-C-D-E, estructura la línea como A-B-C-D y E-F-G. El pequeño reinicio entre grupos le da al modelo la oportunidad de aterrizar en las consonantes correctas en lugar de mezclarlas.
Escribe los números con letras. Usa "thirty" en lugar de "30". Los dígitos escritos son símbolos abstractos; a veces el modelo los comprime en un ruido cortado y sin voz. Una palabra completa en inglés proporciona sustancia fonética.
Inserta espacio visual alrededor de las letras. Escribe "A - B - C" con guiones o espacios en lugar de "ABC". La separación visual le indica al modelo que se trata de elementos independientes, no de un único acrónimo o palabra.
Fija el conteo de sílabas. Mantén cada línea entre seis y diez sílabas. La variación extrema hace que el modelo se apresure en las líneas cortas y alargue las largas. Las listas ya requieren precisión; un ritmo desigual hace que una entrega precisa sea casi imposible.
Elimina la palabra "and" de las listas. En el habla natural, "and" actúa como conjunción. En una lista cantada, añade una sílaba suave que a menudo se traga el borde duro del elemento anterior. "Monday, Tuesday, Wednesday" suena más limpio que "Monday, Tuesday, and Wednesday".
La trampa de la regeneración
Aquí es donde la intuición humana resulta contraproducente. Con letras ordinarias, el prompting iterativo suele mejorar los resultados. Escuchas una frase incorrecta, ajustas la redacción y generas de nuevo. La siguiente versión suena mejor. La prueba demostró que este enfoque funciona para canciones que no contienen enumeraciones. Pero para las canciones que contienen listas, reescribir el prompt hizo que el resultado fuera más difícil de entender.
Los datos fueron inequívocos. Las canciones sin listas mejoraron tras los ajustes de los prompts. Las canciones con enumeraciones se degradaron.
El culpable es la semilla acústica. En los modelos de letra a canción, cambiar el prompt no se limita a editar el audio existente. Reorganiza por completo la base generativa. El modelo reconstruye la interpretación desde cero. Para textos narrativos, el nuevo lanzamiento de dados podría dar con una toma más clara. Para las listas, por lo general, estás provocando una pronunciación más descuidada. Podrías arreglar el tiempo de una sola letra solo para ver cómo el modelo entierra la "J", la "K" y la "L" en el siguiente intento. La toma original era defectuosa, pero la revisión a menudo cambiaba un desastre fonético por otro.
Un flujo de trabajo más inteligente para letras con muchas listas
Debido a que la regeneración corre el riesgo de destruir la claridad, tu proceso debe cambiar. Deja de perseguir la reescritura perfecta. En su lugar, trata el primer prompt como un casting.
Genera múltiples versiones a partir del mismo prompt exacto utilizando diferentes semillas aleatorias. No toques el texto. Mantén la letra constante y deja que el modelo varíe su interpretación. Estás realizando una audición, no una sesión de edición.
Luego, califica cada candidato. Pasa cada versión por mlx-whisper o una herramienta de transcripción similar y mide qué toma coincide más fielmente con tu prompt. Elige al ganador basándote en la precisión de la letra, incluso si la instrumentación o el tono vocal son ligeramente menos pulidos. Para contenido con muchas listas, la inteligibilidad importa más que la vibra.
Lo más importante es realizar tus correcciones de forma anticipada. Aplica reglas de espaciado, límites de sílabas y agrupaciones antes de presionar generar. No escribas la canción del alfabeto en inglés simple e intentes parchearla después. El modelo es menos permisivo con las ediciones retroactivas cuando hay listas de por medio. A
