అక్షరమాల పాడటం అనేది ఒక AI వాయిస్ చేయగలిగే అత్యంత సులభమైన పని కావాలి. A-B-C-D-E-F-G. ఈ భూమిపై ఉన్న ప్రతి బిడ్డకు తెలిసిన ఏడు విడి శబ్దాలు. అయినప్పటికీ, AI మ్యూజిక్ జనరేషన్తో ప్రయోగాలు చేసిన ఎవరికైనా వాస్తవం చాలా క్లిష్టంగా ఉంటుందని తెలుస్తుంది. ఒక మోడల్ను అక్షరమాల పాడమని అడిగితే, L, M, N, O, మరియు P అక్షరాలు తరచుగా ఒకే అస్పష్టమైన శబ్దంగా మారిపోతాయి. "Elemmennopee" అనేది ఒక అక్షరం కాదు. అది ఒక లక్షణం.
దీన్నే LMNOP సమస్య అంటారు, ఇది నర్సరీ రైమ్స్కు మాత్రమే పరిమితం కాదు. వారంలోని రోజులు, సంఖ్యలతో కూడిన సూచనలు మరియు ఏదైనా క్రమబద్ధమైన జాబితాలు ఇదే బలహీనతను బయటపెడతాయి. ఒక డెవలపర్ ఇటీవల ఒక AI పైప్లైన్ ద్వారా ఎనిమిది పాటలను రూపొందించి, వాటి అవుట్పుట్ను ఒక ఆటోమేటిక్ స్పీచ్ రికగ్నిషన్ టూల్ అయిన mlx-whisperతో కొలవడం ద్వారా దీనిని పరీక్షించారు. వ్యక్తిగత వినికిడిపై ఆధారపడటానికి బదులుగా, AI సరిగ్గా ఏమి పాడిందో రిపోర్ట్ చేయడానికి వారు ట్రాన్స్క్రిప్షన్ సాఫ్ట్వేర్ను ఉపయోగించారు. ఫలితాలు చాలా స్పష్టంగా ఉన్నాయి. సాధారణ భాషలో జరగని విధంగా, సంఖ్యల క్రమం లేదా జాబితాలను పలకడం సింథటిక్ సింగర్లను తడబడేలా చేస్తోంది.
జాబితాలు AI వాయిస్లను ఎందుకు దెబ్బతీస్తాయి
మాట్లాడే భాషలో సందర్భం (context) ఉంటుంది. ఎవరైనా, "నేను కుక్కను పార్కుకు తీసుకెళ్తున్నాను" అని ముక్కుముక్కున మాట్లాడినా, మీరు "కుక్క" అనే పదాన్ని వినకపోయినా, ఆ వాక్యం అర్థవంతంగానే ఉంటుంది. చుట్టూ ఉన్న పదాలు ఆ లోటును భర్తీ చేస్తాయి. కానీ జాబితాలు ఆ రక్షణను అందించవు. ప్రతి అంశం విడిగా ఉంటుంది. ఒకవేళ మోడల్ "B" మరియు "D" మధ్య తేడాను సరిగ్గా చెప్పలేకపోతే, వినేవారికి సగం అర్థం దొరకదు. వారికి కేవలం శబ్దం మాత్రమే వినిపిస్తుంది.
అక్షరమాల పాటలో, LMNOP క్లస్టర్ అనేది అత్యంత స్పష్టమైన వైఫల్య బిందువు. వాయిస్ మోడల్ ఆ క్రమాన్ని ఐదు వేర్వేరు అక్షరాలుగా కాకుండా, ఒకే ఫోనెటిక్ బ్లాబ్గా పరిగణిస్తుంది. ప్రతి శబ్దాన్ని స్థిరపరిచే సందర్భోచిత ఆధారాలు లేకపోవడం వల్ల, సింథసైజర్ హల్లుల (consonants) మధ్య మార్పులను ఊహించాల్సి వస్తుంది. అది సాధారణంగా తప్పుగా ఊహిస్తుంది. వారంలోని రోజులు లేదా సంఖ్యలతో కూడిన దశల విషయంలో కూడా ఇదే జరుగుతుంది. మోడల్ ఆ క్రమాన్ని వేగంగా పూర్తి చేయడానికి ప్రయత్నిస్తూ, విడివిడి అంశాలను ఒక అస్పష్టమైన శబ్దంగా మార్చేస్తుంది.
నష్టాన్ని అంచనా వేయడం
దీనిని నిష్పాక్షికంగా అధ్యయనం చేయడానికి, డెవలపర్ ఎనిమిది పాటలను రూపొందించి, లిరిక్ ఖచ్చితత్వాన్ని కొలవడానికి mlx-whisper ద్వారా వాటిని పరీక్షించారు. ఈ ప్రక్రియ చాలా సరళంగా ఉంది: ఒక ప్రాంప్ట్ రాయడం, ఆడియోను రూపొందించడం, ఫలితాన్ని ట్రాన్స్క్రిబ్ చేయడం మరియు ట్రాన్స్క్రిబ్ చేసిన వచనాన్ని ఉద్దేశించిన లిరిక్స్తో పోల్చడం.
సాధారణ కథాత్మక లిరిక్స్ (narrative lyrics) విషయంలో, అవుట్పుట్ తగినంత ఖచ్చితంగా ఉంది. పదాలు ఉండాల్సిన చోట సరిగ్గా వచ్చాయి. కానీ ప్రాంప్ట్లలో జాబితాలు, అక్షరమాల లేదా సంఖ్యల క్రమం ఉన్నప్పుడు, mlx-whisper అర్థం లేని శబ్దాలను (gibberish) ఇచ్చింది. అక్షరాలు మాయమయ్యాయి లేదా కలిసిపోయాయి. సంఖ్యలు గుర్తుపట్టలేని శబ్దాలుగా మారాయి. జాబితా ఎక్కువగా ఉండే లిరిక్స్, సాధారణ గద్యం (prose) కంటే గణనీయంగా తక్కువ స్పష్టతను కలిగి ఉంటాయని ఈ ప్రయోగం ధృవీకరించింది.
సహాయపడే ప్రాంప్ట్ ఆర్కిటెక్చర్
అస్పష్టంగా ఉన్న జాబితాను సరిచేయడానికి మీరు పోస్ట్-ప్రాసెసింగ్ (post-processing) పై ఆధారపడలేరు. మొదటి నోట్ రూపొందించబడక ముందే ఈ పరిష్కారం జరగాలి. జాగ్రత్తగా రూపొందించిన మొదటి ప్రాంప్ట్ మోడల్ను స్పష్టమైన ఉచ్చారణ వైపు నడిపించగలదు. ఈ మార్పులకు ఖర్చు ఏమీ ఉండదు, కానీ ఇవి మోడల్ శ్వాస తీసుకునే విధానాన్ని మరియు విరామాలను మారుస్తాయి.
పెద్ద వరుసలను చిన్న సమూహాలుగా విభజించండి. A-B-C-D-E కి బదులుగా, ఆ లైన్ను A-B-C-D మరియు E-F-G గా రూపొందించండి. సమూహాల మధ్య ఉండే ఈ చిన్న విరామం, అక్షరాలను కలిపి పలకడానికి బదులుగా సరైన హల్లులపై దృష్టి పెట్టడానికి మోడల్కు అవకాశం ఇస్తుంది.
సంఖ్యలను అక్షరాల్లో రాయండి. "30" కి బదులుగా "thirty" అని ఉపయోగించండి. రాసిన అంకెలు అబ్స్ట్రాక్ట్ చిహ్నాలు; మోడల్ కొన్నిసార్లు వాటిని క్లిప్డ్, అన్-వాయిస్డ్ శబ్దాలుగా మార్చేస్తుంది. పూర్తి ఇంగ్లీష్ పదం ఫోనెటిక్ స్పష్టతను ఇస్తుంది.
అక్షరాల చుట్టూ విజువల్ స్పేసింగ్ను ఉంచండి. "ABC" అని కాకుండా హైఫన్లు లేదా స్పేస్లతో "A - B - C" అని రాయండి. ఈ విజువల్ విభజన, ఇవి ఒకే అక్రోనిమ్ లేదా పదం కాదని, విడివిడి అంశాలని మోడల్కు సూచిస్తుంది.
సిలబల్ కౌంట్ను స్థిరీకరించండి. ప్రతి లైన్ను ఆరు నుండి పది సిలబళ్ల మధ్య ఉంచండి. విపరీతమైన మార్పులు మోడల్ చిన్న లైన్లను వేగంగా, పెద్ద లైన్లను సాగదీయడానికి కారణమవుతాయి. జాబితాలకు ఇప్పటికే ఖచ్చితత్వం అవసరం; అసమానమైన లయ (rhythm) ఖచ్చితమైన పలకడాన్ని దాదాపు అసాధ్యం చేస్తుంది.
జాబితాల నుండి "and" అనే పదాన్ని తొలగించండి. సహజమైన మాటలలో, "and" ఒక సంధి పదంగా పనిచేస్తుంది. కానీ పాడే జాబితాలో, అది ఒక మెత్తని సిలబల్ను జోడిస్తుంది, ఇది తరచుగా ముందున్న పదం యొక్క స్పష్టతను దెబ్బతీస్తుంది. "Monday, Tuesday, and Wednesday" కంటే "Monday, Tuesday, Wednesday" అనేది మరింత స్పష్టంగా ఉంటుంది.
రీజెనరేషన్ ట్రాప్ (The Regeneration Trap)
ఇక్కడే మానవ అంతర్ దృష్టి (human intuition) విరుద్ధంగా పనిచేస్తుంది. సాధారణ లిరిక్స్ విషయంలో, పదేపదే ప్రాంప్ట్లను మార్చడం (iterative prompting) వల్ల ఫలితాలు మెరుగుపడతాయి. ఏదైనా పదం తప్పుగా వినిపిస్తే, పదజాలాన్ని మార్చి మళ్ళీ జనరేట్ చేస్తారు. తదుపరి వెర్షన్ మెరుగ్గా ఉంటుంది. జాబితాలు లేని పాటలకు ఈ విధానం పనిచేస్తుందని పరీక్షలో తేలింది. కానీ జాబితాలు ఉన్న పాటల విషయానికి వస్తే, ప్రాంప్ట్ను తిరిగి రాయడం వల్ల అవుట్పుట్ అర్థం చేసుకోవడం మరింత కష్టతరంగా మారింది.
డేటా స్పష్టంగా ఉంది. జాబితాలు లేని పాటలు ప్రాంప్ట్ మార్పుల తర్వాత మెరుగుపడ్డాయి. కానీ సంఖ్యల క్రమం లేదా జాబితా ఉన్న పాటలు మరింత క్షీణించాయి.
The culprit is the acoustic seed. In lyrics-to-song models, changing the prompt does not simply edit the existing audio. It reshuffles the entire generative foundation. The model rebuilds the performance from scratch. For narrative text, the new dice roll might land on a clearer take. For lists, you are usually inviting a worse slur. You might fix the timing on one letter only to watch the model bury "J," "K," and "L" in the next attempt. The original take was flawed, but the revision often traded one phonetic mess for another.
A Smarter Workflow for List-Heavy Lyrics
Because regeneration risks destroying clarity, your process needs to change. Stop chasing the perfect rewrite. Instead, treat the first prompt like a casting call.
Generate multiple versions from the exact same prompt using different random seeds. Do not touch the text. Hold the lyrics constant and let the model vary its performance. You are running an audition, not an edit session.
Then score every candidate. Run each version through mlx-whisper or a similar transcription tool and measure which take matches your prompt most faithfully. Pick the winner based on lyric accuracy, even if the instrumentation or vocal tone is slightly less polished. For list-heavy content, intelligibility matters more than vibe.
Most importantly, front-load your fixes. Apply spacing rules, syllable limits, and grouping before you ever hit generate. Do not write the alphabet song in plain English and try to patch it later. The model is less forgiving of retroactive edits when lists are involved. A
