ಅಕ್ಷರಮಾಲೆಯನ್ನು ಹಾಡುವುದು ಎಐ ಧ್ವನಿಯು ಮಾಡಬಹುದಾದ ಅತ್ಯಂತ ಸುಲಭವಾದ ಕೆಲಸವಾಗಿರಬೇಕು. A-B-C-D-E-F-G. ಭೂಮಿಯ ಮೇಲಿನ ಪ್ರತಿಯೊಬ್ಬ ಮಗುವಿಗೂ ಪರಿಚಿತವಾದ ಏಳು ವಿಭಿನ್ನ ಶಬ್ದಗಳು. ಆದರೆ ಎಐ ಸಂಗೀತ ತಯಾರಿಕೆಯನ್ನು ಪ್ರಯೋಗಿಸಿದ ಯಾರಿಗಾದರೂ ವಾಸ್ತವವು ಗೊಂದಲಮಯವಾಗಿದೆ ಎಂದು ತಿಳಿದಿದೆ. ಒಂದು ಮಾಡೆಲ್ ಅನ್ನು ಅಕ್ಷರಮಾಲೆಯನ್ನು ಹಾಡಲು ಕೇಳಿದರೆ, L, M, N, O, ಮತ್ತು P ಅಕ್ಷರಗಳು ಹೆಚ್ಚಾಗಿ ಒಂದೇ ಅಸ್ಪಷ್ಟ ಶಬ್ದವಾಗಿ ವಿಲೀನಗೊಳ್ಳುತ್ತವೆ. "Elemmennopee" ಎಂಬುದು ಅಕ್ಷರವಲ್ಲ. ಅದು ಒಂದು ಲಕ್ಷಣ.
ಇದು LMNOP ಸಮಸ್ಯೆ, ಮತ್ತು ಇದು ಕೇವಲ ನರ್ಸರಿ ರೈಮ್ಸ್ಗೆ ಸೀಮಿತವಾಗಿಲ್ಲ. ವಾರದ ದಿನಗಳು, ಸಂಖ್ಯೆಗಳ ಸೂಚನೆಗಳು ಮತ್ತು ಯಾವುದೇ ರೀತಿಯ ಕ್ರಮಬದ್ಧ ಪಟ್ಟಿಗಳು ಇದೇ ದೌರ್ಬಲ್ಯವನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತವೆ. ಒಬ್ಬ ಡೆವಲಪರ್ ಇತ್ತೀಚೆಗೆ ಎಐ ಪೈಪ್ಲೈನ್ ಮೂಲಕ ಎಂಟು ಹಾಡುಗಳನ್ನು ತಯಾರಿಸುವ ಮೂಲಕ ಮತ್ತು mlx-whisper (ಒಂದು ಆಟೋಮ್ಯಾಟಿಕ್ ಸ್ಪೀಚ್ ರೆಕಗ್ನಿಷನ್ ಟೂಲ್) ಬಳಸಿ ಅದರ ಫಲಿತಾಂಶವನ್ನು ಅಳೆಯುವ ಮೂಲಕ ಇದನ್ನು ಪರೀಕ್ಷಿಸಿದರು. ಕೇವಲ ಕೇಳಿಸಿಕೊಳ್ಳುವಿಕೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುವ ಬದಲು, ಎಐ ಏನು ಹಾಡಿದೆ ಎಂಬುದನ್ನು ನಿಖರವಾಗಿ ವರದಿ ಮಾಡಲು ಅವರು ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ ಸಾಫ್ಟ್ವೇರ್ ಅನ್ನು ಬಳಸಿದರು. ಫಲಿತಾಂಶಗಳು ಕಠಿಣವಾಗಿದ್ದವು. ಸಾಮಾನ್ಯ ಭಾಷೆಯಲ್ಲದ ರೀತಿಯಲ್ಲಿ, ಎಣಿಕೆ ಮಾಡುವುದು (enumeration) ಸಿಂಥೆಟಿಕ್ ಗಾಯಕರನ್ನು ತಪ್ಪು ದಾರಿಗೆಳೆಯುತ್ತದೆ.
ಪಟ್ಟಿಗಳು ಎಐ ಧ್ವನಿಗಳನ್ನು ಏಕೆ ಹಾಳುಮಾಡುತ್ತವೆ
ಮಾತನಾಡುವ ಭಾಷೆಯು ಸಂದರ್ಭವನ್ನು (context) ಹೊಂದಿರುತ್ತದೆ. ಯಾರಾದರೂ, "ನಾನು ನಾಯಿಯನ್ನು ಪಾರ್ಕ್ಗೆ ಕರೆದೊಯ್ಯುತ್ತಿದ್ದೇನೆ" ಎಂದು ಮಂದವಾಗಿ ಹೇಳಿದರೆ ಮತ್ತು ನೀವು "ನಾಯಿ" ಎಂಬ ಪದವನ್ನು ತಪ್ಪಿಸಿಕೊಂಡರೂ, ವಾಕ್ಯವು ಅರ್ಥಪೂರ್ಣವಾಗಿರುತ್ತದೆ. ಸುತ್ತಮುತ್ತಲಿನ ಪದಗಳು ಆ ಕೊರತೆಯನ್ನು ತುಂಬುತ್ತವೆ. ಆದರೆ ಪಟ್ಟಿಗಳು ಅಂತಹ ಸುರಕ್ಷತಾ ಜಾಲವನ್ನು ನೀಡುವುದಿಲ್ಲ. ಪ್ರತಿಯೊಂದು ಅಂಶವು ಸ್ವತಂತ್ರವಾಗಿರುತ್ತದೆ. ಮಾಡೆಲ್ "B" ಮತ್ತು "D" ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಸರಿಯಾಗಿ ಉಚ್ಚರಿಸದಿದ್ದರೆ, ಕೇಳುಗರಿಗೆ ಅರ್ಧಂಬರ್ಧ ಅರ್ಥ ಸಿಗುವುದಿಲ್ಲ. ಬದಲಾಗಿ ಗೊಂದಲಮಯ ಶಬ್ದಗಳು ಮಾತ್ರ ಸಿಗುತ್ತವೆ.
ಅಕ್ಷರಮಾಲೆಯ ಹಾಡಿನಲ್ಲಿ, LMNOP ಕ್ಲಸ್ಟರ್ ಅತ್ಯಂತ ಸ್ಪಷ್ಟವಾದ ವೈಫಲ್ಯದ ಬಿಂದುವಾಗಿದೆ. ಧ್ವನಿ ಮಾಡೆಲ್ ಈ ಸರಣಿಯನ್ನು ಐದು ಪ್ರತ್ಯೇಕ ಅಕ್ಷರಗಳಿಗಿಂತ ಹೆಚ್ಚಾಗಿ ಒಂದು ಏಕರೂಪದ ಶಬ್ದದಂತೆ ಪರಿಗಣಿಸುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಶಬ್ದವನ್ನು ಸ್ಥಿರಗೊಳಿಸಲು ಸಂದರ್ಭದ ಸುಳಿವುಗಳಿಲ್ಲದೆ, ಸಿಂಥೆಸೈಜರ್ ವ್ಯಂಜನಗಳ ನಡುವಿನ ಬದಲಾವಣೆಗಳನ್ನು ಊಹಿಸುತ್ತದೆ. ಅದು ಸಾಮಾನ್ಯವಾಗಿ ತಪ್ಪಾಗಿ ಊಹಿಸುತ್ತದೆ. ವಾರದ ದಿನಗಳು ಅಥವಾ ಸಂಖ್ಯೆಗಳ ಹಂತಗಳ ವಿಷಯದಲ್ಲೂ ಇದೇ ಆಗುತ್ತದೆ. ಮಾಡೆಲ್ ಈ ಸರಣಿಯನ್ನು ವೇಗವಾಗಿ ಹಾಡಲು ಪ್ರಯತ್ನಿಸಿ, ವಿಭಿನ್ನ ಅಂಶಗಳನ್ನು ಅಸ್ಪಷ್ಟವಾಗಿ ವಿಲೀನಗೊಳಿಸುತ್ತದೆ.
ಹಾನಿಯನ್ನು ಅಳೆಯುವುದು
ಇದನ್ನು ವಸ್ತುನಿಷ್ಠವಾಗಿ ಅಧ್ಯಯನ ಮಾಡಲು, ಡೆವಲಪರ್ ಎಂಟು ಹಾಡುಗಳನ್ನು ತಯಾರಿಸಿದರು ಮತ್ತು ಸಾಹಿತ್ಯದ ನಿಖರತೆಯನ್ನು ಅಳೆಯಲು ಅವುಗಳನ್ನು mlx-whisper ಮೂಲಕ ಚಲಾಯಿಸಿದರು. ಈ ಪ್ರಕ್ರಿಯೆಯು ಸರಳವಾಗಿತ್ತು: ಒಂದು ಪ್ರಾಂಪ್ಟ್ ಬರೆಯಿರಿ, ಆಡಿಯೋ ತಯಾರಿಸಿ, ಫಲಿತಾಂಶವನ್ನು ಟ್ರಾನ್ಸ್ಕ್ರೈಬ್ ಮಾಡಿ ಮತ್ತು ಟ್ರಾನ್ಸ್ಕ್ರೈಬ್ ಮಾಡಿದ ಪಠ್ಯವನ್ನು ಉದ್ದೇಶಿತ ಸಾಹಿತ್ಯದೊಂದಿಗೆ ಹೋಲಿಸಿ.
ಸಾಮಾನ್ಯ ಕಥಾ ರೂಪದ ಸಾಹಿತ್ಯಕ್ಕೆ, ಫಲಿತಾಂಶವು ಸಮರ್ಪಕವಾಗಿತ್ತು. ಪದಗಳು ಸರಿಯಾದ ಜಾಗದಲ್ಲಿ ಬಂದವು. ಆದರೆ ಪ್ರಾಂಪ್ಟ್ಗಳು ಪಟ್ಟಿಗಳು, ಅಕ್ಷರಮಾಲೆ ಅಥವಾ ಎಣಿಕೆಗಳನ್ನು ಒಳಗೊಂಡಾಗ, mlx-whisper ಅರ್ಥಹೀನವಾದ (gibberish) ಫಲಿತಾಂಶವನ್ನು ನೀಡಿತು. ಅಕ್ಷರಗಳು ಮಾಯವಾದವು ಅಥವಾ ವಿಲೀನಗೊಂಡವು. ಸಂಖ್ಯೆಗಳು ಗುರುತಿಸಲಾಗದ ಶಬ್ದಗಳಾಗಿ ಬದಲಾದವು. ಪಟ್ಟಿಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಸಾಹಿತ್ಯವು ಗದ್ಯಕ್ಕಿಂತ (prose) ಗಮನಾರ್ಹವಾಗಿ ಕಳಪೆ ಗುಣಮಟ್ಟವನ್ನು ಹೊಂದಿರುತ್ತದೆ ಎಂದು ಈ ಪ್ರಯೋಗವು ದೃಢಪಡಿಸಿತು.
ಸಹಾಯ ಮಾಡುವ ಪ್ರಾಂಪ್ಟ್ ಆರ್ಕಿಟೆಕ್ಚರ್
ಗೊಂದಲಮಯ ಪಟ್ಟಿಯನ್ನು ಸರಿಪಡಿಸಲು ನೀವು ಪೋಸ್ಟ್-ಪ್ರೊಸೆಸಿಂಗ್ ಮೇಲೆ ಅವಲಂಬಿತರಾಗಲು ಸಾಧ್ಯವಿಲ್ಲ. ಮೊದಲ ನೋಟ್ ತಯಾರಾಗುವ ಮೊದಲೇ ಪರಿಹಾರವು ನಡೆಯಬೇಕು. ಎಚ್ಚರಿಕೆಯಿಂದ ನಿರ್ಮಿಸಲಾದ ಮೊದಲ ಪ್ರಾಂಪ್ಟ್ ಮಾಡೆಲ್ ಅನ್ನು ಸ್ಪಷ್ಟವಾದ ಉಚ್ಚಾರಣೆಗೆ (diction) ಒತ್ತಾಯಿಸಬಹುದು. ಈ ಹೊಂದಾಣಿಕೆಗಳಿಗೆ ಯಾವುದೇ ವೆಚ್ಚವಿಲ್ಲ, ಆದರೆ ಅವು ಮಾಡೆಲ್ ಉಸಿರಾಡುವ ಮತ್ತು ವಿರಾಮ ತೆಗೆದುಕೊಳ್ಳುವ ರೀತಿಯನ್ನು ಬದಲಾಯಿಸುತ್ತವೆ.
ದೀರ್ಘ ಸರಣಿಗಳನ್ನು ಸಣ್ಣ ಗುಂಪುಗಳಾಗಿ ವಿಂಗಡಿಸಿ. A-B-C-D-E ಬದಲಿಗೆ, ಸಾಲನ್ನು A-B-C-D ಮತ್ತು E-F-G ಎಂದು ರಚಿಸಿ. ಗುಂಪುಗಳ ನಡುವಿನ ಈ ಸಣ್ಣ ವಿರಾಮವು ಮಾಡೆಲ್ಗೆ ಅಕ್ಷರಗಳನ್ನು ಒಟ್ಟಿಗೆ ಸೇರಿಸುವ ಬದಲು ಸರಿಯಾದ ವ್ಯಂಜನಗಳನ್ನು ಉಚ್ಚರಿಸಲು ಅವಕಾಶ ನೀಡುತ್ತದೆ.
ಸಂಖ್ಯೆಗಳನ್ನು ಅಕ್ಷರಗಳಲ್ಲಿ ಬರೆಯಿರಿ. "30" ಬದಲಿಗೆ "thirty" ಬಳಸಿ. ಬರೆದ ಅಂಕಿಗಳು ಅಮೂರ್ತ ಸಂಕೇತಗಳಾಗಿವೆ; ಮಾಡೆಲ್ ಕೆಲವೊಮ್ಮೆ ಅವುಗಳನ್ನು ಅಸ್ಪಷ್ಟ ಶಬ್ದಗಳಾಗಿ ಸಂಕುಚಿತಗೊಳಿಸುತ್ತದೆ. ಪೂರ್ಣ ಇಂಗ್ಲಿಷ್ ಪದವು ಶಬ್ದದ ಸ್ಪಷ್ಟತೆಯನ್ನು ನೀಡುತ್ತದೆ.
ಅಕ್ಷರಗಳ ಸುತ್ತ ದೃಶ್ಯ ವಿರಾಮವನ್ನು (visual spacing) ಸೇರಿಸಿ. "ABC" ಎನ್ನುವ ಬದಲು ಹೈಫನ್ಗಳು ಅಥವಾ ಸ್ಪೇಸ್ಗಳೊಂದಿಗೆ "A - B - C" ಎಂದು ಬರೆಯಿರಿ. ಈ ದೃಶ್ಯ ಪ್ರತ್ಯೇಕತೆಯು ಇವುಗಳು ಸ್ವತಂತ್ರ ಅಂಶಗಳಾಗಿವೆ, ಒಂದೇ ಪದ ಅಥವಾ ಸಂಕ್ಷಿಪ್ತ ರೂಪವಲ್ಲ ಎಂದು ಮಾಡೆಲ್ಗೆ ಸೂಚಿಸುತ್ತದೆ.
ಶಬ್ದಗಳ ಸಂಖ್ಯೆಯನ್ನು (syllable count) ನಿರ್ಧರಿಸಿ. ಪ್ರತಿ ಸಾಲನ್ನು ಆರು ಮತ್ತು ಹತ್ತು ಶಬ್ದಗಳ ನಡುವೆ ಇರಿಸಿ. ಅತಿಯಾದ ವ್ಯತ್ಯಾಸವು ಮಾಡೆಲ್ ಸಣ್ಣ ಸಾಲುಗಳನ್ನು ವೇಗವಾಗಿ ಮತ್ತು ಉದ್ದವಾದ ಸಾಲುಗಳನ್ನು ಎಳೆದು ಎಳೆಯುವಂತೆ ಮಾಡುತ್ತದೆ. ಪಟ್ಟಿಗಳಿಗೆ ಈಗಾಗಲೇ ನಿಖರತೆ ಬೇಕಾಗುತ್ತದೆ; ಅಸಮತೋಲಿತ ಲಯವು ನಿಖರವಾದ ಉಚ್ಚಾರಣೆಯನ್ನು ಅಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ.
ಪಟ್ಟಿಗಳಿಂದ "and" ಎಂಬ ಪದವನ್ನು ತೆಗೆದುಹಾಕಿ. ನೈಸರ್ಗಿಕ ಭಾಷೆಯಲ್ಲಿ, "and" ಒಂದು ಸಂಯೋಜಕವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಹಾಡಲ್ಪಡುವ ಪಟ್ಟಿಯಲ್ಲಿ, ಇದು ಒಂದು ಮೃದುವಾದ ಶಬ್ದವನ್ನು ಸೇರಿಸುತ್ತದೆ ಮತ್ತು ಇದು ಹಿಂದಿನ ಪದದ ಸ್ಪಷ್ಟತೆಯನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ. "Monday, Tuesday, and Wednesday" ಎನ್ನುವುದಕ್ಕಿಂತ "Monday, Tuesday, Wednesday" ಎಂಬುದು ಹೆಚ್ಚು ಸ್ಪಷ್ಟವಾಗಿರುತ್ತದೆ.
ಮರು-ತಯಾರಿಕೆಯ ಬಲೆ
ಇಲ್ಲಿ ಮಾನವನ ಅಂತಃಪ್ರಜ್ಞೆಯು ವಿಫಲವಾಗುತ್ತದೆ. ಸಾಮಾನ್ಯ ಸಾಹಿತ್ಯದೊಂದಿಗೆ, ಪದೇ ಪದೇ ಪ್ರಾಂಪ್ಟ್ ಮಾಡುವುದು (iterative prompting) ಸಾಮಾನ್ಯವಾಗಿ ಫಲಿತಾಂಶವನ್ನು ಸುಧಾರಿಸುತ್ತದೆ. ನೀವು ಒಂದು ತಪ್ಪಾದ ಪದವನ್ನು ಕೇಳಿದರೆ, ಪದಗಳನ್ನು ಬದಲಾಯಿಸಿ ಮತ್ತೆ ತಯಾರಿಸಿ. ಮುಂದಿನ ಆವೃತ್ತಿಯು ಉತ್ತಮವಾಗಿ ಕೇಳಿಸುತ್ತದೆ. ಎಣಿಕೆ ಮಾಡದ ಹಾಡುಗಳಿಗೆ ಈ ವಿಧಾನವು ಕೆಲಸ ಮಾಡುತ್ತದೆ ಎಂದು ಪರೀಕ್ಷೆಯು ತೋರಿಸಿದೆ. ಆದರೆ ಪಟ್ಟಿಗಳನ್ನು ಹೊಂದಿರುವ ಹಾಡುಗಳ ವಿಷಯದಲ್ಲಿ, ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಮರುಬರೆಯುವುದು ಫಲಿತಾಂಶವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಇನ್ನೂ ಕಷ್ಟವಾಗುವಂತೆ ಮಾಡಿತು.
ದತ್ತಾಂಶವು ಸ್ಪಷ್ಟವಾಗಿತ್ತು. ಪ್ರಾಂಪ್ಟ್ ಸರಿಪಡಿಸಿದ ನಂತರ ಪಟ್ಟಿಗಳಿಲ್ಲದ ಹಾಡುಗಳು ಸುಧಾರಿಸಿದವು. ಆದರೆ ಎಣಿಕೆ ಮಾಡಿರುವ ಹಾಡುಗಳು ಕಳಪೆಗೊಂಡವು.
The culprit is the acoustic seed. In lyrics-to-song models, changing the prompt does not simply edit the existing audio. It reshuffles the entire generative foundation. The model rebuilds the performance from scratch. For narrative text, the new dice roll might land on a clearer take. For lists, you are usually inviting a worse slur. You might fix the timing on one letter only to watch the model bury "J," "K," and "L" in the next attempt. The original take was flawed, but the revision often traded one phonetic mess for another.
A Smarter Workflow for List-Heavy Lyrics
Because regeneration risks destroying clarity, your process needs to change. Stop chasing the perfect rewrite. Instead, treat the first prompt like a casting call.
Generate multiple versions from the exact same prompt using different random seeds. Do not touch the text. Hold the lyrics constant and let the model vary its performance. You are running an audition, not an edit session.
Then score every candidate. Run each version through mlx-whisper or a similar transcription tool and measure which take matches your prompt most faithfully. Pick the winner based on lyric accuracy, even if the instrumentation or vocal tone is slightly less polished. For list-heavy content, intelligibility matters more than vibe.
Most importantly, front-load your fixes. Apply spacing rules, syllable limits, and grouping before you ever hit generate. Do not write the alphabet song in plain English and try to patch it later. The model is less forgiving of retroactive edits when lists are involved. A
