שירת האותיות צריכה להיות הדבר הקל ביותר שקול בינה מלאכותית יכול לעשות. A-B-C-D-E-F-G. שבעה צלילים נפרדים, מוכרים לכל ילד על פני כדור הארץ. אך כל מי שהתנסה ביצירת מוזיקה באמצעות AI יודע שהמציאות מבולגנת יותר. בקשו ממודל לשיר את האותיות, והאותיות L, M, N, O, ו-P יתמזגו לעיתים קרובות להברה אחת מטושטשת. "Elemmennopee" אינה אות. היא תסמין.

זוהי בעיית ה-LMNOP, והיא משתרעת הרבה מעבר לשירים לילדים. ימי השבוע, הוראות ממוספרות וכל סוג של רשימה מסודרת חושפים את אותה חולשה. מפתח בדק זאת לאחרונה על ידי יצירת שמונה שירים באמצעות pipeline של AI ומדידת הפלט בעזרת mlx-whisper, כלי לזיהוי דיבור אוטומטי. במקום להסתמך על האזנה סובייקטיבית, הם אפשרו לתוכנת התמלול לדווח בדיוק מה שה-AI שר. התוצאות היו בולטות. מנייה (enumeration) מבלבלת זמרים סינתטיים בדרכים ששפה רגילה פשוט לא עושה.

למה רשימות שוברות קולות AI

שפה מדוברת נושאת הקשר. אם מישהו ממלמל, "I'm taking the dog to the park," ופספסתם את המילה "dog", המשפט עדיין הגיוני. המילים שמסביב ממלאות את הפערים. רשימות אינן מציעות רשת ביטחון כזו. כל פריט עומד בפני עצמו. אם המודל מטשטש את ההבדל בין "B" ל-"D", המאזין לא מקבל משמעות חלקית. הוא מקבל רעש.

בשיר האותיות, צבר ה-LMNOP הוא נקודת הכשל הברורה ביותר. מודל הקול מתייחס לרצף כאל גוש פונטי אחד במקום לחמש אותיות נפרדות. ללא רמזים הקשריים שיעגרו כל צליל, הסינתסייזר מנחש את המעברים בין העיצורים. בדרך כלל הוא מנחש לא נכון. הדבר האחרון קורה עם ימי השבוע או שלבים ממוספרים. המודל ממהר לעבור על הרצף, ודוחס פריטים נפרדים לתערובת לא ברורה.

מדידת הנזק

כדי לחקור זאת באופן אובייקטיבי, המפתח יצר שמונה שירים והריץ אותם דרך mlx-whisper כדי לדרג את דיוק המילים. תהליך העבודה היה פשוט: כתיבת פרומפט, יצירת האודיו, תמלול התוצאה והשוואת הטקסט המתומלל למילים המיועדות.

עבור מילים נרטיביות סטנדרטיות, הפלט היה נאמן למקור באופן סביר. המילים הופיעו במקומן. אך כאשר הפרומפטים כללו רשימות, אותיות או מנייה, mlx-whisper החזיר ג'יבריש. אותיות נעלמו או התמזגו. מספרים הפכו להברות בלתי מזוהות. הניסוי אישר כי מילים עמוסות ברשימות סובלות מיכולת הבנה גרועה באופן מדיד בהשוואה לפרוזה.

ארכיטקטורת פרומפטים שעוזרת

אי אפשר להסתמך על עיבוד לאחר מכן (post-processing) כדי לתקן רשימה משובשת. התיקון חייב לקרות לפני שהתו הראשון נוצר. פרומפט ראשון הבנוי בקפידה יכול לאלץ את המודל להגייה ברורה יותר. התאמות אלו אינן עולות דבר, אך הן משנות את האופן שבו המודל נושם ועוצר.

  • פרקו רצפים ארוכים לקבוצות קטנות יותר. במקום A-B-C-D-E, מבנו את השורה כ-A-B-C-D ו-E-F-G. האיפוס הקטן בין הקבוצות נותן למודל הזדמנות להגיע לעיצורים הנכונים במקום למרוח אותם יחד.

  • כתבו מספרים במילים. השתמשו ב-"thirty" במקום ב-"30". ספרות כתובות הן סמלים מופשטים; המודל לעיתים דוחס אותן לרעש קטוע וחסר קול. מילה אנגלית מלאה מספקת תוכן פונטי.

  • הכניסו רווח ויזואלי סביב אותיות. כתבו "A - B - C" עם מקפים או רווחים במקום "ABC". ההפרדה הוויזואלית מאותתת למודל שאלו פריטים עצמאיים, ולא ראשי תיבות או מילה אחת.

  • קבעו את מספר ההברות. שמרו על כל שורה בין שש לעשר הברות. שונות קיצונית גורמת למודל למהר בשורות קצרות ולמתוח שורות ארוכות. רשימות כבר דורשות דיוק; קצב לא אחיד הופך הגשה מדויקת לכמעט בלתי אפשרית.

  • הסירו את המילה "and" מרשימות. בדיבור טבעי, "and" משמשת כמילת קישור. ברשימה מושרת, היא מוסיפה הברה רכה שלעיתים קרובות בולעת את הקצה החד של הפריט הקודם. "Monday, Tuesday, Wednesday" נשמע נקי יותר מ-"Monday, Tuesday, and Wednesday."

מלכודת היצירה מחדש

כאן האינטואיציה האנושית פועלת נגדנו. עם מילים רגילות, פרומפטים איטרטיביים בדרך כלל משפרים את התוצאות. אתם שומעים משפט לא מדויק, משנים מעט את הניסוח ומייצרים שוב. הגרסה הבאה נשמעת טוב יותר. המבחן הראה שגישה זו עובדת עבור שירים שאינם מבוססי מנייה. אך עבור שירים המכילים רשימות, כתיבה מחדש של הפרומפט הפכה את הפלט לקשה יותר להבנה.

הנתונים היו חד-משמעיים. שירים ללא רשימות השתפרו לאחר תיקוני פרומפט. שירים עם מנייה הידרדרו.

The culprit is the acoustic seed. In lyrics-to-song models, changing the prompt does not simply edit the existing audio. It reshuffles the entire generative foundation. The model rebuilds the performance from scratch. For narrative text, the new dice roll might land on a clearer take. For lists, you are usually inviting a worse slur. You might fix the timing on one letter only to watch the model bury "J," "K," and "L" in the next attempt. The original take was flawed, but the revision often traded one phonetic mess for another.

A Smarter Workflow for List-Heavy Lyrics

Because regeneration risks destroying clarity, your process needs to change. Stop chasing the perfect rewrite. Instead, treat the first prompt like a casting call.

Generate multiple versions from the exact same prompt using different random seeds. Do not touch the text. Hold the lyrics constant and let the model vary its performance. You are running an audition, not an edit session.

Then score every candidate. Run each version through mlx-whisper or a similar transcription tool and measure which take matches your prompt most faithfully. Pick the winner based on lyric accuracy, even if the instrumentation or vocal tone is slightly less polished. For list-heavy content, intelligibility matters more than vibe.

Most importantly, front-load your fixes. Apply spacing rules, syllable limits, and grouping before you ever hit generate. Do not write the alphabet song in plain English and try to patch it later. The model is less forgiving of retroactive edits when lists are involved. A